A Cloudflare lançou melhorias na experiência do desenvolvedor para AI Search, sua camada de recuperação gerenciada para agentes. A atualização collapsa cinco primitivos — Workers AI, AI Gateway, Vectorize, R2 e Browser Run — em um único namespace indexado, adiciona modo de crawl sem sitemap, endpoints MCP públicos, roteamento customizado de domínio e embedding e reranking com custo zero ao usar modelos Workers AI.
Antes desta versão, conectar um agente a dados proprietários significava cabear esses cinco primitivos você mesmo. Agora um único comando `wrangler ai-search instance create` aponta AI Search para uma URL de origem, gerencia crawling via Browser Run, chunking, embedding e armazenamento de vetores em uma etapa. Para sites sem sitemap, a flag `--parse-type discover` segue links para encontrar páginas. O resultado é uma instância por superfície de dados, agrupada em um namespace.
O Cloudflare Dev Stack MCP, disponível no Cloudflare AI Playground, demonstra o deployment. Cobre 10 superfícies: Cloudflare Docs, Blog, API Docs, Community, Astro, Vite, Vitest, Hono, Replicate e OpenNext. Cada uma recebe uma instância de AI Search. Uma vinculação de namespace em `wrangler.jsonc` permite a um Worker fazer uma única chamada `AI_SEARCH.search()` que se distribui para todas as 10 simultaneamente. Os resultados retornam como `res.chunks` com metadados de citação e tags de instância, com reranking habilitado e até 10 resultados por chamada.
Dois caminhos de deployment existem. Opção A: vincular o namespace a um Worker, registrar uma ferramenta e distribuir com uma chamada — o caminho que Cloudflare usou para o Dev Stack MCP. Opção B: habilitar URLs públicas no dashboard e obter imediatamente endpoints `/search` e `/mcp` que consultam todas as instâncias no namespace sem código e sem autenticação por padrão. Para dados sensíveis, coloque Cloudflare Access na frente de um domínio customizado e exija login; tokens de Access funcionam tanto para humanos quanto para agentes.
Embedding e reranking custam zero por token ao usar modelos Workers AI designados. Isso elimina o overhead operacional de prever contagens de tokens para workloads de busca onde o volume de queries dispara imprevisvelmente. Armazenamento e compute fora dessas duas operações seguem um modelo de custo "previsível e escalável" ainda em preview.
A maioria das equipes construindo agentes com retrieval-augmented mantêm pipelines customizados: jobs de crawling, chunking, chamadas de embedding para APIs de terceiros, escritas de vector store e interfaces de query. Cada componente tem seu próprio modo de falha e superfície de faturamento. O namespace gerenciado da Cloudflare com uma única chamada CLI e vinculação Worker reduz significativamente a superfície — mas negocia flexibilidade por lock-in. Equipes com infraestrutura não-Cloudflare ou fontes de dados não em sua conta Cloudflare enfrentam restrições de verificação de propriedade. Cloudflare diz que mais métodos de verificação estão chegando.
Se seus agentes precisam de busca semântica sobre documentação, wikis internos ou conteúdo que você possui na Cloudflare, AI Search elimina o trabalho de stitching de pipeline. O preço com embedding gratuito significa que você pode indexar agressivamente sem custos por-query punindo agentes de alto volume.