O que adotar, pilotar, investigar ou pausar para construir com IA em produção. No modelo do radar da Thoughtworks — quatro anéis, evidência citada por blip e histórico de movimento entre volumes.
Esta é a primeira edição do Radar ai|expert — mapa de como AI architects shipping em produção devem pensar sobre stack hoje. Onze zones cobrem do modelo até compliance; quatro rings (Adopt, Trial, Assess, Hold) marcam o nível de confiança pra adotar. O que separa Adopt de Trial neste volume: evidência de produção em múltiplas empresas notáveis, com números operacionais disponíveis publicamente. É um filtro deliberadamente apertado — capability theater não passa. Padrões que dominam o volume: Claude e GPT entram em Adopt no frontier; Llama 4 e Qwen 3 lideram open-weights; vLLM e SGLang continuam como default de inference; MCP virou padrão de integração tool-use cross-vendor; pgvector + Pinecone seguem a divisão self-hosted/managed em RAG. O que está em Hold tem mais a ver com mindshare migrando do que com falha técnica — Chroma e CrewAI ainda funcionam, mas alternativas com mais momentum capturaram a comunidade. Próximo volume sai em Julho/2026, com o radar-analyst agent rodando bimensalmente pra refrescar evidências e propor movimentos.
Anthropic — flagship maduro pós-4.7: preço cortado, ganho de agentic, long-context 1M. É o fallback de segurança do Fable 5.
AdoptMeta — referência de open-weights, ecossistema de fine-tuning + serving mais maduro.
AdoptAlibaba — open-weights com tool use e código competitivos com fronteira fechada.
AdoptOpenAI — referência pra transcrição multilíngua, qualidade próxima de humano para áudio limpo.
TrialOpenAI — iteração sobre a linha GPT-5.x, ~2× o preço do 5.4; ecossistema de tooling segue o mais maduro da turma.
TrialOpenAI — novo default GA (substitui 5.3 Instant; API 'chat-latest'). −52,5% alucinações vs 5.3 Instant em prompts de alto risco; reasoning effort none→xhigh.
TrialGoogle — sucessor da linha 3.x; long-context e multimodal nativo (vídeo/áudio/PDF) seguem como diferencial.
TrialxAI — capacidades fortes em reasoning e código, ainda inconsistente em tool use e safety.
TrialDeepSeek — reasoning model open-weights com chain-of-thought explícito, custo por token muito baixo.
TrialGoogle open-weights — quantizações nativas (INT4/MX), bom equilíbrio capacidade/custo pra small models.
TrialCohere — reranker dedicado pra RAG, ganho de qualidade mensurável sobre re-ranking com LLM.
TrialGoogle — text-to-image com qualidade fotorrealista forte, recurso comercial via GCP.
TrialVoyage AI — embedding model com qualidade no topo dos benchmarks, recomendado pela Anthropic.
AssessAnthropic — primeiro modelo público da classe Mythos (09/jun/2026). SOTA em quase todos os benchmarks, mas com hard safety limits.
AssessOpenAI — variante 5.6 mais rápida/barata p/ trabalho cotidiano (sumarização, rascunho, automação). Desempenho perto do GPT-5.5; preview limitado.
AssessOpenAI — topo da família 5.6 (preview limitado). Coding e security research, novo reasoning 'max' e modo 'ultra' com subagentes; SOTA em Terminal-Bench 2.1. Preço $5/$30 por M (= GPT-5.5).
AssessOpenAI — variante 5.6 para alto volume (atendimento, ferramentas internas, análise de documentos). Novos recordes de benchmark; preview limitado.
AssessMicrosoft — small model treinado em dados sintéticos curados, performance acima do peso em raciocínio.
HoldFlagship Anthropic — best frontier model for agentic workflows com long-context (1M tokens) e tool use confiável.
HoldOpenAI flagship — capacidade multimodal forte, reasoning competitivo, ecossistema mais maduro de tooling.
HoldGoogle — 2M context window, multimodalidade nativa (vídeo + áudio + PDF), preço agressivo.
AdoptInference engine focado em structured generation e workloads agentic com cache de prefix agressivo.
AdoptC++ runtime referência pra inference em CPU + Apple Silicon + edge devices.
AdoptInference engine open-source default pra serving LLM — PagedAttention + continuous batching.
AdoptAWS — multi-model gateway gerenciado, governance forte, residency e compliance enterprise-grade.
TrialFerramentas pra classificar sistemas AI segundo categorias de risco do AI Act — obrigatório UE a partir de 2026.
TrialNVIDIA — máxima performance em hardware NVIDIA, mas configuração e build process complexos.
TrialServerless GPU compute — define funções Python que rodam em GPU, billing por segundo.
TrialInference platform pra open-weights — preços competitivos, latência boa, fine-tuning managed.
TrialVercel — gateway unificado pra LLMs com fallback, caching, observability built-in.
AssessSpec atualizada pra documentação de modelos — agora cobre training data lineage, intended use, limitações.
AssessApple — framework de ML otimizado pra unified memory do Apple Silicon, performance impressionante em M-series.
AdoptAnthropic — SDK first-party pra agentes Claude, tool use + multi-step nativos, mais robusto que LangChain.
AdoptCLI agente terminal-first da Anthropic — adopted rápido por times de engenharia em 2025-2026.
AdoptIDE AI-first — fork VSCode com integração profunda de model context, tab autocomplete melhor da turma.
AdoptProtocolo padrão pra integrar contextos externos com LLMs — adopted pela Anthropic, OpenAI, Cursor, etc.
TrialLangChain — DAG-based orchestration pra agentes multi-step com state explícito.
TrialOpenAI — SDK first-party pra agents GPT, lançado em 2025, ainda evoluindo mas com momentum.
HoldMulti-agent framework — interesse caiu conforme padrões nativos (Claude Agent SDK, OpenAI Agents) maduraram.
AdoptEval framework + observability pra LLM apps, integração tight com workflows de development.
AdoptLLM observability open-source self-hostable — alternativa robusta a Braintrust/LangSmith.
AdoptVector DB managed — escala 100M-bilhões de vectors com QPS alto e latência consistente.
AdoptVector extension pra Postgres — default pra qualquer RAG que não precise de escala massiva.
TrialLlamaIndex — parser de PDF/documentos complexos com qualidade superior a alternatives open-source.
TrialGuardrails managed contra prompt injection, jailbreaks, PII leakage — API simples.
AssessNVIDIA — framework open-source pra guardrails programáveis via Colang, abordagem flexível mas verbosa.
HoldVector DB — perdeu mindshare pra pgvector (self-hosted) e Pinecone (managed) em 2025.