A xAI lançou o Grok 4.6, um modelo de 1,5 trilhão de parâmetros com treinamento complementar estendido focado em tarefas agentic de longo prazo, descrito como um grande passo em relação ao 4.5 pelo mesmo preço.
Os benchmarks mostram que o Grok 4.6 atinge 88,4% no Terminal-Bench v2.1 e desempenho competitivo no Code Arena com GPT-5.6 Sol, enquanto avaliações independentes do Artificial Analysis o colocam em #61 no Índice de Inteligência, aproximadamente em linha com GPT-5.6 Sol Max, mas atrás de Claude Opus/Fable.
O preço é um diferenciador central: Grok 4.6 custa $2/$6 por 1M de tokens de entrada/saída, materialmente abaixo de pares de fronteira, com práticos enquadrando-o imediatamente como o novo padrão para cargas de trabalho de codificação e detecção de bugs.
O treinamento do Grok 4.6 enfatizou RL agentic em codificação, desenvolvimento web, design assistido por computador e tarefas de otimização de kernel, com melhorias relatadas no comportamento de auto-teste em tarefas longas e desempenho mais estável em benchmarks pesados em raciocínio.
Arquitetos se importam: com 37% do preço de fronteira (Grok 4.6 $2/$6 vs. GPT-5.6 Sol em $5+/$15 típico), Grok 4.6 muda o tradeoff de custo-capacidade para agentes de codificação e trabalho de conhecimento autônomos; combinado com o lançamento do produto Grok Bot team-member, isso sinala que xAI/SpaceX está entrando seriamente na categoria 'codificação agentic'.