Google lança Gemini 3.6 Flash com redução de 17% em tokens, preço de saída mais baixo para tarefas agentes
Google lançou três novos modelos Gemini em 21 de julho: Gemini 3.6 Flash como o principal cavalo de batalha, Gemini 3.5 Flash-Lite para inferência de alto volume, e Gemini 3.5 Flash Cyber para descoberta de vulnerabilidades controlada. O anúncio marca uma mudança de ganhos de capacidade bruta para otimização de eficiência de token e custo para cargas de trabalho agentes de produção.
Gemini 3.6 Flash reduz o uso de tokens de saída em 17% em comparação com 3.5 Flash no Índice de Análise Artificial, com alguns benchmarks como Datacurve DeepSWE mostrando reduções de até 65%. O modelo é precificado em $1.50/1M tokens de entrada e $7.50/1M tokens de saída, abaixo de $9/1M saída do Flash 3.5. Leva menos passos de raciocínio e chamadas de ferramentas para realizar fluxos de trabalho multi-etapas, tornando-o mais econômico por tarefa de agente concluída.
Em benchmarks de codificação e trabalho de conhecimento, 3.6 Flash marca 49% em DeepSWE versus 37% para 3.5 Flash, 63.9% em MLE Bench versus 49.7%, e 83% em uso de computador OSWorld-Verified versus 78.4%. A data de corte de conhecimento avança de janeiro de 2025 para março de 2026. 3.5 Flash-Lite visa tarefas de alto throughput em 350 tokens de saída/segundo e preços de $0.30/$2.50, enquanto 3.5 Flash Cyber (restrito a governos e parceiros confiáveis) lida com correlação de vulnerabilidade a um custo de token mais baixo do que modelos maiores.
Para construtores, Gemini 3.6 Flash é mais barato que GPT-5.6 Terra Max, Kimi K3 e Qwen 3.7 Max em preço por tarefa, sinalizando a mudança do Google para econômica de agentes sobre posicionamento de leaderboard. O lançamento ocorre enquanto o flagship 3.5 Pro do Google permanece em testes com parceiros, com pré-treinamento Gemini 4 já em andamento. Para arquitetos, os ganhos de eficiência de token e reduções de custo tornam 3.6 Flash competitivo para cargas de trabalho de agentes de alto volume, embora as tradeoffs de profundidade de raciocínio versus latência permaneçam importantes para seleção de aplicação.
Fontes
- Primary source
- blog.google
“3.6 Flash reduces output token usage by 17% compared to 3.5 Flash on the Artificial Analysis Index”
- cnbc.com
“Gemini 3.6 Flash uses up to 17% fewer tokens and costs less per token, while Gemini 3.5 Flash-Lite targets faster, high-volume workloads”