Google lanza Gemini 3.6 Flash con reducción de 17% de tokens, preciso de salida más bajo para tareas de agentes
Google lanzó tres nuevos modelos Gemini el 21 de julio: Gemini 3.6 Flash como el principal modelo de trabajo, Gemini 3.5 Flash-Lite para inferencia de alto volumen, y Gemini 3.5 Flash Cyber para descubrimiento de vulnerabilidades controlado. El anuncio marca un cambio de ganancias de capacidad bruta a optimización de eficiencia de tokens y costos para cargas de trabajo agentes de producción.
Gemini 3.6 Flash reduce el uso de tokens de salida en un 17% en comparación con 3.5 Flash en el Índice de Análisis Artificial, con algunos benchmarks como Datacurve DeepSWE mostrando reducciones de hasta 65%. El modelo tiene un precio de $1.50/1M tokens de entrada y $7.50/1M tokens de salida, por debajo de la salida de $9/1M de 3.5 Flash. Requiere fewer razonamiento y llamadas de herramientas para realizar flujos de trabajo de más pasos, haciéndolo más económico por tarea de agente completada.
En benchmarks de codificación y trabajo de conocimiento, 3.6 Flash anota 49% en DeepSWE versus 37% para 3.5 Flash, 63.9% en MLE Bench versus 49.7%, y 83% en uso de computadora OSWorld-Verified versus 78.4%. La fecha de corte de conocimiento avanza de enero de 2025 a marzo de 2026. 3.5 Flash-Lite apunta a tareas de alto rendimiento en 350 tokens de salida/segundo y precios de $0.30/$2.50, mientras que 3.5 Flash Cyber (restringido a gobiernos y socios de confianza) maneja parches de vulnerabilidad a un costo de token más bajo que modelos más grandes.
Para constructores, Gemini 3.6 Flash subestima a GPT-5.6 Terra Max, Kimi K3 y Qwen 3.7 Max en precio por tarea, señalando el giro de Google hacia economía de agentes sobre posicionamiento de tabla de clasificación. El lanzamiento ocurre mientras el flagship 3.5 Pro de Google permanece en pruebas con socios, con pre-entrenamiento de Gemini 4 ya en curso. Para arquitectos, las ganancias de eficiencia de tokens y reducciones de costos hacen que 3.6 Flash sea competitivo para cargas de trabajo agentes de alto volumen, aunque las compensaciones de profundidad de razonamiento versus latencia siguen siendo importantes para la selección de aplicaciones.
Fuentes
- Primary source
- blog.google
“3.6 Flash reduces output token usage by 17% compared to 3.5 Flash on the Artificial Analysis Index”
- cnbc.com
“Gemini 3.6 Flash uses up to 17% fewer tokens and costs less per token, while Gemini 3.5 Flash-Lite targets faster, high-volume workloads”