DeepSeek V4 Flash, lanzado el 1º de agosto de 2026, cuesta aproximadamente 3 centavos por prueba del Índice de Inteligencia de Análisis Artificial—el modelo más barato conocido por un factor de 30. Moonshot Kimi K3 cuesta 86 centavos por prueba, GPT-5.6 Sol de OpenAI $1,86, y Claude Fable 5 de Anthropic $3,15. El precio publicado es de $0,14 por millón de tokens de entrada y $0,28 por millón de tokens de salida. V4 Flash puntuea 50 en el Índice de Inteligencia, igualando a Google Gemini 3.6 Flash y colocándose un punto detrás de Muse Spark 1.1 de Meta, pero muy por debajo de los modelos fronterizos Claude Opus 5 (61), Claude Fable 5 (60) y GPT-5.6 Sol (59).
El modelo es una Mezcla de Expertos con 284 mil millones de parámetros totales y 13 mil millones activados, soportando una ventana de contexto de 1 millón de tokens. Una actualización de post-entrenamiento del 31 de julio impulsó un salto masivo: DeepSeek V4 Flash puntea 54% en benchmarks de codificación agentic (DeepSWE), desde 7% en la versión de vista previa. En Terminal Bench 2.1, puntea 82.7%, superando el V4-Pro-Preview más pesado en 72.1%—una inversión donde el modelo presupuestario de DeepSeek supera a su hermano premium. El modelo está disponible a través de la API de DeepSeek con un nuevo checkpoint V4-Flash-0731; los pesos se abrieron bajo Licencia MIT en Hugging Face.
Para los profesionales, V4 Flash reescribe la economía unitaria de implementaciones agentic de alto volumen. A los precios actuales de tokens y el benchmark de costo por prueba, se convierte en el estándar para asistentes de codificación, generación aumentada de recuperación y bucles de agentes donde el rendimiento importa más que el razonamiento fronterizo. La recaudación reciente de $7 mil millones de DeepSeek le da a la empresa sala de maniobra para mantener precios agresivos mientras otros laboratorios reducen tasas. La compensación es clara: los modelos fronterizos se mantienen adelante en razonamiento y trabajo agentic de largo horizonte, pero la brécha con V4 Flash ahora es lo suficientemente pequeña como para que el enrutamiento, almacenamiento en caché y loteado—no la elección del modelo—se conviertan en la palanca de costo.