A partir del 16 de agosto de 2026, DeepSeek decretó recargos de precios en horas pico en toda su línea V4: V4 Pro sube a $3.96 por 1M tokens de salida en pico (9 AM–12 PM, 2 PM–6 PM UTC), 4.5× la tasa de off-pico de $0.88. V4 Flash alcanza el pico en $1.32 por 1M tokens de salida (vs. $0.66 off-pico), también ~2×. El precio de entrada se duplica de manera similar: V4 Pro de $0.435 a $0.87; V4 Flash de $0.14 a $0.28. Esto representa el primer cambio de costo de API material desde el lanzamiento de V4 el 31 de julio y es explicitamente distinto del descuento heredado de off-pico de V3 que fue descontinuado con el lanzamiento de V4.
DeepSeek había advertido a desarrolladores el 6 de agosto de un "aumento significativo" sin fecha divulgada; el lanzamiento del 16 comprimió la ventana de transición. La empresa marcosó el recargo como gestión de demanda durante ventanas de uso pico en zonas horarias chinas y estadounidenses. El almacenamiento en caché de contexto aún se aplica: las entradas de caché-hit caen a $0.0028/M, preservando descuentos pronunciados para aplicaciones con prefijos estábles (prompts del sistema, documentos repetidos). Para cargas de trabajo de caché-miss-heavy, las tasas efectivas aumentan considerablemente.
El precio ultra bajo de DeepSeek se había convertido en un ancla de costo para la industria. V4 Flash en $0.14/M de entrada había sido 20–60× más barato que modelos de frontera de OpenAI o Anthropic y cambió la economía unitaria del procesamiento por lotes, clasificación y cargas de trabajo agentas de alto rendimiento. Miles de equipos construíram presupuestos de inferencia alrededor de esas tarifas. El aumento señala un punto de inflexión: la era de inferencia de LLM casi a nivel libre puede estar terminando. Los competidores (OpenAI, Anthropic, Google) no han movido precios en respuesta, pero la presión del mercado se está intensificando.
Para arquitectos: los modelos de costo construidos alrededor del precio mínimo de DeepSeek ahora están obsoletos. Los recargos en horas pico crean tres decisiones tácticas: (1) programar cargas de trabajo de lote/no interactivas para ventanas de off-pico para reducir costos a la mitad; (2) reconstruir prompts y flujos de trabajo para maximizar golpes en caché (tasas de golpe 90%+ pueden reducir el costo de entrada efectiva 80–90%); (3) evaluar el enrutamiento multi-proveedor para cambiar tráfico cuando los precios cruzan umbrales de calidad de costo. Los equipos que dependían de DeepSeek como un único proveedor de costo eficiente ahora deben hacer una prueba de estrés de presupuestos de pronósticos contra tasas de pico. Para aplicaciones de producción, V4 Flash de off-pico permanece 5–10× más barato que GPT-4o o Claude 3.5 Sonnet; la brecha absoluta se estrechaba pero la ventaja de costo persiste en tiempos de off-pico.