Começando em 16 de agosto de 2026, DeepSeek decretou sobrecargos de preço em hora de pico em toda a sua linha V4: V4 Pro sobe para $3.96 por 1M tokens de output em pico (9 AM–12 PM, 2 PM–6 PM UTC), 4.5× a taxa de off-pico de $0.88. V4 Flash chega ao pico em $1.32 por 1M tokens de output (vs. $0.66 off-pico), também ~2×. Preço de input similarmente dobra: V4 Pro de $0.435 para $0.87; V4 Flash de $0.14 para $0.28. Isto representa a primeira mudança material de custo de API desde o lançamento de V4 em 31 de julho e é explicitamente distinto do desconto de off-pico legado de V3 que foi depreciado com o lançamento de V4.
DeepSeek tinha avisado desenvolvedores em 6 de agosto de um "aumento significativo" sem data divulgada; o rollout de 16 comprimiu a janela de transição. A empresa enquadrou a sobrecarga como gestão de demanda durante janelas de uso de pico em zonas horárias chinesas e dos EUA. O caching de contexto ainda se aplica: inputs de cache-hit caem para $0.0028/M, preservando descontos ngremes para aplicações com prefixos estáveis (prompts do sistema, documentos repetidos). Para workloads de cache-miss-heavy, taxas efetivas sobem drasticamente.
O preço ultra-baixo da DeepSeek tinha se tornado uma âncora de custo para a indústria. V4 Flash em $0.14/M de input tinha sido 20–60× mais barato que modelos de fronteira de OpenAI ou Anthropic e mudou a economia unitária de processamento em lote, classificação, e workloads agentos de alta taxa. Milhares de times construíram orçamentos de inferência em torno daquelas taxas. O aumento sinaliza um ponto de inflexão: a era de inferência de LLM perto de nível-livre pode estar terminando. Competidores (OpenAI, Anthropic, Google) não moveram preços em resposta, mas pressão de mercado está montando.
Para arquitetos: modelos de custo construídos em torno do preço piso da DeepSeek agora são obsoletos. Sobrecargos de hora de pico criam três decisões táticas: (1) agendar workloads de lote/não-interativos para janelas de off-pico para reduzir custos; (2) reconstruir prompts e workflows para maximizar cache hits (taxas de hit 90%+ podem derrubar custo de input efetivo 80–90%); (3) avaliar roteamento multi-provedor para trocar tráfego quando preços cruzam limiares de qualidade de custo. Times que dependiam de DeepSeek como um provedor único de custo eficiente devem agora teste-estresse orçamentos previsões contra taxas de pico. Para aplicações de produção, V4 Flash de off-pico permanece 5–10× mais barato que GPT-4o ou Claude 3.5 Sonnet; a lacuna absoluta se estreitou mas a vantagem de custo persiste em tempos de off-pico.