A linha dupla V4 da DeepSeek de fine-tuning final de julho de 2026 aguça o compromisso custo-qualidade. V4-Flash ($0.14 input / $0.28 output por 1M tokens) é posicionado como o animal de carga de alto volume, enquanto V4-Pro ($0.435 input / $0.87 output por 1M tokens) aponta para raciocínio e codificação mais difíceis. Em tokens de output, Flash custa aproximadamente 68% menos que Pro, ou cerca de 12,4× mais barato por unidade. A distinção importa porque a maioria dos desenvolvedores paga por output, não por input, quando o contexto já está carregado.
Nos benchmarks padrão de engenharia de software, V4-Flash atinge ~79% em SWE-bench Verified (resolvendo problemas GitHub reais) versus ~80,6% para Pro. A atualização pós-treinamento -0731 especificamente ajustou Flash para tarefas agenticas: Terminal-Bench 2.1 em 82.7, Toolathlon Verified em 70.3 e DeepSWE em 54.4 — competitivos com modelos muito maiores de código fechado. DeepSeek observou a atualização como um refinamento pós-treinamento, não uma nova arquitetura, e manteve o nome do modelo (deepseek-v4-flash) estável para que integrações existentes obtenham a melhoria automaticamente.
Comparado aos modelos de fronteira ocidentais, Flash permanece 95% mais barato em input e 98% mais barato em output versus Claude Sonnet 4.6, e 85% mais barato que o próprio V4-Pro em base por token. O preço de cache-hit cai o input Flash para $0.003 por 1M, tornando workloads de prefixo repetido praticamente grátis após a primeira passagem. DeepSeek anunciou um aumento de preço futuro (data efetiva e magnitude a confirmar), mas o current rate card permanece.
Para equipes de engenharia construindo sistemas agenticos de alto volume, RAG de documento longo ou assistentes de codificação, o custo baixo de output do V4-Flash e capacidade suficiente de raciocínio invertem a equação longe da consolidação de modelo único em direção a roteamento inteligente: V4-Flash por padrão, modo raciocínio Flash@max para a maioria do trabalho, e escalação Pro apenas para a minoria mais difícil. Essa estratégia de roteamento tipicamente corta contas 60-80% mantendo qualidade em 95% das tarefas.