aiexpert
Início / Notícias / Nota
Market · 10 de ago. de 2026, 15:04 · 4 fontes

DeepSeek V4-Flash custa 67% menos que V4-Pro em output; ~79% de qualidade de codificação a 1/3 do preço

A linha dupla V4 da DeepSeek de fine-tuning final de julho de 2026 aguça o compromisso custo-qualidade. V4-Flash ($0.14 input / $0.28 output por 1M tokens) é posicionado como o animal de carga de alto volume, enquanto V4-Pro ($0.435 input / $0.87 output por 1M tokens) aponta para raciocínio e codificação mais difíceis. Em tokens de output, Flash custa aproximadamente 68% menos que Pro, ou cerca de 12,4× mais barato por unidade. A distinção importa porque a maioria dos desenvolvedores paga por output, não por input, quando o contexto já está carregado.

Nos benchmarks padrão de engenharia de software, V4-Flash atinge ~79% em SWE-bench Verified (resolvendo problemas GitHub reais) versus ~80,6% para Pro. A atualização pós-treinamento -0731 especificamente ajustou Flash para tarefas agenticas: Terminal-Bench 2.1 em 82.7, Toolathlon Verified em 70.3 e DeepSWE em 54.4 — competitivos com modelos muito maiores de código fechado. DeepSeek observou a atualização como um refinamento pós-treinamento, não uma nova arquitetura, e manteve o nome do modelo (deepseek-v4-flash) estável para que integrações existentes obtenham a melhoria automaticamente.

Comparado aos modelos de fronteira ocidentais, Flash permanece 95% mais barato em input e 98% mais barato em output versus Claude Sonnet 4.6, e 85% mais barato que o próprio V4-Pro em base por token. O preço de cache-hit cai o input Flash para $0.003 por 1M, tornando workloads de prefixo repetido praticamente grátis após a primeira passagem. DeepSeek anunciou um aumento de preço futuro (data efetiva e magnitude a confirmar), mas o current rate card permanece.

Para equipes de engenharia construindo sistemas agenticos de alto volume, RAG de documento longo ou assistentes de codificação, o custo baixo de output do V4-Flash e capacidade suficiente de raciocínio invertem a equação longe da consolidação de modelo único em direção a roteamento inteligente: V4-Flash por padrão, modo raciocínio Flash@max para a maioria do trabalho, e escalação Pro apenas para a minoria mais difícil. Essa estratégia de roteamento tipicamente corta contas 60-80% mantendo qualidade em 95% das tarefas.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source deepseek.ai
  2. 02 DeepSeek API Pricing 2026: V4-Flash & V4-Pro Per-Token Costs deepseek.ai “V4-Flash $0.14/$0.28; V4-Pro $0.435/$0.87 per 1M tokens”
  3. 03 DeepSeek V4 Pro vs DeepSeek V4 Flash: Performance, Pricing, and When to Use Each codersera.com “Flash@max roughly matches Pro@high on reasoning while costing about 12.4x less per output token”
  4. 04 DeepSeek V4 Flash vs V4 Pro: Efficiency vs Flagship orcarouter.ai “aggregator evaluations put V4 Flash (Max) around 79.0% on SWE-bench Verified versus about 80.6% for V4 Pro”