aiexpert
Início / Notícias / Nota
Research · 10 de ago. de 2026, 14:03 · 4 fontes

DeepSeek V4-Flash oficial bate V4-Pro em benchmarks de agentes; Terminal Bench 2.1 atinge 82,7

DeepSeek lançou DeepSeek-V4-Flash-0731 em beta público em 31 de julho de 2026, como lançamento oficial do modelo que bateu V4-Pro-Preview em todos os nove benchmarks de agentes publicados, com Terminal Bench 2.1 pontuando 82,7 no mesmo preço de $0,14 por 1M de entrada e $0,28 por 1M de saída.

O V4-Flash-0731 usa exatamente a mesma arquitetura e tamanho da versão de pré-visualização de abril (parâmetros totais de 284B, ~13B ativos em Mixture-of-Experts)—apenas o pós-treinamento foi refeito. Os benchmarks de agentes incluíram Cybergym 76,7, NL2Repo 54,2, DeepSWE 54,4, Toolathlon verificado 70,3, Agent Last Exam 25,2, Automation Bench 25,1, DSBench-FullStack 68,7 e DSBench-Hard 59,6.

O V4-Flash oficial suporta nativamente o formato Responses API e foi especialmente adaptado para Codex, permitindo integração direta sem shim de tradução. A $0,14 por milhão de tokens de entrada, V4-Flash é o modelo de agente mais econômico do mercado, entregando 82,7 em Terminal Bench 2.1 versus Opus-4.8's 85,0, uma diferença de apenas 2,3 pontos, por uma fração do preço. Para construtores: um modelo mais barato batendo a tier cara em trabalho de agente através de pós-treinamento sinaliza uma lacuna de qualidade se estreitando em tarefas padrão de agente. Verifique contra sua própria carga de trabalho antes de trocar.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source deepseek.ai
  2. 02 flowtivity.ai flowtivity.ai “DeepSeek V4-Flash just scored 82.7 on Terminal Bench 2.1, beating V4-Pro-Preview by 14.7%”
  3. 03 morphllm.com morphllm.com “DeepSeek V4-Flash: 284B total, 13B active, $0.14/M input, $0.28/M output”
  4. 04 deepseekv4guide.org deepseekv4guide.org “Terminal-Bench 2.1 hits 82.7; DeepSWE 54.4; Agent Last Exam 25.2”