DeepSeek V4-Flash 0731 sai de pré-visualização com pontuação de inteligência 50, 60% mais barato que GPT-5.6 Luna
DeepSeek lançou oficialmente o V4-Flash 0731 em 31 de julho de 2026, movendo o modelo do status de pré-visualização para disponibilidade de nível de produção. O modelo Mixture of Experts de 284 bilhões de parâmetros (13B ativo) alcançou uma pontuação do Artificial Analysis Intelligence Index de 50—um salto de 10 pontos sobre a pré-visualização de abril e apenas 1 ponto abaixo do recém-desconto GPT-5.6 Luna da OpenAI (51 em esforço máximo). A atualização veio apenas por pós-treinamento, sem mudanças arquitetônicas, e o modelo chega com suporte de integração Codex e o módulo de decodificação especulativa DSpark integrado.
Na API de DeepSeek, V4-Flash 0731 custa $0,14 por milhão de tokens de entrada e $0,28 por milhão de tokens de saída, com desconto agressivo de cache de 98% para $0,0028 em tokens em cache. Considerando as taxas típicas de acerto de cache (relação 7:2:1 de cache/entrada/saída), o custo mesclado cai para $0,06 por milhão de tokens. A Artificial Analysis calcula o custo da tarefa do modelo em aproximadamente 60% mais barato que Luna, apesar de corresponder à inteligência em benchmarks de agentes de codificação. O modelo é licenciado MIT e disponível no Hugging Face (embora os pesos 0731 ainda não tenham sido publicados; a versão atual ainda é a pré-visualização de abril), executável localmente em 168GB para 4-bit sem perdas ou 110GB para quantização 3-bit.
Para construtores e equipes de infraestrutura, o sequenciamento importa: DeepSeek escolheu produtizar Flash (a camada de baixo custo) primeiro enquanto mantinha V4-Pro (flagship de 1,6T) em pré-visualização. Isso inverte o enquadramento clássico "maior é melhor" e sinaliza que a qualidade de pós-treinamento e compatibilidade de harness agora superam a contagem de parâmetros para cargas de trabalho agenticas empresariais. O lançamento Flash 0731 vem um dia após os cortes de preços Luna da OpenAI, remoldando a curva de preço-desempenho novamente e continuando o padrão de modelos chineses estabelecendo o ritmo no custo enquanto laborat órios frontier competem em velocidade e confiabilidade.
Fontes
- Primary source
- DeepSeek V4 Flash 0731: Official Release, Agent Benchmarks
“284B/13B MoE, same architecture re-post-trained, MIT-licensed, Artificial Analysis scores 50 on Intelligence Index”
- DeepSeek API Changelog
“DeepSeek-V4-Flash API now in public beta with Codex support and significantly enhanced agent capabilities”
- Artificial Analysis: DeepSeek V4 Flash 0731
“Cost per task 60% lower than Luna at matching intelligence; $0.06 blended rate on 7:2:1 cache/input/output ratio”