DeepSeek lançou oficialmente o V4-Flash 0731 em 31 de julho de 2026, movendo o modelo do status de pré-visualização para disponibilidade de nível de produção. O modelo Mixture of Experts de 284 bilhões de parâmetros (13B ativo) alcançou uma pontuação do Artificial Analysis Intelligence Index de 50—um salto de 10 pontos sobre a pré-visualização de abril e apenas 1 ponto abaixo do recém-desconto GPT-5.6 Luna da OpenAI (51 em esforço máximo). A atualização veio apenas por pós-treinamento, sem mudanças arquitetônicas, e o modelo chega com suporte de integração Codex e o módulo de decodificação especulativa DSpark integrado.
Na API de DeepSeek, V4-Flash 0731 custa $0,14 por milhão de tokens de entrada e $0,28 por milhão de tokens de saída, com desconto agressivo de cache de 98% para $0,0028 em tokens em cache. Considerando as taxas típicas de acerto de cache (relação 7:2:1 de cache/entrada/saída), o custo mesclado cai para $0,06 por milhão de tokens. A Artificial Analysis calcula o custo da tarefa do modelo em aproximadamente 60% mais barato que Luna, apesar de corresponder à inteligência em benchmarks de agentes de codificação. O modelo é licenciado MIT e disponível no Hugging Face (embora os pesos 0731 ainda não tenham sido publicados; a versão atual ainda é a pré-visualização de abril), executável localmente em 168GB para 4-bit sem perdas ou 110GB para quantização 3-bit.
Para construtores e equipes de infraestrutura, o sequenciamento importa: DeepSeek escolheu produtizar Flash (a camada de baixo custo) primeiro enquanto mantinha V4-Pro (flagship de 1,6T) em pré-visualização. Isso inverte o enquadramento clássico "maior é melhor" e sinaliza que a qualidade de pós-treinamento e compatibilidade de harness agora superam a contagem de parâmetros para cargas de trabalho agenticas empresariais. O lançamento Flash 0731 vem um dia após os cortes de preços Luna da OpenAI, remoldando a curva de preço-desempenho novamente e continuando o padrão de modelos chineses estabelecendo o ritmo no custo enquanto laborat órios frontier competem em velocidade e confiabilidade.