O benchmark da Together AI na suite de codificação DeepSWE mostra DeepSeek-V4 Flash 0731 (lançado em 31 de julho) em $0,10 por tarefa vs. GPT-5.6 Luna em $0,61—uma diferença de custo aproximadamente 6 vezes maior. Embora GPT-5.6 Luna leve em precisão de disparo único (67,2% vs. 53,3% pass@1), a economia reescreve em escala: o pass@2 do DeepSeek (70,1%) já corresponde à qualidade de primeira tentativa de Luna por aproximadamente um terço do custo. O preço por token favorece DeepSeek acentuadamente na saída ($0,18 vs. $1,20 por milhão de tokens), embora a entrada recentemente desconta de Luna ($0,20 vs. $0,09) tenha reduzido a diferença de entrada.
DeepSeek falha de forma mais graciosa: quando falha, corrompe suites de teste existentes em apenas 9% das falhas vs. 15% de Luna—a assinatura de regressão dos modelos da linhagem OpenAI. Por domínio, Luna domina tarefas intensivas em raciocínio (análise de programa, concorrência, internals de linguagem, gaps ~30 pontos), mas DeepSeek se sai bem em trabalho estruturado—construtores SQL, análise de configuração, problemas em forma de esquema—onde até lidera. O desempenho JavaScript do DeepSeek fica atrás acentuadamente (35% vs. 60%), uma bandeira de risco para codebases intensivas em JS.
Uma estratégia em cascata—executando DeepSeek primeiro e escalando apenas em caso de falha—resolve 78,9% das tarefas DeepSWE em $0,385 cada: mais preciso que Luna sozinho, 37% mais barato. Para arquitetos escalando agentes de codificação, este benchmark enfatiza a vantagem de custo por solução do DeepSeek e o valor do roteamento multi-modelo com gate de verificação. A vantagem restante de Luna é entrada multimodal e profundidade do ecossistema OpenAI; a de DeepSeek é pesos abertos (licença MIT) e otimização para agentes.