Together AI executou DeepSeek-V4 Flash 0731 e GPT-5.6 Luna frente a frente no DeepSWE — 113 tarefas reais de codificação de longo horizonte de repositórios open-source vivos, quatro tentativas por tarefa, avaliadas aprovado/reprovado por suite de testes oculta. Luna é o engenheiro melhor. DeepSeek é barato o suficiente para que rotear algum trabalho para DeepSeek primeiro e escalar para Luna em caso de falha vença Luna sozinha em precisão e custo.

A liderança de Luna em qualidade de disparo único é clara. Pass@1: 67,2% vs 53,3%. A lacuna persiste em cada contagem de tentativas iguais: 81,6% vs 70,1% em k=2, 90,3% vs 80,5% em k=4. Luna também roda mais rápido — 16 minutos mediana vs 23, 92 passos vs 148, e produz menos: 70k tokens vs 104k. Para capacidade bruta, esta não é uma disputa próxima.

O custo inverte a história. DeepSeek roda $0,10 por tentativa; Luna $0,61 — uma diferença de 6x. Isso resulta em 532 DeepSeek soluções por $100 versus 110 para Luna. Concretamente: pass@2 do DeepSeek (70,1%) já corresponde ao pass@1 de Luna (67,2%), e duas tentativas de DeepSeek custam $0,20 — um terço de uma única execução de Luna. Com um verificador para escolher a tentativa vencedora, DeepSeek corresponde à qualidade de primeira tentativa de Luna em um terço do custo.

A cascata é a resposta prática. Execute DeepSeek primeiro; escale para Luna em caso de falha. Together AI mediu isso em 78,9% de precisão de tarefa e $0,385 por tarefa. Isso supera Luna sozinha (67,2%) e reduz Luna-para-tudo em 37%. Para equipes executando cargas de trabalho de agente de código em escala, este é o arbitragem que o benchmark revela.

Os modos de falha também favorecem DeepSeek. Quando DeepSeek falha, ele quebra testes existentes em 9% dos casos. Luna faz isso 15% das vezes — consistente com a assinatura de regressão 15-20% que Together AI vê em modelos de linhagem GPT incluindo Sol. Ambos falham principalmente por quase acerto (DeepSeek 69%, Luna 66%), mas o modelo mais caro é mais provável de corromper código em funcionamento. A implicação prática: implantações de Luna precisam de portas de regressão completa. DeepSeek precisa menos.

O detalhamento de domínio e linguagem revela onde cada modelo pertence. Luna vence em 7 de 8 domínios de tarefa. Suas vantagens são mais nítidas em análise de programa (69% vs 33%), concorrência e durabilidade (70% vs 38%), e internals de tempo de execução de linguagem (86% vs 59%) — aproximadamente lacunas de 30 pontos em trabalho de raciocínio. A vitória de domínio único do DeepSeek é linguagens de consulta e configuração (78% vs 70%): construtores SQL, funções de janela, paginação de keyset, analisadores de configuração. Código estruturado, em forma de esquema, que segue convenção é onde DeepSeek se destaca. Luna vence em todas as cinco linguagens de programação. DeepSeek é respeitável em Rust (55% vs 60%) e Go (62% vs 79%). JavaScript é um penhasco: 35% para DeepSeek contra 60% para Luna. Se sua stack de agente toca JavaScript, DeepSeek é uma falsa economia. Se vive em configuração, consulta ou Rust, DeepSeek fecha a maior parte da lacuna.

Em $0,10 por tarefa, DeepSeek-V4 Flash ganha seu lugar como o primeiro estágio de qualquer pipeline de agente de código ciente de custo. Rotear consulta e trabalho de configuração para ele por padrão. Use-o como uma camada de fan-out barata para pass@k. Escale para Luna para tarefas com uso intensivo de raciocínio ou JavaScript onde a lacuna de capacidade do DeepSeek é real e mensurável.