Um terço dos patches de código que passam em todos os outros testes falham na validação de serving end-to-end em tarefas SGLang, revelando que a conclusão de tarefas locais não garante correção em produção. Pesquisadores da NVIDIA e UC Berkeley construíram SWE-Serve, um benchmark de 53 tarefas fundamentado em mudanças de produção do SGLang, um sistema de inference-serving de código aberto, para medir esse gap diretamente.

O benchmark abrange seis famílias de engenharia de inferência: habilitação de modelo e backend, decodificação especulativa e avançada, kernels e quantização, caching e estado de runtime, execução distribuída e APIs de serving. As tarefas variam de correções de correção localizadas a integrações que cruzam limites de API, scheduling e estado de runtime. A solução oracle mediana altera 553 linhas em sete arquivos, com algumas tarefas exigindo até 6.077 linhas em 35 arquivos. Cada tarefa executa em CPU ou em uma única GPU H100 e inclui testes funcionais e de regressão ocultos, com 19 tarefas adicionando testes end-to-end de model-serving que lançam um processo de serving autônomo e validam comportamento através de interfaces de requisição públicas.

Em 11 modelos e 31 configurações de esforço de modelo, a configuração com melhor desempenho alcança 75% de pass@1 médio. Claude Opus 5 e GPT-5.6 Sol ambos atingem 75% de pass@1, embora com custos de recursos diferentes: Opus 5 em esforço máximo custa $17.40 por tarefa com 122k tokens de saída, enquanto Sol em esforço máximo custa $12.26 com 52k tokens. O benchmark revela um spread de 40 pontos percentuais em desempenho entre modelos, de 75% para os melhores desempenhos até 35% para Inkling S.

O gap de correção em produção emerge claramente quando testes end-to-end de model-serving são removidos da pontuação. Em 19 tarefas com cobertura end-to-end, a taxa de pass salta de 45.9% sob o verificador completo para 69.4% quando testes E2E são excluídos, um aumento de 23.4 pontos percentuais que se mantém em todas as 11 configurações top-per-model. Um controle pareado removendo o mesmo número de testes não-E2E produz apenas 8.0 transições fail-to-pass em média, comparado com 16.1 para remoção de testes E2E—uma diferença de 2.0×. Na tarefa core-serving de mixture-of-experts Gemma 4, 48.5% dos patches criados por agentes passaram em todos os testes não-E2E mas falharam em pelo menos um teste E2E, incapazes de servir o modelo especificado corretamente através das interfaces públicas do servidor ativo.

Além de serving end-to-end, tarefas testando múltiplos domínios de runtime mostram taxas de pass substancialmente mais baixas. As 26 tarefas de domínio de runtime único têm taxa de pass média de 69.0%, enquanto as 27 tarefas de multi-runtime-domain têm média de 47.7%—um gap de 21.3 pontos percentuais. Tarefas testando explicitamente coordenação concorrente mostram quedas ainda mais íngremes, com taxas de pass 29.0 pontos percentuais mais baixas que tarefas sem esse requisito. Requisitos de persistent-state correlacionam com taxas de pass 20.8 pontos percentuais mais baixas em tarefas GPU. Esses gaps persistem mesmo em esforço máximo de raciocínio: aumentar esforço melhora taxas de pass agregadas mas não fecha consistentemente os gaps de correção em produção.

O benchmark impõe avaliação closed-book, bloqueando acesso à web pública e repositório upstream durante execução de agentes. Um piloto open-book confirmou que todos os três modelos avaliados recuperaram soluções upstream específicas de tarefas, então a configuração closed-book previne agentes de copiar soluções. Cada trajetória de avaliação foi auditada para recuperação proibida; nenhum teste foi invalidado nessa base. O benchmark admite apenas 34% dos candidatos de tarefa após qualificação: 53 de 156 candidatos passaram em controles executáveis exigindo patches no-op para falhar em todos os testes fail-to-pass e passar em todos os testes pass-to-pass, enquanto soluções oracle passam em todos os testes. Probing adversarial assistido por agentes identificou vulnerabilidades em instruções de tarefas e verificadores, levando a 27 candidatos de tarefa exigindo mudanças de verificador antes da admissão.

Para times entregando sistemas de inferência, o takeaway é direto: passagem em testes locais não valida serving em produção, e testes end-to-end através de caminhos de serving ativo devem ser parte do gate de avaliação.