El benchmark de Together AI en la suite de codificación DeepSWE muestra DeepSeek-V4 Flash 0731 (lanzado el 31 de julio) a $0,10 por tarea vs. GPT-5.6 Luna a $0,61—una diferencia de costo aproximadamente 6 veces mayor. Aunque GPT-5.6 Luna lidera en precisión de disparo único (67,2% vs. 53,3% pass@1), la economía se reescribe a escala: el pass@2 de DeepSeek (70,1%) ya iguala la calidad de primer intento de Luna por aproximadamente un tercio del costo. El precio por token favorece a DeepSeek bruscamente en salida ($0,18 vs. $1,20 por millón de tokens), aunque la entrada recientemente descuentada de Luna ($0,20 vs. $0,09) ha reducido la brecha de entrada.
DeepSeek falla más gracefully: cuando falla, corrompe suites de prueba existentes solo en el 9% de fallos vs. 15% de Luna—la firma de regresión de los modelos de linaje OpenAI. Por dominio, Luna domina tareas de razonamiento intensivo (análisis de programa, concurrencia, internals de lenguaje, gaps ~30 puntos), pero DeepSeek se desempeña bien en trabajo estructurado—constructores SQL, análisis de configuración, problemas en forma de esquema—donde incluso lidera. El desempeño de JavaScript de DeepSeek se queda atrás bruscamente (35% vs. 60%), una bandera de riesgo para codebases intensivas en JS.
Una estrategia en cascada—ejecutando DeepSeek primero y escalando solo en caso de fallo—resuelve el 78,9% de tareas DeepSWE a $0,385 cada una: más preciso que Luna solo, 37% más barato. Para arquitectos escalando agentes de codificación, este benchmark subraya la ventaja de costo por solución de DeepSeek y el valor del enrutamiento multi-modelo controlado por verificación. La ventaja restante de Luna es entrada multimodal y profundidad del ecosistema OpenAI; la de DeepSeek es pesos abiertos (licencia MIT) y optimización para agentes.