Together AI ejecutó DeepSeek-V4 Flash 0731 y GPT-5.6 Luna frente a frente en DeepSWE — 113 tareas reales de codificación de largo horizonte de repositorios open-source vivos, cuatro ensayos por tarea, calificadas aprobado/reprobado por suite de pruebas oculta. Luna es el ingeniero mejor. DeepSeek es lo suficientemente barato para que enrutar algo de trabajo a DeepSeek primero y escalar a Luna en caso de fallo supere a Luna solo en precisión y costo.
El liderazgo de Luna en calidad de disparo único es claro. Pass@1: 67,2% vs 53,3%. La brecha se mantiene en cada conteo de intentos igual: 81,6% vs 70,1% en k=2, 90,3% vs 80,5% en k=4. Luna también se ejecuta más rápido — 16 minutos mediana vs 23, 92 pasos vs 148, y produce menos: 70k tokens vs 104k. Para capacidad bruta, esto no es una competencia cerrada.
El costo invierte la historia. DeepSeek corre $0,10 por intento; Luna $0,61 — una diferencia de 6x. Eso produce 532 soluciones de DeepSeek por $100 versus 110 para Luna. Concretamente: el pass@2 de DeepSeek (70,1%) ya iguala el pass@1 de Luna (67,2%), y dos intentos de DeepSeek cuestan $0,20 — un tercio de una ejecución única de Luna. Con un verificador para elegir el intento ganador, DeepSeek iguala la calidad de primer intento de Luna a un tercio del costo.
La cascada es la respuesta práctica. Ejecuta DeepSeek primero; escala a Luna en caso de fallo. Together AI midió esto en 78,9% de precisión de tarea y $0,385 por tarea. Eso supera a Luna solo (67,2%) y reduce Luna-para-todo en 37%. Para equipos ejecutando cargas de trabajo de agente de código a escala, este es el arbitraje que el benchmark revela.
Los modos de fallo también favorecen a DeepSeek. Cuando DeepSeek falla, rompe pruebas existentes en 9% de los casos. Luna lo hace 15% de las veces — consistente con la firma de regresión del 15-20% que Together AI ve en modelos de linaje GPT incluyendo Sol. Ambos fallan principalmente por fallo cercano (DeepSeek 69%, Luna 66%), pero el modelo más caro es más probable que corrompa código funcionando. La implicación práctica: las implementaciones de Luna necesitan puertas de regresión completa. DeepSeek necesita menos.
El desglose de dominio y lenguaje revela dónde pertenece cada modelo. Luna gana en 7 de 8 dominios de tareas. Sus ventajas son más agudas en análisis de programa (69% vs 33%), concurrencia y durabilidad (70% vs 38%), e internals de tiempo de ejecución de lenguaje (86% vs 59%) — aproximadamente brechas de 30 puntos en trabajo de razonamiento. La única victoria de dominio de DeepSeek es lenguajes de consulta y configuración (78% vs 70%): constructores SQL, funciones de ventana, paginación de keyset, analizadores de configuración. Código estructurado, con forma de esquema, que sigue convención es donde DeepSeek se destaca. Luna gana en los cinco lenguajes de programación. DeepSeek es respetable en Rust (55% vs 60%) y Go (62% vs 79%). JavaScript es un acantilado: 35% para DeepSeek contra 60% para Luna. Si tu stack de agente toca JavaScript, DeepSeek es una falsa economía. Si vive en configuración, consulta o Rust, DeepSeek cierra la mayor parte de la brecha.
A $0,10 por tarea, DeepSeek-V4 Flash se gana su lugar como la primera etapa de cualquier pipeline de agente de código consciente de costos. Enruta consulta y trabajo de configuración a él por defecto. Úsalo como una capa de fan-out barata para pass@k. Escala a Luna para tareas con uso intensivo de razonamiento o JavaScript donde la brecha de capacidad de DeepSeek es real y medible.