Together AI comparó DeepSeek V4 Pro 0813 con GPT-5.6 Sol de OpenAI en DeepSWE, un benchmark de ingeniería de software entre tipos de tareas e idiomas. Sol gana single-shot: 72.7% pass@1 vs 62.8% de Pro. Pero en pass@4 (cuatro reintentos), Pro se adelanta: 88.5% vs 85.8%. La diferencia crítica: DeepSeek cuesta $0.24 por rollout, mientras que Sol cuesta $8.37 por rollout—una brecha de 35x.
A escala, Pro genera 260 resoluciones de tareas por $100 gastados frente a 9 del Sol. Sol es más rápido (17 min vs 35 min promedio, 53 pasos vs 146) y más preciso por intento. Pro es confiable a menor costo y gana en tareas de Rust; Sol domina Python/Go. Los modos de falla difieren: Sol rompe suites de pruebas existentes en el 20% de las fallas (firma de regresión de familia GPT); Pro es más conservador en 11%.
La estrategia óptima es una cascada: ejecute Pro primero, escale a Sol en fallos de prueba. Este enfoque híbrido resuelve el 83% de las tareas DeepSWE a $3.35 por tarea—10 puntos porcentuales por encima de Sol-only al 40% del costo unitario de Sol. Para equipos con presupuestos de latencia, Sol es premium; para inferencia con restricción de costos o trabajo por lotes, Pro-first cascading invierte la economía.