Cognition lanzó SWE-2, un modelo de generación de código post-entrenado a partir de Kimi K3, una base de 2.8 billones de parámetros, logrando 50.0% en FrontierCode 1.1 Main mientras cuesta 64% menos que Fable 5.1 con la misma puntuación. El modelo introduce un enfoque de aprendizaje por refuerzo que entrena múltiples niveles de esfuerzo en una sola ejecución, avanzando toda la frontera costo-rendimiento en lugar de optimizar para un único punto.

SWE-2 se construye sobre Kimi K3, que ya había sido sometido a RL extenso para codificación agéntica. El post-entrenamiento de Cognition añade 5–6 puntos en muchos benchmarks aplicando una función de recompensa penalizada por costo que trata cada nivel de esfuerzo de forma independiente. La fórmula de recompensa R=S−λeC penaliza el costo linealmente por nivel de esfuerzo, con cada penalización ajustada para coincidir con la pendiente local de la frontera de Pareto del modelo base. Este enfoque se deriva de primeros principios: solo una penalización lineal produce el mismo resultado ya sea aplicada antes o después de promediar el costo, asegurando que el objetivo de RL se alinee directamente con la posición del modelo en el plano costo-rendimiento.

En FrontierCode 1.1 Main, SWE-2 medium obtiene 50.0% mientras toma 58% menos turnos y cuesta 81% menos en promedio que SWE-1.7. Las ganancias de eficiencia provienen de exploración enfocada: mayor inteligencia permite al modelo juzgar qué partes de la base de código importan para una tarea, permitiéndole hacer su primera edición real después de una mediana de 18 pasos comparado con 48 para SWE-1.7. En DeepSWE 1.1, SWE-2 obtiene 73.0%, igualando GPT-5.6 Sol a 72.7% mientras supera el 37.7% de SWE-1.7. En Terminal-Bench 2.1, SWE-2 alcanza 92.8% versus el 81.5% de SWE-1.7.

La capa de servicio utiliza decodificación especulativa DSpark con un modelo borrador entrenado usando SpecForge durante RL para rastrear cambios de política. Cognition utiliza kernels NVFP4 y FP8 con entrenamiento consciente de cuantización para reducir el uso de memoria y mantener la inferencia numéricamente cercana al entrenamiento. Un retardador de prefill agrupa solicitudes cercanas, mejorando el rendimiento por GPU en 10–20%, aunque al costo de mayor tiempo hasta el primer token.

Los datos de entrenamiento escalaron significativamente: Cognition triplicó el número de entornos de RL, añadió superposiciones de seguimiento de instrucciones, y construyó un volante impulsado por puntos de control previos de SWE-2 para endurecer iterativamente verificadores y prevenir gaming de recompensas. El modelo también introduce una línea de base de recompensa ponderada por longitud derivada de primeros principios, que reduce la varianza de gradiente sin costo extra y estabiliza significativamente el entrenamiento manteniendo baja la divergencia KL entre inferencia y entrenamiento.

La parte difícil es que la ventaja de costo de SWE-2 depende enteramente del nivel de esfuerzo que un arquitecto elija. SWE-2 medium es 81% más barato que SWE-1.7 en FrontierCode 1.1 Main, pero SWE-2 high y max requieren más planificación y exploración en tareas complejas, estrechando la brecha de costo. El modelo está disponible en Devin Desktop y CLI con lanzamiento en Devin Web y Fusion, pero el artículo no incluye números de latencia de inferencia, límites de tokens, o precio por token—solo costo por tarea en benchmarks específicos. Los equipos que comparan SWE-2 con Fable 5.1 o GPT-Astra necesitan medir su propia distribución de carga de trabajo entre niveles de esfuerzo para saber si las ganancias de Pareto se traducen a su caso de uso.

Para equipos que eligen entre modelos de código cerrados y de peso abierto, la conclusión es que escalar RL al régimen de parámetros multi-billones con penalizaciones de costo principistas puede igualar rendimiento frontier a una fracción del precio, pero solo si tu distribución de tareas se alinea con el nivel de esfuerzo donde esa ventaja se mantiene.