Un nuevo artículo de Princeton e instituciones asociadas argumenta que la forma correcta de hacer stress-test a un modelo de razonamiento no es problemas matemáticos más difíciles—es forzar al modelo a cambiar de habilidades a mitad de la cadena. El trabajo, publicado el 5 de agosto de 2026 en arXiv, introduce Skill Entropy, una métrica formal para benchmarking de razonamiento de horizonte largo, y Skill²-Bench, un benchmark que cubre 558 habilidades en 9 dominios. Las pruebas de 8 modelos de frontera y 4 modelos de código abierto expusieron la brecha en cambio de habilidades: la precisión disminuye conforme aumenta la entropía a nivel de tarea.
Skill²-Bench se basa en tareas de horizonte largo entre habilidades—problemas multistep donde cada paso requiere razonamiento diferente y depende de salidas previas. Un ejemplo: derivar un resultado matemático y luego usarlo en un problema de programación. Los benchmarks existentes evalúan matemáticas, código y planificación por separado. Skill²-Bench fuerza dependencia secuencial. Cada tarea recibe una puntuación escalar de skill-entropy a partir de calibración de modelo de referencia: la entropía es alta cuando un modelo de referencia maneja bien dos habilidades aisladamente pero falla cuando se combinan. El benchmark agrupa tareas en tres niveles por puntuación de entropía.
Los 9 dominios abarcan matemáticas, ciencia, codificación, lógica, extracción de información, planificación, escritura creativa, recuperación de contexto e instrucción. Esta amplitud es deliberada. Los autores quieren que la entropía aflore en cualquier lugar donde los agentes encadenen pasos heterogéneos, no solo en transiciones matemática-a-código. El benchmark está disponible en Hugging Face en Gen-Verse/Skill2-Bench con scripts de evaluación para checkpoints de peso abierto servidos por vLLM y modelos de API.
En el lado del entrenamiento, el artículo convierte skill entropy de una medición a una señal de recompensa. Skill-Entropy RL utiliza GRPO con rollouts anotados por habilidad: en cada paso, el modelo predice tanto la respuesta como la habilidad usada para producirla. La recompensa combina corrección a nivel de paso con una señal de skill-entropy midiendo alineación entre secuencias de habilidad predichas y gold. El modelo recibe una señal de entrenamiento para transiciones de habilidad, no solo corrección final.
Las ganancias son sustanciales. En Qwen3-4B-Instruct, Skill-Entropy RL eleva la puntuación Skill²-Bench de 34,4% a 68,4%—una ganancia de 34 puntos. En Qwen3-1.7B, la mejoría va de 14,6% a 40,1%, casi triplicando la línea base. Ambos superan las líneas de base reportadas. La señal de entrenamiento se transfiere: aplicarla a datos OpenR1-Math produce mejoras comparables, mostrando que skill entropy es un objetivo reutilizable, no andamio específico de benchmark.
El costo de ingeniería es significativo. El pipeline completo requiere Python 3.10+, CUDA 12.x y PyTorch 2.8. La secuencia—calibración de entropía a través de puerta de enlace de API de modelo de referencia, generación de tareas, calentamiento SFT, entrenamiento GRPO—abarca múltiples días en un cluster de GPU. La calibración de entropía por sí sola requiere llamadas de API para etiquetado y deduplicación antes de que comience el entrenamiento. Los equipos sin acceso a clusters de GPU o Slurm no reproducirán esto del README en una tarde.
El artículo aún no aborda skill entropy en cadenas de uso de herramientas y multi-agente, donde los límites de habilidad son frecuentemente llamadas de función en lugar de pasos de razonamiento. Los dominios del benchmark se ajustan dentro de una ventana de contexto de un solo modelo. Los pipelines de producción que enrutan subproblemas a agentes especializados o APIs externas introducen entropía de nivel de sistema, no entropía de nivel de token. Si la métrica se generaliza es una pregunta abierta.
La conclusión para el profesional: si está seleccionando un modelo de razonamiento para un pipeline agnóstico encadenando matemáticas, recuperación y planificación, las puntuaciones MATH o HumanEval no le dicen nada sobre degradación entre habilidades. Skill²-Bench proporciona medición; Skill-Entropy RL proporciona una receta de entrenamiento para cerrar la brecha en modelos pequeños con hardware restringido.