Los investigadores de Inria, Damien Sileo, Valentin Lacombe y Dimitri Kachler, lanzaron Reasoning Core, una biblioteca de 50 generadores procedurales para problemas de razonamiento verificables diseñada para ajuste fino supervisado por conclusión. El artículo, publicado el 5 de agosto, compara la colección con Procedural Warmup, Reasoning Gym y SynLogic en cuatro configuraciones de modelo base. En la comparación primaria de 3B, Reasoning Core logra los puntajes promedio más altos en DROP, LogiQA y ARC-Challenge.
Los 50 generadores abarcan nueve dominios: matemáticas, lógica formal, planificación, seguimiento de estado, razonamiento en grafos, matemática formal, datos estructurados, juegos, causalidad y código. Cada generador expone una API de Python unificada: `get_task("task_name").generate_example()` devuelve un prompt, respuesta canónica y trace de razonamiento opcional. La función `score_answer` proporciona un evaluador determinístico, eliminando la necesidad de un juez de LLM.
El diseño prioriza amplitud distribucional sobre cantidad de tareas. Entrenar en un único dominio PDDL como BlocksWorld no generaliza a variaciones menores. Reasoning Core aleatoriza parámetros de dominio dentro de cada generador — la planificación PDDL se ejecuta sobre conjuntos de objetos y definiciones de operadores aleatorizados en lugar de instancias fijas. Los controles de dificultad permiten cronogramas curriculares ajustados a la curva de solvibilidad de cada modelo base. La guía de autoría de tareas de la biblioteca expone una API pública de entrenamiento e influencia para experimentos baseline/treatment pareados reproducibles.
El hallazgo clave del artículo: la validez semántica por sí sola no determina la utilidad del entrenamiento. Los problemas que se analizan correctamente pueden fallar en mejorar el desempeño si sus objetivos son verbosos o la dificultad está mal calibrada. El procedimiento de auditoría aplicado a Reasoning Core y colecciones rivales reveló discrepancias sutiles en generación, renderizado, formato de objetivo y evaluación.
Para equipos que prefieren datos pre-generados, hay más de 10B tokens disponibles en el dataset de HuggingFace `reasoning-core/procedural-pile` con divisiones de entrenamiento y prueba. La biblioteca se integra con Environments Hub de Prime Intellect, OpenReward, OpenEnv, reasoning-gym y SynLogic. La instalación es `uv pip install reasoning-core`. La biblioteca, datasets y materiales de auditoría están disponibles públicamente bajo licencia MIT.
Los pipelines procedurales que se ven correctos a nivel de definición de tareas pueden introducir silenciosamente discrepancias — un generador produciendo un formato de token mientras el evaluador espera otro, o controles de dificultad agrupando muestras en una región sin señal de gradiente. Los equipos que construyen harnesses de evaluación personalizados deben ejecutar la suite de regresión en cada tarea antes de agregarla al entrenamiento, no solo revisar ejemplos puntuales. La API de influencia pública hace esto viable.
Reasoning Core es actualmente el conjunto de herramientas procedural más bien documentado supervisado por conclusión a escala 3B, pero la corrección requiere ejecutar la suite de auditoría — los generadores son herramientas, no una solución lista para usar.