Pesquisadores da Inria, Damien Sileo, Valentin Lacombe e Dimitri Kachler, lançaram o Reasoning Core, uma biblioteca de 50 geradores procedurais para problemas de raciocínio verificáveis projetada para fine-tuning supervisionado por conclusão. O artigo, publicado em 5 de agosto, faz benchmark da coleção contra Procedural Warmup, Reasoning Gym e SynLogic em quatro configurações de modelo base. Na comparação primária de 3B, o Reasoning Core alcança os maiores scores médios em DROP, LogiQA e ARC-Challenge.
Os 50 geradores abrangem nove domínios: matemática, lógica formal, planejamento, rastreamento de estado, raciocínio em grafos, matemática formal, dados estruturados, jogos, causalidade e código. Cada gerador expõe uma API Python unificada: `get_task("task_name").generate_example()` retorna um prompt, resposta canônica e trace de raciocínio opcional. A função `score_answer` fornece um scorer determinístico, eliminando a necessidade de um juiz LLM.
O design prioriza amplitude distribucional sobre contagem de tarefas. Treinar em um único domínio PDDL como BlocksWorld não generaliza para variações menores. O Reasoning Core randomiza parâmetros de domínio dentro de cada gerador — planejamento PDDL é executado sobre conjuntos de objetos e definições de operadores randomizados em vez de instâncias fixas. Controles de dificuldade permitem cronogramas curriculares ajustados à curva de solvibilidade de cada modelo base. O guia de autoria de tarefas da biblioteca expõe uma API pública de treinamento e influência para experimentos baseline/treatment pareados reproduzíveis.
A descoberta chave do artigo: validade semântica sozinha não determina utilidade de treinamento. Problemas que fazem parse corretamente podem falhar em melhorar o desempenho se seus targets forem verbosos ou a dificuldade estiver descalibrada. O procedimento de auditoria aplicado ao Reasoning Core e coleções rivais evidenciou desajustes sutis em geração, renderização, formato de target e scoring.
Para equipes que preferem dados pré-gerados, mais de 10B tokens estão disponíveis no dataset HuggingFace `reasoning-core/procedural-pile` com splits de train e test. A biblioteca se integra com Environments Hub da Prime Intellect, OpenReward, OpenEnv, reasoning-gym e SynLogic. A instalação é `uv pip install reasoning-core`. A biblioteca, datasets e materiais de auditoria estão publicamente disponíveis sob licença MIT.
Pipelines procedurais que parecem corretos no nível de definição de tarefas podem introduzir silenciosamente desajustes — um gerador produzindo um formato de token enquanto o scorer espera outro, ou controles de dificuldade agrupando amostras em uma região sem sinal de gradiente. Equipes construindo harnesses de avaliação customizados devem executar a suite de regressão em cada tarefa antes de adicioná-la ao treinamento, não apenas fazer spot-check em exemplos. A API de influência pública torna isso tratável.
Reasoning Core é o toolkit procedural supervisionado por conclusão mais bem documentado atualmente em escala 3B, mas a correção requer executar a suite de auditoria — os geradores são ferramentas, não uma solução turnkey.