Hugging Face y alphaXiv orquestaron un esfuerzo de 19 días con 1.221 miembros de la comunidad armados con agentes de codificación para reproducir artículos de ICML 2026. El resultado es el mayor intento de auditoría post-publicación de una gran conferencia de ML: 6.816 libros de registro Trackio, 2.226 artículos intentados (34% de la conferencia), 35.908 afirmaciones juzgadas y un conjunto de datos públicamente consultable. ICML 2026 aceptó 6.352 artículos—aproximadamente el doble del año anterior—de 23.918 envíos mientras la capacidad de revisores se estancaba.
Los participantes utilizaron Claude Code, Codex, Cursor u orx de OpenResearch para escribir y ejecutar código de reproducción en la computación GPU sin servidor de Hugging Face. Cada ejecución produjo un libro de registro Trackio—un Hugging Face Space con resumen, código, artefactos y rastros de agentes opcionales. Un juez automatizado ejecutando GLM-5.2 asignó veredictos por afirmación: verificado, falsificado, escala de juguete o inconclusivo. Los participantes ganaron $20 en créditos de computación; el premio principal fue $2.000 de $4.000. Un participante reprodujo 360+ artículos.
El 51% de los artículos examinados (1.103) tuvieron al menos una afirmación verificada de forma independiente. De estos, 266 fueron totalmente reproducidos y 632 parcialmente reproducidos sin afirmaciones falsificadas—totalizando 3.978 afirmaciones confirmadas respaldadas por experimentos reales. El 23% de los artículos (496) tuvieron al menos una afirmación falsificada o cuestionada. Los recuentos de categorías se superponen porque los artículos en ambos grupos (afirmaciones verificadas y falsificadas en el mismo artículo) se cuentan dos veces. Los 242 artículos que recibieron veredictos opuestos de equipos independientes son el caso más claro. 49 artículos tuvieron todas las afirmaciones falsificadas y ninguna verificada.
502 artículos produjeron solo evidencia a escala de juguete cuando los conjuntos de datos eran propietarios o los puntos de control no se liberaron. 280 artículos no produjeron nada porque faltaban artefactos. Modos de fallo comunes: código incompleto, cadenas de dependencia complejas, requisitos de GPU no disponibles en hardware básico, datos propietarios sin sustituto sintético. Donde la reproducción completa era imposible, los participantes documentaron por qué y ejecutaron análogos a escala reducida, preservando la cadena de auditoría.
Dos artículos sobrevivieron al escrutinio máximo. "Flat Minima and Generalization: Insights from Stochastic Convex Optimization" fue reproducido por 20 equipos independientes; 12 verificaron cada afirmación. "A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness"—probando a los jueces LLM—tuvo 14 de 17 libros de registro verificando todas las afirmaciones. En el otro extremo, un artículo destacado aceptado tenía una nota del revisor afirmando que no había verificado cuidadosamente las pruebas. La auditoría lo hizo. El resumen de falsificación es público.
Trackio se instala vía pip. El script de andamio genera un esqueleto de libro de registro con un único comando curl. El conjunto de datos de veredicto de 35.908 afirmaciones es público en Hugging Face. El protocolo de desafío—extraer afirmaciones, ejecutar experimentos contra cada afirmación, hacer que un juez independiente relea los libros de registro con auto-evaluaciones marcadas como no confiables—es un patrón que los equipos de plataforma pueden adoptar para la evaluación interna de modelos. Los 242 artículos con veredictos contradictorios forman el producto principal: una lista clasificada y consultable de afirmaciones controvertidas en investigación de ML actual, con rastros de agentes adjuntos.