Hugging Face e alphaXiv orquestraram um esforço de 19 dias com 1.221 membros da comunidade equipados com agentes de codificação para reproduzir artigos do ICML 2026. O resultado é a maior auditoria pós-publicação tentada de uma grande conferência de ML: 6.816 logbooks Trackio, 2.226 artigos tentados (34% da conferência), 35.908 afirmações julgadas e um conjunto de dados publicamente pesquisável. ICML 2026 aceitou 6.352 artigos—aproximadamente o dobro do ano anterior—de 23.918 submissões enquanto a capacidade de revisores estagnou.
Participantes usaram Claude Code, Codex, Cursor ou orx do OpenResearch para escrever e executar código de reprodução na computação GPU sem servidor da Hugging Face. Cada execução produziu um logbook Trackio—um Hugging Face Space com resumo, código, artefatos e rastreamentos de agentes opcionais. Um juiz automatizado executando GLM-5.2 atribuiu vereditos por afirmação: verificado, falsificado, escala de brinquedo ou inconclusivo. Participantes ganharam $20 em créditos de computação; o prêmio máximo foi $2.000 de $4.000. Um participante reproduziu 360+ artigos.
51% dos artigos examinados (1.103) tiveram pelo menos uma afirmação independentemente verificada. Desses, 266 foram totalmente reproduzidos e 632 parcialmente reproduzidos sem afirmações falsificadas—totalizando 3.978 afirmações confirmadas apoiadas por experimentos reais. 23% dos artigos (496) tiveram pelo menos uma afirmação falsificada ou contestada. As contagens de categorias se sobrepõem porque artigos em ambos os grupos (afirmações verificadas e falsificadas no mesmo artigo) contam duas vezes. Os 242 artigos que receberam vereditos opostos de equipes independentes são o caso mais claro. 49 artigos tiveram todas as afirmações falsificadas e nenhuma verificada.
502 artigos produziram apenas evidências em escala de brinquedo quando conjuntos de dados eram proprietários ou checkpoints não lançados. 280 artigos não produziram nada porque artefatos estavam faltando. Modos de falha comuns: código incompleto, cadeias de dependência complexas, requisitos de GPU indisponíveis em hardware básico, dados proprietários sem substituto sintético. Onde reprodução completa era impossível, participantes documentaram por quê e executaram análogos em escala reduzida, preservando a cadeia de auditoria.
Dois artigos sobreviveram ao escrutínio máximo. "Flat Minima and Generalization: Insights from Stochastic Convex Optimization" foi reproduzido por 20 equipes independentes; 12 verificaram cada afirmação. "A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness"—testando juízes LLM em si—teve 14 de 17 logbooks verificando todas as afirmações. Na outra extremidade, um artigo de destaque aceito tinha uma nota do revisor afirmando que não havia verificado cuidadosamente as provas. A auditoria fez. O resumo da falsificação é público.
Trackio instala via pip. O script de scaffolding gera um esqueleto de logbook com um único comando curl. O conjunto de dados de veredito de 35.908 afirmações é público na Hugging Face. O protocolo de desafio—extrair afirmações, executar experimentos contra cada afirmação, ter um juiz independente relê logbooks com auto-avaliações marcadas como não confiáveis—é um padrão que equipes de plataforma podem adotar para avaliação interna de modelos. Os 242 artigos com vereditos contraditórios formam o produto principal: uma lista classificada e consultável de afirmações contestadas em pesquisa de ML atual, com rastreamentos de agentes anexados.