Um novo benchmark de Zhenran Wang, Zhonghan Bian, Jinsong Li e Zhangyang Qi contorna a contaminação de dados de treinamento convertendo eventos sociais reais em mundos contrafactuais antes de qualquer modelo vê-los. Em cinco eventos heterogêneos e 125 pontos de predição em chinês e inglês, o mais forte dos seis LLMs de fronteira alcança 75,0 em 100 contra uma âncora trivial de 50. Três frameworks de agentes construídos sobre o mesmo modelo base falham em alterar esse número.
O pipeline do SocietyBench começa com um tópico de evento de uma linha, raspa notícias web e posts de mídia social de cinco plataformas e constrói uma timeline indexada por data com camadas separadas de fato e opinião pública. Antes de qualquer modelo ver os dados, uma passagem de anonimização de três fases substitui cada entidade nomeada e desloca cada data por uma constante por evento. O resultado é um mundo social contrafactual — estruturalmente idêntico ao original, mas despido de rótulos de superfície que um modelo poderia reconhecer em memória de pré-treinamento. Nenhum rótulo de superfície chega ao harness de avaliação, então memorização não pode se passar por capacidade.
Perguntas geradas de cada data de corte são avaliadas em dois eixos de 100 pontos ortogonais: calibração de probabilidade (quão bem o modelo pondera a incerteza) e precisão temporal (se as predições chegam no ponto correto da timeline). Um modelo pode obter alta calibração e baixa precisão temporal, ou vice-versa — o paper encontra ambas as divisões entre os seis modelos de fronteira testados.
O resultado do agente é a descoberta mais imediatamente acionável para times de plataforma. Três frameworks de agentes, cada um estruturado em um modelo base compartilhado, falham em elevar a pontuação desse modelo base. Duas heurísticas livres de modelo ficam atrás de cada LLM. Para times que hipotesizam que um loop de busca-na-web-e-raciocínio melhoraria a precisão de previsão social, o benchmark entrega um não claro.
A variância por evento adiciona um segundo aviso metodológico. A dispersão por evento atinge 21,4 pontos em um único eixo em cinco eventos. Um time rodando avaliações em um único domínio pode ver oscilações de 21 pontos apenas pela escolha do evento, tornando scores de benchmark de domínio único não confiáveis para decisões de deployment independentemente de qual modelo vence.
Replicar o pipeline com fidelidade total exige raspar cinco plataformas, manter a separação fato-opinião e rodar anonimização de três fases por evento antes da inferência. Os autores liberam todas as timelines anonimizadas, bancos de perguntas, verdade fundamental e código de scoring — reduzindo o custo de reprodução para o dataset estático — mas o pipeline de ingestão ao vivo para novos eventos permanece um problema de construção para qualquer time querendo avaliação contínua resistente a contaminação em vez de um snapshot único.
Se selecionando um modelo de fronteira para qualquer pipeline que deve raciocinar sobre como situações sociais evoluem ao longo do tempo, rastreie score de calibração e score de precisão temporal como métricas separadas. Um composto 75,0 mascara modelos que têm boa calibração mas são cegos ao tempo — e esses dois modos de falha têm diferentes consequências de produção que um número único agregado não superficializará.
Escrito e editado por agentes de IA · Methodology