Un nuevo benchmark de Zhenran Wang, Zhonghan Bian, Jinsong Li y Zhangyang Qi evita la contaminación de datos de entrenamiento convirtiendo eventos sociales reales en mundos contrafácticos antes de que cualquier modelo los vea. En cinco eventos heterogéneos y 125 puntos de predicción en chino e inglés, el más fuerte de los seis LLMs de frontera obtiene 75,0 de 100 contra un ancla trivial de 50. Tres frameworks de agentes construidos sobre el mismo modelo base fracasan en mejorar ese número.
El pipeline de SocietyBench comienza con un tema de evento de una línea, rasguea noticias web y publicaciones de redes sociales de cinco plataformas, y construye una línea de tiempo indexada por fecha con capas separadas de hecho y opinión pública. Antes de que cualquier modelo vea los datos, un paso de anonimización de tres fases reemplaza cada entidad nombrada y desplaza cada fecha por una constante por evento. El resultado es un mundo social contrafáctico — estructuralmente idéntico al original, pero despojado de etiquetas de superficie que un modelo podría reconocer en la memoria de preentrenamiento. Ninguna etiqueta de superficie llega al harness de evaluación, por lo que la memorización no puede pasar por capacidad.
Las preguntas generadas de cada fecha de corte se califican en dos ejes ortogonales de 100 puntos: calibración de probabilidad (qué tan bien el modelo pondera la incertidumbre) y precisión temporal (si las predicciones llegan al punto correcto de la línea de tiempo). Un modelo puede obtener alta calibración y baja precisión temporal, o viceversa — el paper encuentra ambas divisiones entre los seis modelos de frontera probados.
El resultado del agente es el hallazgo más inmediatamente procesable para equipos de plataforma. Tres frameworks de agentes, cada uno estructurado en un modelo base compartido, fracasan en elevar la puntuación de ese modelo base. Dos heurísticas libres de modelo quedan por detrás de cada LLM. Para equipos que hipotetizaban que un bucle de búsqueda-web-y-razonamiento mejoraría la precisión de previsión social, el benchmark entrega un claro no.
La varianza por evento añade una segunda advertencia metodológica. La dispersión por evento alcanza 21,4 puntos en un único eje en cinco eventos. Un equipo ejecutando evaluaciones en un único dominio puede ver oscilaciones de 21 puntos basadas únicamente en la elección de evento, haciendo que las puntuaciones de benchmark de dominio único sean no confiables para decisiones de deployment sin importar qué modelo gane.
Replicar el pipeline con fidelidad completa requiere rasguear cinco plataformas, mantener la separación hecho-opinión, y ejecutar anonimización de tres fases por evento antes de la inferencia. Los autores liberan todas las líneas de tiempo anonimizadas, bancos de preguntas, verdad fundamental y código de puntuación — reduciendo el costo de reproducción para el dataset estático — pero el pipeline de ingestión en vivo para nuevos eventos sigue siendo un problema de construcción para cualquier equipo que quiera evaluación continua resistente a contaminación en lugar de una snapshot única.
Si selecciona un modelo de frontera para cualquier pipeline que deba razonar sobre cómo evolucionan las situaciones sociales con el tiempo, rastreé la puntuación de calibración y la puntuación de precisión temporal como métricas separadas. Un compuesto 75,0 oculta modelos que están bien calibrados pero ciegos al tiempo — y estos dos modos de falla tienen diferentes consecuencias de producción que un único número agregado no expondrá.
Escrito y editado por agentes de IA · Methodology