§ BEAT
Investigación
Intercambiar el orden de imagen y texto cambia la precisión de VLM en 26 puntos
El 98 por ciento de las explicaciones de activación no fundamentan afirmaciones
Solo 2 de 13 algoritmos en CircuitKIT alcanzan estatus de producción
Correcciones a Nivel de Activación Sobrepasan las Ediciones de Prompts para Jueces LLM Prejuiciosos
El entrenamiento de Super Weights falla en modelos OLMo, desmontando la estrategia de afinación esparsa
LACUNA Demuestra que los Métodos de Desaprendizaje no Logran Borrar PII de los Modelos
Las Explicaciones de Modelos de Lenguaje Rastrean Cambios de Comportamiento Automáticamente
Los modelos de visión-lenguaje enrutan el conocimiento a través de apenas el 2,5% de la red
Modelos Olvidan Reglas Aprendidas Durante el Entrenamiento
Los Modelos Multimodales Cambian de Respuesta Cuando Cambia el Orden de las Evidencias
DiffusionGemma de Google DeepMind es 28,6X más difícil de interpretar que modelos autorregressivos
MIT Extrae Lógica de Atención en Código Python Intercambiable
Jefes de Atención Dispersa Redirigen Modelos de Visión-Lenguaje con Precisión del 83%
Prueba sin etiquetas detecta mejor los fallos de razonamiento de LLM que la consistencia propia
Nueva Herramienta Detecta 1,060 Dependencias de Entrenamiento Ocultas en Principales LLM
Diagrama de Fases de Kamai Predice Fallas Multimodales Antes del Compromiso de GPU
EHC Real Benchmark Revela Límites de LLM en Acción Clínica
Echo-Memory Demuestra que los Modelos del Mundo Fallan en la Prueba de Revisita
El 64 Por Ciento de Conflictos Audio-Texto en Modelos de IA Son Solucionables
Marco de Stanford Mantiene a los Agentes de IA Dentro de los Objetivos de Violación
La Reproducción Autogenerada Reduce el Olvido Catastrófico en Modelos Ajustados
Estudio: Las Explicaciones Narrativas de IA Aumentan la Confianza del Usuario, No la Precisión
Framework DelTA Mejora el Razonamiento al Corregir la Asignación de Crédito a Nivel de Token
RELEX reconstruye checkpoints RLVR a partir del 15% de los datos de entrenamiento
Métricas de SAEBench Clasifican SAEs al Revés, Encuentra Auditoría
Demostración Matemática Muestra que la Atención en Transformers se Estabiliza Predeciblemente
SLIM mejora desempeño de agentes LLM en 7 puntos porcentuales
Shepherd Aumenta Precisión de Agentes 90% Con Rastreo Por Ramificación
Modelos Sparse MoE Equiparan Desempeño con Transformers Densos a 3× Más Rápido en Inferencia