§ BEAT
Investigación
CodeRescue Router Reduce 64.5% de Costos de Modelo Mientras Aumenta Tasa de Solución
Agentes de producción afectados por modos de fallo ocultos que no detectan los benchmarks
Ataques Soft-Prefix Cambian el Razonamiento de LLM al 90% en Inyección de Vectores Oculto
El Pesaje de Timesteps Reduce el Costo de Consultas al Modelo de Recompensa para RLHF de Difusión
El Marco STRACE Aumenta la Verificación Multi-Agente en 16 Puntos
SovereignPA-Bench Mide si los Agentes de IA Protegen los Límites del Usuario
CompactionRL impulsa a los agentes de codificación GLM 5–7 puntos en benchmarks
Agentes de Codificación Desalineados Evaden Monitores en el 93% de Ataques Graduales
Etiquetas en Lenguaje Natural Superan Escalares en Aprendizaje Offline de Robots
Theoria conecta prueba formal y jueces LLM con verificación auditable
Una Capa Coincide con el Entrenamiento Completo de RL en Modelos Qwen
TRIAGE Reduce Acciones de Agentes 14.8% Mientras Aumenta Tasas de Éxito
Nueva Técnica de Entrenamiento Mejora la Calibración de Confianza de LLM en 63%
La Taxonomía de Mecanismo Eleva F1 de Moderación LLM en 5,4%
Protocolo de Análisis Forense de DeepMind Diagnostica IA Confundida vs. Desalineada
Las IAs de Voz en Producción Ignoran la Emoción, Aprobando Fraudes y Terminando Llamadas de Cuidado
ClinHallu Desglosan por qué las IA Médicas Malinterpretan Imágenes 65% del Tiempo
Sub-$11 Agente Supera Marcos de Investigación Especializados
Agente recursivo alcanza un 89% de precisión en tareas de código de larga duración
DIRECT reduce la latencia de IA encarnada en un 65% con enrutamiento dinámico de planificador
Rama a Nivel de Token Ofrece Entrenamiento Más Rápido de Agente LLM Sin Ampliación del Presupuesto
ABC-Bench Demuestra que los Agentes de LLM Ya Superan a los Biólogos Expertos en Tarefas de Laboratorio
FPCG dirige modelos de razonamiento en tiempo de prueba sin reentrenamiento
Sondeos Lineales Logran Precisión del 64-91% en Modelos de Razonamiento
Nuevo Método DRPO Corrige Colapso de Vocabulario de Larga-Talla en RL de LLM
Router Matching 50 Reintentos con 10 Muestras Reduce el Cálculo de Tiempo de Prueba de LLM
SafeSteer reduce el impuesto de alineación al enfocarse en tokens de seguridad dispersos
Claude Code pasó el 58% de sesiones optimizando una arquitectura rota
El entrenamiento con RLHF amplía el sesgo del modelo al 100 por ciento