§ BEAT
Investigación
LangChain lanza Harbor para la medición de agentes en el mundo real
SWE-Pruner Pro Reduce 39% de Uso de Tokens en Agentes de Codificación
Los jueces LLM revierten el 85% de los veredictos con respuestas de referencia
Apple's MM-ToolSandBox Revela por qué la Mitad de los Agentes de IA Avanzada Fracasa en Tareas Visuales
ZoRRO iguala al aprendizaje profundo en CTR a una velocidad 600× mayor
Claude Opus Falla la Mitad de las Tarefas del Mundo Real en UniClawBench
OpenAI revela que el 30% de las tareas de SWE-Bench Pro están rotas
SearchGen-20K Ensena a Generadores Visuales Cuándo Buscar
Nuevo Método de Verificación Logra 86.5% en Terminal-Bench Sin Ajuste Fino
Monitor de Umbral Simple Iguala Salvaguardias Complejas de LLM en Artículo del ICML
Tres grandes benchmarks inflan las puntuaciones de agentes de código, descubre auditoría
Los Baselines de Prompting Simple Superan los Métodos de Supervisión Compleja
El Contexto del Idioma Original Recupera la Precisión Perdida en Cascadas Multilingües
La Probabilidad de Secuencia Falla como Señal de Inferencia en Producción
RiVER Permite Aprendizaje por Refuerzo Sin Etiquetas de Verdad Absoluta
La Alucinación de Modelos Mundiales es un Problema de Datos, No de Arquitectura
Benchmark FFASR Expone la Brecha en el Reconocimiento de Voz de Campo Lejano
Corrección de Regex Estricta Aumenta Recuperación de Calificación de Agentes en 60 Puntos Porcentuales
Aprendizaje en Contexto Amortizado Reduce el Costo de Servicio Few-Shot
Solo el 10,5% del Código Generado por IA Pasa Verificaciones de Seguridad
DiffusionGemma Desmiente Afirmaciones de Google sobre Decodificación Bloqueada
Reentrenamiento de Máscara Dispersa Iguala el Rendimiento de la Destilación de Política Completa
EvoArena Benchmark Revela Colapso de Agentes en Entornos en Evolución
La mitad de las correcciones de código generadas por IA fallan en la revisión humana
Recuperación de Tokens Cierra Brecha de Precisión Mientras Reduce a la Mitad el Cálculo de Inferencia de VLM
Las clasificaciones de LLM no predicen fiabilidad en producción
Grok 3 Supera a Biólogos Credenciados en Tareas de Laboratorio ADN Autónomo
FASE Reduce el Costo de Detección de Alucinaciones al 0.3% de los Rivales
El Esquema EvalCards Revela Brechas Metadatos de Comparación de IA Sistematizadas