EN VIVO · SÁB, 25 JUL 2026 --:--:-- ET
Edición Nº 95 GASTO TOTAL $14947.35 ARTÍCULOS HOY 2 TOKENS TOTAL 9.65B
aiexpert
§ BEAT

Investigación

30 stories Benchmarks ×

LangChain lanza Harbor para la medición de agentes en el mundo real

SWE-Pruner Pro Reduce 39% de Uso de Tokens en Agentes de Codificación

Los jueces LLM revierten el 85% de los veredictos con respuestas de referencia

Apple's MM-ToolSandBox Revela por qué la Mitad de los Agentes de IA Avanzada Fracasa en Tareas Visuales

ZoRRO iguala al aprendizaje profundo en CTR a una velocidad 600× mayor

Claude Opus Falla la Mitad de las Tarefas del Mundo Real en UniClawBench

OpenAI revela que el 30% de las tareas de SWE-Bench Pro están rotas

SearchGen-20K Ensena a Generadores Visuales Cuándo Buscar

Nuevo Método de Verificación Logra 86.5% en Terminal-Bench Sin Ajuste Fino

Monitor de Umbral Simple Iguala Salvaguardias Complejas de LLM en Artículo del ICML

Tres grandes benchmarks inflan las puntuaciones de agentes de código, descubre auditoría

Los Baselines de Prompting Simple Superan los Métodos de Supervisión Compleja

El Contexto del Idioma Original Recupera la Precisión Perdida en Cascadas Multilingües

La Probabilidad de Secuencia Falla como Señal de Inferencia en Producción

RiVER Permite Aprendizaje por Refuerzo Sin Etiquetas de Verdad Absoluta

La Alucinación de Modelos Mundiales es un Problema de Datos, No de Arquitectura

Benchmark FFASR Expone la Brecha en el Reconocimiento de Voz de Campo Lejano

Corrección de Regex Estricta Aumenta Recuperación de Calificación de Agentes en 60 Puntos Porcentuales

Aprendizaje en Contexto Amortizado Reduce el Costo de Servicio Few-Shot

Solo el 10,5% del Código Generado por IA Pasa Verificaciones de Seguridad

DiffusionGemma Desmiente Afirmaciones de Google sobre Decodificación Bloqueada

Reentrenamiento de Máscara Dispersa Iguala el Rendimiento de la Destilación de Política Completa

EvoArena Benchmark Revela Colapso de Agentes en Entornos en Evolución

La mitad de las correcciones de código generadas por IA fallan en la revisión humana

Recuperación de Tokens Cierra Brecha de Precisión Mientras Reduce a la Mitad el Cálculo de Inferencia de VLM

Las clasificaciones de LLM no predicen fiabilidad en producción

Grok 3 Supera a Biólogos Credenciados en Tareas de Laboratorio ADN Autónomo

FASE Reduce el Costo de Detección de Alucinaciones al 0.3% de los Rivales

El Esquema EvalCards Revela Brechas Metadatos de Comparación de IA Sistematizadas

Paneles de jueces diversos de proveedores eliminan sesgo en evaluaciones de modelos de lenguaje