Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH Microsoft Mapea Fallos de Planificación en Agentes Multilingües, Eleva Precisión en 5.6%
RESEARCH Benchmark GDPevo muestra que los agentes empresariales ganan 8 puntos por experiencia
RESEARCH HazMart Cuantifica la Disyuntiva Fidelidad-Seguridad en Modelos de Razonamiento
RESEARCH Modelos Fronterizos Intentan Hacer Trampa en el 7–14% de las Ejecuciones de Evaluación
RESEARCH AtumAI Reduce el Diseño de Política de Datacenter de Meses a Texto Plano
RESEARCH PRECOG Reduce la Latencia de RAG 4500× en Hardware SSM de Borde
RESEARCH Robot Caltech Esquiva Bolas con una Precisión del 95% Usando Solo una Cámara
RESEARCH Smevals reduce el costo de evaluación de modelos desacoplando la calificación de las ejecuciones de prueba RESEARCH Equipo de Maryland ajusta la constante oculta de OPSD para corregir la fragilidad
RESEARCH Muestreo Repetido Supera la Auto-Reflexión en Modelos de IA Pequeños
RESEARCH ReviewBench Expone la Brecha del 30% en la Detección de Agentes de Revisión de Código
RESEARCH OpenAI Expone Red de Estafas ChatGPT Operando desde Camboya
RESEARCH El Pipeline de Auditoría KAISEN Revela Fallas Silenciosas en la Equidad de la IA Clínica
RESEARCH ReToken Reduce a la Mitad la Memoria GPU de Modelos Vision-Language RESEARCH OSReward expone sesgo sistemático en jueces VLM para evaluación de agentes
RESEARCH Agentes de IA Dominan Conversaciones, Reducen Intercambio Humano-Humano
RESEARCH Primer benchmark de oficina para preciar el trabajo de agentes revela brecha de productividad
RESEARCH Ningún modelo de frontera supera el 2.6% en tareas contables de ocho pasos RESEARCH El ajuste de API de OpenAI eleva GPT-5.6 Sol a 38,3% en ARC-AGI-3
RESEARCH Agentes Frontera Alcanzan 65% en Verificación de Estado en Flujos de Producción
RESEARCH Modelo Gráfico Multimodal Elimina Barreras de Dominio en Transferencia Zero-Shot RESEARCH πR² Permite que los Robots Reaccionen en Tiempo Real sin Reentrenamiento
RESEARCH Desktop-Delta Bench Limita el Razonamiento de Agentes GUI al 65%
RESEARCH CARE Reduce la Activación de Expertos en Fine-Tuning MoE-LoRA RESEARCH Alibaba Identifica Corrupción Silenciosa de Rama en Destilación de Difusión
RESEARCH El preentrenamiento de embeddings vence al tamaño del modelo en 1.215 pruebas de matching de entidades
RESEARCH OPD Supera a GRPO en la Planificación de Agentes de Horizonte Largo
RESEARCH DataOrchestra reduce la computación de canalizaciones de datos al omitir reescrituras innecesarias
RESEARCH Google Logra Tasa de Error Cuántica Récord Sin Pausar la Computación
RESEARCH Intercambiar el orden de imagen y texto cambia la precisión de VLM en 26 puntos
RESEARCH Microsoft's OpenForgeRL Entrena Agentes en Arreos de Producción
RESEARCH El 98 por ciento de las explicaciones de activación no fundamentan afirmaciones
RESEARCH LangChain lanza Harbor para la medición de agentes en el mundo real
RESEARCH Google Vincula Investigación de Laboratorios de EE. UU. a su Nube y Economía de Tokens RESEARCH CodeRescue Router Reduce 64.5% de Costos de Modelo Mientras Aumenta Tasa de Solución
RESEARCH Agentes de producción afectados por modos de fallo ocultos que no detectan los benchmarks
RESEARCH Solo 2 de 13 algoritmos en CircuitKIT alcanzan estatus de producción