Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH Agents-K1 Reemplaza Fragmentos de Texto RAG con Grafos de Conocimiento Científico Tipados
RESEARCH EvoArena Benchmark Revela Colapso de Agentes en Entornos en Evolución
RESEARCH Sub-$11 Agente Supera Marcos de Investigación Especializados
RESEARCH Agente recursivo alcanza un 89% de precisión en tareas de código de larga duración
RESEARCH La mitad de las correcciones de código generadas por IA fallan en la revisión humana
RESEARCH DIRECT reduce la latencia de IA encarnada en un 65% con enrutamiento dinámico de planificador
RESEARCH Claude Fable 5 parcheó código de forma autónoma y costó 110 dólares en un día
RESEARCH Nueva Herramienta Detecta 1,060 Dependencias de Entrenamiento Ocultas en Principales LLM
RESEARCH Rama a Nivel de Token Ofrece Entrenamiento Más Rápido de Agente LLM Sin Ampliación del Presupuesto
RESEARCH Recuperación de Tokens Cierra Brecha de Precisión Mientras Reduce a la Mitad el Cálculo de Inferencia de VLM
RESEARCH Sistema Tahoe de Text-to-SQL Reduce el Retroalimentación del Compilador en un 96%
RESEARCH Google's DiffusionGemma alcanza 1.000 Tokens por Segundo
RESEARCH GRPO Reduce las Fallas de Manejo de Pausas en Agentes de Full-Duplex Sin Pérdida Semántica
RESEARCH Diagrama de Fases de Kamai Predice Fallas Multimodales Antes del Compromiso de GPU
RESEARCH ABC-Bench Demuestra que los Agentes de LLM Ya Superan a los Biólogos Expertos en Tarefas de Laboratorio
RESEARCH FPCG dirige modelos de razonamiento en tiempo de prueba sin reentrenamiento
RESEARCH Sondeos Lineales Logran Precisión del 64-91% en Modelos de Razonamiento RESEARCH Las clasificaciones de LLM no predicen fiabilidad en producción
RESEARCH Grok 3 Supera a Biólogos Credenciados en Tareas de Laboratorio ADN Autónomo
RESEARCH EEVEE supera agentes de auto-mejora con margen del 48% en inferencia multi-dominio
RESEARCH Compilador Piper Elimina la Codificación Manual para Entrenamiento Distribuido
RESEARCH Capa Lineal Simple Supera Puerta de 1M-Parámetros en Prueba de Aceleración MTP
RESEARCH EHC Real Benchmark Revela Límites de LLM en Acción Clínica
RESEARCH AHA-WAM logra un control de robot 4.59 veces más rápido al desacoplar Transformadores de Difusión
RESEARCH FASE Reduce la Detección de Alucinaciones a una Velocidad de 333x
RESEARCH Nuevo Método DRPO Corrige Colapso de Vocabulario de Larga-Talla en RL de LLM
RESEARCH FASE Reduce el Costo de Detección de Alucinaciones al 0.3% de los Rivales
RESEARCH SIGA Acelera Agentes de Codificación en Simuladores Científicos por 36×
RESEARCH Echo-Memory Demuestra que los Modelos del Mundo Fallan en la Prueba de Revisita
RESEARCH Investigadores de Waterloo reducen el costo de cuantificación de incertidumbre un 99.7% con FASE
RESEARCH El Esquema EvalCards Revela Brechas Metadatos de Comparación de IA Sistematizadas
RESEARCH Agente de IA de Perplexity Reduce el Tiempo de Tareas un 87 Por Ciento en Estudio de Producción
RESEARCH El 64 Por Ciento de Conflictos Audio-Texto en Modelos de IA Son Solucionables
RESEARCH Router Matching 50 Reintentos con 10 Muestras Reduce el Cálculo de Tiempo de Prueba de LLM
RESEARCH StreamMA Reduce la Latencia de Razonamiento Multi-Agente 26,9×
RESEARCH Paneles de jueces diversos de proveedores eliminan sesgo en evaluaciones de modelos de lenguaje