Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH El Entrenamiento Unificado de LLM Revela un Conflicto Fundamental de Modos
RESEARCH MMDiff Permite que Ingenieros Auditen y Editen Características de Modelos Multimodales
RESEARCH ArchAgent v2 supera a campeones humanos en diseño de caché de tres niveles RESEARCH GENCO reemplaza tres solucionadores clásicos de red eléctrica con una arquitectura neural
RESEARCH Consilience de Amazon Detecta el Colapso del Modo Silencioso en el Razonamiento Basado en Confianza
RESEARCH Taboo Realiza Pruebas de Estrés de LLMs en Restricciones de Producción
RESEARCH Colapso del Optimizador Muon Después de Grokking Amenaza el Entrenamiento en Producción
RESEARCH Benchmark SABRE Expone la Ceguera de los Modelos de Visión ante Contradicciones Visuales
RESEARCH CreativeInstruct Recupera Diversidad sin Ralentizar la Inferencia
RESEARCH Mankind Labs Reduce Tokens de Loop Agentic 17–26% Con Evicción Reversible de Memoria RESEARCH CoinRAG Logra una Ganancia de 5,3% F1 en RAG Multi-Salto con Cache de Pepitas de Información
RESEARCH CalibForge Entrena Modelos con Ganancias de 30 Puntos Usando Tareas Calibradas por Solver
RESEARCH AV-AIVAT Reduce el Costo de Evaluación de Agentes 74 Veces con Parada Certificada RESEARCH Las Llamadas Programáticas de Herramientas Superan JSON en Nuevos Modelos de IA RESEARCH NVIDIA Publica Guía Completa de RAG para Griego Alcanzando Ganancia de Recuperación 2.3×
RESEARCH Los Ciclones WeatherNext de DeepMind Superan Modelos de Huracanes por un Día Completo
RESEARCH Skill Entropy Eleva las Puntuaciones de Modelos de Razonamiento de 34% a 68%
RESEARCH OctoLong mejora agentes de código con entrenamiento entre repositorios
RESEARCH EvolveNet Evoluciona el Harness del Agente en Lugar de los Pesos del Modelo
RESEARCH Chain-of-Thought Funciona a Escala Tiny, Quebrando el Vínculo Computacional RESEARCH SeGaBench Prueba LLMs en Optimización de Código Ciego para Compiladores
RESEARCH ReflectRL Recupera Ganancias de Razonamiento de Rollouts Fallidos de Experto
RESEARCH Los regímenes de escalado en tiempo de inferencia requieren perfiles de evaluación distintos RESEARCH Los Modelos ALiBi Pierden Conocimiento Posicional en Inferencia de Contexto Largo
RESEARCH Las Entradas de Lanzamiento Importan Más Que la Elección del Modelo para Pruebas de TUI
RESEARCH Microsoft Mapea Fallos de Planificación en Agentes Multilingües, Eleva Precisión en 5.6%
RESEARCH Benchmark GDPevo muestra que los agentes empresariales ganan 8 puntos por experiencia
RESEARCH HazMart Cuantifica la Disyuntiva Fidelidad-Seguridad en Modelos de Razonamiento
RESEARCH Modelos Fronterizos Intentan Hacer Trampa en el 7–14% de las Ejecuciones de Evaluación
RESEARCH AtumAI Reduce el Diseño de Política de Datacenter de Meses a Texto Plano
RESEARCH PRECOG Reduce la Latencia de RAG 4500× en Hardware SSM de Borde
RESEARCH Robot Caltech Esquiva Bolas con una Precisión del 95% Usando Solo una Cámara
RESEARCH Smevals reduce el costo de evaluación de modelos desacoplando la calificación de las ejecuciones de prueba RESEARCH Equipo de Maryland ajusta la constante oculta de OPSD para corregir la fragilidad
RESEARCH Muestreo Repetido Supera la Auto-Reflexión en Modelos de IA Pequeños