Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH El entrenamiento de Super Weights falla en modelos OLMo, desmontando la estrategia de afinación esparsa
RESEARCH Compresión de Rango Bajo Eficiente en Entrenamiento, Sin Pruebas de Velocidad en Servicio
RESEARCH Hugging Face Reduce el Exceso de Atención en Inferencia 20-40% con Núcleos Fusionados
RESEARCH Claude Opus Falla la Mitad de las Tarefas del Mundo Real en UniClawBench
RESEARCH Co-LMLM de Cornell empareja a GPT-4o-Mini al almacenar hechos en una base de datos RESEARCH El Pesaje de Timesteps Reduce el Costo de Consultas al Modelo de Recompensa para RLHF de Difusión
RESEARCH El Marco STRACE Aumenta la Verificación Multi-Agente en 16 Puntos
RESEARCH DynaKRAG Mejora la Precisión de QA Multi-Salto hasta 5.78 Puntos
RESEARCH OpenAI revela que el 30% de las tareas de SWE-Bench Pro están rotas
RESEARCH DepthWeave-KV reduce la memoria de caché de LLM en 8,3 veces sin reentrenamiento
RESEARCH SovereignPA-Bench Mide si los Agentes de IA Protegen los Límites del Usuario
RESEARCH Bucle de Planificación Dual Resuelve el Vacío Semántico en Robots Jerárquicos
RESEARCH SearchGen-20K Ensena a Generadores Visuales Cuándo Buscar
RESEARCH CompactionRL impulsa a los agentes de codificación GLM 5–7 puntos en benchmarks
RESEARCH Nuevo Método de Verificación Logra 86.5% en Terminal-Bench Sin Ajuste Fino
RESEARCH Monitor de Umbral Simple Iguala Salvaguardias Complejas de LLM en Artículo del ICML
RESEARCH Agentes de Codificación Desalineados Evaden Monitores en el 93% de Ataques Graduales
RESEARCH LACUNA Demuestra que los Métodos de Desaprendizaje no Logran Borrar PII de los Modelos
RESEARCH Etiquetas en Lenguaje Natural Superan Escalares en Aprendizaje Offline de Robots
RESEARCH Theoria conecta prueba formal y jueces LLM con verificación auditable
RESEARCH Tres grandes benchmarks inflan las puntuaciones de agentes de código, descubre auditoría
RESEARCH El Entrenamiento de AutoMem Duplica el Desempeño del Agente en Tareas de Largo Horizonte
RESEARCH Una Capa Coincide con el Entrenamiento Completo de RL en Modelos Qwen
RESEARCH BrowserBC Eleva la Tasa de Éxito de Agentes de Navegador al 81% Utilizando Trazas Humanas
RESEARCH Las Explicaciones de Modelos de Lenguaje Rastrean Cambios de Comportamiento Automáticamente
RESEARCH TRIAGE Reduce Acciones de Agentes 14.8% Mientras Aumenta Tasas de Éxito
RESEARCH Los Baselines de Prompting Simple Superan los Métodos de Supervisión Compleja
RESEARCH Investigadores Cierran la Brecha entre Agentes de IA y Habilidades Curadas Manualmente
RESEARCH Nueva Técnica de Entrenamiento Mejora la Calibración de Confianza de LLM en 63%
RESEARCH Google Lanza Modelo Tabular Zero-Shot Pero Oculta Datos de Benchmark
RESEARCH Los modelos de visión-lenguaje enrutan el conocimiento a través de apenas el 2,5% de la red RESEARCH Agentes de IA Duplican la Fricción de Merge a Nivel de Repositorio
RESEARCH El Contexto del Idioma Original Recupera la Precisión Perdida en Cascadas Multilingües RESEARCH ENS Alcanza Precisión 10× en Benchmarks Difíciles de EDPs sin Bucles de Corrección
RESEARCH La Taxonomía de Mecanismo Eleva F1 de Moderación LLM en 5,4%