Todo lo que la redacción publicó, en orden cronológico. Cada ítem trae origen, fuentes y tiempo de lectura.
RESEARCH Cada Clasificador de Guardrail Probado Falla en Verificación Formal de Seguridad
RESEARCH Demostración Matemática Muestra que la Atención en Transformers se Estabiliza Predeciblemente
RESEARCH Agentes de IA Evaden la Ingeniería de Software, Arriesgan Fallos en Producción
RESEARCH SLIM mejora desempeño de agentes LLM en 7 puntos porcentuales
RESEARCH Shepherd Aumenta Precisión de Agentes 90% Con Rastreo Por Ramificación
RESEARCH WildClawBench: Claude Opus Alcanza 62% en Evaluación de Agentes en Mundo Real
RESEARCH Modelos Sparse MoE Equiparan Desempeño con Transformers Densos a 3× Más Rápido en Inferencia
RESEARCH Optimizador Muon Logra 2× de Velocidad sobre AdamW en Entrenamiento de LLM en Producción
RESEARCH CIVeX Registra Cero Ejecuciones Falsas en Flujos Confundidos
RESEARCH Artículo Desmantela Afirmación sobre Descubrimiento Causal en Modelos de Predicción
RESEARCH Modelos Congelados Codifican Roles Semánticos Sin Fine-Tuning
RESEARCH Flow-OPD Eleva la Precisión de Stable Diffusion a 92 desde 63
RESEARCH Conformal Path Reasoning reduce conjuntos de respuestas en grafos de conocimiento en 40 por ciento
RESEARCH Equipo de Los Alamos Entrena Modelo de 8B que Generaliza en Benchmarks de Razonamiento
RESEARCH Contexto Más Largo Degrada Cooperación de LLM, Revela Estudio
RESEARCH AutoTTS Reduce Costos de Inferencia 69,5% con Scaling Adaptativo en Tiempo de Prueba
RESEARCH Impuesto de Acoplamiento: El Modo de Razonamiento Reduce la Precisión Bajo Límites de Token
RESEARCH Modelos Frontier Discrepan sobre Políticas Ambiguas, DRIP-R Demuestra
RESEARCH ActCam Controla Cámaras de Vídeo y Personajes Sin Fine-Tuning
RESEARCH Optimizer-Model Consistency Reduce el Olvido de LLMs en Fine-tuning
RESEARCH Precisión del Solucionador de Matemáticas en IA Sube 21.4% Con Generación Respaldada por Verificador
RESEARCH Análisis Arena: 66% de los Votos en Ranking se Cancelan
RESEARCH SIRA Supera Recuperación Densa Sin Entrenamiento ni Infraestructura GPU
RESEARCH UniPool reduce el presupuesto de parámetros MoE entre 34 y 58 por ciento
RESEARCH IA Matemática de DeepMind Alcanza 48% en Problemas de Nivel de Investigación
RESEARCH MoEs escasos mantienen precisión con poda del 87.5% de pesos
RESEARCH Investigadores de Rice y Apple reducen FID 22% en generación de imágenes con corrección de tokens
RESEARCH Entropía del Primer Token Rivaliza Detección de Alucinación Multi-Muestra
RESEARCH MRI-Eval Encuentra LLMs con 97% en Tarjetas de Estudio, 30% en Recordación Abierta
RESEARCH Q2RL Alcanza 100% de Éxito en Inserción de Espiga, Superando BC e IBRL
RESEARCH Purdue y Georgia Tech Demuestran que los Transformers Extraen Features No-lineales en Contexto
RESEARCH LongSeeker Supera a Competidores en Tareas de Largo Horizonte
RESEARCH Sistema Agentic de Verkor Cierra RTL-a-Layout en 80 Horas
RESEARCH LLMs Multi-Agent Pierden Un Tercio de Calidad Pero Señalan Ruta de Recuperación
RESEARCH Pruebas de Seguridad Fracasan Cuando el Modelo de Claude Oculta Sospechas en Su Interior
RESEARCH Mozilla Encontró 12 Bugs Críticos en Firefox Usando Claude Mythos
RESEARCH SymptomAI Supera a Clínicos 2.47x en Ensayo Real
RESEARCH OpenSeeker-v2 supera Tongyi de Alibaba en benchmarks de búsqueda agentic
RESEARCH Recomendador automático de agentes reduce pasos de ingeniería en sistemas multi-agentes a uno
RESEARCH Framework Dreadnode Reduce Red Teaming de IA de Semanas a Horas