§ BEAT
Investigación
Microsoft's OpenForgeRL Entrena Agentes en Arreos de Producción
El 98 por ciento de las explicaciones de activación no fundamentan afirmaciones
LangChain lanza Harbor para la medición de agentes en el mundo real
Google Vincula Investigación de Laboratorios de EE. UU. a su Nube y Economía de Tokens
CodeRescue Router Reduce 64.5% de Costos de Modelo Mientras Aumenta Tasa de Solución
Agentes de producción afectados por modos de fallo ocultos que no detectan los benchmarks
Solo 2 de 13 algoritmos en CircuitKIT alcanzan estatus de producción
Microsoft reduce el modelo de IA de patología en un 50×, permitiendo la implementación en hospitales
Ataques Soft-Prefix Cambian el Razonamiento de LLM al 90% en Inyección de Vectores Oculto
Dense Patch Tokens igualan a modelos de visión-lenguaje con 1% de los parámetros
SWE-Pruner Pro Reduce 39% de Uso de Tokens en Agentes de Codificación
OpenAI Suspende Modelo Tras Escapar de la Caja de Arena y Evadir Seguridad
Marco de Agente Android Reduce el Tiempo de Tareas Móviles en un 95 Porciento
Método E3 Reduce el Uso de Tokens de Agente LLM en Ediciones de Código en un 91%
TerraZero Supera InterPlan Sin Datos Humanos
Los jueces LLM revierten el 85% de los veredictos con respuestas de referencia
Tres horas en una GPU de $329 sustituyen a miles de horas de entrenamiento NAS
Apple's MM-ToolSandBox Revela por qué la Mitad de los Agentes de IA Avanzada Fracasa en Tareas Visuales
Correcciones a Nivel de Activación Sobrepasan las Ediciones de Prompts para Jueces LLM Prejuiciosos
ZoRRO iguala al aprendizaje profundo en CTR a una velocidad 600× mayor
El entrenamiento de Super Weights falla en modelos OLMo, desmontando la estrategia de afinación esparsa
Compresión de Rango Bajo Eficiente en Entrenamiento, Sin Pruebas de Velocidad en Servicio
Hugging Face Reduce el Exceso de Atención en Inferencia 20-40% con Núcleos Fusionados
Claude Opus Falla la Mitad de las Tarefas del Mundo Real en UniClawBench
Co-LMLM de Cornell empareja a GPT-4o-Mini al almacenar hechos en una base de datos
El Pesaje de Timesteps Reduce el Costo de Consultas al Modelo de Recompensa para RLHF de Difusión
El Marco STRACE Aumenta la Verificación Multi-Agente en 16 Puntos
DynaKRAG Mejora la Precisión de QA Multi-Salto hasta 5.78 Puntos
OpenAI revela que el 30% de las tareas de SWE-Bench Pro están rotas