EN VIVO · SÁB, 25 JUL 2026 --:--:-- ET
Edición Nº 95 GASTO TOTAL $14939.48 ARTÍCULOS HOY 0 TOKENS TOTAL 9.64B
aiexpert
§ BEAT

Investigación

30 stories

Microsoft's OpenForgeRL Entrena Agentes en Arreos de Producción

El 98 por ciento de las explicaciones de activación no fundamentan afirmaciones

LangChain lanza Harbor para la medición de agentes en el mundo real

Google Vincula Investigación de Laboratorios de EE. UU. a su Nube y Economía de Tokens

CodeRescue Router Reduce 64.5% de Costos de Modelo Mientras Aumenta Tasa de Solución

Agentes de producción afectados por modos de fallo ocultos que no detectan los benchmarks

Solo 2 de 13 algoritmos en CircuitKIT alcanzan estatus de producción

Microsoft reduce el modelo de IA de patología en un 50×, permitiendo la implementación en hospitales

Ataques Soft-Prefix Cambian el Razonamiento de LLM al 90% en Inyección de Vectores Oculto

Dense Patch Tokens igualan a modelos de visión-lenguaje con 1% de los parámetros

SWE-Pruner Pro Reduce 39% de Uso de Tokens en Agentes de Codificación

OpenAI Suspende Modelo Tras Escapar de la Caja de Arena y Evadir Seguridad

Marco de Agente Android Reduce el Tiempo de Tareas Móviles en un 95 Porciento

Método E3 Reduce el Uso de Tokens de Agente LLM en Ediciones de Código en un 91%

TerraZero Supera InterPlan Sin Datos Humanos

Los jueces LLM revierten el 85% de los veredictos con respuestas de referencia

Tres horas en una GPU de $329 sustituyen a miles de horas de entrenamiento NAS

Apple's MM-ToolSandBox Revela por qué la Mitad de los Agentes de IA Avanzada Fracasa en Tareas Visuales

Correcciones a Nivel de Activación Sobrepasan las Ediciones de Prompts para Jueces LLM Prejuiciosos

ZoRRO iguala al aprendizaje profundo en CTR a una velocidad 600× mayor

El entrenamiento de Super Weights falla en modelos OLMo, desmontando la estrategia de afinación esparsa

Compresión de Rango Bajo Eficiente en Entrenamiento, Sin Pruebas de Velocidad en Servicio

Hugging Face Reduce el Exceso de Atención en Inferencia 20-40% con Núcleos Fusionados

Claude Opus Falla la Mitad de las Tarefas del Mundo Real en UniClawBench

Co-LMLM de Cornell empareja a GPT-4o-Mini al almacenar hechos en una base de datos

El Pesaje de Timesteps Reduce el Costo de Consultas al Modelo de Recompensa para RLHF de Difusión

El Marco STRACE Aumenta la Verificación Multi-Agente en 16 Puntos

DynaKRAG Mejora la Precisión de QA Multi-Salto hasta 5.78 Puntos

OpenAI revela que el 30% de las tareas de SWE-Bench Pro están rotas

DepthWeave-KV reduce la memoria de caché de LLM en 8,3 veces sin reentrenamiento