IBM Research publicó esta semana un estudio sobre ALTK-Evolve, un framework que destila las trayectorias pasadas propias de un agente en directrices de comportamiento reutilizables e inyectarlas en tiempo de inferencia—sin actualizaciones de pesos, sin anotación humana. La memoria óptima del agente depende del tamaño y capacidad del modelo. La mala calibración desperdicia tokens o mata el rendimiento.
El equipo probó tres configuraciones de memoria en AppWorld, un benchmark de 585 tareas que abarca 168 tareas estándar y 417 tareas de desafío en nueve aplicaciones simuladas. La línea de base no utilizaba memoria. El "conjunto de directrices completo" inyectaba cada directriz extraída en cada paso ReAct. La "recuperación curada" entregaba un núcleo fijo más selecciones por tarea. Todas las directrices provenían del pool de división de entrenamiento; nada de los datos de prueba fue utilizado.
Emergieron tres patrones. Los modelos fuertes con capacidad de sobra ganaron más con las directrices completas. DeepSeek-V3.2 (671B MoE) ganó 9,5 puntos porcentuales en la finalización de tareas, con ancho de banda para absorber lecciones de casos extremos.
Los modelos más pequeños y de nivel medio mostraron el patrón opuesto. Los grandes conjuntos de directrices degradaron el rendimiento o se empataron mientras consumían tokens. La recuperación curada resultó ser simultaneamente más precisa y más barata. gpt-oss-120b (117B MoE) ganó 16,1 puntos porcentuales usando recuperación curada con +5% tokens adicionales en contexto. El mismo modelo con directrices completas ganó menos con aproximadamente 50% más tokens.
Los modelos ya saturados no mostraron ganancia medible. GLM-5 (745B MoE) produjo resultados planos para cualquier configuración. Los investigadores de IBM señalaron esto como el "patrón saturado" y dejaron la interpretación abierta: el modelo puede haber alcanzado su límite en estas tareas, las directrices pueden no abordar sus modos de fallo, o puede no aplicar la orientación efectivamente.
Este trabajo se diferencia de los benchmarks de memoria anteriores al enfocarse en el costo de producción. La recuperación curada es simultáneamente más precisa y más barata para modelos de nivel medio. El almacenamiento en caché de prompts hace que las directrices completas sean asequibles para modelos de frontera en cargas de trabajo por lotes. Todo el bucle de aprendizaje—recopilación de trayectorias, extracción de directrices, consolidación, inyección—se ejecuta sin actualizaciones de pesos, razón por la cual ALTK-Evolve se ejecutó idénticamente en los ocho modelos probados.
El número de parámetros por sí solo no predice qué patrón sigue un modelo. El margen de beneficio del benchmark, el tamaño de la ventana de contexto, la arquitectura, la calidad de las directrices y la distribución de tareas interactúan. IBM Research dice que separar esos factores es trabajo en curso. Para despliegues en producción, ejecute una pasada de calibración en tareas representativas antes de elegir una configuración de memoria para un modelo específico.
Las tareas de AppWorld están limitadas, bien estructuradas y con puntuación binaria—ideal para medición pero estructuralmente diferente de las cargas de trabajo de producción abiertas que se ejecutan durante horizontes más largos con criterios de éxito más difusos. La transferibilidad no se establece por este estudio.
Para equipos que construyen infraestructura de inferencia: la recuperación curada con un conjunto de directrices núcleo apretado es el punto óptimo para cualquier modelo fuera del nivel de frontera. Mida la sobrecarga de tokens antes y después de agregar memoria. Si la sobrecarga supera 10–15% sin ganancias correspondientes en la finalización de tarefas en evaluaciones retenidas, el modelo probablemente está saturado o siendo inundado. Este documento proporciona las categorías de diagnóstico; la calibración aún requiere sus propios datos de evaluación.