IBM Research publicó ALTK-Evolve, un sistema de memoria agentic que consolida modos de falla aprendidos y lecciones de un agente en directrices recuperables selectivamente—logrando hasta 7x menor consumo de token que ACE (Agentic Context Engineering) en tareas de razonamiento multi-paso. En un modelo débil (gpt-oss-120b), ALTK-Evolve igualed la tasa de completación de objetivo 54.8% de ACE en el benchmark AppWorld mientras consuming 116K tokens por tarea versus 777K de ACE. En modelos más fuertes (DeepSeek-V3.2), ALTK-Evolve mejoró precision (89.3% vs 80.4%) mientras reducía costos a 40% de los 634K tokens de ACE.
Ambos sistemas aprenden de trayectorias de agentes sin actualizaciones de peso o etiquetas humanas. ACE y ALTK-Evolve acuerdan en un principio central: nunca comprimen lecciones duramente ganadas de un agente en resúmenes breves; en su lugar, preservan almacenes ricos e itemizados con contadores de soporte mostrando cuántos episodios independientes produjeron cada pauta. La divergencia está en la entrega: ACE inyecta el playbook integral completo en cada paso de inferencia; ALTK-Evolve usa recuperación selectiva, enviando un núcleo fijo de pautas de alto soporte más lecciones específicas de tarea seleccionadas via similitud coseno o clasificación de LLM.
La eficiencia de token proviene de esta compensación recuperación versus inyección. En tareas más difíciles donde los modelos deben elegir la lección correcta en lugar de atravesar instrucciones genéricas, la selección curada se adelanta. ALTK-Evolve también extrae pautas tipadas (estrategia, recuperación, optimización) con atribución causal a trayectorias de origen y con granularidad de subtarea, permitiendo transferencia a través de dominios de agentes. El trabajo prueba ambos sistemas en AppWorld, un benchmark multi-paso de agentes abarcando división de facturas, búsqueda de canciones, y reconciliación de pedidos a través de APIs simuladas.
Para arquitectos: el costo de memoria agentic importa a escala. Si ejecuta docenas de agentes concurrentes durante meses, la eficiencia de token por tarea determina capex. La estrategia de recuperación selectiva de ALTK-Evolve transfiere entre modelos débiles y fronterizos. La tipificación y proveniencia causal habilitan reuso a través de dominios de agentes no relacionados—una lección aprendida por una app puede servir otra. Observe despliegues de producción; con reducción de 7x tokens en modelos débiles, la economía cambia quién puede permitirse memoria agentic persistente.