IBM Research publicó una comparación directa con ACE (Agentic Context Engineering), el framework de Stanford/SambaNova para auto-mejora de agentes. El ALTK-Evolve de IBM supera a ACE en precisión de tareas en AppWorld mientras usa 58,5% menos tokens por tarea en DeepSeek-V3.2, e iguala la precisión de ACE en gpt-oss-120b consumiendo 85,1% menos tokens. El framework de código abierto ya está disponible en GitHub con integración MCP para Claude Code, Codex e IBM Bob.

Ambos sistemas abordan el mismo problema: los agentes LLM no fallan por falta de conocimiento sino por la incapacidad de usar herramientas de forma confiable. La solución es la memoria agéntica — convertir el historial de trayectoria del agente en directrices reutilizables inyectadas en tiempo de inferencia sin actualizaciones de pesos o etiquetas humanas. ACE y ALTK-Evolve están de acuerdo en un principio: nunca comprima las lecciones en un resumen breve. El sesgo de brevedad borra detalles arduamente ganados. ACE rastrea un contador útil/perjudicial por punto de manual; ALTK-Evolve rastrea un contador de soporte por directriz. Mismo principio, dos implementaciones.

La diferencia central es en la entrega. ACE inyecta su manual completo en cada paso de inferencia para cada tarea y modelo. ALTK-Evolve trata la entrega como una variable: un núcleo fijo de directrices de alto soporte, extendido por tarea con un pequeño conjunto seleccionado por similitud de coseno o ponderación de prioridad guiada por LLM. En modelos más débiles envía solo lo que el modelo puede usar; en modelos más fuertes envía el conjunto consolidado completo. ACE siempre transmite todas las directrices.

En AppWorld — tareas multietapa en un promedio de 9,5 APIs y 1,8 aplicaciones simuladas — con el mismo agente base ReAct: DeepSeek-V3.2 con ACE logra 80,4 Task Goal Completion (TGC) y 73,2 Scenario Goal Completion (SGC) en 634K tokens por tarea. ALTK-Evolve con DeepSeek-V3.2 logra 89,3 TGC y 80,4 SGC en 263K tokens por tarea. En gpt-oss-120b, ACE ejecuta 777K tokens por tarea para 54,8 TGC / 35,7 SGC; ALTK-Evolve ejecuta 116K tokens para 56,0 TGC / 37,5 SGC. En el modelo más fuerte, ALTK-Evolve gana en ambos ejes con 41% del gasto de inferencia de ACE. En el modelo más débil, iguala la precisión con 15% del presupuesto de tokens de ACE.

El desglose por dificultad explica por qué la entrega selectiva gana. En gpt-oss-120b, el manual completo de ACE tiene una ventaja en tareas Fácil y Medio — la inyección exhaustiva ayuda cuando las tareas se pueden resolver con instrucciones genéricas. En tareas Difícil, donde el modelo debe elegir la lección correcta en lugar de navegar por todas las opciones, la recuperación seleccionada gana, y las tareas Difícil deciden el agregado. En DeepSeek-V3.2 el patrón se invierte: el modelo es lo suficientemente fuerte para usar un manual completo, pero la selección por tarea de ALTK-Evolve aún gana en general, perdiendo solo en Medio. IBM formula la entrega como un dial en lugar de una política fija porque un volcado de manual genérico es subóptimo en ambas direcciones.

La integración es nativa de MCP. Antes de cada ejecución del agente, la herramienta MCP `get_guidelines` expone la dirección específica de la tarea; después de la ejecución, `save_trajectory` envía trazas de ejecución estructuradas para que el almacén aprenda. Una instalación de complemento Claude Code de una línea añade ALTK-Evolve a cualquier agente. El almacén de memoria fusiona casi-duplicados con consolidación que conserva soporte — cuando las lecciones se fusionan, la directriz sobreviviente hereda el recuento de soporte combinado para que el almacén se reduzca sin perder la evidencia detrás de cada directriz.

Para equipos en producción, el contexto de costos es empírico. El artículo del Stanford's Digital Economy Lab — "How Do AI Agents Spend Your Money?" (Brynjolfsson, Pentland, Pei et al.) — encontró que las tareas de codificación agéntica consumen hasta 1.000x más tokens que el razonamiento de código estándar, impulsado casi en su totalidad por la releitura del contexto de entrada, no por la generación de salida. El mismo artículo encontró que los costos de tokens para una tarea idéntica pueden variar hasta 30x entre ejecuciones, porque las trayectorias del agente son estocásticas y los modelos no pueden predecir su propio gasto por adelantado. Stanford lo llama "pricey context snowball" — cada paso relee todo el historial acumulado, y el historial solo crece. Una capa de memoria de entrega selectiva que reduce tokens por tarea en 58–85% mientras mantiene o mejora la precisión es la palanca de costo de inferencia más clara disponible sin cambiar el modelo o hardware.

Una restricción de implementación: la consolidación de ALTK-Evolve asume un volumen de tareas suficiente para que los contadores de soporte sean significativos. En cargas de trabajo de bajo volumen, el costo por tarea de la inferencia de paso de aprendizaje reduce las ganancias; la orientación de IBM es medir la relación de costo aprender-para-hacer antes de escalar. Cuando esa relación es favorable, las facturas de tokens caen y la precisión en tareas difíciles aumenta. Esa es la combinación que los equipos de plataforma estaban esperando.