IBM Research publicou ALTK-Evolve, um sistema de memória agentic que consolida modos de falha aprendidos e lições de um agente em diretrizes selecionáveis—alcançando até 7x menor consumo de token do que ACE (Agentic Context Engineering) em tarefas de raciocínio multi-passo. Em um modelo fraco (gpt-oss-120b), ALTK-Evolve igualou a taxa de conclusão de gol 54,8% de ACE no benchmark AppWorld enquanto consumia 116K tokens por tarefa versus 777K de ACE. Em modelos mais fortes (DeepSeek-V3.2), ALTK-Evolve melhorou precisão (89,3% vs 80,4%) enquanto reduzia custos para 40% dos 634K tokens de ACE.
Ambos os sistemas aprendem com trajetórias de agentes sem atualizações de peso ou rótulos humanos. ACE e ALTK-Evolve concordam em um princípio central: nunca comprimir as lições duramente conquistadas de um agente em resumos breves; em vez disso, preservar armazena ricos e itens com contadores de suporte mostrando quantos episódios independentes produziram cada diretriz. A divergência é na entrega: ACE injeta o playbook abrangente completo a cada passo de inferência; ALTK-Evolve usa recuperação seletiva, enviando um núcleo fixo de diretrizes de alto suporte além de lições específicas de tarefa selecionadas via similaridade cosseno ou classificação de LLM.
A eficiência de token vem desta troca de recuperação versus injeção. Em tarefas mais difíceis onde modelos devem escolher a lição certa em vez de atravessar instruções genéricas, seleção curada fica à frente. ALTK-Evolve também extrai diretrizes tipadas (estratégia, recuperação, otimização) com atribuição causal volta a trajetórias de origem e em granularidade de subtarefa, permitindo transferência em domínios de agentes. O trabalho testa ambos os sistemas em AppWorld, um benchmark de agentes multi-passo abrangendo divisão de contas, busca de música, e reconciliação de pedidos em APIs simuladas.
Para arquitetos: custo de memória agentic importa em escala. Se você executa dezenas de agentes concurrent ao longo de meses, eficiência de token por tarefa determina capex. A estratégia de recuperação seletiva de ALTK-Evolve transfere entre modelos fracos e fronteiriços. A tipagem e provenância causal permitem reuso em domínios de agentes não relacionados—uma lição aprendida por um app pode servir outro. Fique atento para desdobramentos em produção; a 7x redução de token em modelos fracos, a economia muda quem pode arcar com memória agentic persistente.