IBM Research publicou um estudo esta semana sobre ALTK-Evolve, um framework que destila as próprias trajetórias passadas de um agente em diretrizes comportamentais reutilizáveis e as injeta no tempo de inferência—sem atualizações de peso, sem anotação humana. A memória ideal do agente depende do tamanho e da capacidade do modelo. A má calibração desperdiça tokens ou mata o desempenho.
A equipe testou três configurações de memória no AppWorld, um benchmark com 585 tarefas abrangendo 168 tarefas padrão e 417 tarefas de desafio em nove aplicativos simulados. A linha de base não usava memória. O "conjunto de diretrizes completo" injetava cada diretriz extraída a cada etapa ReAct. A "recuperação curada" entregava um núcleo fixo mais seleções por tarefa. Todas as diretrizes vieram do pool de divisão de treinamento; nada dos dados de teste foi usado.
Três padrões surgiram. Modelos fortes com capacidade de sobra ganharam mais com as diretrizes completas. DeepSeek-V3.2 (671B MoE) ganhou 9,5 pontos percentuais na conclusão de tarefas, com largura de banda para absorver lições de casos extremos.
Modelos menores e de médio porte mostraram o padrão oposto. Grandes conjuntos de diretrizes degradaram o desempenho ou se igualaram enquanto consumiam tokens. A recuperação curada se mostrou simultaneamente mais precisa e mais barata. gpt-oss-120b (117B MoE) ganhou 16,1 pontos percentuais usando recuperação curada com +5% tokens adicionais no contexto. O mesmo modelo recebendo diretrizes completas ganhou menos com aproximadamente 50% mais tokens.
Modelos já saturados não mostraram ganho mensurável. GLM-5 (745B MoE) produziu resultados planos para qualquer configuração. Pesquisadores da IBM sinalizaram isso como o "padrão saturado" e deixaram a interpretação em aberto: o modelo pode ter atingido seu limite nessas tarefas, as diretrizes podem não endereçar seus modos de falha, ou pode não aplicar a orientação efetivamente.
Este trabalho difere dos benchmarks de memória anteriores ao se concentrar no custo de produção. A recuperação curada é simultaneamente mais precisa e mais barata para modelos de médio porte. O cache de prompt torna as diretrizes completas acessíveis para modelos de ponta em cargas de trabalho em lote. O loop de aprendizado inteiro—coleta de trajetória, extração de diretrizes, consolidação, injeção—funciona sem atualizações de peso, razão pela qual ALTK-Evolve funcionou identicamente em todos os oito modelos testados.
A contagem de parâmetros sozinha não prevê qual padrão um modelo se enquadra. Espaço de manobra do benchmark, tamanho da janela de contexto, arquitetura, qualidade das diretrizes e distribuição de tarefas interagem. IBM Research diz que separar esses fatores é trabalho em andamento. Para implantações em produção, execute uma passagem de calibração em tarefas representativas antes de escolher uma configuração de memória para um modelo específico.
As tarefas do AppWorld são limitadas, bem estruturadas e binárias—ideais para medição, mas estruturalmente diferentes das cargas de trabalho de produção abertas que funcionam por horizontes mais longos com critérios de sucesso mais fuzzy. A transferibilidade não é estabelecida por este estudo.
Para equipes construindo infraestrutura de inferência: recuperação curada com um conjunto de diretrizes núcleo apertado é o ponto ideal para qualquer modelo fora da camada de ponta. Meça a sobrecarga de tokens antes e depois de adicionar memória. Se a sobrecarga exceder 10–15% sem ganhos correspondentes na conclusão de tarefas em avaliações retidas, o modelo provavelmente está saturado ou sendo inundado. Este artigo fornece as categorias diagnósticas; a calibração ainda requer seus próprios dados de avaliação.