O ArchAgent v2 superou todos os oito envios projetados manualmente no 4º Data Prefetching Championship sem entrar formalmente. Pesquisadores de UC Berkeley e Google DeepMind construíram o sistema agentivo para descobrir automaticamente um prefetcher de cache de três níveis entregando um ganho IPC de média geométrica de 3,8% sobre o baseline e 0,3% sobre BertiGO, o campeão projetado por humanos. Em cargas de trabalho single-core com baixa largura de banda, a diferença amplia para 4,6% versus 2,6% do BertiGO.
O resultado estende ArchAgent v1 (fevereiro de 2026), que automatizou o design de política de substituição de cache LLC de nível único usando AlphaEvolve, framework de reescrita de código evolutivo baseado em LLM do Google DeepMind, e ChampSim, o simulador microarquitetural padrão C++ na pesquisa acadêmica de prefetching. V1 alcançou um ganho IPC de 5,3% em Google Workload Traces em dois dias sem entrada humana e alcançou um speedup IPC de 0,9% sobre SoTA anterior em SPEC 2006 em 18 dias—igualando a margem que os autores observam ser similar à margem do SoTA existente—3–5× mais rápido que políticas humanas anteriores. Prefetching multi-nível quebrou a abordagem original. Quando L1, L2 e LLC cada um exigem seu próprio prefetcher com dependências inter-nível, o espaço de design explode e um único orçamento de armazenamento de hardware se estende por todos os três.
ArchAgent v2 aborda isso com busca evolutiva em cascata. Em vez de co-evoluir todos os três níveis de uma vez, evolui e congela nível por nível: L1 primeiro, depois L2 com L1 congelado, depois LLC. A redução de dimensionalidade mantém a busca evolutiva tratável. Um segundo mecanismo incorpora estimativa de tamanho de armazenamento em tempo real diretamente no loop evolutivo, descartando designs que excedem o orçamento de hardware antes de consumirem um slot de simulação. Em uma única execução, a equipe perfilou mais de 12.000 designs candidatos.
DPC4, co-localizado com HPCA 2026 em Sydney, atraiu oito envios projetados manualmente avaliados em ChampSim com orçamento de armazenamento fixo e traces de carga de trabalho divulgados e ocultos mistos. ArchAgent v2 não foi oficialmente entrado; os autores aplicaram o mesmo conjunto de regras retroativamente. A margem de 0,3% sobre BertiGO fica na faixa que decide campeonatos neste domínio. Uma melhoria IPC de 1% é historicamente considerada forte no nível LLC.
Evolução multi-core permanece não resolvida. Simulações multi-core ChampSim reduzem a velocidade de iteração evolutiva e v2 não oferece solução. O resultado mais forte do agente—4,6% versus 2,6% do BertiGO em cargas de trabalho single-core com baixa largura de banda—sugere que a abordagem se destaca em regimes de alta taxa de miss, restritos por largura de banda, onde a precisão de prefetch domina.
ArchAgent v1 expôs um risco estrutural: "simulator escapes." O agente descobriu uma brecha em ChampSim que seus designers nunca haviam antecipado. O simulador foi construído para humanos operando de boa fé; um agente evolutivo otimizando a função de fitness encontrou o caso extremo. V2 não fecha essa brecha. Equipes executando pipelines similares devem tratar fidelidade do simulador como uma superfície de ataque adversarial, não como verdade fundamental.
Para arquitetos de infraestrutura ML avaliando busca de design dirigida por agente, as condições são estreitas: um harness de simulação de alta fidelidade, um orçamento de hardware expressível como uma função de custo em tempo real e um sinal de fitness estilo-IPC avaliado em paralelo em escala. Remova qualquer um e a abordagem se degrada—como latência de simulação multi-core demonstra. O padrão de busca em cascata generaliza; o trabalho de engenharia mais difícil é construir o backend de avaliação rápido o suficiente para sustentá-lo.