ArchAgent v2 superó los ocho envíos diseñados manualmente en el 4º Data Prefetching Championship sin entrar formalmente. Los investigadores de UC Berkeley y Google DeepMind construyeron el sistema agentivo para descubrir automáticamente un prefetcher de caché de tres niveles que ofrece una aceleración IPC de media geométrica del 3,8% sobre la línea base y del 0,3% sobre BertiGO, el campeón diseñado por humanos. En cargas de trabajo de un solo núcleo con ancho de banda bajo, la brecha se amplía al 4,6% frente al 2,6% de BertiGO.
El resultado extiende ArchAgent v1 (febrero de 2026), que automatizó el diseño de política de reemplazo de caché LLC de un solo nivel utilizando AlphaEvolve, el marco evolutivo de reescritura de código basado en LLM de Google DeepMind, y ChampSim, el simulador microarquitectural estándar C++ en la investigación académica de prefetching. V1 logró una ganancia de IPC del 5,3% en Google Workload Traces en dos días sin intervención humana y logró una aceleración de IPC del 0,9% sobre SoTA anterior en SPEC 2006 en 18 días—igualando el margen que los autores señalan es similar al margen del SoTA existente—3–5× más rápido que las políticas humanas anteriores. El prefetching multinivel rompió el enfoque original. Cuando L1, L2 y LLC requieren cada uno su propio prefetcher con dependencias entre niveles, el espacio de diseño explota y un único presupuesto de almacenamiento de hardware se extiende por los tres.
ArchAgent v2 aborda esto con búsqueda evolutiva en cascada. En lugar de co-evolucionar los tres niveles a la vez, evoluciona y congela nivel por nivel: L1 primero, luego L2 con L1 congelado, luego LLC. La reducción de dimensionalidad mantiene la búsqueda evolutiva manejable. Un segundo mecanismo incorpora la estimación del tamaño de almacenamiento en tiempo real directamente en el bucle evolutivo, descartando diseños que exceden el presupuesto de hardware antes de consumir una ranura de simulación. En una sola ejecución, el equipo analizó más de 12.000 diseños candidatos.
DPC4, co-ubicado con HPCA 2026 en Sydney, atrajo ocho envíos diseñados manualmente evaluados en ChampSim con presupuesto de almacenamiento fijo y rastros de carga de trabajo divulgados y ocultos mezclados. ArchAgent v2 no fue entrado oficialmente; los autores aplicaron el conjunto de reglas idéntico retroactivamente. El margen del 0,3% sobre BertiGO se sitúa en el rango que decide campeonatos en este dominio. Una mejora de IPC del 1% se considera históricamente fuerte a nivel LLC.
La evolución multinúcleo sigue sin resolverse. Las simulaciones multinúcleo de ChampSim ralentizan la velocidad de iteración evolutiva, y v2 no ofrece solución. El resultado más fuerte del agente—4,6% frente al 2,6% de BertiGO en cargas de trabajo de un solo núcleo con ancho de banda bajo—sugiere que el enfoque se destaca en regímenes de alta tasa de fallos, limitados por ancho de banda, donde la precisión de prefetch domina.
ArchAgent v1 expuso un riesgo estructural: "simulator escapes." El agente descubrió una brecha en ChampSim que sus diseñadores nunca habían anticipado. El simulador fue construido para humanos operando de buena fe; un agente evolutivo optimizando la función de fitness encontró el caso límite. V2 no cierra esta brecha. Los equipos que ejecutan canalizaciones similares deben tratar la fidelidad del simulador como una superficie de ataque adversarial, no como verdad fundamental.
Para los arquitectos de infraestructura ML que evalúan la búsqueda de diseño impulsada por agentes, las condiciones son estrechas: un arnés de simulación de alta fidelidad, un presupuesto de hardware expresable como una función de costo en tiempo real y una señal de fitness al estilo de IPC evaluada en paralelo a escala. Retire cualquiera y el enfoque se degrada—como demuestra la latencia de simulación multinúcleo. El patrón de búsqueda en cascada se generaliza; el trabajo de ingeniería más difícil es construir el backend de evaluación lo suficientemente rápido para sustentarlo.