aiexpert
Inicio / Noticias / Nota
Research · 08 ago 2026, 11:34 · 2 fuentes

Investigador inicia leaderboard de deoptimización de CPU; instrucción x86 alcanza 198 mil millones de ciclos/62 segundos

Christopher Domas, un investigador de hardware, lanzó el leaderboard de Deoptimización de CPU para medir instrucciones x86 individuales con la latencia más alta—lo inverso de la optimización de instrucción tradicional. El poseedor del récord, fxrstor64 (una instrucción de restauración de estado SIMD), toma 62 segundos (198 mil millones de ciclos de CPU) para ejecutar bajo condiciones específicas. Para lograr esto, Domas primero usó una herramienta personalizada para localizar un área de alta latencia en la tela PCIe, luego forzó la CPU a cargar un estado de 512 bytes desde Memory-Mapped I/O (MMIO) a la máxima lentitud, poniendo en cola la operación detrás de lecturas MMIO frívolas para inanición el complejo raíz PCIe.

La metodología revela el comportamiento de la CPU bajo condiciones patológicas. El enfoque de Domas empareja la restauración de estado con múltiples lecturas de 4 bytes de registros MMIO de alta latencia, saturando el complejo raíz del PCIe y forzando la serialización. El experimento destaca cómo la jerarquía de memoria, la contención del subsistema de E/S y la presión del archivo de registros pueden combinarse para crear latencias de peor caso órdenes de magnitud más altas de lo que sugieren los datos de especificación. Todos los tiempos se normalizan por el reloj base de la CPU; las plataformas se ejecutaron sin modificaciones de hardware ni interrupciones de software.

Domas planea expandir con leaderboards de ARM y RISC-V. El proyecto sirve un propósito educativo: mientras que la investigación de optimización domina el enfoque académico e industrial, entender el comportamiento de instrucciones patológicas ayuda a los diseñadores de chips a identificar cuellos de botella e ingenieros de software a reconocer escenarios donde código crítico de desempeño podría estancarse inesperadamente. El récord xrstor64 puede extenderse más usando instrucciones AMX de Intel Sapphire Rapids, que escalan el área de estado de 512 bytes a 8 KB—potencialmente causando demoras de billones de ciclos.

Para arquitectos e investigadores de hardware, esta es una contribución novedosa al panorama de benchmarking del conjunto de instrucciones. Expone la brecha entre especificación de pico y latencia del mundo real bajo carga patológica, relevante para entender coherencia de caché, contrapremisión de E/S y contención entre dominios en las CPU modernas.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source tomshardware.com
  2. 02 tomshardware.com tomshardware.com