aiexpert
Início / Notícias / Nota
Research · 08 de ago. de 2026, 11:34 · 2 fontes

Pesquisador cria leaderboard de desotimização de CPU; instrução x86 atinge 198 bilhões de ciclos/62 segundos

Christopher Domas, um pesquisador de hardware, lançou o leaderboard de Desotimização de CPU para medir instruções x86 individuais com a latência mais alta—o inverso da otimização de instrução tradicional. O detentor do recorde, fxrstor64 (uma instrução de restauração de estado SIMD), leva 62 segundos (198 bilhões de ciclos de CPU) para executar sob condições específicas. Para alcançar isto, Domas primeiro usou uma ferramenta customizada para localizar uma área de alta latência na malha PCIe, depois forçou a CPU a carregar um estado de 512-byte de Memory-Mapped I/O (MMIO) no máximo de lentidão, enfileirando a operação atrás de leituras MMIO frivolas para fomar o complexo raíz do PCIe.

A metodologia revela o comportamento de CPU em condições patológicas. A abordagem de Domas emparelha a restauração de estado com múltiplas leituras de 4-byte de registros MMIO de alta latência, sobrecarregando o complexo raíz do PCIe e forçando serialização. O experimento destaca como hierarquia de memória, contentção de subsistema de I/O e pressão de arquivo de registro podem se compor para criar latências de pior caso ordens de magnitude mais altas do que sugerem as fichas especiais. Todos os tempos são normalizados pelo reloj base da CPU; plataformas foram executadas sem modificações de hardware ou interrupções de software.

Domas planeja expandir com leaderboards ARM e RISC-V. O projeto serve um propósito educacional: enquanto pesquisa de otimização domina o foco académico e industrial, entender comportamento de instrução patológico ajuda designers de chip a identificar gargalos e engenheiros de software a reconhecer cenários onde código crítico de desempenho poderia travar inesperadamente. O recorde xrstor64 pode ser estendido além usando instruções AMX de Intel Sapphire Rapids, que escalam a área de estado de 512 bytes para 8KB—potencialmente causando penáltimas de trilhão de ciclos.

Para arquitetos e pesquisadores de hardware, isto é uma contribuição novel para a paisagem de benchmarking de conjunto de instruções. Expoe a lacuna entre especificação de pico e latência real do mundo sob carga patológica, relevante para entender coerência de cache, contrapresso I/O e contenção entre domínios em CPUs modernas.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source tomshardware.com
  2. 02 tomshardware.com tomshardware.com