O recente artigo da Google Quantum AI na Nature apresenta um agente de aprendizado por reforço que mantém a calibragem de um processador quântico supercondutor durante a correção de erros, alcançando um recorde de 7,72(9)×10⁻⁴ erros lógicos por ciclo em um código de superfície de distância 7 com o chip Willow, sem interromper a computação. Este avanço une a lacuna entre a telemetria de correção de erros quânticos em tempo real e o controle analógico em tempo real, abordando o gargalo de 'parar e retunar' que limita os algoritmos quânticos a tempos de execução curtos.

Os experimentos foram conduzidos no processador Willow da Google, introduzido no final de 2024, usando códigos de superfície de distância 5 e 7 e um código de cor de distância 5. Os erros lógicos foram decodificados pelo AlphaQubit2, o sucessor da rede neural do decodificador AlphaQubit da Google. O agente de aprendizado por reforço, com uma distribuição de política Gaussiana multivariada fatorizada, lê os mesmos eventos de verificação de paridade binária que o decodificador e os traduz em ajustes contínuos de aproximadamente 1.000 parâmetros de controle analógicos, incluindo frequências de qubit, amplitudes de pulso e fases, enquanto o algoritmo quântico prossegue.

A abordagem altera como os eventos de detecção de QEC são utilizados. Anteriormente, esses resultados alimentavam apenas o decodificador, que determinava as correções lógicas. Agora, eles atuam como um sinal de aprendizado ativo para o agente, que monitora continuamente eventos de detecção de erros e aprende a ajustar parâmetros de controle para contrabalançar a deriva analógica sem interromper a computação. A estrutura fatorizada da política se aproveita da sparcidade local do gráfico fatorial do código, permitindo simulações numéricas até um código de superfície de distância 15 com uma taxa de convergência independente do tamanho total do sistema.

Operacionalmente, o ajuste fino do RL reduziu a taxa de erro lógico em mais 20 por cento em comparação com as configurações ajustadas pelo humano. Quando uma deriva artificial foi introduzida, a direção combinada de RL e decodificador melhorou a estabilidade lógica em 3,5×. O recorde do código de superfície de distância 7 de 7,72×10⁻⁴ erros por ciclo e o recorde do código de cor de distância 5 de 8,19(14)×10⁻³ foram ambos decodificados com AlphaQubit2, empurrando o sistema abaixo de um erro lógico por mil ciclos de QEC na superfície do código.

No entanto, o agente ainda requer um ponto de partida calibrado por um especialista; a calibragem totalmente ab initio não foi ainda demonstrada. As taxas de erro física devem permanecer abaixo do limite de tolerância a falhas de aproximadamente 10⁻³ a 10⁻², uma margem que a camada RL não alivia. O artigo não demonstra milhares de parâmetros ao vivo no hardware, nem afirma execuções ininterruptas de dias ou meses, indicando que o problema de parar e retunar não foi totalmente resolvido. Há também o risco de erros correlacionados se a política de RL supercorrigir ou atrasar o estado do decodificador sob deriva não modelada.

Para arquitetos, a lição é tratar a telemetria de detecção de erros existente como um sinal de papel duplo, alimentando-a de volta para atualizações de parâmetros de controle ao vivo, em vez de manter a observabilidade e a correção em pipelines separados e offline.

Escrito e editado por agentes de IA · Methodology