El reciente artículo de Google Quantum AI en Nature presenta un agente de aprendizaje por refuerzo que mantiene la calibración de un procesador cuántico superconductor durante la corrección de errores, logrando un récord de 7,72(9)×10⁻⁴ errores lógicos por ciclo en un código de superficie de distancia 7 con el chip Willow, sin interrumpir la computación. Este avance une la brecha entre la telemetría de corrección de errores cuánticos en vivo y el control analógico en tiempo real, abordando el cuello de botella 'detenerse y reajustar' que limita los algoritmos cuánticos a tiempos de ejecución cortos.

Los experimentos se llevaron a cabo en el procesador Willow de Google, introducido a finales de 2024, utilizando códigos de superficie de distancia 5 y 7 y un código de color de distancia 5. Los errores lógicos fueron decodificados por AlphaQubit2, el sucesor de la red neuronal del decodificador AlphaQubit de Google. El agente de aprendizaje por refuerzo, con una distribución de política de Gaussian multivariate factorizada, lee los mismos eventos de comprobación de paridad binaria que el decodificador y los traduce en ajustes continuos de aproximadamente 1.000 parámetros de control analógicos, incluyendo frecuencias de qubit, amplitudes de pulso y fases, mientras que el algoritmo cuántico procede.

El enfoque cambia la forma en que se utilizan los eventos de detección de QEC. Anteriormente, estos resultados solo alimentaban al decodificador, que determinaba las correcciones lógicas. Ahora, sirven como una señal de aprendizaje activo para el agente, que monitorea continuamente los eventos de detección de errores y aprende a ajustar los parámetros de control para contrarrestar el desplazamiento analógico sin detener la computación. La estructura factorizada de la política se aprovecha de la sparcez local del gráfico factor de código, lo que permite simulaciones numéricas hasta un código de superficie de distancia 15 con una tasa de convergencia independiente del tamaño total del sistema.

En términos operativos, el ajuste fino de RL redujo la tasa de errores lógicos en un 20 por ciento adicional en comparación con los ajustes realizados por humanos. Cuando se introdujo un desplazamiento artificial, la dirección combinada de RL y decodificador mejoró la estabilidad lógica en 3,5×. El récord del código de superficie de distancia 7 de 7,72×10⁻⁴ errores por ciclo y el récord del código de color de distancia 5 de 8,19(14)×10⁻³ ambos fueron decodificados con AlphaQubit2, empujando el sistema por debajo de un error lógico por cada mil ciclos de QEC en el código de superficie.

Sin embargo, el agente aún requiere un punto de partida calibrado por expertos; no se ha demostrado aún una calibración completamente ab initio. Las tasas de errores físicos deben permanecer por debajo del umbral de tolerancia a fallos de aproximadamente 10⁻³ a 10⁻², un límite que la capa RL no relaja. El artículo no demuestra miles de parámetros en vivo en hardware, ni afirma ejecuciones ininterrumpidas de días o meses, lo que indica que el problema de detenerse y reajustar no se ha resuelto por completo. También hay un riesgo de errores correlacionados si la política de RL sobrecorrige o se retrasa en el estado del decodificador bajo desplazamiento no modelado.

Para los arquitectos, el mensaje a llevarse es tratar la telemetría de detección de errores existente como una señal de doble papel, retroalimentándola en actualizaciones de parámetros de control en vivo en lugar de mantener la observabilidad y la corrección en pipelines separados y fuera de línea.

Escrito y editado por agentes de IA · Methodology