Amazon le dijo a sus propios ingenieros en mayo que dejaran de desperdiciar ciclos de CPU. La directiva, entregada en reuniones internas y reportada por The Information, ordenó a los usuarios de EC2 reducir instancias de baja utilización para liberar capacidad para clientes pagadores. El tiempo de aprovisionamiento se ha extendido de horas a días. Un ingeniero veterano de Amazon le dijo a The Information que nunca había esperado tanto por una instancia de computación.
La causa inmediata: las cargas de trabajo de IA agentic están consumiendo CPU a una tasa que la infraestructura nunca fue diseñada para manejar.
La inferencia de IA tradicional utilizaba una CPU por cada ocho GPUs. La CPU tokenizaba entradas, enrutaba solicitudes y mantenía alimentadas las colas de GPU—trabajo ligero. Las cargas de trabajo agentic rompen ese modelo. Cada bucle de agente—planificar, llamar herramienta, analizar respuesta, re-tokenizar, enrutar al siguiente sub-agente—se ejecuta casi completamente en CPU. Un artículo de Georgia Tech e Intel de noviembre de 2025 lo midió: el procesamiento de herramientas en CPUs representa del 50 al 90 por ciento de la latencia total en cargas de trabajo agentic.
El CFO de Intel, David Zinsner, confirmó en la llamada de resultados Q1 2026 que la proporción CPU-a-GPU en centros de datos se movió de 1:8 a 1:4. Dijo que los despliegues agentic podrían empujarla a 1:1. Los analistas de JP Morgan modelaron una proporción ideal de siete CPUs por GPU.
La aritmética práctica es brutal. En un nodo estándar de 8 GPUs con 64 vCPUs, un trabajo de despliegue GRPO llamando a una sandbox de ejecución de código satura todos los núcleos de CPU en aproximadamente 32 trabajadores concurrentes. Las GPUs permanecen inactivas esperando trayectorias puntuadas. Un pipeline LangGraph o CrewAI de 10 agentes que realiza tres llamadas de herramientas por paso necesita aproximadamente 30 hilos de CPU simultáneos por ronda de inferencia. El equipo de infraestructura de Spheron recomienda 16–24 vCPUs por GPU para pipelines que ejecutan diez o más agentes concurrentes. La mayoría de las instancias de EC2 existentes son demasiado pequeñas para esa proporción.
La demanda ha superado la oferta. Dylan Patel en SemiAnalysis reportó que Amazon y Microsoft agotaron su inventario completo de CPU para empresas de IA incluyendo OpenAI y Anthropic. Amazon triplicó su número de servidores CPU año tras año y aún así agotó la oferta. OpenAI trasladó todo su código a ARM para acceder a instancias AWS Graviton—Graviton5, construido en TSMC N3 con 192 núcleos, es actualmente la opción de mayor densidad de Amazon.
Los precios de CPU de servidores han subido un 20 por ciento desde marzo; los precios de venta promedio subieron un 27 por ciento en Q1 2026. Los tiempos de entrega para CPUs de servidores de alto número de núcleos se han extendido a seis meses. Intel confirmó que la demanda de Xeon excede la oferta por un margen "significativo" y ha desplazado capacidad de oblea de chips para consumidores a producción de centros de datos.
La escasez no es uniforme. La crisis de capacidad de Amazon se concentra en instancias spot. Las fuentes de The Information confirmaron que la capacidad reservada contratada no ha experimentado escasez. Los arquitectos que fijaron acuerdos de instancia reservada antes de Q1 están aislados; los equipos en demanda bajo demanda o spot compiten por lo que queda.
El riesgo de costo agrava el riesgo de capacidad. Un agente de codificación dentro de Amazon gastó $1,8 millones en costos de tokens el mes pasado, superando su presupuesto de desarrollo en un 860 por ciento. Los bucles agentic que generan sub-agentes sin límites saturan CPU y generan volumen de tokens que abruma los controles de costo.
La conclusión para arquitectos: CPU es la nueva GPU en despliegues agentic. La capacidad reservada es la única capacidad confiable. Cualquier bucle de agente sin límites de concurrencia explícitos y planificación de proporción CPU-a-GPU es un incidente de latencia y costo esperando ocurrir.