Martin Spier, quien encabeza Performance de ChatGPT en OpenAI, enmarco el problema central en QCon AI como crecimiento explosivo de usuarios chocando contra desarrollo con agentes a escala. ChatGPT alcanzó un millón de usuarios en cinco días desde su lanzamiento y los equipos de ingeniería que lo sirven nunca lo alcanzaron completamente. El desarrollo con agentes hizo que ese alcance fuera estructural.
El problema de velocidad no está principalmente limitado por GPU. Una única solicitud de usuario pasa por procesamiento de cliente, carga de conversación, ensamblaje de contexto, tokenización, enrutamiento, inferencia, streaming y observabilidad antes de que un token llegue al usuario. Cualquier paso puede convertirse en un cuello de botella. Si una tarea requiere 30 solicitudes de modelo, un segundo adicional por solicitud se acumula. Reducir el trabajo repetido en todo el sistema importa tanto como hacer el modelo más rápido de forma aislada. Ahorrar un segundo por solicitud de la capa de orquestración importa tanto como el throughput bruto del modelo.
La respuesta de OpenAI: un arnés con agentes basado en Rust que conecta modelos, herramientas y el entorno del usuario. La opción de diseño clave para eficiencia de caché trata todo el historial visible por el modelo como append-only. Los nuevos mensajes, resultados de herramientas y estado del entorno se agregan al final en lugar de insertarse antes. Las herramientas aparecen en orden determinístico. Las políticas de aprobación y la configuración en tiempo de ejecución se aplican en el momento de la ejecución, no incrustadas en definiciones. El prefijo visto por el modelo permanece estable entre turnos, impulsando las tasas de acierto de prompt-cache. El precio de API GPT-5.2 incorpora el incentivo: descuento del 90% en tokens de entrada en caché ($1.75/1M estándar) le da a esa disciplina de diseño peso financiero.
OpenAI gastó $5.02 mil millones solo en inferencia de Azure en la primera mitad de 2025. En junio de 2026, los ingenieros desarrollaron una optimización solo de software—sin hardware nuevo, sin cambio arquitectónico—que redujo costos de inferencia en más del 50%. Aplicado al tráfico de visitantes desconectados de ChatGPT, redujo el recuento de GPU Nvidia sirviendo ese segmento a aproximadamente un par de cientos. La técnica permanece sin revelar; el análisis señala reutilización de caché KV, cuantización y agrupamiento más inteligente de solicitudes como contribuidores probables. Si las ganancias se transfieren a clientes de API pagados ejecutando cargas de trabajo con agentes—el tráfego más intensivo en computación—permanece abierto.
La codificación con agentes agrega presión de segundo orden: las regresiones llegan más rápido. Los equipos que entregan con agentes de codificación se encuentran a una capa de abstracción de distancia de entender lo que empujaron. Los humanos ya no saben todos los detalles de un cambio antes de que entre en producción. Eso comprime la ventana de detección antes de que las regresiones se acumulen. La respuesta de OpenAI: encuentre automatización con automatización. Implemente agentes de IA siempre activos para perfilado, detección de regresión y optimización continua. El equipo de performance está construyendo telemetría y herramientas que los agentes pueden leer directamente, en lugar de esperar a que los humanos analicen gráficos de llama.
Los benchmarks estándar—pares de tokens fijos 1k-in/8k-out u 8k-in/1k-out—no capturan la forma de múltiples turnos, heavy-tailed, tool-interleaved de trazas con agentes. Las métricas que importan cambian: latencia de traza de extremo a extremo, tiempo para primer token de respuesta en toda una sesión de agente, tasa de acierto de caché entre turnos y comportamiento del planificador bajo alta concurrencia de ráfagas de salida cortas. La presión de caché KV de sesiones de larga duración y la presión del planificador de altos volúmenes de solicitudes de salida son las características de carga que importan; los benchmarks de un solo turno pierden ambas.
La inferencia para cargas de trabajo con agentes es un problema de diseño de sistemas con multiplicadores. Arregle el arnés antes de ajustar el modelo.