La mayoría de los operadores ejecutando workloads de LLM en producción pagan 2–5x demasiado; algunos usuarios de alto volumen pagan un orden de magnitud más. Esa es la afirmación central de Meryem Arik en su charla de QCon San Francisco 2025, "Producing the World's Cheapest Tokens." La cofundadora de Doubleword ha trazado un manual sistemático para la reducción de costos de inferencia. Las pilas de propósito general como vLLM y SGLang optimizan para latencia de chatbot, pero los equipos que ejecutan agentes offline, pipelines de etiquetado o generación de datos sintéticos pagan por latencia que no necesitan.
Arik enmarca el espacio de diseño como un trade-off de tres vías: latencia, costo y calidad—elige dos. Las workloads prioritarias de latencia (asistentes de codificación, chatbots) se ejecutan en tamaños pequeños de lotes en hardware costoso con kernels optimizados para latencia; Cerebras y Groq sirven esta esquina. Las workloads de calidad con velocidad (guardrails, routers, on-device) intercambian el tamaño del modelo y la precisión para mantenerse baratos y rápidos. La tercera esquina—calidad a bajo costo, latencia irrelevante—es donde Doubleword se ha enfocado durante los últimos 6 a 12 meses. Casos de uso: workflows de agentes nocturnos, sumarización, etiquetado de datos, generación de datos sintéticos para RL o fine-tuning. A medida que los modelos mejoran y los workflows autónomos ganan confianza, este bucket absorberá más carga de trabajo de producción.
Cuatro palancas impulsan la reducción de costos. Primero, optimizaciones específicas de lotes: los servidores de inferencia de propósito general optimizan para solicitudes individuales a baja latencia; cambiar a programación consciente de workload—incluyendo reordenamiento de colas para maximizar el llenado de lotes—cambia el perfil de utilización de GPU. Segundo, selección de hardware: desacoplando la inferencia de los SLAs de latencia P99 abre tiers de GPU no económicas para servicio síncrono pero eficientes para trabajos de throughput. Tercero, decodificación especulativa: un modelo borrador más pequeño genera tokens candidatos que el modelo objetivo verifica en paralelo, multiplicando las ganancias de throughput en grandes ejecuciones de lotes. Cuarto, cuantización: la precisión INT8 o FP8 reduce la demanda de ancho de banda de memoria en 2–4x frente a baselines FP16, habilitando tamaños de lote efectivos más grandes en la misma huella de GPU.
El efecto compuesto es sustancial. Doubleword comercializa su servicio de inferencia asincrónica y por lotes 50–90% más barato que las APIs en tiempo real para workloads de larga duración y alto volumen. La plataforma es compatible con OpenAI y se dirige a agentes, evals y pipelines—workloads que toleran minutos de latencia por $/millón de tokens dramáticamente menores. Los datos de la industria respaldan esta dirección: el AI Index de Stanford HAI 2025 informa que el costo de inferencia para un sistema de nivel GPT-3.5 cayó 280 veces entre noviembre de 2022 y octubre de 2024, impulsado por declives de costos de hardware de aproximadamente 30% anuales y ganancias de eficiencia energética de 40% anuales. La inferencia consume aproximadamente el 80% de los presupuestos de infraestructura de IA. El entrenamiento es un evento único; la inferencia se ejecuta en cada solicitud para siempre.
La mayoría de los equipos optan por el runtime popular primero. El batching continuo de vLLM produce hasta 23x de mejora de throughput sobre serving ingenuo (según benchmarks de Anyscale), pero sigue siendo diseñado en torno a patrones de solicitud-respuesta sensibles a la latencia. Adaptarlo para workloads puro-throughput y alta-latencia requiere configuración deliberada—límites de tamaño de lote, prioridad de scheduler, ajuste de profundidad de cola—que no son valores predeterminados. Las tasas de aceptación de decodificación especulativa varían significativamente por tipo de tarea; elegir el modelo de borrador incorrecto erosiona el speedup. La cuantización en INT4 ahorra más memoria pero necesita evaluación contra umbrales de calidad específicos de la tarea antes del lanzamiento de producción.
El trabajo anterior de Arik con TitanML señaló un patrón relacionado: los equipos que despliegan múltiples variantes fine-tuned del mismo modelo base encendieron instancias de GPU separadas por fine-tune. El serving multi-adapter basado en LoRA—alojando un modelo base e intercambiando rápidamente adapters fine-tuned en la misma GPU—colapsa esto en una única instancia, cortando horas de GPU inactivas sin sacrificar la especificidad del modelo.
Conclusión directa: si ningún humano observa el flujo de tokens en tiempo real—agentes, evals, etiquetado, datos sintéticos—pagas por latencia que no necesitas. El reordenamiento de colas, la programación asincrónica, la cuantización y la selección de tier de hardware dirigidas al bucket no-tiempo-real ofrecen una reducción de costos de 50–90%.