Modal reconstruyó su infraestructura de sandboxes para eliminar el cuello de botella de coordinación centralizada de Kubernetes, logrando 1 millón de sandboxes concurrentes con tiempo de inicio mediano menor a 0.5 segundos y una tasa máxima de creación de 50,000 sandboxes por segundo, según los ingenieros de personal Colin Weld y Connor Adams escribiendo en el blog de ingeniería de la plataforma según reportó InfoQ.
El problema central que Weld y Adams identificaron es que Kubernetes y orquestadores de contenedores similares dependen de planificación centralizada y un almacén de estado fuertemente consistente. A escala, operaciones que son O(contenedores) u O(nodos) se convierten en cuellos de botella: el algoritmo de planificación y etcd, el almacén duradero central de Kubernetes, ambos crecen en carga con el tamaño del clúster, y etcd no es nativamente fragmentable dentro de un espacio de claves. Ejecutar 1 millón de sandboxes en decenas de miles de nodos de cómputo empuja estos límites más allá de la viabilidad. Superar la limitación es posible pero requiere "trabajo serio", incluyendo reescribir o reemplazar etcd y paralelizar el algoritmo de planificación.
La solución de Modal invierte el modelo de coordinación. En lugar de una fuente global de verdad, cada worker se convirtió en su propia fuente de verdad. En lugar de un único planificador serializado, Modal desplegó una flota de servidores de planificación operando en paralelo, permitiendo que la capa de planificación escale horizontalmente. Una vez que un servidor de planificación decide qué worker debe alojar un sandbox, contacta a ese worker directamente vía RPC. Los workers aceptan la solicitud si tienen recursos libres o la rechazan de otro modo. El único componente centralizado restante es un stream de Redis donde todos los workers publican su estado, pero las pruebas de carga mostraron que esto permanece viable hasta bien más de 100,000 workers.
En su benchmark, Modal creó 1 millón de sandboxes en menos de un minuto. El tiempo mediano desde la creación del sandbox hasta la ejecución del código fue menor a 0.5 segundos, con la plataforma sosteniendo 50,000 creaciones de sandboxes por segundo. Estos números representan el piso operacional para plataformas de agentes multi-tenant: equipos que construyen sistemas agénticos que generan contextos de ejecución aislados necesitan aprovisionamiento sub-segundo y la capacidad de manejar decenas de miles de solicitudes concurrentes.
El cambio arquitectónico refleja una comprensión más profunda sobre la infraestructura de GenAI. Alex Jones, ingeniero principal de IA de AWS, comentando sobre el anuncio, señaló que el logro clave de Modal no fue extender Kubernetes sino "rodear todo el asunto" después de entender sus limitaciones. Jones argumenta que "Kubernetes no se está adaptando lo suficientemente rápido a lo que la infraestructura de GenAI realmente necesita" y predice un desacoplamiento: el plano de ejecución necesita lo que Modal construyó—límites de aislamiento apareciendo en milisegundos—mientras que el plano de coordinación, donde los flujos de trabajo multi-agente necesitan memoria compartida y límites de seguridad superpuestos, aún se beneficia de sistemas de forma Kubernetes.
Modal no está solo en esta dirección. Otros proyectos que persiguen objetivos similares incluyen Unikraft, Google Substrate y Overdrive, todos buscando reconstruir la infraestructura en la nube alrededor de ejecución altamente escalable con arranques en frío sub-10-milisegundos. El patrón es claro: equipos que construyen pilas de inferencia serverless o plataformas de agentes multi-tenant deben esperar que los orquestadores de propósito general se conviertan en una restricción antes que en una solución, y planificar para infraestructura que desacople la planificación de la ejecución.