A Modal reconstruiu sua infraestrutura de sandbox para eliminar o gargalo de coordenação centralizada do Kubernetes, alcançando 1 milhão de sandboxes simultâneos com tempo mediano de inicialização abaixo de 0.5 segundos e taxa de criação de pico de 50,000 sandboxes por segundo, segundo os engenheiros de staff Colin Weld e Connor Adams escrevendo no blog de engenharia da plataforma conforme reportado pela InfoQ.
O problema central identificado por Weld e Adams é que Kubernetes e orquestradores de contêiner similares dependem de agendamento centralizado e um armazenamento de estado fortemente consistente. Em escala, operações que são O(containers) ou O(nodes) se tornam gargalos: o algoritmo de agendamento e etcd, o armazenamento durável central do Kubernetes, ambos crescem em carga com o tamanho do cluster, e etcd não é nativamente fragmentável dentro de um keyspace. Executar 1 milhão de sandboxes em dezenas de milhares de nós de computação ultrapassa esses limites além da viabilidade. Superar a limitação é possível mas requer "trabalho sério", incluindo reescrever ou substituir etcd e paralelizar o algoritmo de agendamento.
A solução da Modal inverte o modelo de coordenação. Em vez de uma fonte global de verdade, cada worker se tornou sua própria fonte de verdade. Em vez de um único agendador serializado, a Modal implantou uma frota de servidores de agendamento operando em paralelo, permitindo que a camada de agendamento escale horizontalmente. Uma vez que um servidor de agendamento decide qual worker deve hospedar um sandbox, ele contata esse worker diretamente via RPC. Workers aceitam a requisição se têm recursos livres ou a rejeitam caso contrário. O único componente centralizado restante é um Redis stream onde todos os workers publicam seu estado, mas testes de carga mostraram que isso permanece viável até bem acima de 100,000 workers.
Em seu benchmark, a Modal criou 1 milhão de sandboxes em menos de um minuto. O tempo mediano da criação de sandbox até a execução de código foi abaixo de 0.5 segundos, com a plataforma sustentando 50,000 criações de sandbox por segundo. Esses números representam o piso operacional para plataformas de agentes multi-tenant: equipes construindo sistemas agentic que geram contextos de execução isolados precisam de provisionamento sub-segundo e da capacidade de lidar com dezenas de milhares de requisições simultâneas.
A mudança arquitetônica reflete uma percepção mais profunda sobre infraestrutura de GenAI. Alex Jones, engenheiro principal de IA da AWS, comentando sobre o anúncio, observou que a conquista chave da Modal não foi estender Kubernetes mas "contornar a coisa toda" após entender suas limitações. Jones argumenta que "Kubernetes não está se adaptando rápido o suficiente ao que infraestrutura de GenAI realmente precisa" e prediz um desacoplamento: o plano de execução precisa do que a Modal construiu—limites de isolamento aparecendo em milissegundos—enquanto o plano de coordenação, onde workflows multi-agente precisam de memória compartilhada e limites de segurança sobrepostos, ainda se beneficia de sistemas de forma Kubernetes.
A Modal não está sozinha nessa direção. Outros projetos perseguindo objetivos similares incluem Unikraft, Google Substrate e Overdrive, todos buscando reconstruir infraestrutura em nuvem em torno de execução altamente escalável com cold starts sub-10-milissegundos. O padrão é claro: equipes construindo stacks de inferência serverless ou plataformas de agentes multi-tenant devem esperar que orquestradores de propósito geral se tornem uma restrição antes de uma solução, e planejar infraestrutura que desacople agendamento de execução.