Dharma AI publicou um agendador de GPU com consideração de restrição que alcança 33+ pontos percentuais de utilização mais altos do que agendamento FIFO no hardware idêntico rodando cargas de trabalho idênticas. O insight principal: utilização de GPU está se tornando a próxima restrição dura em IA de empresa, e ordem de alocação—não capacidade total—decide o que cabe. O alocador trata inferência em tempo real como uma curva de demanda elástica (dependente de tráfego) e cargas de trabalho em lote (treinamento, inferência em lote, quantização) como blocos de GPU contíguos, resolvendo a heterogeneidade fundamental que torna agendas FIFO caras.
O agendamento FIFO desperdíça capacidade de duas maneiras: (1) Reserva para demanda de pico em tempo real vincula GPUs por dias inteiros, mesmo durante horas fora do pico, quando essas GPUs ficam inativas; um serviço disparando para 6 GPUs ao meio-dia mas caindo para 2 às 4 da manhã deve reservar todos os 6 por 24 horas, bloqueando trabalhos em lote. (2) Ordem: FIFO coloca trabalhos em ordem de chegada sem considerar prioridade ou o que mais ainda cabe no horizonte, levando a trabalho de alta prioridade enfileirando atrás de solicitações de baixo valor e fragmentação de capacidade. Em um teste 8-GPU pesado de treinamento, o alocador com consideração de restrição melhorou utilização de 53,6% para 87,0% e duplicou valor de saída ponderado por prioridade (ganho de 105,1%). Em cinco cenários de alta contenção, utilização saltou de banda de 52-85% para banda de 72-88%, com ganhos de valor ponderado por prioridade em média de 52%.
Isto aborda uma lacuna de produção cada vez mais aguda conforme empresas implantam serviços de IA multiloócio. Ineficiência de reserva de GPU e agendamento é invisibilidade quando clusters tìm capacidade de sobra; se torna crítica sob contenção, exatamente o regime onde serviço de modelo e treinamento compartilham pool. O alocador remove o teto de reserva estática e coloca trabalhos por prioridade dentro da janela de capacidade disponível, recuperando 30+ pontos de um ativo fixo, rapidamente depreciativo. A técnica é aplicável a qualquer pool de GPU de múltiplas cargas de trabalho (clusters de inferência, ambientes de treinamento, plataformas mistas de inferência-treinamento).