Dharma AI ha publicado un programador de GPU consciente de restricciones que logra 33+ puntos porcentuales de utilización más altos que la programación FIFO en hardware idéntico ejecutando cargas de trabajo idénticas. La idea central: la utilización de GPU se está convirtiendo en la siguiente restricción dura en IA empresarial, y el orden de asignación—no la capacidad total—decide qué cabe. El asignador trata la inferencia en tiempo real como una curva de demanda elástica (dependiente del tráfico) y cargas de trabajo por lotes (entrenamiento, inferencia por lotes, cuantización) como bloques de GPU contiguos, resolviendo la heterogeneidad fundamental que hace que los cronogramas FIFO sean costosos.
La programación FIFO desperdicia capacidad de dos maneras: (1) Reserva para demanda pico en tiempo real ata las GPUs durante días completos incluso durante horas fuera de pico cuando esas GPUs están ociosas; un servicio que se dispara a 6 GPUs al mediodía pero cae a 2 a las 4 AM debe reservar los 6 durante 24 horas, bloqueando trabajos por lotes. (2) Orden: FIFO coloca trabajos en orden de llegada sin considerar prioridad o qué más aún cabe en el horizonte, lo que lleva a que el trabajo de alta prioridad espere detrás de solicitudes de bajo valor y fragmentación de capacidad. En una prueba de 8 GPU pesada en entrenamiento, el asignador consciente de restricciones mejoró la utilización de 53.6% a 87.0% y duplicó el valor de salida ponderado por prioridad (ganancia de 105.1%). En cinco escenarios de alta contención, la utilización saltó de banda 52-85% a banda 72-88%, con ganancias de valor ponderado por prioridad promediando 52%.
Esto aborda una brecha de producción cada vez más aguda conforme las empresas despliegan servicios de IA multiinquilino. La ineficiencia de reserva de GPU y programación es invisible cuando los clusters tienen capacidad de sobra; se vuelve crítica bajo contención, exactamente el régimen donde el servicio de modelo y el entrenamiento comparten el grupo. El asignador elimina el límite de reserva estática y coloca trabajos por prioridad dentro de la ventana de capacidad disponible, recuperando 30+ puntos de un activo fijo y rápidamente depreciatório. La técnica es aplicable a cualquier grupo de GPU de múltiples cargas de trabajo (clústeres de inferencia, entornos de entrenamiento, plataformas mixtas inferencia-entrenamiento).