Multiverse Computing publicó un artículo de investigación el 10 de agosto de 2026, titulado "Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss", introduciendo optimizaciones de sistemas que reducen drásticamente los requisitos de VRAM para destilación de conocimiento (entrenamiento de un modelo estudiante más pequeño para imitar un profesor más grande). Destilación—el proceso de comprimir modelos de parámetros de billones como Kimi-K3 (2.8T parámetros) en variantes más pequeñas desplegables—se ha vuelto práctica crítica pero sigue siendo prohibitivamente costosa: la destilación en línea estándar alcanza ~250GB de VRAM, requiriendo cientos de GPU. El nuevo enfoque reduce picos a ~128GB, cortando costos lo suficiente para permitir destilación de contexto largo en una sola GPU H200/B200.
La técnica utiliza dos cambios de sistemas clave: (1) destilación sin conexión, almacenando en caché solo los logits top-K del profesor una sola vez en lugar de recomputar el pase directo completo en cada paso, eliminando el profesor de la memoria por completo; (2) una pérdida de divergencia KL fusionada en trozos que evita materializar la matriz completa de vocabulario×longitud-de-secuencia, procesando trozos de secuencia de extremo a extremo y descartándolos después del pase hacia atrás. Juntas, estas reducen el pico de memoria por paso de destilación de ~250GB a menos de 128GB, manteniendo calidad de entrenamiento.
El avance importa porque la compresión de modelo abierto (Nemotron de Nvidia, Hypernova de Multiverse, variantes destiladas próximamente de Qwen/GLM/gpt-oss) sigue siendo uno de los mayores costos en la canalización de modelo abierto. Los profesionales que implementan maestros de parámetros de billones han sido limitados por el costo de destilación; estos ahorros desbloquean experimentación distribuida y barridos de múltiples ablaciones en hardware modesto, acelerando el ritmo al que la destilación de modelo abierto y la optimización pueden iterar.