Multiverse Computing publicó una receta de distillation esta semana que rompe el cuello de botella del cluster de dos GPUs: cachear los top-100 logits del teacher una sola vez offline, reemplazar con una fused chunked KL loss, y ejecutar recuperación de distillation de largo contexto en una única H200 en lugar de un rack. El paper, co-lanzado en Hugging Face, apunta a equipos que comprimen modelos de pesos abiertos como Qwen, GLM, o Kimi — donde el teacher pesa 2.8 billones de parámetros y requiere 3 TB de VRAM solo para cargar.

El impulsor de costo es sencillo de articular, pero desastroso en la práctica. La distillation online estándar mantiene tanto teacher como student en memoria GPU simultáneamente. En cada paso de entrenamiento el teacher ejecuta un forward pass completo y produce una distribución de probabilidad a través de todo su vocabulario. Para gpt-oss-120b con tamaño de vocabulario 201.088, longitud de secuencia 32K, y batch size 4, ese tensor de probabilidad del teacher es aproximadamente 50 GB en bfloat16 antes de que un solo gradiente se compute. Agregue pesos del student, activaciones, estados del optimizador, y el pico de memoria por paso alcanza alrededor de 250 GB — muy por encima del límite de 141 GB de un H200 o B200.

El primer fix es distillation offline. Ejecute el teacher una sola vez, cachee los top-100 tokens más probables por posición de secuencia, almacene esos logits en disco, luego desaloje el teacher de la memoria GPU completamente. El student entrena contra el cache indefinidamente. El mismo cache es reutilizable a través de ablations: intercambiar arquitecturas de student, tasas de aprendizaje, o longitudes de secuencia ya no requiere ejecutar un modelo con billones de parámetros.

El segundo fix es la fused chunked KL loss. El paper compara tres formulaciones matemáticamente equivalentes. Dense KL expande los cached top-100 teacher logits en una cuadrícula de tamaño de vocabulario completo y la compara contra la cuadrícula de log-probabilidad igualmente densa del student, manteniendo dos tensores vocab × sequence completos en memoria simultáneamente. Forward-chunked KL mantiene el teacher sparse y computa la loss en un slice de secuencia a la vez, eliminando el tensor teacher denso y logrando el throughput más rápido; el inconveniente es que la cuadrícula completa de logits del student se materializa para el backward pass, por lo que la memoria aún escala con la longitud de secuencia. La fused chunked KL va más allá fusionando la proyección de output directamente en el loop de loss. Nunca construye el tensor de logits completo del student: proyecta hidden states a logits para un chunk, pliega el resultado en el acumulador de loss en ejecución, descarta el chunk, y continúa. El backward pass recomputa cada chunk sobre la marcha en lugar de almacenarlo. El trade-off es FLOPs adicionales para recomputación; la ganancia es que el pico VRAM cae de aproximadamente 250 GB a 128 GB.

Esa cifra de 128 GB es significativa: se ajusta dentro de una única H200 con espacio para pesos de modelo student, eliminando el requisito de tensor parallelism multi-nodo. Esto hace que long-context healing runs — fine-tuning de un student comprimido para recuperar capacidades a longitudes de secuencia extendidas — sea práctico en infraestructura single-GPU por primera vez.

Para arquitectos evaluando esto, la superficie de integración es estrecha. Ningún cambio requiere modificar la arquitectura del modelo. El cache offline es un paso de preprocesamiento contra cualquier checkpoint del teacher. La fused chunked loss es un reemplazo drop-in para el término KL en cualquier loop de distillation training estándar. Multiverse Computing produjo Hypernova 60B usando este pipeline; Nvidia's Nemotron 3 Puzzle 75B usó compresión comparable. Ambos modelos muestran la trayectoria de producción: comenzar con un teacher frontier, destilar a tamaño deployable, recuperar calidad a través de entrenamiento multi-ablation barato.

La restricción que permanece es la aproximación top-K. Cachear solo 100 logits por posición descarta la cola de la distribución del teacher. Para la mayoría de los tokens — distribuciones peaked de alta confianza — esto importa poco. Para posiciones ambiguas donde el teacher distribuye masa de probabilidad a través de cientos de candidatos, un cache top-100 es lossy. Los equipos que comprimen modelos para dominios estrechos donde los tail tokens llevan peso semántico deben validar la calidad de recuperación en sus conjuntos eval específicos antes de comprometerse a producción.