Investigadores de múltiples instituciones publicaron MISA-T el 11 de agosto, una política de admisión en capa de enrutamiento que reemplaza heurísticas por carga de trabajo con tres mecanismos coordinados — admisión de sesión adaptativa, asignación de capacidad KV consciente de carga de trabajo y contabilidad KV consciente del tiempo de residencia — para programar rollouts mixtos RLVR, RLHF y agentos en servicio de inferencia asincrónico compartido. En Step3.7 y Qwen3.6-35B-A3B, MISA-T supera un Enrutador vLLM consciente de caché sintonizado por barrido en 53.3% y 43.6% de rendimiento de rollout respectivamente. En un experimento Step3.7 emparejado de 50 iteraciones, entrega un aumento de rendimiento de 35.6% y reduce el tiempo promedio de iteración en 22.8% mientras mantiene la mezcla de carga de trabajo del entrenador intacta.
El problema central: enrutamiento consciente de prefijo, el estándar actual en pilas de producción vLLM, enruta solicitudes a réplicas que ya contienen su prefijo en caché KV. Esto funciona cuando todas las solicitudes se asemejan. Las canalizaciones de post-entrenamiento que mezclan RLVR (secuencias verificables cortas, alta rotación), RLHF (retroalimentación multi-turno moderada, ritmo humano) y rollouts de agentos (sesiones multi-turno largas con brechas de llamadas de herramientas) en el mismo clúster producen tres clases de carga con tiempos de residencia KV radicalmente diferentes. Las sesiones de agentos de larga residencia llenan bloques y expulsan tokens RLVR a mitad del rollout, deteniendo la canalización de muestra del entrenador.
MISA-T se ubica en la capa de enrutamiento y rastrea el tiempo de residencia esperado de cada sesión antes de la admisión. Controla la admisión verificando si existe capacidad KV suficiente para servir la trayectoria completa de la sesión sin desplazar cargas de trabajo más cercanas a su finalización. La asignación de capacidad es consciente de clase de carga: las sesiones RLVR reciben bloques ajustados que coinciden con sus secuencias cortas, mientras que las sesiones de agentos se asignan a regiones que toleran brechas de llamadas de herramientas sin disparar expulsión. El componente de contabilidad de tiempo de residencia ajusta estimaciones dinámicamente mientras las duraciones de sesión observadas divergen de las anteriores.
MISA-T logra sus ganancias de rendimiento contra una línea de base sintonizada por barrido, no una configuración de Enrutador vLLM por defecto. El equipo de comparación ejecutó barridos de hiperparámetros en el enrutador consciente de caché antes de medir, por lo que la brecha representa una mejora algorítmica genuina sobre un sistema bien configurado. En las ablaciones solo-rollout, las tasas de acierto de caché de prefijo permanecen altas junto con ganancias de rendimiento, confirmando que MISA-T no sacrifica eficiencia de caché por rendimiento de admisión.
Para equipos de plataforma de inferencia, el régimen donde esto importa más es post-entrenamiento asincrónico a escala: un modelo actor en vLLM generando rollouts mientras un clúster de entrenamiento separado ejecuta FSDP o Megatron con GRPO. El paso de rollout es el cuello de botella de ruta crítica. Una reducción de 22.8% en el tiempo promedio de iteración se compone en miles de pasos de entrenamiento. Sistemas como RollArt (Alibaba, 96 H800 + 32 H20 GPUs) y BiDiRL (compartición bidireccional de recursos rollout/entrenamiento) muestran que el rendimiento de rollout limita directamente el rendimiento de entrenamiento. MISA-T apunta a la brecha de programación dentro del conjunto de rollout que ningún sistema aborda.
El artículo evalúa dos modelos: Step3.7 (un modelo de razonamiento denso) y Qwen3.6-35B-A3B (un modelo MoE con 3.6B parámetros activos por token). El delta de rendimiento es mayor en Step3.7 (53.3%) que en Qwen3.6-35B-A3B (43.6%), probablemente reflejando condiciones de presupuesto KV más ajustadas en modelos densos. El artículo no reporta conteo de GPU o topología de clúster, haciendo que la extrapolación a implementaciones multi-nodo más grandes sea incierta. La hoja de ruta RL Q2 2026 de vLLM ya enumera perfiles adaptativos de rendimiento/latencia para cola larga de rollout RL y transporte de artefactos basado en RDMA como elementos abiertos. MISA-T aborda la capa de programación entre esas dos preocupaciones pero no resuelve la sobrecarga de sincronización de pesos entre clústeres.
Para canalizaciones de post-entrenamiento que mezclan RLVR, RLHF y rollout de agentos en réplicas vLLM compartidas, el enfoque en capa de enrutamiento de MISA-T no requiere cambios en el marco de entrenamiento o motor de inferencia — solo en el enrutador que despacha sesiones a réplicas.