Together AI lanza autoscaling de inferencia en solicitudes en vuelo, TTFT, utilización de GPU
Together AI lanzó autoscaling para sus puntos finales de Inferencia de Modelo Dedicado, permitiendo que las implementaciones escalen en función de métricas específicas de inferencia, incluidas solicitudes en vuelo, tiempo hasta primer token (TTFT), utilización de GPU y rendimiento de tokens. A diferencia de las métricas de autoscaling tradicionales de estilo CPU que pueden tergiversar la carga de servicio de LLM, estas métricas reflejan directamente la presión de la cola de solicitudes y la eficiencia de lotes. Los constructores pueden establecer límites de réplicas, elegir una métrica y objetivo, y ajustar ventanas de escala hacia arriba y hacia abajo para gestionar el equilibrio entre baja aprovisionamiento (degradación aguda de la latencia p95) y exceso de aprovisionamiento (pagar por GPUs ociosas).
La plataforma aplica un bucle de control proporcional: si apunta a 8 solicitudes en vuelo por réplica y observa 16, el sistema escala a 2x réplicas (dentro de límites). Las ventanas de tiempo evitan oscilación—las ventanas de escala hacia arriba se mantienen cortas (cuesta solo algunos minutos de réplica si son falsas) mientras que las ventanas de escala hacia abajo se mantienen más largas (falsos scale-downs desencadenan cold starts). Together AI proporciona ocho métricas de autoscaling: concurrencia (inflight_requests, un estándar seguro), SLO (TTFT p95, percentiles de latencia), y eficiencia (primero costo). Un único comando PATCH establece réplicas mín/máx, ventanas, métrica, objetivo y percentil.
Para arquitectos: la estructura de costo de GPU ahora refleja la economía de utilización de las aerolíneas. El servicio de LLM se degrada de manera no lineal cuando las colas de solicitudes se respaldan; el autoscaling en indicadores principales (conteo en vuelo) en lugar de indicadores rezagados (utilización) es crítico para los SLO de producción. Los constructores deben ajustar el autoscaling de forma agresiva en solicitudes en vuelo para cargas de trabajo de chat (alto lote) y de forma más conservadora para tráfico de agente de contexto largo. Los retrasos de arranque en frío (minutos para extraer y calentar pesos del modelo) significan que el autoscaler debe escalar temprano en señales principales, no reaccionar a picos de latencia observados.