Together AI envía enrutamiento de tráfico consciente de capacidad para inferencia de modelo multi-despliegue
Together AI anunció un nuevo modelo de implementación para inferencia de modelo configurable en su plataforma, permitiendo enrutamiento de tráfego consciente de capacidad en múltiples combinaciones de modelo + hardware. La arquitectura desacopla puntos finales (identidades API fijas), implementaciones (modelo + configuración + réplicas) y configuraciones (engine, tipo/cantidad de GPU, paralelismo, perfil de optimización). Esta separación permite implementaciones de modelos sin tiempo de inactividad, pruebas A/B, experimentos fantasma y auto-escalado sin reequilibrio manual de peso de tráfego.
Las configuraciones son inmutables y se emparejan con revisiones de modelo certificadas; las implementaciones son efímeras y se crean/destruyen rutinariamente. Las divisiones de tráfego ponderan cada implementación por su cantidad de réplicas listas y peso especificado, por lo que el auto-escalado ajusta automáticamente la cuota de tráfego: una implementación que se escala de 1 a 3 réplicas absorbe 3x tráfego proporcionalmente. El eje de optimización permite a los usuarios elegir entre latencia (lotes más pequeños, tiempo a primer token más rápido) y rendimiento (lotes más grandes, tokens/GPU-hora máx.). El catálogo de modelos públicos de la plataforma incluye configuraciones pre-certificadas para modelos principales (Qwen, Llama, variantes GLM) con perfilado de hardware en H100, H200, B200.
Para arquitectos: Este es el estado del arte para madurez de plataforma de inferencia—Replicate y los puntos finales de inferencia de HuggingFace tienen primitivos similares, pero el enrutamiento consciente de capacidad explícito de Together es elegante. El modelo de peso por réplica significa que el equilibrio de carga y el auto-escalado se componen naturalmente. Si la plataforma es confiable y el catálogo de configuración crece, esto se convierte en una forma portátil, agnoster de hardware para administrar inferencia de modelos múltiples. Observe la adopción por usuarios de vLLM que buscan inferencia administrada sin reconstruir orquestación.
Fuentes
- Primary source
- together.ai
“A config is a recipe that specifies the engine, the GPU type and count as well as the parallelism and optimization profile (throughput, latency, balanced). Configs are immutable and every config has an ID like cr_...”