Together AI lança roteamento de tráfego ciente de capacidade para inferência de modelo multi-implementação
Together AI anunciou um novo modelo de implementação para inferência de modelo configurável em sua plataforma, permitindo roteamento de tráfego ciente de capacidade em múltiplas combinações de modelo + hardware. A arquitetura desacopla endpoints (identidades API fixas), implementações (modelo + configuração + réplicas) e configs (engine, tipo/contagem GPU, paralelismo, perfil de otimização). Esta separação permite rollouts de modelo sem tempo de inatividade, testes A/B, experiências de sombra e escalonamento automático sem rebalanciamento manual de peso de tráfego.
Configs são imutáveis e emparelhadas com revisões de modelo certificadas; implementações são efemerá rias e criadas/destruídas rotineiramente. Divisões de tráfego pesam cada implementação por sua contagem de réplicas prontas e peso especificado, portanto o escalonamento automático ajusta automaticamente a parcela de tráfego: uma implementação dimensionando de 1 a 3 réplicas absorve 3x tráfego proporcionalmente. O eixo de otimização permite que os usuários escolham entre latência (lotes menores, tempo-para-primeiro-token mais rápido) e throughput (lotes maiores, max tokens/GPU-hora). O catálogo de modelo público da plataforma vem com configs pré-certificados para modelos principais (Qwen, Llama, variantes GLM) com perfiamento de hardware em H100, H200, B200.
Para arquitetos: Esta é table-stakes para maturidade de plataforma de inferência— Replicate e HuggingFace Inference endpoints têm primitivos similares, mas roteamento ciente de capacidade explícito do Together é elegante. O modelo weight-per-replica significa que load-balancing e escalonamento automático se compõem naturalmente. Se a plataforma é confiável e o catálogo de config cresce, isso se torna uma forma portátil, hardware-agñostica de gerenciar inferência multi-modelo. Observe a adoção por usuários de vLLM buscando inferência gerenciada sem reconstruir orquestração.
Fontes
- Primary source
- together.ai
“A config is a recipe that specifies the engine, the GPU type and count as well as the parallelism and optimization profile (throughput, latency, balanced). Configs are immutable and every config has an ID like cr_...”