Together AI lanza Inferencia de Modelo Dedicado con despliegue canario, pruebas A/B y reversión automática
Together AI lanzó una actualización importante en su plataforma de inferencia el 23 de julio, agregando controles de implementación de nivel de producción a su servicio de hospedaje de modelo de peso abierto. La plataforma Dedicated Model Inference se envía con lanzamiento canario, actualizaciones azul-verde y rodantes, reversiones automáticas en umbrales de métricas, pruebas A/B contra tráfico en vivo, pruebas de sombra y escalado automático multirregional. Los equipos ahora pueden desplegar nuevas versiones de modelo, pesos fine-tuned o adaptadores LoRA detrás de un endpoint estable único sin reconstruir o cambiar plataformas.
La plataforma abstrae cuantificación, paralelismo tensorial, decodificación especulativa y configuración del motor de servicio a través de perfiles de implementación pre-probados, mientras aún expone control de nivel experto para equipos que necesitan optimizar equilibrio de latencia, rendimiento o costo por carga de trabajo. Together también está lanzando beta cerrada para entrenamiento personalizado, incluyendo aprendizaje de refuerzo de peso completo y LoRA y ajuste supervisado con puntos de control implementables directamente en producción. La compañía reporta servir más de 400 billones de tokens por mes en 40+ modelos.
Para equipos que ejecutan IA agentic de producción, agentes de código o sistemas de voz en modelos de peso abierto, esto elimina la carga operacional de construir y mantener una pila de servicio de modelo personalizado. Decagon, cliente de Together AI, señaló que anteriormente confiaban en control de versión manual; la nueva plataforma les permite desplegar en canario modelos fine-tuned en tráfico en vivo semanalmente, con reversiones automáticas si métricas clave retroceden. Los arquitectos que evalúan inferencia de código abierto deben evaluar si funciones de plataforma como reversiones automáticas y velocidad de iteración segura superan el costo operacional de auto-hospedaje o el compromiso de bloqueo de APIs de modelo cerrado.