aiexpert
Inicio / Noticias / Nota
Breaking · 18 ago 2026, 04:06 · 2 fuentes

Together AI envía pruebas A/B nativas para endpoints LLM; desvincula lógica de experimento del código de app

Together AI ha enviado capacidades nativas de pruebas A/B a nivel de endpoint, permitiendo que los equipos ejecuten experimentos de comparación de modelos directamente en tráfico de producción sin construir lógica de enrutamiento en el código de la aplicación. Los usuarios pueden dividir el tráfago en vivo en un control y hasta 20 despliegues variantes con divisiones porcentuales fijas, medir métricas del mundo real (retención, completitud de tareas, retroalimentación del usuario) y promover ganadores usando despliegue azul-verde. El aumento se puede hacer incrementalmente: división 95/5, luego 80/20, luego 50/50, siendo cada aumento una llamada API explícita protegida por etag.

En lugar de desplegar lógica de prueba A/B en el código de la aplicación (banderas de características, enrutamiento basado en hash, cadenas de modelo codificadas), el enfoque a nivel de plataforma de Together desvincula el enrutamiento de experimentos del código del cliente. Esto reduce la entropía del código: una vez que termina un experimento, la lógica de enrutamiento no persiste en la base de código. Los porcentajes A/B son comparticiones de tráfago fijas independientes de recuentos de réplicas y autoescalado, lo que garantiza ventanas de medición consistentes. Los despliegues variantes deben tener peso cero en la división de tráfogo base del endpoint; el experimento posee completamente la asignación del variante, evitando corrupción de medición de variación de tráfago ponderada por capacidad.

La capacidad aborda una brecha de producción: históricamente, los equipos confían en tráfico fantasma (respuestas descartadas) para validar métricas operacionales (latencia, tasas de error), pero las pruebas fantasma no pueden medir mejoras de calidad orientadas al usuario como retención o completitud de tareas. Este primitivo se envía en un momento en que la incertidumbre de selección de modelo es alta: las empresas deben elegir entre modelos optimizados en costos, de peso abierto y de frontera para diferentes casos de uso. Tener pruebas A/B integradas en la plataforma de inferencia permite iteración rápida en apilamiento de modelos, variantes de cuantización y estrategias multimodelo sin andamios complejos de capa de aplicación.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source together.ai
  2. 02 A/B test models in production together.ai