aiexpert
Inicio / Noticias / Nota
Research · 22 ago 2026, 01:34 · 2 fuentes

Juez de Trace de LangSmith vía Fireworks: Ajuste Fino de Qwen Alcanza Rendimiento de Frontera a Costo 100x Menor

LangChain Labs y Fireworks se asociaron para ajustar un modelo Qwen-3.5-35B para detectar "Error Percibido" en traces de agentes en producción—identificando cuándo los usuarios piensan que el asistente cometió un error o generó salida que necesita corrección. El modelo ajustado iguala o supera la precisión del modelo de frontera (Claude Opus, GPT-5.5) mientras se ejecuta 100x más barato. En el conjunto de datos de entrenamiento (chat-langchain), el modelo alcanzó 96,1% de precisión, y críticamente, se transfirió a un dominio diferente (Fleet, un constructor de agentes sin código) con 90,8% de precisión, demostrando generalización.

LangSmith procesa miles de millones de tokens diarios en traces de producción. El objetivo era extraer señales de forma rentable de cada trace manteniendo el desempeño de frontera. El equipo usó dos conjuntos de datos internos (chat-langchain: 885 ejemplos; Fleet: 911 ejemplos) con traces multiturno, combinaron etiquetado asistido por modelo y revisión humana, y entrenaron con LoRA en la infraestructura SFT administrada de Fireworks. El modelo ajustado también se transfiere entre dominios mejor que el Qwen base, sugiriendo que "error percibido" es una señal evaluadora genuinamente de propósito general.

Para profesionales, esto demuestra un patrón repetido: el ajuste fino de modelos abiertos pequeños en datos específicos del dominio puede igualar o superar el desempeño del modelo de frontera a un costo significativamente menor. Para productos intensivos en agentes, detectar error percibido en traces en tiempo real permite bucles de mejora continua sin facturas de API de modelo de frontera.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source langchain.com
  2. 02 langchain.com langchain.com “LangSmith fine-tuned Qwen model achieves 100x cheaper inference cost vs. frontier models on trace judging; 96.1% accuracy on chat-langchain, 90.8% on Fleet transfer task”