LangChain Labs y Fireworks se asociaron para ajustar un modelo Qwen-3.5-35B para detectar "Error Percibido" en traces de agentes en producción—identificando cuándo los usuarios piensan que el asistente cometió un error o generó salida que necesita corrección. El modelo ajustado iguala o supera la precisión del modelo de frontera (Claude Opus, GPT-5.5) mientras se ejecuta 100x más barato. En el conjunto de datos de entrenamiento (chat-langchain), el modelo alcanzó 96,1% de precisión, y críticamente, se transfirió a un dominio diferente (Fleet, un constructor de agentes sin código) con 90,8% de precisión, demostrando generalización.
LangSmith procesa miles de millones de tokens diarios en traces de producción. El objetivo era extraer señales de forma rentable de cada trace manteniendo el desempeño de frontera. El equipo usó dos conjuntos de datos internos (chat-langchain: 885 ejemplos; Fleet: 911 ejemplos) con traces multiturno, combinaron etiquetado asistido por modelo y revisión humana, y entrenaron con LoRA en la infraestructura SFT administrada de Fireworks. El modelo ajustado también se transfiere entre dominios mejor que el Qwen base, sugiriendo que "error percibido" es una señal evaluadora genuinamente de propósito general.
Para profesionales, esto demuestra un patrón repetido: el ajuste fino de modelos abiertos pequeños en datos específicos del dominio puede igualar o superar el desempeño del modelo de frontera a un costo significativamente menor. Para productos intensivos en agentes, detectar error percibido en traces en tiempo real permite bucles de mejora continua sin facturas de API de modelo de frontera.