LangChain y Fireworks publicaron un sistema de evaluación de traces que reduce el costo de evaluación por trace en 100x comparado con llamadas directas a APIs frontier. El sistema fine-tunea Qwen-3.5-35B para clasificar "error percibido"—si un usuario creía que un agente cometió un error—en cada trace de producción fluyendo a través de LangSmith, que procesa billones de tokens diariamente. El precio de los modelos frontier hizo que la evaluación integral fuera económicamente imposible en esa escala; el modelo abierto fine-tuned lo hace rutina.

Error percibido significa no si un agente estaba objetivamente equivocado, sino si el usuario respondió como si lo fuera. Indicadores: correcciones del usuario, solicitudes repetidas, acciones de agente rechazadas, admisiones explícitas de errores del asistente. El evaluador genera un objeto JSON con un flag booleano y justificación—{"perceived_error": true, "reason": "The user corrects the meeting date the assistant used."}—y lo escribe nuevamente en el trace para análisis downstream.

Construir el conjunto de entrenamiento evitó anotación humana pura a escala. LangChain obtuvo traces multi-turn de dos datasets internos: chat-langchain (885 ejemplos, Q&A técnico) y Fleet (911 ejemplos, agente de documento e investigación sin código). Las etiquetas vinieron de votación de panel-de-modelos; desacuerdos escalaron a un segundo panel; desacuerdos persistentes fueron a revisores humanos. Las tasas de error percibido fueron 24% y 18% respectivamente—distribución real de producción, no divisiones artificialmente equilibradas.

Fine-tuning utilizó supervised fine-tuning gestionado con LoRA en Fireworks, entrenando exclusivamente en chat-langchain. El objetivo era confirmar la transferencia cross-domain antes de comprometerse con entrenamiento dual-dataset. El modelo SFT chat-langchain alcanzó 96.1% de accuracy en su dataset base versus 91.6% para Claude Opus y 90.5% para Qwen base. En Fleet—un domain que nunca había visto—el modelo SFT anotó 90.8%, 3.6 puntos por encima de Qwen base y 0.6 por encima de Claude Opus en 90.2%. GPT-5.5 lideró en chat-langchain en 98.9% pero bajó a 89.1% en Fleet, por debajo del modelo abierto fine-tuned.

Qwen-3.5-35B fue elegido después de que modelos más pequeños no pudieran manejar el razonamiento multi-turn trace. El equipo excluyó mensajes tool-call del contexto de entrenamiento, apostando a que los mensajes humanos e IA llevan la señal principal de error percibido. La ingeniería de prompts siguió análisis de modos de fallo a pequeña escala en lugar de reescritura wholesale. Ambas opciones se marcan como levers para trabajo futuro—reintroducir tool calls, recortar secuencias largas—pero la configuración actual ya logra accuracy frontier en pruebas de transferencia cross-dataset.

Ejecutar un modelo abierto 35B en inferencia de Fireworks cuesta una fracción de las llamadas frontier API por token. En la escala de LangSmith de billones de tokens diariamente, esa diferencia es binaria: la evaluación integral de traces es o asequible o imposible. La reducción de 100x la mueve a la primera categoría. Los equipos con cargas de trabajo agentics más pequeñas obtienen el mismo beneficio—cobertura de eval que antes era muestreada ahora puede abarcar tráfico de producción completo.

La fricción principal: este enfoque requiere un dataset etiquetado y un ciclo de fine-tuning. LangChain construyó el suyo a partir de traces de producción usando etiquetado asistido por modelo, que es replicable pero no trivial. Cualquier equipo que desee un juez domain-specific de error percibido necesitará ejecutar el mismo proceso en sus propios traces.

Si el presupuesto de eval limita la cobertura de trace-judge, fine-tuning un modelo abierto mid-size en Fireworks ahora es un camino creíble hacia una señal de calidad frontier en 1% del costo frontier API.