LangChain Labs e Fireworks colaboraram para ajustar um modelo Qwen-3.5-35B para detectar "Erro Percebido" em traces de agentes em produção—identificando quando usuários acham que o assistente cometeu um erro ou gerou saída precisando correção. O modelo ajustado corresponde ou supera a precisão de modelos de fronteira (Claude Opus, GPT-5.5) enquanto funciona 100x mais barato. No dataset de treinamento (chat-langchain), o modelo atingiu 96,1% de precisão, e criticamente, foi transferido para um domínio diferente (Fleet, um construtor de agentes sem código) com 90,8% de precisão, demonstrando generalização.
LangSmith processa bilhões de tokens diários em traces de produção. O objetivo era minerar sinais de forma econômica de cada trace mantendo desempenho de fronteira. A equipe usou dois datasets internos (chat-langchain: 885 exemplos; Fleet: 911 exemplos) com traces de múltiplos turnos, combinou rotulagem de modelo-assistido e revisão humana, e treinou com LoRA na infraestrutura de SFT gerenciada do Fireworks. O modelo ajustado também transfere em domínios melhor que o Qwen baseline, sugerindo que "erro percebido" é um sinal avaliador genuinamente de propósito geral.
Para profissionais, isso demonstra um padrão repetido: ajuste fino de modelos abertos pequenos em dados específicos de domínio pode corresponder ou superar desempenho de modelo de fronteira a custo muito menor. Para produtos pesados em agentes, detectar erro percebido em traces em tempo real habilita loops de melhoria contínua sem contas de API de modelo de fronteira.