aiexpert
Início / Notícias / Nota
Research · 22 de ago. de 2026, 01:34 · 2 fontes

Juíz de Trace do LangSmith via Fireworks: Ajuste Fino de Qwen Atinge Desempenho de Fronteira a Custo 100x Menor

LangChain Labs e Fireworks colaboraram para ajustar um modelo Qwen-3.5-35B para detectar "Erro Percebido" em traces de agentes em produção—identificando quando usuários acham que o assistente cometeu um erro ou gerou saída precisando correção. O modelo ajustado corresponde ou supera a precisão de modelos de fronteira (Claude Opus, GPT-5.5) enquanto funciona 100x mais barato. No dataset de treinamento (chat-langchain), o modelo atingiu 96,1% de precisão, e criticamente, foi transferido para um domínio diferente (Fleet, um construtor de agentes sem código) com 90,8% de precisão, demonstrando generalização.

LangSmith processa bilhões de tokens diários em traces de produção. O objetivo era minerar sinais de forma econômica de cada trace mantendo desempenho de fronteira. A equipe usou dois datasets internos (chat-langchain: 885 exemplos; Fleet: 911 exemplos) com traces de múltiplos turnos, combinou rotulagem de modelo-assistido e revisão humana, e treinou com LoRA na infraestrutura de SFT gerenciada do Fireworks. O modelo ajustado também transfere em domínios melhor que o Qwen baseline, sugerindo que "erro percebido" é um sinal avaliador genuinamente de propósito geral.

Para profissionais, isso demonstra um padrão repetido: ajuste fino de modelos abertos pequenos em dados específicos de domínio pode corresponder ou superar desempenho de modelo de fronteira a custo muito menor. Para produtos pesados em agentes, detectar erro percebido em traces em tempo real habilita loops de melhoria contínua sem contas de API de modelo de fronteira.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source langchain.com
  2. 02 langchain.com langchain.com “LangSmith fine-tuned Qwen model achieves 100x cheaper inference cost vs. frontier models on trace judging; 96.1% accuracy on chat-langchain, 90.8% on Fleet transfer task”