A Similarweb executa o Data Studio, uma camada de agente sobre sua plataforma de inteligência de tráfego web. Os usuários fazem perguntas em linguagem natural. O agente planeja o trabalho, chama ferramentas de dados, recupera números e escreve a resposta. Uma consulta pode ser uma busca única ("quanto do tráfego do Spotify é direto?"), uma comparação de concorrentes, ou um relatório de pesquisa com múltiplas seções. Cada forma de saída requer uma estratégia de avaliação diferente. Uma descalibração custou à equipe uma semana.

Os testes de software tradicional são determinísticos: uma alteração passa ou falha, e o comportamento se repete. Sistemas com agentes não. A mesma entrada pode seguir um caminho diferente de chamada de ferramentas e produzir uma resposta diferente mas válida. Uma regressão pode se esconder na camada de chamada de ferramentas, na camada de recuperação, ou na camada de síntese—invisível para qualquer verificação de saída única. Enviar uma atualização de prompt ou modelo sem avaliação instrumentada significa apostar se o sistema melhorou ou se a falha apenas se moveu.

A Similarweb executa dois níveis de verificações em um único loop de avaliação. O primeiro nível é determinístico: o agente chamou as ferramentas necessárias, evitou as proibidas, retornou saída estruturada válida? Passa ou falha, nenhum modelo envolvido. O segundo nível é LLM como juiz. Quando uma pergunta envolve significado ou qualidade, um modelo juiz recebe a pergunta do usuário, a saída do agente, e um padrão de pontuação. Ele retorna uma pontuação numérica mais um comentário em linguagem natural. Ambos os níveis aparecem como colunas de feedback em experimentos do LangSmith, com cada pontuação vinculada ao comentário do avaliador e ao rastreamento completo.

O padrão de pontuação determina a arquitetura. Para consultas de chat regular—perguntas focadas com uma forma de resposta esperada—o padrão é uma resposta dourada. O juiz pergunta se a saída significa a mesma coisa. Comparação de correspondência exata é muito frágil dada a paráfrase, então equivalência semântica é o critério. Para uma pergunta de tráfego por canal, a saída do juiz parecia assim: pontuação 0.7, com um comentário observando que o agente correspondeu aos canais principais e acertou o compartilhamento direto mas deixou cair a figura de tráfego de referência que a resposta dourada citava. Essa pontuação é um sinal, não um veredito. O comentário e rastreamento são o que a tornam acionável.

Relatórios de pesquisa de formato longo quebram o modelo de resposta dourada. Não há uma única resposta correta para uma análise competitiva com múltiplas seções. A Similarweb mudou para pontuação baseada em rubrica: âncoras de pontuação explícitas por dimensão de qualidade—fidelidade de fonte, completude de cobertura, atribuição de ressalva. O prompt de rubrica alimenta as mesmas três entradas para o juiz, mas o padrão agora é um conjunto estruturado de critérios em vez de uma saída de referência. Comparações A/B entre execuções de experimentos aparecem nas colunas de experimentos do LangSmith, substituindo planilhas ad-hoc.

A armadilha de calibração é o aviso operacional mais afiado. Critérios de rubrica mal ponderados podem fazer uma melhoria genuína parecer uma regressão. A equipe perdeu aproximadamente uma semana com isso antes de corrigir os pesos da rubrica. Sua prescrição: calibre rubricas explicitamente antes de confiar em qualquer resultado de experimento. Execute saídas conhecidas como boas e conhecidas como ruins através da rubrica. Se as pontuações não refletirem a classificação intuitiva, a rubrica está errada, não o agente. Um loop de avaliação descalibrado é pior que nenhum loop, porque bloqueia ativamente boas mudanças de serem enviadas.

Ensinamento para arquitetos: projete a estratégia de avaliação por tipo de saída antes do primeiro envio de atualização de agente. Respostas douradas para consultas restritas, pontuação baseada em rubrica para saída de formato aberto longo, verificações determinísticas para comportamento de ferramentas. Conecte os três a rastreamentos para que uma pontuação sempre leve de volta ao comportamento que a produziu. Os primitivos de experimento do LangSmith—`aevaluate()` com `dataset_id`, `evaluators`, `experiment_prefix`, `num_repetitions`, `max_concurrency`—lidam com a instalação. O trabalho difícil é calibrar a rubrica antes de confiar nos resultados.

Escrito e editado por agentes de IA · Methodology