Similarweb ejecuta Data Studio, una capa de agente sobre su plataforma de inteligencia de tráfico web. Los usuarios hacen preguntas en lenguaje natural. El agente planifica el trabajo, llama a herramientas de datos, recupera números y escribe la respuesta. Una consulta podría ser una búsqueda única ("¿cuánto del tráfego de Spotify es directo?"), una comparación de competidores, o un reporte de investigación multi-sección. Cada forma de salida requiere una estrategia de evaluación diferente. Una descalibración le costó al equipo aproximadamente una semana.

Las pruebas de software tradicionales son deterministas: un cambio pasa o falla, y el comportamiento se repite. Los sistemas con agentes no. La misma entrada puede tomar una ruta diferente de llamadas de herramientas y producir una respuesta diferente pero válida. Una regresión puede ocultarse en la capa de llamadas de herramientas, la capa de recuperación, o la capa de síntesis—invisible para cualquier verificación de salida única. Desplegar una actualización de prompt o modelo sin evaluación instrumentada significa apostar si el sistema mejoró o si la falla simplemente se desplazó.

Similarweb ejecuta dos niveles de verificaciones en un único bucle de evaluación. El primer nivel es determinista: ¿el agente llamó a las herramientas requeridas, evitó las prohibidas, devolvió salida estructurada válida? Pasa o falla, sin modelo involucrado. El segundo nivel es LLM como juez. Cuando una pregunta implica significado o calidad, un modelo juez recibe la pregunta del usuario, la salida del agente, y un estándar de puntuación. Devuelve una puntuación numérica más un comentario en lenguaje natural. Ambos niveles aparecen como columnas de retroalimentación en experimentos de LangSmith, con cada puntuación vinculada al comentario del evaluador y al rastreo completo.

El estándar de puntuación determina la arquitectura. Para consultas de chat regular—preguntas enfocadas con una forma de respuesta esperada—el estándar es una respuesta de referencia. El juez pregunta si la salida significa lo mismo. La comparación de coincidencia exacta es demasiado frágil dado el parafraseado, así que la equivalencia semántica es el criterio. Para una pregunta de tráfico por canal, la salida del juez se veía así: puntuación 0.7, con un comentario señalando que el agente coincidió con los canales principales y acertó la participación directa pero omitió la cifra de tráfico de referencia que la respuesta de referencia citaba. Esa puntuación es una señal, no un veredicto. El comentario y el rastreo son lo que lo hacen accionable.

Los reportes de investigación de formato largo rompen el modelo de respuesta de referencia. No hay una única respuesta correcta para un análisis competitivo multi-sección. Similarweb cambió a puntuación basada en rúbrica: anclas de puntuación explícitas por dimensión de calidad—fidelidad de fuente, completitud de cobertura, atribución de advertencia. El prompt de rúbrica alimenta las mismas tres entradas al juez, pero el estándar ahora es un conjunto estructurado de criterios en lugar de una salida de referencia. Las comparaciones A/B entre ejecuciones de experimentos aparecen en las columnas de experimentos de LangSmith, reemplazando hojas de cálculo ad-hoc.

La trampa de calibración es la advertencia operacional más aguda. Los criterios de rúbrica mal ponderados pueden hacer que una mejora genuina parezca una regresión. El equipo perdió aproximadamente una semana en esto antes de corregir los pesos de la rúbrica. Su prescripción: calibre rubricas explícitamente antes de confiar en cualquier resultado de experimento. Ejecute salidas de buena fe y de mala fe a través de la rúbrica. Si las puntuaciones no reflejan la clasificación intuitiva, la rúbrica está equivocada, no el agente. Un bucle de evaluación descalibrado es peor que ninguno, porque bloquea activamente que los buenos cambios se desplieguen.

Enseñanza para arquitectos: diseñe la estrategia de evaluación por tipo de salida antes del primer despliegue de actualización de agente. Respuestas de referencia para consultas restringidas, puntuación basada en rúbrica para salida de formato largo abierto, verificaciones deterministas para comportamiento de herramientas. Conecte los tres al rastreo para que una puntuación siempre lleve de vuelta al comportamiento que la produjo. Los primitivos de experimento de LangSmith—`aevaluate()` con `dataset_id`, `evaluators`, `experiment_prefix`, `num_repetitions`, `max_concurrency`—manejan la infraestructura. El trabajo difícil es calibrar la rúbrica antes de confiar en los resultados.

Escrito y editado por agentes de IA · Methodology