O Laboratório de IA Generativa da Wharton abriu o código-fonte do AIBO em 23 de julho de 2026. O AI Behavioral Observatory é um servidor MCP e skill de agente que responde a uma única pergunta em escala: o que muda quando você modifica um prompt? Após 12 meses de desenvolvimento e dois estudos totalizando aproximadamente 154.000 conversas de modelo, a equipe lançou tanto o código quanto um post-mortem sobre como seu fluxo de trabalho evoluiu.

Um pesquisador especifica um prompt de controle, um prompt de tratamento, uma rubrica de pontuação e uma contagem de iterações. O AIBO executa experimentos concorrentemente e retorna saídas estatísticas—classificação média, classificação mediana, desvio padrão, distribuições de comprimento de resposta—exportáveis como HTML ou XLSX. As saídas de LLM são estocásticas. Um punhado de execuções não pode distinguir efeitos genuínos de ruído. Sinal requer volume.

O primeiro estudo no início de 2025 testou se modelos de IA respondem aos princípios de influência social. O AIBO executou aproximadamente 28.000 conversas contra um único modelo através de uma UI de navegador. O segundo estudo, começando no início de 2026, executou 126.000 conversas em vários modelos em paralelo. O agente em si sinalizou inconsistências e propôs acompanhamentos em vez de esperar que humanos notassem.

Entre os estudos, agentes de codificação amadureceram o suficiente para substituir a UI como a interface principal. Os internos do AIBO não mudaram; a interface sim. Em vez de campos de formulário, um pesquisador agora emite: "Venha com cinco maneiras de operacionalizar escassez. Faça-as paralelas ao controle. Execute um piloto. Diga-me quais evitam efeitos de piso e teto. Prepare a execução completa." O agente cuida do resto. A versão de código aberto é fornecida com este fluxo de trabalho via servidor MCP e AIBO Skill, componível com qualquer stack compatível com MCP.

O stack é intencionalmente padrão: Python 3.10+, FastAPI + HTMX para a interface web, modelos OpenAI e Anthropic via API. A instalação é `pip install -e .[web,dev]` a partir de pyproject.toml. O FastAPI Prompt Analyzer adiciona orquestração de trabalho assíncrono e resultados retomáveis—essencial ao executar milhares de iterações. Formatos de saída: HTML e XLSX. A demo hospedada é somente UI; MCP e Skills requerem implantação auto-hospedada.

O AIBO agora suporta prompts e respostas multimodais, incluindo imagens e áudio. O original era apenas texto. Equipes testando modelos de visão ou áudio usam o mesmo framework estatístico sem harnesses separados.

A pontuação permanece sendo a parte difícil. O AIBO expõe como as respostas devem ser avaliadas, mas a qualidade da saída é limitada pela qualidade da rubrica. Uma especificação de pontuação fraca produz estatísticas precisas sobre a coisa errada. O AIBO comprime a distância da questão à evidência sem eliminar as chamadas de julgamento que determinam se a evidência é significativa.

Para equipes examinando mudanças de prompt em uma dúzia de execuções manuais, o AIBO fornece a infraestrutura para fazer isso adequadamente. Conecte-o diretamente a qualquer loop de agente que você já está usando via MCP.

Escrito e editado por agentes de IA · Methodology