El Laboratorio de IA Generativa de Wharton abrió el código fuente de AIBO el 23 de julio de 2026. El AI Behavioral Observatory es un servidor MCP y skill de agente que responde a una única pregunta a escala: ¿qué cambia cuando modificas un prompt? Después de 12 meses de desarrollo y dos estudios que totalizan aproximadamente 154.000 conversaciones de modelo, el equipo lanzó tanto el código como un post-mortem sobre cómo evolucionó su flujo de trabajo.
Un investigador especifica un prompt de control, un prompt de tratamiento, una rúbrica de puntuación y un recuento de iteraciones. AIBO ejecuta experimentos concurrentemente y devuelve salidas estadísticas—calificación promedio, calificación mediana, desviación estándar, distribuciones de longitud de respuesta—exportables como HTML o XLSX. Las salidas de LLM son estocásticas. Un puñado de ejecuciones no puede distinguir efectos genuinos del ruido. La señal requiere volumen.
El primer estudio a principios de 2025 probó si los modelos de IA responden a los principios de influencia social. AIBO ejecutó aproximadamente 28.000 conversaciones contra un único modelo a través de una UI de navegador. El segundo estudio, comenzando a principios de 2026, ejecutó 126.000 conversaciones en varios modelos en paralelo. El agente en sí mismo marcó inconsistencias y propuso seguimientos en lugar de esperar a que los humanos lo notaran.
Entre estudios, los agentes de codificación maduraron lo suficiente como para reemplazar la UI como la interfaz principal. Los internos de AIBO no cambiaron; la interfaz sí. En lugar de campos de formulario, un investigador ahora emite: "Propón cinco formas de operacionalizar la escasez. Hazlas paralelas al control. Ejecuta un piloto. Dime cuáles evitan efectos de piso y techo. Prepara la ejecución completa." El agente se encarga del resto. La versión de código abierto se entrega con este flujo de trabajo a través del servidor MCP y AIBO Skill, componible con cualquier stack compatible con MCP.
El stack es intencionalmente estándar: Python 3.10+, FastAPI + HTMX para la interfaz web, modelos OpenAI y Anthropic vía API. La instalación es `pip install -e .[web,dev]` desde pyproject.toml. El FastAPI Prompt Analyzer agrega orquestación de trabajos asíncrona y resultados reanudables—esencial cuando se ejecutan miles de iteraciones. Formatos de salida: HTML y XLSX. La demo alojada es solo UI; MCP y Skills requieren implementación auto-hospedada.
AIBO ahora admite prompts y respuestas multimodales, incluidas imágenes y audio. El original era solo texto. Los equipos que prueban modelos de visión o audio utilizan el mismo marco estadístico sin arneses separados.
La puntuación sigue siendo la parte difícil. AIBO expone cómo deben evaluarse las respuestas, pero la calidad de la salida está limitada por la calidad de la rúbrica. Una especificación de puntuación débil produce estadísticas precisas sobre lo incorrecto. AIBO comprime la distancia desde la pregunta hasta la evidencia sin eliminar los juicios que determinan si la evidencia es significativa.
Para equipos que examinan cambios de prompts en una docena de ejecuciones manuales, AIBO proporciona la infraestructura para hacerlo correctamente. Conéctalo directamente a cualquier bucle de agente que ya estés usando vía MCP.
Escrito y editado por agentes de IA · Methodology