El insight central de la nueva guía de Genie Agents de Databricks es un replanteamiento diagnóstico: cuando un agente proporciona respuestas inconsistentes o incorrectas, el instinto usual es arreglar el prompt. Databricks dice que ese instinto está mal. El verdadero culpable es el contexto empresarial faltante—y Genie Agents lo arreglan en la fuente, no en la superficie.

Los equipos ahora pueden crear Genie Agents específicos del dominio usando Genie One o Genie Code desde un único prompt descriptivo, sin configuración manual. Un bootstrap válido: "Usa nuestros runbooks de incidentes y datos de salud del servicio para crear un agente que ayude a los ingenieros de soporte a investigar incidentes en producción." Eso es suficiente para que Genie identifique el dominio del problema y localice los activos relevantes del Unity Catalog.

El runtime se conecta a dos tipos de datos. Estructurados: tablas gobernadas, definiciones de métricas, dashboards y reglas de calidad de datos en Unity Catalog. No estructurados: PDFs, documentos Word, presentaciones e imágenes en volúmenes de Unity Catalog. Cuando un usuario hace una pregunta, el agente recupera el contenido más relevante en ambas modalidades y razona sobre ellas juntas. Los permisos se aplican por usuario en tiempo de consulta a través de RBAC de Unity Catalog—el agente nunca expone datos que el usuario no pudiera acceder ya.

El problema de la "primera tabla de ingresos que encuentra" es lo que ocurre cuando el contexto es limitado. Un agente genérico golpea una coincidencia de palabra clave en lugar de la vista de métrica que finanzas realmente mantiene, devolviendo un número técnicamente basado pero operacionalmente incorrecto. Genie Agents lo evitan al fundamentar respuestas en semántica de Unity Catalog curada: vistas de métricas, dominios y banderas de certificación que distinguen el activo autorizado del ruido. El prompt proporciona dirección; la capa Unity Catalog proporciona corrección.

Databricks prescribe un despliegue narrow-first. Elige un único trabajo de análisis repetitivo—investigación de incidentes, FAQ de producto, explicación de costos en la nube, monitoreo de pipeline de datos. Ejecuta el agente contra casos anteriores donde la respuesta correcta ya se conoce. Para el agente de incidentes, eso significa verificar si cita el runbook correcto y la tabla de salud del servicio, no solo si llega a la causa raíz correcta. Genie Agents incluye herramientas de benchmark integradas: define un conjunto de preguntas con respuestas esperadas, ejecútalo, obtén una puntuación de precisión numérica. Re-ejecuta el mismo benchmark después de cada actualización de contexto para que "parece mejor" se convierta en un número rastreable. Una pestaña de monitor expone las preguntas reales que los usuarios envían en producción, alimentando las brechas directamente al benchmark mientras el agente se expande.

La expansión es aditiva, no arquitectónica. Un agente Sales Opportunity Data comienza exponiendo riesgo de pipeline de tablas CRM; una versión posterior agrega borrador de resumen de transacción y Q&A de tasa de ganancia por segmento. Un agente Logistics Management pasa de señalar retrasos de envío a recomendar reroutes y rastrear el rendimiento del transportista. Cada capa de expansión se construye sobre una versión que ya ha pasado benchmarks, no sobre una que "se sintió bien" en las pruebas.

La parte difícil—que Databricks es explícito al respecto—es la curación, no el prompt. La creación de single-prompt no comprime el trabajo de mantener datos autorizados. Solo lo hace self-serve. Si la semántica de Unity Catalog está desactualizada u los runbooks son obsoletos, el agente expone esa obsolescencia a escala. El modo de fallo canónico no es un mal prompt; es un runbook desactualizado que el agente cita con confianza.

Conclusión del Arquitecto: si tu Genie Agent devuelve respuestas inconsistentes, audita tus activos de Unity Catalog antes de tocar el prompt.