Netflix lanzó `oci-agent` en junio de 2026 y ha ejecutado más de 100 análisis causales por mes desde entonces. El paquete Python de código abierto implementa un bucle actor-crítico para Inferencia Causal Observacional (OCI) — estimando causalidad a partir de datos no experimentales — y ahora está disponible en GitHub para equipos que necesitan flujos causales auditables y reproducibles.

La arquitectura central separa tres roles: un Principal humano que escribe el plan de análisis inicial; un agente Actor que lo refina en una especificación de análisis de datos, completa un notebook Jupyter templado y lo ejecuta; y un agente Crítico que revisa la salida, la califica en una escala de tres niveles (not_satisfactory / satisfactory_with_caveats / fully_satisfactory) y recomienda cambios en las especificaciones. El bucle se ejecuta hasta que el Crítico está satisfecho o se alcanza una condición de parada. Todos los artefactos — planes, especificaciones, gráficos, notebooks ejecutados — se versionan y se suben a un almacén de archivos donde el Principal puede verificar los resultados localmente. Netflix llama a esto "auditorías de proceso". Debido a que la inferencia causal a partir de datos observacionales no tiene una verdad fundamental, no se puede evaluar un agente de la manera habitual.

El conjunto de herramientas debajo de `oci-agent` es anterior a la era de LLM. Netflix lo construyó para responder preguntas como "¿cuál es el efecto de jugar un juego de Netflix en la retención de miembros?" usando emulación de ensayos objetivo — para cada pregunta causal, identificar la prueba A/B ideal y verificar si los datos observacionales pueden aproximarla creíblemente. El agente hereda cuatro diagnósticos rigurosos: equilibrio de covariables (diferencia media estandarizada después de ponderación por debajo de 0,2), solapamiento (puntuación de propensión entre 0,1 y 0,9), una prueba de resultado placebo (efecto de tratamiento en variables previas al tratamiento no significativamente diferente de cero) y análisis de sensibilidad para confusores ocultos. Estas comprobaciones se ejecutan automáticamente; el Crítico las califica antes de emitir su calificación.

El caso de estudio muestra qué sucede sin esta disciplina. Netflix pidió tanto a un prompt de Claude sin procesar como a `oci-agent` que estimaran el impacto del compromiso con un nuevo tipo de entretenimiento (el vertical de juegos, llamado "Type X") en la retención de miembros de 2 meses. `oci-agent` devolvió una estimación del 25% de la línea base — el enfoque LLM ingenuo sobreestimó el efecto causal en aproximadamente 4×. El Crítico señaló el sesgo del usuario temprano y una prueba de placebo fallida, luego activó iteraciones con parámetros ajustados hasta que surgió una estimación defendible.

El lanzamiento de código abierto incluye EconML para el ML causal subyacente, cubriendo el aprendizaje doblemente robusto de efectos de tratamiento promedio para tratamientos binarios únicos. Desde junio, el equipo ha añadido estimación de efecto de tratamiento heterogéneo y modelos parcialmente lineales para múltiples tratamientos continuos. Contra el benchmark de la Conferencia de Inferencia Causal Atlántica de 2016 (77 procesos generadores de datos, 231 estimaciones, 44 métodos competidores), la metodología estadística del agente es competitiva: RMSE bajo e intervalos de confianza del 95% bien calibrados en relación con enfoques ajustados manualmente.

El problema de ingeniería más difícil es el diseño de evaluación, no la arquitectura del agente. Debido a que las estimaciones causales de datos observacionales no tienen un oráculo externo, la señal de calidad de Netflix es procedural: ¿siguió el agente el guion, el Crítico señaló los diagnósticos correctos, puede un humano re-ejecutar el notebook y obtener la misma respuesta? Esa es una garantía más débil que la precisión numérica en una tabla de posiciones. Los equipos que envían agentes para decisiones reguladas o de alto riesgo tendrán que construir rastros de auditoría similares en lugar de tratar la salida de LLM como auto-validante.

Conclusión para arquitectos: si su stack de ciencia de datos ejecuta trabajo causal observacional hoy — estimación de métrica proxy, análisis de impacto en la retención, atribución de características — `oci-agent` te da una plantilla actor-crítico funcional construida sobre la carga de producción de Netflix, con umbrales de diagnóstico y guiones ya definidos.