A Netflix lançou o `oci-agent` em junho de 2026 e tem executado mais de 100 análises causais por mês desde então. O pacote Python de código aberto implementa um loop ator-crítico para Inferência Causal Observacional (OCI) — estimando causalidade a partir de dados não experimentais — e agora está disponível no GitHub para equipes que precisam de fluxos causais auditáveis e reproduzíveis.

A arquitetura central separa três papéis: um Principal humano que escreve o plano de análise inicial; um agente Ator que o refina em uma especificação de análise de dados, preenche um notebook Jupyter modelado e o executa; e um agente Crítico que revisa a saída, classifica em uma escala de três níveis (not_satisfactory / satisfactory_with_caveats / fully_satisfactory) e recomenda mudanças de especificação. O loop funciona até que o Crítico fique satisfeito ou uma condição de parada seja atingida. Todos os artefatos — planos, especificações, gráficos, notebooks executados — são versionados e carregados em um armazenamento de arquivos onde o Principal pode verificar resultados localmente. A Netflix chama isso "auditorias de processo". Como inferência causal de dados observacionais não tem verdade fundamental, você não pode avaliar um agente da forma usual.

O conjunto de ferramentas por baixo do `oci-agent` é anterior à era de LLM. A Netflix o construiu para responder perguntas como "qual é o efeito de jogar um jogo da Netflix na retenção de membros?" usando emulação de ensaio alvo — para cada questão causal, identificar o teste A/B ideal e verificar se os dados observacionais podem credibilizar aproximadamente. O agente herda quatro diagnósticos rigorosos: equilíbrio de covariáveis (diferença média padronizada após ponderação inferior a 0,2), sobreposição (escore de propensão entre 0,1 e 0,9), um teste de resultado placebo (efeito de tratamento em variáveis pré-tratamento não significativamente diferentes de zero) e análise de sensibilidade para confundidores ocultos. Essas verificações são executadas automaticamente; o Crítico as classifica antes de emitir sua avaliação.

O caso de estudo mostra o que acontece sem essa disciplina. A Netflix pediu tanto a um prompt Claude bruto quanto ao `oci-agent` para estimar o impacto do engajamento com um novo tipo de entretenimento (o vertical de jogos, chamado "Type X") na retenção de membros de 2 meses. O `oci-agent` retornou uma estimativa de 25% da baseline — a abordagem LLM ingênua superestimou o efeito causal em aproximadamente 4×. O Crítico sinalizou viés de adotante inicial e um teste placebo falhado, e então acionou iterações com parâmetros ajustados até que uma estimativa defensável emergisse.

O lançamento de código aberto vem com EconML para o ML causal subjacente, cobrindo aprendizagem duplamente robusta de efeitos de tratamento médio para tratamentos binários únicos. Desde junho, a equipe adicionou estimativa de efeito de tratamento heterogênea e modelos parcialmente lineares para múltiplos tratamentos contínuos. Em relação ao benchmark da Conferência de Inferência Causal Atlântica de 2016 (77 processos geradores de dados, 231 estimativas, 44 métodos concorrentes), a metodologia estatística do agente é competitiva: baixo RMSE e intervalos de confiança de 95% bem calibrados em relação a abordagens ajustadas manualmente.

O problema de engenharia mais difícil é design de avaliação, não arquitetura de agente. Como estimativas causais de dados observacionais não têm um oráculo externo, o sinal de qualidade da Netflix é processual: o agente seguiu o playbook, o Crítico sinalizou os diagnósticos corretos, um humano pode re-executar o notebook e obter a mesma resposta? Essa é uma garantia mais fraca do que precisão numérica em um ranking. Equipes que entregam agentes para decisões reguladas ou de alto risco precisarão construir trilhas de auditoria similares em vez de tratar a saída de LLM como auto-validante.

Conclusão para arquitetos: se seu stack de ciência de dados executa trabalho causal observacional hoje — estimativa de métrica proxy, análise de impacto na retenção, atribuição de características — o `oci-agent` oferece um template ator-crítico funcional construído na carga de produção da Netflix, com limiares de diagnóstico e playbooks já definidos.