A Databricks lançou três extensões AUTO CDC esta semana que eliminam lógica MERGE personalizada de pipelines CDC: rastreamento de histórico bimestral (Beta), atualizações parciais para feeds de mudança esparsos (GA), e a API Python AUTO CDC Type 1 contribuída para Apache Spark 4.2.

O AUTO CDC Bimestral rastreia dois timestamps independentes. O tempo comercial marca quando um fato era verdadeiro no mundo real. O tempo do sistema marca quando o sistema de registro aprendeu sobre isso. O mecanismo adiciona quatro colunas gerenciadas: __START_AT e __END_AT para tempo comercial, __SYSTEM_START_AT e __SYSTEM_END_AT para tempo do sistema. Quando uma correção chega com um timestamp anterior, o mecanismo reescreve o histórico afetado no lugar em vez de anexar. A declaração é declarativa: STORED AS BITEMPORAL com colunas SEQUENCE BY e SYSTEM SEQUENCE BY — sem MERGE personalizado necessário.

O driver regulatório é direto. A Regra SEC 17a-4 e as regras de manutenção de registros FINRA exigem que as empresas reconstruam registros como existiam em um ponto específico no tempo — tanto o que os dados diziam quanto o que o sistema acreditava. A varredura de fiscalização de manutenção de registros da SEC resultou em mais de $2 bilhões em multas em mais de 100 empresas desde 2021. As tabelas SCD Type 2 padrão não podem responder ambas as perguntas simultaneamente. Uma tabela bimestral pode: uma consulta delimitada para 3 de janeiro retorna o que o sistema mostrou naquele dia; uma consulta executada hoje retorna a verdade corrigida após uma correção retroativa.

A GA de atualizações parciais fecha um modo de falha comum. Muitas fontes CDC emitem apenas colunas alteradas como NULL para tudo o mais. Sem tratamento explícito, esses NULLs sobrescrevem dados válidos silenciosamente. A correção é declarativa: defina ignore_null_updates ou ignore_null_updates_column_list em create_auto_cdc_flow(), e o mecanismo aplica apenas campos alterados.

A contribuição de código aberto envia a API Python AUTO CDC Type 1 para Apache Spark 4.2 via SPARK-56249, revisada através do processo SPIP padrão. A implementação lida com eventos fora de ordem através de uma tabela de estado auxiliar — tombstones de exclusão e microlotes retentados convergem em vez de corromper o alvo. Funciona em Delta Lake e Iceberg. A interface SQL (CREATE FLOW ... AS AUTO CDC INTO) é mesclada no master para a próxima versão do Spark; suporte SCD Type 2 de histórico completo e atualizações parciais estão em desenvolvimento.

Um engenheiro de aeroespacial e defesa da Fortune 500 substituiu 1.500 linhas de código CDC personalizado com 4 linhas de declarações AUTO CDC. Navy Federal Credit Union executa AUTO CDC em Lakeflow Spark Declarative Pipelines para processar bilhões de eventos de aplicativo. A redução de padrão: 6–10 linhas de pipeline declarativo vs. 40–200+ linhas de lógica MERGE feita à mão.

Restrições: O AUTO CDC Bimestral está em Beta e requer channel: PREVIEW. Funciona apenas em SDP sem servidor ou edições Pro/Advanced. DML em tabelas de alvo AUTO CDC requer Unity Catalog e Databricks Runtime 13.3 LTS ou superior; ler feeds de mudança requer DBR 15.2 ou superior. O histórico bimestral sobrevive a VACUUM (que exclui versões de arquivo Delta anteriores a 7 dias), tornando-o uma alternativa viável a TIMESTAMP AS OF para reprodutibilidade de treinamento de longa duração.

Se seus pipelines CDC carregam requisitos regulatórios, de auditoria ou de reprodutibilidade de ML, avalie bimestral agora. O custo operacional é duas colunas de sequenciamento extra e um pin de canal de visualização, não uma reescrita de pipeline.