aiexpert
Início / Notícias / Nota
Research · 18 de ago. de 2026, 00:05 · 2 fontes

Databricks Feature Store atinge latência de 200ms p99 para agregações de ML de streaming via Spark RTM

Databricks Feature Store agora fornece atualização de recurso em tempo real com latência p99 de 200ms desde a ingestão de Kafka até a disponibilidade da loja de recursos online, reduzindo o atraso de recursos de minutos/horas para sub-milissegundo. A atualização combina três componentes: Spark Real-Time Mode (RTM) para processamento contínuo de eventos linha por linha com agregações de janela em rolamento, Lakebase para armazenamento online otimizado para streaming com amplificação de escrita reduzida, e orquestração automática via pontos finais do Model Serving.

A arquitetura remove a escolha tradicional entre consistência de lote (lento, recursos obsoletos) e código de streaming personalizado (rápido, frágil, alta carga de ops). Cientistas de dados agora podem criar uma definição de recurso uma vez e executá-la em pipelines em lote (para recursos de linha de base históricos) e fluxos em tempo real (para recursos de sinal atual). O sistema mantém instâncias RocksDB com estado por janela de agregação para rastrear somas/contagens/médias em rolamento na granularidade de evento, depois escreve atualizações via novo coletor JDBC de streaming.

A detecção de fraude e a personalização são os casos de uso impulsionando isso: modelos de fraude requerem sinais frescos dos últimos 10 minutos combinados com linhas de base de 30 dias para distinguir comportamento normal de anômalo. Modelos de personalização precisam de sinais de intenção em tempo real para impulsionar o engajamento. Em escala, a arquitetura troca precisão de relógio de parede (limites de intervalo exatos) por atualização de milissegundo usando janelas em rolamento que olham para trás a partir do timestamp de cada evento em vez de sincronizar com limites de intervalo fixos.

Para profissionais de ML ops e equipes de plataforma de recursos, a implicação é que agregações de streaming não requerem consumidores Kafka personalizados, gerenciamento de estado e conectores JDBC externos. A camada de abstração reduz a carga de engenharia e permite que cientistas de dados não especializados implantassem pipelines de recursos frescos. No entanto, a latência de 200ms é medida p99 em uma única agregação; a latência de produção de ponta a ponta (incluindo recuperação, conversão vetorial, inferência do modelo) será maior, e os profissionais devem validar SLOs de ponta a ponta de vários recursos para seus casos de uso.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source databricks.com
  2. 02 Databricks: Feature Store serves features with sub-second freshness databricks.com