A NVIDIA lançou Nemotron 3 Diarization, um modelo de peso aberto com 100 milhões de parâmetros para identificação e atribuição de falantes em tempo real em áudio com múltiplos falantes. O modelo ocupa o primeiro lugar no leaderboard Diarization-Bench da Voice Arena com uma taxa de erro de diarização (DER) de 14.72% e suporta até oito falantes em conversas ao vivo e gravadas, dobrando o limite de quatro falantes da linha de base Streaming Sortformer anterior da NVIDIA.

O modelo aceita áudio mono de 16 kHz, converte-o em características de Mel-espectrograma com passo de quadro de 10 ms e alimenta essas características através de um codificador Transformer de 31 camadas com embeddings posicionais rotatórios. A saída é um tensor de forma [T, 8]—T passos de tempo por oito canais de falante possíveis—onde cada valor representa a probabilidade de um falante estar ativo naquele momento. Durante inferência em streaming, dois mecanismos de memória preservam a identidade do falante entre chunks: um Cache de Falante em Ordem de Chegada (AOSC) que retém informações sobre falantes observados anteriormente, organizados por seus canais em ordem de chegada, e uma fila primeiro-a-entrar-primeiro-a-sair (FIFO) que fornece contexto de quadro recente. Este design permite que um modelo opere em múltiplos pontos de latência sem retreinamento.

O modelo suporta quatro latências de buffer de entrada recomendadas: 30.4 segundos para processamento estilo offline, 1.04 segundo para baixa latência, 0.64 segundo para latência muito baixa e 0.32 segundo para latência ultra-baixa. Esses valores medem apenas o áudio armazenado em buffer antes da inferência; computação, rede, ASR e processamento de aplicação adicionam à latência ponta a ponta. Na configuração de 30.4 segundos em uma NVIDIA RTX PRO 5000 com tamanho de batch 32 e torch.compile(), o modelo atinge fator em tempo real de 15,113× (RTFx)—significando que processa áudio 15,113 vezes mais rápido que tempo real—comparado com 2,619× para a linha de base anterior, enquanto reduz DER DIHARD III de 19.09% para 12.73%. Na configuração de 1.04 segundo, atinge 865× RTFx versus 136×, reduzindo DER de 19.60% para 13.18%.

Comparado com a linha de base Streaming Sortformer anterior de quatro falantes em latência de 1.04 segundo, Nemotron 3 Diarization reduz DER em todos os oito conjuntos de dados avaliados, com melhorias relativas variando de 9.0% em CALLHOME-Part2 a 65.2% em NOTSOFAR1 MHM. A média não ponderada de reduções relativas por conjunto de dados é 41.0%. A vantagem se amplia em condições de contagem de falantes mais alta: em gravações DIHARD III com cinco a nove falantes, a melhoria é maior do que em subconjuntos de dois falantes, embora o máximo de oito falantes do modelo signifique que gravações com nove falantes excedem seu limite especificado.

O modelo produz rótulos de falante genéricos com timestamps, não verificação de identidade. Aplicações downstream devem mapear IDs de canal anônimos para identidades de falante explícitas emparelhando timestamps com metadados de reunião, perfis de usuário ou verificação de falante ativo. Erros de diarização incluem fala perdida, alarmes falsos, atribuições incorretas de falante e erros de limite. O post do blog Hugging Face observa que ruído, reverberação severa, gravação de campo distante, mudança de domínio e conversas longas podem aumentar esses erros. O modelo é projetado para sistemas Linux com GPUs NVIDIA Ampere, Hopper ou Blackwell suportadas e aceita áudio mono de 16 kHz em formatos .wav, .flac, .opus e .mp3.

Para equipes que constroem sistemas de agentes baseados em voz ou pipelines de processamento de áudio, a negociação principal é entre latência e precisão: buffers de entrada mais curtos reduzem tempo de resposta mas degradam tanto precisão quanto throughput, então a seleção de ponto operacional deve seguir requisitos de produto ponta a ponta em vez de apenas duração de buffer.