NVIDIA lança modelo ASR de 600M parâmetros com arquitetura cache-aware FastConformer-RNNT para transcrição em streaming de baixa latência em 40 localidades de idiomas, com WER de 5,48% no português brasileiro no FLEURS.
The lab published no verifiable benchmark for this model.
ASR multilíngue em streaming a partir de um único modelo de 600M parâmetros reduz significativamente a complexidade operacional em comparação com pipelines que mantêm modelos separados por idioma, com impacto direto em custo de inferência e latência de implantação.
Os WERs reportados no FLEURS — 7,91% em inglês, 5,48% em português brasileiro, 4,11% em espanhol — situam o modelo em faixa competitiva para aplicações de produção. A arquitetura cache-aware permite escalar streams simultâneos em uma única GPU H100, dado que o card divulga comparativo de throughput contra o Parakeet RNNT, sinalizando posicionamento direto para workloads de call center e legendagem em tempo real.
Arquitetos de plataformas de voz e CTOs de contact centers multilíngues que precisam consolidar pipelines de ASR por idioma em um único endpoint de baixa latência; equipes de engenharia de mídia e transmissão que necessitam de legendagem automática em tempo real para audiências em português, espanhol e outras línguas sem incorrer no custo operacional de modelos dedicados por locale.