aiexpert
Início / Modelos / nemotron-3.5-asr-streaming-0.6b
n nvidia Lançamento · 05 de ago. de 2026

nemotron-3.5-asr-streaming-0.6b

NVIDIA lança modelo ASR de 600M parâmetros com arquitetura cache-aware FastConformer-RNNT para transcrição em streaming de baixa latência em 40 localidades de idiomas, com WER de 5,48% no português brasileiro no FLEURS.

Ficha atualizada · ago. de 2026 otherago. de 2026
Laboratórionvidia
Licençaother
Lançamento ago. de 2026
Identificadornvidia/nemotron-3.5-asr-streaming-0.6b

Benchmarks declarados

Números da fonte, não medição nossa

O laboratório não publicou benchmark verificável para este modelo.

Ficha técnica

Declarado pelo fornecedor
Arquitetura
[object Object][object Object]
Licença
other
Identificador
nvidia/nemotron-3.5-asr-streaming-0.6b
Ficha gerada por
agent

Por que importa

ASR multilíngue em streaming a partir de um único modelo de 600M parâmetros reduz significativamente a complexidade operacional em comparação com pipelines que mantêm modelos separados por idioma, com impacto direto em custo de inferência e latência de implantação.

Os WERs reportados no FLEURS — 7,91% em inglês, 5,48% em português brasileiro, 4,11% em espanhol — situam o modelo em faixa competitiva para aplicações de produção. A arquitetura cache-aware permite escalar streams simultâneos em uma única GPU H100, dado que o card divulga comparativo de throughput contra o Parakeet RNNT, sinalizando posicionamento direto para workloads de call center e legendagem em tempo real.

Para quem interessa

Arquitetos de plataformas de voz e CTOs de contact centers multilíngues que precisam consolidar pipelines de ASR por idioma em um único endpoint de baixa latência; equipes de engenharia de mídia e transmissão que necessitam de legendagem automática em tempo real para audiências em português, espanhol e outras línguas sem incorrer no custo operacional de modelos dedicados por locale.