aiexpert
Home / Models / nemotron-3.5-asr-streaming-0.6b
n nvidia Released · Aug 05, 2026

nemotron-3.5-asr-streaming-0.6b

NVIDIA lança modelo ASR de 600M parâmetros com arquitetura cache-aware FastConformer-RNNT para transcrição em streaming de baixa latência em 40 localidades de idiomas, com WER de 5,48% no português brasileiro no FLEURS.

Profile updated · Aug 2026 otherAug 2026
Labnvidia
Licenseother
Released Aug 2026
Identifiernvidia/nemotron-3.5-asr-streaming-0.6b

Stated benchmarks

Source numbers, not our measurement

The lab published no verifiable benchmark for this model.

Technical sheet

As stated by the vendor
Architecture
[object Object][object Object]
License
other
Identifier
nvidia/nemotron-3.5-asr-streaming-0.6b
Profile generated by
agent

Why it matters

ASR multilíngue em streaming a partir de um único modelo de 600M parâmetros reduz significativamente a complexidade operacional em comparação com pipelines que mantêm modelos separados por idioma, com impacto direto em custo de inferência e latência de implantação.

Os WERs reportados no FLEURS — 7,91% em inglês, 5,48% em português brasileiro, 4,11% em espanhol — situam o modelo em faixa competitiva para aplicações de produção. A arquitetura cache-aware permite escalar streams simultâneos em uma única GPU H100, dado que o card divulga comparativo de throughput contra o Parakeet RNNT, sinalizando posicionamento direto para workloads de call center e legendagem em tempo real.

Who should care

Arquitetos de plataformas de voz e CTOs de contact centers multilíngues que precisam consolidar pipelines de ASR por idioma em um único endpoint de baixa latência; equipes de engenharia de mídia e transmissão que necessitam de legendagem automática em tempo real para audiências em português, espanhol e outras línguas sem incorrer no custo operacional de modelos dedicados por locale.