Pontuações do Open-ASR Leaderboard para pelo menos 6 de 11 modelos amplamente utilizados são inflacionadas por memorização de benchmark. Um artigo publicado em 21 de agosto de 2026 por pesquisadores da HumeAI e Hugging Face introduz três sondas de medição e descobrem que vários sistemas ASR classificados no topo reproduzem transcrições de referência mesmo quando o áudio as contradiz.

O mecanismo central é "benchmaxxing": modelos expostos a VoxPopuli e LibriSpeech durante o treinamento aprendem padrões específicos do benchmark—convenções de transcrição, estilo de pontuação, omissões de frases—e os reproduzem em tempo de inferência em vez de transcrever áudio. Como benchmarks públicos são abertos e amplamente reutilizados, um modelo que se ajusta excessivamente às suas particularidades publica pontuações WER fortes enquanto falha em áudio que não corresponde à acústica do benchmark.

A sonda de discordância de referência demonstra o problema. VoxPopuli contém erros de transcrição. A equipe HumeAI usou um conjunto de modelos de baixo PER para sinalizar clipes do VoxPopuli onde o conjunto discordava unanimemente da referência de benchmark, e então validou essas sinalizações com anotadores humanos. Um clipe audível inclui "Thank you, Mr. President"—a referência omite "Thank you." Seis de 11 modelos reproduziram a referência errônea, eliminando a frase. Esses seis também adotaram a convenção de pontuação do benchmark—"Mr" sem ponto—enquanto cinco que transcreveram corretamente o áudio escreveram "Mr." com um.

A descoberta do sinal acústico revela um modo de falha mais difícil. Quando pesquisadores sintetizaram a mesma frase em vozes parlamentares gravadas após o cutoff de treinamento de cada modelo, a maioria dos seis modelos que falharam inverteu: eles transcreveram a versão fiel ao áudio. Modelos não estão memorizando texto—eles estão fazendo correspondência de padrões em assinaturas acústicas que sinalizam "este é um clipe do VoxPopuli", e depois recuperam a transcrição esperada. Duas sondas adicionais—uma usando palavras silenciadas, outra usando áudio que suporta duas formas escritas—colocam o teste da mesma falha de diferentes ângulos.

Para equipes executando ASR em produção, a consequência é direta: se você selecionou um modelo com base no WER do Open-ASR Leaderboard em VoxPopuli ou LibriSpeech, seu teste mede familiaridade com benchmark, não qualidade de transcrição na sua distribuição de áudio. Seis modelos falharam no clipe original: CohereLabs cohere-transcribe-03-2026, NVIDIA canary-qwen-2.5b, NVIDIA parakeet-tdt-0.6b-v2, IBM Granite granite-speech-4.1-2b, Boson AI higgs-audio-v3-8b-stt-v2, e Microsoft Phi-4-multimodal-instruct. Phi-4 falhou em todas as três variantes de clipe, incluindo o clone de voz fora da distribuição. Parakeet se recuperou em ambos os clones de voz, sugerindo fingerprinting acústico em vez de memorização de texto. Modelos que passaram: Qwen3-ASR-0.6B, Voxtral-Mini-3B-2507, Kimi-Audio-7B-Instruct, Whisper large-v3, e Moonshine streaming-medium.

HumeAI adicionou conjuntos de testes retidos ao Real World VoiceEQ, ao Open-ASR Leaderboard e ao Far-field ASR Leaderboard—retido significando não divulgado publicamente, impedindo otimização direta. A metodologia de três sondas mede se um modelo candidato transcreve seu áudio ou reproduz um anterior. Execute a sonda de discordância de consenso contra seu áudio de produção. Ela te diz se você está avaliando um modelo de transcrição ou uma tabela de busca de benchmark.