OpenAI — referência pra transcrição multilíngua, qualidade próxima de humano para áudio limpo.
v4 reduziu hallucinations em silêncio (big problema do v3). Suporta 100+ línguas com qualidade decente. Open-weights, self-hostável (whisper.cpp, faster-whisper). API OpenAI também disponível. Para pipelines de podcast, voice agents, transcrição: default. Trade-off: streaming real-time ainda é melhor com Deepgram/AssemblyAI.