VibeVoice de Microsoft — un modelo de speech-to-text al estilo Whisper con diarización de hablantes integrada directamente en la arquitectura — está recibiendo atención renovada después de que el desarrollador Simon Willison publicó benchmarks prácticos ejecutando la versión cuantizada en 4-bit MLX (5,71 GB) en un MacBook Pro M5 Max con 128 GB. El modelo transcribió una hora de audio de podcast en 8 minutos 45 segundos, alcanzando un pico de ~61,5 GB de RAM durante la etapa de prefill y bajando a ~18 GB durante la generación. El modelo tiene licencia MIT y el checkpoint mlx-community/VibeVoice-ASR-4bit convertido por la comunidad está disponible en Hugging Face.
A diferencia de Whisper, VibeVoice produce JSON estructurado con campos speaker_id por segmento, timestamps y duración — permitiendo diarización downstream sin un paso de pipeline separado. Willison notó que el modelo distinguió correctamente dos participantes de la conversación más una voz distintiva de "sponsor read", presentando tres speaker IDs para un podcast de dos personas. Un límite estricto de 1 hora de audio por llamada de inferencia significa que las grabaciones más largas deben dividirse con ventanas superpuestas y speaker IDs reconciliados entre segmentos. El modelo original (17,3 GB, fp16) fue lanzado por Microsoft el 21 de enero de 2026; el artículo de Willison es el primer perfil detallado de desempeño en Apple Silicon en ganar circulación amplia.