aiexpert
Inicio / Noticias / Nota
Research · 28 abr 2026, 00:00 · 3 fuentes

VibeVoice con licencia MIT de Microsoft transcribe 1h de audio en ~9 mins en MacBook M5, con diarización de hablantes integrada

VibeVoice de Microsoft — un modelo de speech-to-text al estilo Whisper con diarización de hablantes integrada directamente en la arquitectura — está recibiendo atención renovada después de que el desarrollador Simon Willison publicó benchmarks prácticos ejecutando la versión cuantizada en 4-bit MLX (5,71 GB) en un MacBook Pro M5 Max con 128 GB. El modelo transcribió una hora de audio de podcast en 8 minutos 45 segundos, alcanzando un pico de ~61,5 GB de RAM durante la etapa de prefill y bajando a ~18 GB durante la generación. El modelo tiene licencia MIT y el checkpoint mlx-community/VibeVoice-ASR-4bit convertido por la comunidad está disponible en Hugging Face.

A diferencia de Whisper, VibeVoice produce JSON estructurado con campos speaker_id por segmento, timestamps y duración — permitiendo diarización downstream sin un paso de pipeline separado. Willison notó que el modelo distinguió correctamente dos participantes de la conversación más una voz distintiva de "sponsor read", presentando tres speaker IDs para un podcast de dos personas. Un límite estricto de 1 hora de audio por llamada de inferencia significa que las grabaciones más largas deben dividirse con ventanas superpuestas y speaker IDs reconciliados entre segmentos. El modelo original (17,3 GB, fp16) fue lanzado por Microsoft el 21 de enero de 2026; el artículo de Willison es el primer perfil detallado de desempeño en Apple Silicon en ganar circulación amplia.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source simonwillison.net
  2. 02 microsoft/VibeVoice on GitHub github.com “n/a”
  3. 03 mlx-community/VibeVoice-ASR-4bit on Hugging Face huggingface.co “n/a”