aiexpert
Inicio / Noticias / Nota
Research · 13 ago 2026, 00:05 · 2 fuentes

SL2T de DeepMind trae sign-language-to-text a dispositivos del consumidor; 100K+ horas, 50+ idiomas, zero-shot 70 BLEURT

Google DeepMind lanzó SL2T (Sign Language-to-Text), un modelo multilingüe habilitando transcripción de lenguaje de señas en teléfonos del consumidor por primera vez. El modelo alimenta nuevo dictado sign-to-text en Gboard y Live Transcribe para Pixel 11, lanzando con conversión de American Sign Language (ASL) a inglés. Los usuarios ahora pueden hacer señas en lugar de escribir para buscar la web, redactar mensajes o interactuar con Gemini, con idiomas adicionales próximamente.

SL2T se entrena en más de 100,000 horas de datos en 50+ lenguajes de señas (aproximadamente 25% ASL). A diferencia de enfoques anteriores que utilizaban anotaciones intermedias llamadas "glosses", SL2T traduce directamente de coordenadas de cuerpo-pose a texto, capturando marcadores no manuales y construcciones espaciales que los glosses pierden. El modelo logra una puntuación BLEURT zero-shot de 70 en el benchmark FLEURS-ASL — significativamente más alta que cualquier resultado previamente reportado para traducción ASL-a-inglés.

La ingeniería abordó restricciones del mundo real: reducción de latencia de streaming, prevención de alucinación en entradas no firmadas, equidad para firmantes zurdos (10% de la población) e desempeño en firma con una mano (usado mientras se sostiene un teléfono). La privacidad se preserva usando detección de punto-pose en dispositivo (MediaPipe Holistic) en lugar de vídeo crudo — solo las coordenadas geométricas se envían al servidor para traducción, y el vídeo original se descarta inmediatamente.

Fuentes

Todo lo que sostiene esta nota
  1. 01 Primary source deepmind.google
  2. 02 deepmind.google deepmind.google