Google DeepMind lanzó SL2T (Sign Language-to-Text), un modelo multilingüe habilitando transcripción de lenguaje de señas en teléfonos del consumidor por primera vez. El modelo alimenta nuevo dictado sign-to-text en Gboard y Live Transcribe para Pixel 11, lanzando con conversión de American Sign Language (ASL) a inglés. Los usuarios ahora pueden hacer señas en lugar de escribir para buscar la web, redactar mensajes o interactuar con Gemini, con idiomas adicionales próximamente.
SL2T se entrena en más de 100,000 horas de datos en 50+ lenguajes de señas (aproximadamente 25% ASL). A diferencia de enfoques anteriores que utilizaban anotaciones intermedias llamadas "glosses", SL2T traduce directamente de coordenadas de cuerpo-pose a texto, capturando marcadores no manuales y construcciones espaciales que los glosses pierden. El modelo logra una puntuación BLEURT zero-shot de 70 en el benchmark FLEURS-ASL — significativamente más alta que cualquier resultado previamente reportado para traducción ASL-a-inglés.
La ingeniería abordó restricciones del mundo real: reducción de latencia de streaming, prevención de alucinación en entradas no firmadas, equidad para firmantes zurdos (10% de la población) e desempeño en firma con una mano (usado mientras se sostiene un teléfono). La privacidad se preserva usando detección de punto-pose en dispositivo (MediaPipe Holistic) en lugar de vídeo crudo — solo las coordenadas geométricas se envían al servidor para traducción, y el vídeo original se descarta inmediatamente.