Google DeepMind lanzó SL2T (sign-language-to-text) el 12 de agosto de 2026, integrada en Gboard y Live Transcribe en Pixel 11—la primera IA de lenguaje de signos en un producto de consumo mainstream. El modelo traduce el lenguaje de signos americano al inglés en tiempo real en cualquier campo de texto: búsqueda web, mensajes, Gemini, Live Transcribe. Pixel 11 se lanza el 20 de agosto sin costo adicional. Mercado potencial: 70 millones de personas sordas y con problemas de audición a nivel mundial, 200+ lenguajes de signos, ninguno de los cuales tenía un equivalente de dictado por voz hasta ahora.

La arquitectura utiliza un pipeline de dos etapas con un límite claro dispositivo/servidor. La etapa uno se ejecuta completamente en el dispositivo: MediaPipe Holistic extrae 130 coordenadas de punto de referencia geométrico en tiempo real en la cara, manos, brazos y torso. El vídeo sin procesar se descarta en el dispositivo—nunca abandona el teléfono. La etapa dos transmite solo la secuencia de coordenadas ligera a los servidores de Google, donde SL2T genera texto en inglés en flujo. Enviar coordenadas en lugar de vídeo reduce el ancho de banda y elimina la objeción de privacidad central a la entrada basada en cámara.

SL2T descarta la capa gloss que dominaba los pipelines anteriores de lenguaje de signos. Los sistemas gloss producían tokens intermedios por-signo antes de generar texto; DeepMind argumenta que los glosses pierden marcadores no manuales (expresiones faciales, movimientos de boca, gramática espacial) y limitan el vocabulario a signos etiquetados. SL2T mapea los puntos de referencia directamente al texto—el movimiento que cambió la TA del lenguaje hablado de tablas de frases a sequence-to-sequence neural. La calidad de la traducción ahora escala con datos, no con vocabulario de anotación fija.

Corpus de entrenamiento: 100.000+ horas en 50+ lenguajes de signos, aproximadamente 25% en ASL. El entrenamiento multilingüe conjunto fue deliberado—el modelo aprende prioridades estructurales entre idiomas. DeepMind informa que supera los baselines monolingües en pruebas internas. En FLEURS-ASL (sd-test), SL2T obtiene 70 BLEURT zero-shot, significativamente más alto que cualquier resultado publicado. Zero-shot importa: el modelo generaliza sin ajuste fino específico de tareas.

El endurecimiento de producción fue más allá de la optimización de benchmark. DeepMind abordó: latencia de transmisión (ajustada pero no divulgada); alucinación cuando la cámara ve movimiento sin signos; reconocimiento de signante zurdo (10% de signantes); precisión con una mano, inevitable en un teléfono donde la otra mano sostiene el dispositivo. Ninguno aparece en FLEURS-ASL. Son la brecha entre benchmark e implementado.

En el lanzamiento, el modelo maneja solo ASL al inglés. Tiene dificultades con signos raros y deletreo rápido con dedos. Google no ha divulgado tasas de error por demografía de signante más allá de los casos zurdo y con una mano. DeepMind estableció un Comité Asesor de IA de Lenguaje de Signos (AISLAC) de organizaciones de Sordos y publicó un informe de impacto enumerando contextos prohibidos: atención médica, legal/aplicación de la ley, evaluación académica, entrevistas de empleo, audiencias gubernamentales. El modelo no es un sustituto de intérpretes humanos certificados.

SL2T es un pipeline de inferencia dividida funcional para entrada de postura corporal. La decisión de descartar vídeo sin procesar en el límite del dispositivo intercambia grabación original por una superficie de cumplimiento más ligera—la opción de diseño con la mayor consecuencia. Observe si la extracción de punto de referencia en el dispositivo se convierte en el piso de latencia cuando Google se expande a hardware Android de nivel inferior más allá de Pixel 11.