aiexpert
Início / Notícias / Nota
Research · 13 de ago. de 2026, 00:05 · 2 fontes

SL2T da DeepMind traz sign-language-to-text para dispositivos do consumidor; 100K+ horas, 50+ línguas, zero-shot 70 BLEURT

Google DeepMind lançou SL2T (Sign Language-to-Text), um modelo multilingüe habilitando transcrição de língua de sinais em telefones do consumidor pela primeira vez. O modelo alimenta novo ditação sign-to-text no Gboard e Live Transcribe para Pixel 11, lançando com conversão de American Sign Language (ASL) para inglês. Os usuários agora podem fazer sinais em vez de digitar para pesquisar a web, rascunhar mensagens ou interagir com Gemini, com línguas adicionais em breve.

SL2T foi treinado em mais de 100.000 horas de dados em 50+ línguas de sinais (aproximadamente 25% ASL). Diferentemente de abordagens anteriores que usavam anotações intermediárias chamadas "glosses", SL2T traduz diretamente de coordenadas de corpo-pose para texto, capturando marcadores não-manuais e construções espaciais que glosses perdem. O modelo atinge uma pontuação zero-shot BLEURT de 70 no benchmark FLEURS-ASL — significativamente mais alta do que qualquer resultado previamente relatado para tradução ASL-to-English.

A engenharia abordou restrições do mundo real: redução de latência de streaming, prevenção de alucinação em entradas não-assinando, equidade para assinantes canhotos (10% da população) e desempenho em assinatura com uma mão (usado enquanto segura um telefone). A privacidade é preservada usando detecção de marca-pose em dispositivo (MediaPipe Holistic) em vez de vídeo bruto — apenas coordenadas geométricas são enviadas ao servidor para tradução, e o vídeo original é imediatamente descartado.

Fontes

Tudo que sustenta esta nota
  1. 01 Primary source deepmind.google
  2. 02 deepmind.google deepmind.google