O modelo SL2T do Google DeepMind traz ditado em Linguagem Gestual Americana para telemóveis Pixel
Um novo sistema de tradução transforma entrada sinalizada em texto dentro do Gboard e Live Transcribe, começando com ASL para inglês no Pixel 11.

Pontos-chave
- O Google DeepMind lançou o SL2T, um modelo de linguagem gestual para texto que converte Linguagem Gestual Americana em inglês escrito num telemóvel.
- O SL2T está disponível primeiro no Pixel 11 dentro do Gboard, a aplicação de teclado do Google, e Live Transcribe, a sua ferramenta de legendagem.
- O modelo foi treinado com mais de 100 mil horas de sinalização em mais de 50 linguagens gestuais, com cerca de um quarto em ASL.
- No teste FLEURS-ASL, o SL2T obteve uma pontuação de 70 BLEURT sem qualquer ajuste específico da tarefa, valor que a equipa afirma estar bem acima de qualquer figura previamente reportada.
- Para proteger a privacidade, o telemóvel envia apenas coordenadas de pontos corporais para o servidor, não o vídeo da câmara, e descarta o material original.
Durante décadas, o ditado por voz permitiu que pessoas ouvintes falassem com os seus telemóveis em vez de escreverem. Utilizadores surdos foram maioritariamente deixados de fora dessa conveniência.
O Google DeepMind quer mudar isso. O laboratório lançou o SL2T, abreviatura de sign-language-to-text, um modelo que observa alguém a sinalizar e produz texto escrito noutra língua. Está agora integrado em duas aplicações no Pixel 11: Gboard, o teclado, e Live Transcribe, que mostra palavras faladas como legendas.
A primeira versão funciona com Linguagem Gestual Americana para inglês. Mais dispositivos e mais línguas são prometidos.
O que pode um utilizador realmente fazer com isto?
Sinalizar em qualquer lugar onde normalmente digitariam. É essa a promessa, e é uma promessa concreta.
No Gboard, um utilizador surdo pode sinalizar para pesquisar na web, escrever uma mensagem, redigir um documento, ou pedir ao Gemini, o chatbot do Google, que faça uma tarefa. No Live Transcribe, pode sinalizar uma resposta durante uma conversa face a face em vez de digitar texto. Os testadores do Google disseram que sinalizar em ASL se sentia mais rápido e natural do que digitar em inglês.
Isto é importante porque linguagens gestuais não são inglês renderizado com as mãos. São línguas completas com a sua própria gramática, construídas a partir de movimentos das mãos, braços, face, cabeça e torso acontecendo simultaneamente.
Como funciona o modelo?
O SL2T faz dois trabalhos difíceis simultaneamente: observa o corpo com atenção, depois traduz entre duas línguas diferentes.
Uma ferramenta no dispositivo chamada MediaPipe Holistic rastreia pontos no sinalizador, coisas como articulações, cotovelos e referências faciais. Apenas essas coordenadas viajam para os servidores do Google. O vídeo da câmara fica no telemóvel e é descartado. Essa escolha de design é a história de privacidade, e é uma história significativa.
O modelo do lado do servidor traduz então os pontos em movimento diretamente para texto em inglês. Sistemas mais antigos frequentemente passavam por uma forma abreviada escrita intermédia chamada "gloss". O SL2T ignora esse passo, o que o Google afirma evita limitar o vocabulário e permite que a qualidade melhore conforme mais dados chegam.
O treinamento utilizou mais de 100 mil horas de sinalização em mais de 50 linguagens gestuais. Aproximadamente um quarto era ASL. O treinamento em muitas línguas simultaneamente, afirma a equipa, ajudou o modelo a aprender estruturas partilhadas entre elas.
Qual é o seu desempenho, realmente?
Bom, com limitações honestas. No teste FLEURS-ASL, um conjunto público para tradução de ASL para inglês, o SL2T obteve uma pontuação de 70 BLEURT sem qualquer ajuste específico da tarefa. BLEURT é uma pontuação de qualidade automatizada para traduções. O Google descreve esse valor como bem à frente dos resultados anteriores.
Os testes de desempenho não são a história completa. A equipa lista modos reais de falha: sinais raros, soletração digital rápida (um exemplo transformou "prey" em "grey"), frases passivas, e tempo verbal quando o contexto é limitado. Os engenheiros também trabalharam em problemas que um teste de desempenho não detetará, incluindo atraso na transmissão em fluxo, texto alucinado quando ninguém está sinalizando, sinalização com uma mão enquanto segura o telemóvel, e desempenho justo para aproximadamente 10% dos sinalizadores que são canhotos.
Quem o moldou?
Colaboradores surdos, desde o início. O projeto foi concebido por Sam Sepah, um engenheiro surdo no Google, e parceiros surdos participaram na recolha de dados, testes de utilizador e revisão de impacto.
O Google também criou um Comité Consultivo de IA em Linguagem Gestual com organizações e especialistas surdos, e publicou um relatório de impacto conjunto juntamente com o lançamento do SL2T 1.0 no Gboard e Live Transcribe.
O que os leitores devem tirar disto?
Se você ou alguém que conhece usa ASL e possui um Pixel 11, o ditado por sinalização é agora uma opção integrada no teclado e no Live Transcribe. Espere arestas ásperas em sinais raros ou rápidos. Espere que a lista de línguas cresça.
Para todos os outros, esta é uma das primeiras vezes que uma IA de linguagem gestual saiu do laboratório de pesquisa e chegou a um produto de consumidor em circulação.



