O modelo SL2T do Google DeepMind traz ditado em Linguagem Gestual Americana para telemóveis Pixel

Um novo sistema de tradução transforma entrada sinalizada em texto dentro do Gboard e Live Transcribe, começando com ASL para inglês no Pixel 11.

AI2Day Newsdesk4 min read
A futuristic AI model represented visually as interconnected nodes and pathways, symbolizing complex data processing
Share

Pontos-chave

  • O Google DeepMind lançou o SL2T, um modelo de linguagem gestual para texto que converte Linguagem Gestual Americana em inglês escrito num telemóvel.
  • O SL2T está disponível primeiro no Pixel 11 dentro do Gboard, a aplicação de teclado do Google, e Live Transcribe, a sua ferramenta de legendagem.
  • O modelo foi treinado com mais de 100 mil horas de sinalização em mais de 50 linguagens gestuais, com cerca de um quarto em ASL.
  • No teste FLEURS-ASL, o SL2T obteve uma pontuação de 70 BLEURT sem qualquer ajuste específico da tarefa, valor que a equipa afirma estar bem acima de qualquer figura previamente reportada.
  • Para proteger a privacidade, o telemóvel envia apenas coordenadas de pontos corporais para o servidor, não o vídeo da câmara, e descarta o material original.

Durante décadas, o ditado por voz permitiu que pessoas ouvintes falassem com os seus telemóveis em vez de escreverem. Utilizadores surdos foram maioritariamente deixados de fora dessa conveniência.

O Google DeepMind quer mudar isso. O laboratório lançou o SL2T, abreviatura de sign-language-to-text, um modelo que observa alguém a sinalizar e produz texto escrito noutra língua. Está agora integrado em duas aplicações no Pixel 11: Gboard, o teclado, e Live Transcribe, que mostra palavras faladas como legendas.

A primeira versão funciona com Linguagem Gestual Americana para inglês. Mais dispositivos e mais línguas são prometidos.

O que pode um utilizador realmente fazer com isto?

Sinalizar em qualquer lugar onde normalmente digitariam. É essa a promessa, e é uma promessa concreta.

No Gboard, um utilizador surdo pode sinalizar para pesquisar na web, escrever uma mensagem, redigir um documento, ou pedir ao Gemini, o chatbot do Google, que faça uma tarefa. No Live Transcribe, pode sinalizar uma resposta durante uma conversa face a face em vez de digitar texto. Os testadores do Google disseram que sinalizar em ASL se sentia mais rápido e natural do que digitar em inglês.

Isto é importante porque linguagens gestuais não são inglês renderizado com as mãos. São línguas completas com a sua própria gramática, construídas a partir de movimentos das mãos, braços, face, cabeça e torso acontecendo simultaneamente.

Como funciona o modelo?

O SL2T faz dois trabalhos difíceis simultaneamente: observa o corpo com atenção, depois traduz entre duas línguas diferentes.

Uma ferramenta no dispositivo chamada MediaPipe Holistic rastreia pontos no sinalizador, coisas como articulações, cotovelos e referências faciais. Apenas essas coordenadas viajam para os servidores do Google. O vídeo da câmara fica no telemóvel e é descartado. Essa escolha de design é a história de privacidade, e é uma história significativa.

O modelo do lado do servidor traduz então os pontos em movimento diretamente para texto em inglês. Sistemas mais antigos frequentemente passavam por uma forma abreviada escrita intermédia chamada "gloss". O SL2T ignora esse passo, o que o Google afirma evita limitar o vocabulário e permite que a qualidade melhore conforme mais dados chegam.

O treinamento utilizou mais de 100 mil horas de sinalização em mais de 50 linguagens gestuais. Aproximadamente um quarto era ASL. O treinamento em muitas línguas simultaneamente, afirma a equipa, ajudou o modelo a aprender estruturas partilhadas entre elas.

Qual é o seu desempenho, realmente?

Bom, com limitações honestas. No teste FLEURS-ASL, um conjunto público para tradução de ASL para inglês, o SL2T obteve uma pontuação de 70 BLEURT sem qualquer ajuste específico da tarefa. BLEURT é uma pontuação de qualidade automatizada para traduções. O Google descreve esse valor como bem à frente dos resultados anteriores.

Os testes de desempenho não são a história completa. A equipa lista modos reais de falha: sinais raros, soletração digital rápida (um exemplo transformou "prey" em "grey"), frases passivas, e tempo verbal quando o contexto é limitado. Os engenheiros também trabalharam em problemas que um teste de desempenho não detetará, incluindo atraso na transmissão em fluxo, texto alucinado quando ninguém está sinalizando, sinalização com uma mão enquanto segura o telemóvel, e desempenho justo para aproximadamente 10% dos sinalizadores que são canhotos.

Quem o moldou?

Colaboradores surdos, desde o início. O projeto foi concebido por Sam Sepah, um engenheiro surdo no Google, e parceiros surdos participaram na recolha de dados, testes de utilizador e revisão de impacto.

O Google também criou um Comité Consultivo de IA em Linguagem Gestual com organizações e especialistas surdos, e publicou um relatório de impacto conjunto juntamente com o lançamento do SL2T 1.0 no Gboard e Live Transcribe.

O que os leitores devem tirar disto?

Se você ou alguém que conhece usa ASL e possui um Pixel 11, o ditado por sinalização é agora uma opção integrada no teclado e no Live Transcribe. Espere arestas ásperas em sinais raros ou rápidos. Espere que a lista de línguas cresça.

Para todos os outros, esta é uma das primeiras vezes que uma IA de linguagem gestual saiu do laboratório de pesquisa e chegou a um produto de consumidor em circulação.

© 2026 AI2Day