Il modello SL2T di Google DeepMind porta la dettatura in Lingua dei Segni Americana ai telefoni Pixel
Un nuovo sistema di traduzione trasforma l'input gestuale in testo all'interno di Gboard e Live Transcribe, inizialmente con la Lingua dei Segni Americana verso l'inglese su Pixel 11.

Punti chiave
- Google DeepMind ha lanciato SL2T, un modello che trasforma il linguaggio dei segni in testo, convertendo la Lingua dei Segni Americana in inglese scritto su un telefono.
- SL2T debutta su Pixel 11 all'interno di Gboard, l'app tastiera di Google, e Live Transcribe, lo strumento di sottotitolazione.
- Il modello è stato addestrato su più di 100.000 ore di linguaggio gestuale in oltre 50 lingue dei segni, di cui circa un quarto in ASL.
- Nel benchmark FLEURS-ASL, SL2T ha ottenuto 70 BLEURT zero-shot, un risultato che il team dichiara essere superiore a qualsiasi cifra precedentemente riportata.
- Per proteggere la privacy, il telefono invia al server solo le coordinate dei punti del corpo, non il video della fotocamera, e scarta le immagini originali.
Da decenni, la dettatura vocale consente alle persone udenti di parlare ai loro telefoni invece di digitare. Gli utenti sordi sono rimasti per lo più esclusi da questa comodità.
Google DeepMind vuole cambiare le cose. Il laboratorio ha rilasciato SL2T, acronimo di sign-language-to-text, un modello che osserva qualcuno che firma e produce testo scritto in un'altra lingua. È ora integrato in due app su Pixel 11: Gboard, la tastiera, e Live Transcribe, che mostra le parole parlate come didascalie.
La prima versione gestisce la Lingua dei Segni Americana verso l'inglese. Sono promessi altri dispositivi e altre lingue.
Che cosa può fare effettivamente un utente con questo?
Firmare ovunque digiterebbe normalmente. Questo è l'argomento, ed è uno concreto.
In Gboard, un utente sordo può firmare per cercare sul web, scrivere un messaggio, redigere un documento o chiedere a Gemini, il chatbot di Google, di svolgere un'attività. In Live Transcribe, può firmare una risposta durante una conversazione faccia a faccia invece di scrivere il testo. I tester di Google hanno affermato che firmare in ASL sembrava più veloce e più naturale che digitare in inglese.
Questo è importante perché i linguaggi dei segni non sono l'inglese reso con le mani. Sono lingue complete con la propria grammatica, costruite dai movimenti di mani, braccia, volto, testa e torso che avvengono contemporaneamente.
Come funziona il modello?
SL2T svolge due compiti difficili contemporaneamente: osserva attentamente il corpo, quindi traduce tra due lingue diverse.
Uno strumento su dispositivo chiamato MediaPipe Holistic traccia i punti sul firmatario, cose come nocche, gomiti e punti di riferimento facciali. Solo quelle coordinate viaggiano verso i server di Google. Il video della fotocamera rimane sul telefono e viene scartato. Questa scelta progettuale è la storia della privacy, ed è una significativa.
Il modello lato server traduce quindi direttamente i punti in movimento in testo inglese. I sistemi precedenti spesso passavano attraverso una stenografia scritta intermedia chiamata "gloss". SL2T salta questo passaggio, che Google dice evita di limitare il vocabolario e consente al miglioramento della qualità di progredire man mano che arrivano più dati.
L'addestramento ha utilizzato oltre 100.000 ore di linguaggio gestuale in più di 50 lingue dei segni. All'incirca un quarto era ASL. L'addestramento su molte lingue insieme, secondo il team, ha aiutato il modello a imparare le strutture condivise tra loro.
Quanto è buono, veramente?
Buono, con limiti onesti. Su FLEURS-ASL, un set di test pubblico per la traduzione da ASL a inglese, SL2T ha ottenuto 70 BLEURT senza alcun fine-tuning specifico per l'attività. BLEURT è un punteggio di qualità automatico per le traduzioni. Google definisce questa cifra ben superiore ai risultati precedenti.
I benchmark non sono l'intera storia. Il team elenca i veri modi di fallimento: segni rari, dattilologia veloce (un esempio ha trasformato "prey" in "grey"), frasi passive e tempo quando il contesto è scarso. Gli ingegneri hanno anche affrontato problemi che un benchmark non coglierà, incluso il ritardo di trasmissione, il testo allucinato quando nessuno sta firmando, la firma con una sola mano mentre si tiene il telefono e prestazioni eque per il circa 10% dei firmatari che sono mancini.
Chi l'ha modellato?
Collaboratori sordi, fin dall'inizio. Il progetto è stato concepito da Sam Sepah, un ingegnere sordo di Google, e partner sordi hanno partecipato alla raccolta dati, ai test degli utenti e alla revisione dell'impatto.
Google ha anche istituito un comitato consultivo AI Sign Language con organizzazioni e esperti sordi, e ha pubblicato un rapporto congiunto sull'impatto insieme al rilascio di SL2T 1.0 in Gboard e Live Transcribe.
Cosa dovrebbero trarre i lettori da questo?
Se tu o qualcuno che conosci usa ASL e possiede un Pixel 11, la dettatura gestuale è ora un'opzione integrata nella tastiera e in Live Transcribe. Aspettati elementi approssimativi su segni rari o veloci. Aspettati che l'elenco delle lingue cresca.
Per tutti gli altri, questo è uno dei primi casi in cui un'IA per il linguaggio dei segni ha lasciato il laboratorio di ricerca e è sbarcata in un prodotto consumer in spedizione.



