Ricercatori Scoprono Come Leggere i "Pensieri Nascosti" dell'IA e Sollevare Veri Interrogativi sulla Sicurezza
Un team di informatici ha hackerato il ragionamento segreto che i migliori modelli di IA tengono ben nascosto. Dentro hanno trovato password leaked e alcune domande imbarazzanti su un'azienda cinese di IA.

Punti chiave
- Ricercatori dell'Università di Tübinga e collaboratori hanno trovato un metodo per estrarre i passaggi di ragionamento nascosti dai principali modelli di IA, inclusi quelli realizzati da OpenAI, Anthropic e Google.
- La stessa tecnica ha esposto dati privati, come password e chiavi API, memorizzati nel processo di ragionamento di un modello, anche se tutte e tre le aziende hanno successivamente corretto questa specifica vulnerabilità.
- Un modello cinese chiamato Kimi K3, realizzato da Moonshot AI, ha prodotto pattern di ragionamento straordinariamente simili agli output nascosti di Claude Opus 4.8 e GPT 5.6 Sol, sollevando dubbi su se sia stato addestrato copiando questi modelli.
- I ricercatori avvertono che la somiglianza è suggestiva, non prova conclusiva di copia.
- Risolvere completamente il problema più profondo richiederebbe cambiamenti importanti al modo in cui funzionano le interfacce di programmazione di queste aziende.
Ogni modello di IA avanzato ha una sorta di monologo interno. Prima di darti una risposta, affronta il problema passo dopo passo in quello che i ricercatori chiamano "chain of thought", un processo di ragionamento scritto che il modello utilizza per risolvere problemi difficili. Le aziende mantengono questo ragionamento nascosto. È commercialmente sensibile, e condividerlo apertamente faciliterebbe ai rivali di copiarlo.
Ora un team di informatici ha trovato un modo per leggere comunque questi pensieri nascosti.
La tecnica, riportata da Wired AI, proviene da ricercatori dell'Università di Tübinga, dell'Istituto Max Planck, dell'istituto di sicurezza dell'IA MATS Research e dalla società di sicurezza Snyk. La loro intuizione chiave è quasi elegante nella sua semplicità.
Come funziona effettivamente l'attacco?
Le aziende di IA in genere offrono i loro modelli in più versioni. Un modello grande è potente ma costoso da eseguire; una versione più piccola dello stesso modello costa meno. Entrambe le versioni condividono la stessa struttura sottostante, il che significa che condividono la stessa capacità di decifrare i dati crittografati scambiati tra loro.
Quando usi un grande modello di IA tramite un'API (application programming interface, la connessione digitale che consente ai software di comunicare tra loro), il modello invia una copia crittografata del suo ragionamento al tuo computer per condividere parte del lavoro di elaborazione. I ricercatori hanno scoperto che alimentare questo ragionamento crittografato a un modello fratello più piccolo e economico può sbloccarlo.
Perché il modello più piccolo collabora quando quello più grande non lo farebbe? I modelli più piccoli ricevono meno "alignment training", il processo che insegna all'IA a seguire le regole e rifiutare richieste imbarazzanti. Elimina questa protezione e il modello è molto più disposto a mostrare il suo ragionamento.
"L'idea di scambiare messaggi verso una variante di modello più debole che ha la stessa chiave di decrittazione ma un allineamento più debole è molto interessante," ha affermato Florian Tramer, specialista di sicurezza informatica presso l'ETH di Zurigo.
Cosa hanno trovato dentro?
Due cose, e hanno gravità abbastanza diversa.
Primo: password e chiavi API. Se avessi mai incollato credenziali sensibili in un prompt mentre utilizzi uno di questi servizi di IA, quell'informazione avrebbe potuto finire dentro la traccia di ragionamento del modello. I ricercatori l'hanno estratta. OpenAI, Anthropic e Google sono stati tutti avvisati il mese scorso, e ognuna ha aggiornato i suoi sistemi per bloccare questa specifica fuga. Se hai utilizzato uno di questi servizi prima della patch, è consigliabile ruotare tutte le chiavi API o password che potresti aver incluso nei prompt.
Secondo: la questione della copia. I ricercatori hanno alimentato 90 domande a diversi modelli di IA, quindi hanno fornito ad alcuni modelli open-weight (modelli di IA scaricabili gratuitamente che chiunque può eseguire) le parole di apertura delle tracce di ragionamento catturate dai grandi modelli proprietari. Kimi K3, un modello dell'azienda cinese Moonshot AI, ha generato un ragionamento che somigliava notevolmente all'output nascosto di Claude Opus 4.8 e GPT 5.6 Sol. Due altri modelli testati, incluso DeepSeek della Cina e Inkling realizzato negli USA, non hanno mostrato lo stesso pattern.
I ricercatori sono attenti a ciò che questo significa. Il loro articolo afferma che i risultati "non possono stabilire causalmente la distillazione", il che significa che non hanno provato che si sia verificata una copia. La distillazione è una tecnica ampiamente utilizzata nello sviluppo dell'IA in cui un nuovo modello più piccolo impara studiando gli output di uno più grande. È pratica normale. La controversia è se le aziende cinesi l'hanno utilizzata per copiare i modelli statunitensi senza permesso.
Gli utenti ordinari dovrebbero preoccuparsi adesso?
La vulnerabilità di fuga password è stata corretta. Questo è il problema pratico più urgente, e è gestito.
Il problema più ampio, che il ragionamento nascosto può ancora essere parzialmente estratto anche dopo la patch, rimane. Risolverlo completamente richiederebbe a queste aziende di riprogettare da zero il modo in cui funzionano le loro API. Alexander Panfilov, il ricercatore dell'Università di Tübinga che ha guidato il lavoro, afferma che la vulnerabilità più profonda persiste.
Per ora, vale una regola semplice: non incollare password, dettagli personali o informazioni aziendali sensibili in nessun chatbot o strumento di IA. Questo consiglio era sempre sensato. Questa ricerca lo rende un po' più urgente.
Domande comuni
I miei dati sono a rischio se uso ChatGPT, Claude o Gemini?
La vulnerabilità specifica che potrebbe esporre password e chiavi API è stata corretta da tutte e tre le aziende. In futuro, evita di includere informazioni sensibili nei prompt di IA come abitudine generale, poiché i servizi di IA elaborano i tuoi input su server esterni.
Cos'è la distillazione ed è illegale?
La distillazione è una tecnica in cui un nuovo modello di IA impara studiando gli output di uno esistente, utilizzando essenzialmente un modello più intelligente come insegnante. È ampiamente utilizzata e legale nella maggior parte dei contesti, anche se utilizzarla per copiare un modello proprietario di un concorrente senza permesso potrebbe violare i termini di servizio o sollevare questioni di proprietà intellettuale.



