I modelli di IA potrebbero non dovere dimenticare tutto: il caso per lo "unlearning" più intelligente
Una nuova ricerca di Apple ML Research suggerisce che alcuni dati di addestramento hanno un effetto così scarso su un modello di IA che rimuoverli è una perdita di tempo e denaro.

Punti chiave
- Apple ML Research ha pubblicato uno studio che scopre come alcuni punti di dati di addestramento hanno un'influenza trascurabile sugli output del modello di IA.
- Gli attuali metodi di unlearning trattano ogni punto di dati come ugualmente importante, il che la ricerca sostiene sia computazionalmente dispendioso.
- I risultati potrebbero ridurre i costi di conformità alla privacy per le aziende che utilizzano IA addestrata su dati personali.
- Lo studio ha utilizzato funzioni di influenza su compiti di riconoscimento del linguaggio e delle immagini per identificare i dati a basso impatto.
Che cos'è l'unlearning dell'IA e perché è importante?
L'unlearning dell'IA è il processo di rimozione di un'informazione specifica da un modello già addestrato, senza dover ricostruire il modello da zero. Pensatelo come cercare di far dimenticare a qualcuno un numero di telefono senza cancellare l'intera memoria.
È importante perché le leggi sulla privacy in molti paesi ora danno alle persone il diritto di far cancellare i loro dati personali. Se le vostre informazioni sono state utilizzate per addestrare un sistema di IA, un'azienda potrebbe essere legalmente obbligata a rimuoverle. Riaddestare un grande modello da zero è costoso. Molto costoso. Quindi i ricercatori hanno costruito scorciatoie di "unlearning" per fare il lavoro più velocemente.
L'approccio standard odierno cancella ogni punto di dati segnalato con lo stesso sforzo, indipendentemente da quanto in realtà lo abbia modellato. Una vostra foto che ha appena influenzato leggermente il modello durante l'addestramento subisce lo stesso processo di rimozione costoso di una che il modello ha memorizzato profondamente.
Cosa hanno effettivamente scoperto i ricercatori?
Hanno scoperto che non tutti i punti di dati lasciano la stessa impronta. Molti non ne lasciano quasi nessuna.
Il team ha utilizzato uno strumento chiamato funzioni di influenza, un metodo matematico che stima quanto ogni singolo esempio di addestramento ha cambiato il comportamento finale del modello. Applicato sia a compiti di testo che di immagini, l'analisi ha costantemente identificato un sottoinsieme di esempi di addestramento il cui punteggio di influenza era così vicino a zero che rimuoverli non ha fatto alcuna differenza misurabile negli output del modello.
La conclusione: questi punti sono effettivamente "già dimenticati". Trattarli allo stesso modo dei dati ad alta influenza spreca tempo di elaborazione e, quindi, denaro.
Cosa significa questo per le aziende e gli utenti comuni?
Per le aziende, l'implicazione pratica è una riduzione dei costi di conformità. Se arriva una richiesta di privacy e i dati segnalati risultano essere a bassa influenza, il modello potrebbe non avere bisogno di un processo di unlearning costoso.
Per gli individui che hanno chiesto a un'azienda di cancellare i loro dati da un sistema di IA, questa ricerca non significa che la loro richiesta venga ignorata. Significa che gli ingegneri potrebbero un giorno utilizzare strumenti più intelligenti per verificare che i dati non abbiano effettivamente avuto alcun effetto, piuttosto che eseguire un processo di cancellazione generalizzato.
Vale la pena essere onesti su ciò che ancora non sappiamo. La ricerca è un'analisi comparativa, non un prodotto o un sistema distribuito. La legge sulla privacy nel mondo reale attualmente non ha un'esenzione per "influenza trascurabile", e le autorità di regolamentazione potrebbero non accettare un punteggio matematico come prova che i dati siano stati veramente rimossi. Quelle domande rimangono ancora aperte.
Cosa succede dopo?
L'unlearning efficiente è un'area di ricerca in rapida evoluzione, e questo lavoro aggiunge una prospettiva pratica ad essa: prima di spendere soldi per rimuovere dati, verificate se i dati erano importanti in primo luogo. Questo approccio potrebbe cambiare il modo in cui l'intero campo affronta il problema.
Una conclusione onesta: se la vostra azienda memorizza dati personali che alimentano un modello di IA, iniziate a controllare cosa effettivamente raccogliete. Meno dati non necessari addestrate, minore il vostro mal di testa legato all'unlearning in seguito.



