Un nuovo progetto vuole costruire dati di addestramento AI aperti e condivisi che chiunque possa ispezionare

OpenWALDO è un dataset crowdsourced che qualsiasi azienda potrebbe utilizzare come fondamento pulito e verificabile per addestrare modelli di IA. Al momento è ancora molto piccolo. L'idea dietro non lo è.

AI2Day Newsdesk3 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

Punti chiave

  • OpenWALDO, lanciato da Gregory Kurtzer, fondatore di CentOS e Rocky Linux, è un dataset condiviso e con licenza aperta, concepito come fondamento pubblico per addestrare modelli di IA.
  • Il progetto è finanziato da CIQ, la società di infrastrutture per l'IA di Kurtzer, e attualmente contiene 167,3 miliardi di token di riferimento tratti da documenti governativi, articoli accademici e letteratura di dominio pubblico.
  • I modelli di IA all'avanguardia si addestrano tipicamente su decine di trilioni di token, il che significa che il dataset attuale di OpenWALDO rappresenta una piccola frazione di ciò di cui i modelli di grandi dimensioni hanno bisogno.
  • CIQ sostiene che i dati di addestramento nascosti espongono le aziende a rischi legali e di sicurezza, poiché nessuno può verificare quali materiali protetti da copyright o soggetti a restrizioni potrebbero essere incorporati nel modello.
  • Nessuna azienda ha ancora confermato pubblicamente di aver addestrato un modello su OpenWALDO; CIQ non ha risposto quando interpellato.

La maggior parte dei modelli di IA è costruita su segreti. I dati utilizzati per insegnare loro cosa dire, come ragionare e cosa evitare non vengono quasi mai divulgati alle persone che acquistano e utilizzano questi modelli. Un nuovo progetto chiamato OpenWALDO, riportato per la prima volta da The Register AI, vuole cambiare le cose.

OpenWALDO sta per Open Weights, Artifacts, Licenses, Data, Origins. Il nome è lungo, ma l'idea è semplice: costruire un insieme condiviso e pubblicamente ispezionabile di dati di addestramento, il testo grezzo e le informazioni da cui i modelli di IA imparano, in modo che qualsiasi azienda o ricercatore possa utilizzarli come punto di partenza verificato.

Perché i dati di addestramento segreti sono importanti per le aziende ordinarie?

I dati di addestramento nascosti rappresentano una responsabilità, non solo un problema filosofico. Se un modello ha imparato da libri protetti da copyright, conversazioni raccolte dagli utenti o output provenienti da sistemi di IA rivali, le aziende che costruiscono prodotti basati su quel modello potrebbero trovarsi esposte legalmente senza saperlo.

CIQ, l'azienda di infrastrutture per l'IA dietro OpenWALDO, lo ha espresso chiaramente: "Spesso non c'è modo di sapere quali dati hanno addestrato un determinato modello, sotto quale licenza, o con quale consenso."

Per un ospedale che acquista uno strumento di IA, uno studio legale che utilizza un assistente di IA o un rivenditore che costruisce un chatbot per i clienti, questa mancanza di trasparenza rappresenta un rischio reale. Non puoi controllare ciò che non puoi vedere.

C'è anche un problema di spreco. Ogni laboratorio di IA che addestra il proprio modello in segreto ripete il lavoro che altri hanno già completato. Un singolo dataset condiviso e pulito, sostiene il team di OpenWALDO, consentirebbe alle aziende di evitare il lavoro duplicato e di aggiungere i propri dati privati sopra una base di riferimento verificata.

Come si confronta OpenWALDO con quello che usano i grandi laboratori di IA?

Il divario è significativo al momento. Ecco i numeri:

OpenWALDO Modello di frontiera tipico
Dimensione del dataset 167,3 miliardi di token Decine di trilioni di token
Tipi di fonte Documenti governativi, articoli accademici, mailing list, letteratura di dominio pubblico Non divulgati
Trasparenza della licenza Completamente aperta Largamente sconosciuta
Governance Comunitaria, open source Chiusa, proprietaria

Un token rappresenta circa tre quarti di una parola in inglese, quindi 167 miliardi di token costituiscono una grande biblioteca, ma rimangono una frazione di ciò che modelli come GPT-4 o la serie Llama di Meta hanno consumato durante l'addestramento.

Kurtzer traccia un parallelo diretto con Linux, il sistema operativo open-source che ora alimenta la maggior parte dei server di internet. I critici una volta hanno definito il codice open-source insicuro e inaffidabile. Ha comunque vinto, perché chiunque poteva ispezionarlo, correggerlo e migliorarlo.

"Linux non ha vinto perché certificato sicuro," ha detto Kurtzer. "Ha vinto perché era ispezionabile, forkabile e validato dalla comunità."

Se OpenWALDO seguirà quel percorso o scomparirà silenziosamente è genuinamente incerto. Lo spazio dell'addestramento dell'IA open-source è affollato di buone intenzioni e scarsa adozione.

La considerazione onesta: se la vostra azienda dipende da uno strumento di IA, chiedete al vostro fornitore quali dati lo hanno addestrato e se può mostrarvi la licenza per quei dati. Probabilmente oggi non otterrete una risposta completa. Ma fare la domanda vi mette avanti rispetto alla maggior parte degli acquirenti, e progetti come OpenWALDO esistono proprio perché quella domanda merita una risposta.

© 2026 AI2Day