Un nouveau projet veut construire des données d'entraînement IA ouvertes et partagées que chacun peut examiner

OpenWALDO est un ensemble de données collaboratif que n'importe quelle entreprise pourrait utiliser comme base propre et vérifiable pour l'entraînement de modèles IA. Pour le moment, il est minuscule. L'idée derrière cela ne l'est pas.

AI2Day Newsdesk3 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

Points clés

  • OpenWALDO, lancé par Gregory Kurtzer, fondateur de CentOS et Rocky Linux, est un ensemble de données partagé et sous licence ouverte conçu comme fondation publique pour l'entraînement de modèles IA.
  • Le projet est financé par CIQ, la société d'infrastructure IA de Kurtzer, et contient actuellement 167,3 milliards de jetons de référence provenant de documents gouvernementaux, d'articles académiques et de littérature du domaine public.
  • Les modèles IA de pointe s'entraînent généralement sur des dizaines de billions de jetons, ce qui signifie que l'ensemble de données actuel d'OpenWALDO n'est qu'une fraction de ce dont les grands modèles ont besoin.
  • CIQ soutient que les données d'entraînement cachées exposent les entreprises à des risques juridiques et de sécurité, car personne ne peut vérifier quels matériaux protégeables par le droit d'auteur ou restreints pourraient être intégrés dans un modèle.
  • Aucune entreprise n'a publiquement confirmé avoir entraîné un modèle sur OpenWALDO pour le moment; CIQ n'a pas répondu à la question.

La plupart des modèles IA sont construits sur des secrets. Les données utilisées pour leur enseigner quoi dire, comment raisonner et quoi éviter ne sont presque jamais divulguées aux personnes qui achètent et utilisent ces modèles. Un nouveau projet appelé OpenWALDO, d'abord rapporté par The Register AI, veut changer cela.

OpenWALDO signifie Open Weights, Artifacts, Licenses, Data, Origins. Le nom est un brin compliqué, mais l'idée est simple : construire un ensemble partagé et publiquement inspectable de données d'entraînement, le texte brut et les informations à partir desquels les modèles IA apprennent, afin que toute entreprise ou chercheur puisse l'utiliser comme point de départ vérifié.

Pourquoi les données d'entraînement secrètes importent-elles aux entreprises ordinaires?

Les données d'entraînement cachées constituent un risque, et pas seulement un problème philosophique. Si un modèle a appris à partir de livres protégeables par le droit d'auteur, de conversations scrappées d'utilisateurs, ou de résultats provenant de systèmes IA rivaux, les entreprises qui construisent des produits sur ce modèle pourraient être confrontées à une exposition juridique sans le savoir.

CIQ, la société d'infrastructure IA derrière OpenWALDO, l'a énoncé clairement : « Il n'existe souvent aucun moyen de savoir quelles données ont entraîné un modèle donné, sous quelle licence, ou avec quel consentement. »

Pour un hôpital achetant un outil IA, un cabinet juridique utilisant un assistant IA, ou un détaillant construisant un chatbot client, cette opacité est un risque réel. Vous ne pouvez pas vérifier ce que vous ne pouvez pas voir.

Il y a aussi un problème de gaspillage. Chaque laboratoire IA entraînant son propre modèle en secret répète le travail que d'autres ont déjà fait. Un ensemble de données partagé, unique et propre, selon l'équipe OpenWALDO, permettrait aux entreprises d'éviter les efforts dupliqués et d'ajouter leurs propres données privées par-dessus une base de référence vérifiée.

Comment OpenWALDO se compare-t-il à ce que les grands laboratoires IA utilisent?

L'écart est important pour le moment. Voir les chiffres :

OpenWALDO Modèle de pointe typique
Taille de l'ensemble de données 167,3 milliards de jetons Dizaines de billions de jetons
Types de sources Documents gouvernementaux, articles académiques, listes de diffusion, littérature du domaine public Non divulgués
Transparence des licences Complètement ouverte Largement inconnue
Gouvernance Communautaire, code source ouvert Fermée, propriétaire

Un jeton représente environ trois-quarts d'un mot anglais, donc 167 milliards de jetons constituent une grande bibliothèque, mais toujours qu'une fraction de ce que des modèles comme GPT-4 ou la série Llama de Meta ont consommé lors de l'entraînement.

Kurtzer établit un parallèle direct avec Linux, le système d'exploitation open source qui alimente maintenant la plupart des serveurs d'Internet. Les critiques ont autrefois qualifié le code open source d'non sécurisé et peu fiable. Il a gagné malgré tout, parce que chacun pouvait l'inspecter, le corriger et l'améliorer.

« Linux n'a pas gagné en étant certifié sûr », a déclaré Kurtzer. « Il a gagné en étant inspectable, forçable et validé par la communauté. »

Que OpenWALDO suive ce chemin ou s'effondre tranquillement reste véritablement incertain. L'espace de l'entraînement IA open source est rempli de bonnes intentions et d'une faible adoption.

Le vrai constat : si votre entreprise dépend d'un outil IA, demandez à votre fournisseur quelles données l'ont entraîné et s'il peut vous montrer la licence pour ces données. Vous ne recevrez probablement pas de réponse complète aujourd'hui. Mais poser la question vous place en avance sur la plupart des acheteurs, et des projets comme OpenWALDO existent précisément parce que cette question mérite une réponse.

© 2026 AI2Day