Новий проект хоче побудувати відкриті, спільні дані для навчання ШІ, які кожен може перевірити

OpenWALDO — це краудсорсинговий набір даних, який будь-яка компанія могла б використовувати як чисту, перевірну основу для навчання моделей ШІ. Наразі він крихітний. Але ідея, що за цим стоїть, масштабна.

AI2Day Newsdesk3 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

Ключові моменти

  • OpenWALDO, запущений засновником CentOS і Rocky Linux Грегорі Куртцером, — це спільний набір даних із відкритою ліцензією, призначений як публічна основа для навчання моделей ШІ.
  • Проект фінансується компанією CIQ, яка належить Куртцеру і спеціалізується на інфраструктурі ШІ, і поточно містить 167,3 мільярда токенів з державних записів, наукових праць і творів із суспільного надбання.
  • Передові моделі ШІ зазвичай навчаються на десятках трильйонів токенів, тому поточний набір даних OpenWALDO становить лише невелику частку того, що потрібно великим моделям.
  • CIQ стверджує, що приховані дані для навчання створюють для компаній юридичні та безпекові ризики, тому що ніхто не може перевірити, які матеріали з авторськими правами або обмеженого доступу можуть бути закладені в модель.
  • Жодна компанія публічно не підтвердила навчання моделі на OpenWALDO; CIQ не відповіла на запит про це.

Більшість моделей ШІ розробляються на основі секретних даних. Інформація, якою вчать моделі говорити, міркувати й уникати помилок, практично ніколи не розкривається тим, хто ці моделі купує й використовує. Новий проект OpenWALDO, про який спочатку повідомив The Register AI, хоче це змінити.

OpenWALDO розшифровується як Open Weights, Artifacts, Licenses, Data, Origins. Назва громіздка, але ідея проста: створити спільний, публічно перевіряємий набір навчальних даних — сировинний текст і інформацію, на якій навчаються моделі ШІ, щоб будь-яка компанія або дослідник могли використовувати його як перевірену стартову точку.

Чому приховані дані для навчання важливі для звичайних компаній?

Приховані дані для навчання — це не просто філософська проблема, а й реальна відповідальність. Якщо модель навчалася на книгах, захищених авторськими правами, на скрепленій інформації з розмов користувачів або на виходах конкуруючих систем ШІ, компанії, які розробляють продукти на основі такої моделі, можуть відповідати за це перед законом, навіть не усвідомлюючи цього.

CIQ, компанія з інфраструктури ШІ, що стоїть за OpenWALDO, висловлюється прямолінійно: «Часто неможливо дізнатися, на яких даних навчалася дана модель, за якою ліцензією й з чиєю згоди».

Для лікарні, яка купує інструмент ШІ, юридичної фірми, яка користується асистентом ШІ, чи для розрізничного продавця, який створює чат-бот для клієнтів, така непрозорість — реальний ризик. Ви не можете перевірити те, що не можете бачити.

Крім того, є проблема з марнуванням ресурсів. Кожна ШІ-лабораторія, яка таємно навчає свою модель, повторює роботу, яку вже зробили інші. Єдиний спільний чистий набір даних, як стверджує команда OpenWALDO, дозволив би компаніям пропустити дублйовану роботу й додати на основу перевіреної лінії власні приватні дані.

Як OpenWALDO порівнюється з тим, що використовують великі ШІ-лабораторії?

Розрив наразі значний. Дивіться цифри:

OpenWALDO Типова передова модель
Розмір набору даних 167,3 мільярда токенів Десятки трильйонів токенів
Типи джерел Державні записи, наукові праці, списки розсилання, твори із суспільного надбання Не розкриваються
Прозорість ліцензій Повністю відкрита Здебільшого невідома
Управління Спільнота, відкрите програмне забезпечення Закрите, власницькі

Токен — це приблизно три чверті англійського слова, тому 167 мільярдів токенів — це велика бібліотека, але все ж лише частина того, що моделі на кшталт GPT-4 або серія Llama від Meta використовували під час навчання.

Куртцер проводить пряму паралель з Linux, операційною системою з відкритим кодом, яка нині живить більшість серверів інтернету. Критики колись називали відкритий код небезпечним і ненадійним. Він все одно переміг, тому що кожен міг його перевірити, виправити й вдосконалити.

«Linux переміг не тому, що був сертифікований як безпечний, — сказав Куртцер. — Він переміг, тому що його можна було перевірити, розгалузити й валідувати спільнотою».

Чи піде OpenWALDO цим шляхом або тихо зникне, справді невизначено. Простір відкритого ШІ-навчання переповнений добрими намірами й мінімальним впровадженням.

Чесна оцінка: якщо ваш бізнес залежить від інструменту ШІ, запитайте у вашого продавця, на яких даних навчалася модель й чи можуть вони показати вам ліцензію на ці дані. Сьогодні ви, ймовірно, не отримаєте повної відповіді. Але це питання наперед ставить вас у кращі умови, ніж більшість покупців, і проекти на кшталт OpenWALDO існують саме тому, що така відповідь на це питання потрібна.

© 2026 AI2Day