Новый проект хочет создать открытые, общедоступные данные для обучения ИИ, которые может проверить каждый

OpenWALDO — это набор данных, созданный краудсорсингом, который любая компания может использовать как чистую, проверяемую основу для обучения моделей ИИ. Сейчас он совсем небольшой. Но идея, лежащая в его основе, очень многообещающая.

AI2Day Newsdesk3 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

Ключевые моменты

  • OpenWALDO, запущенный основателем CentOS и Rocky Linux Грегори Куртцером, — это открытый лицензированный набор данных, предназначенный в качестве публичной основы для обучения моделей ИИ.
  • Проект финансируется компанией CIQ, занимающейся инфраструктурой ИИ и принадлежащей Куртцеру, и в настоящий момент содержит 167,3 миллиарда контрольных токенов из государственных документов, научных статей и произведений общественного достояния.
  • Передовые модели ИИ обычно обучаются на десятках триллионов токенов, поэтому текущий набор данных OpenWALDO составляет лишь небольшую часть того, что нужно крупным моделям.
  • CIQ утверждает, что скрытые данные обучения создают для бизнеса юридические и безопасностные риски, так как никто не может проверить, какой защищённый авторским правом или ограниченный материал встроен в модель.
  • Пока ни одна компания публично не подтвердила обучение модели на OpenWALDO; CIQ не ответила на запрос по этому вопросу.

Большинство моделей ИИ строятся на основе секретов. Данные, используемые для обучения тому, что говорить, как рассуждать и чего избегать, практически никогда не раскрываются людям, которые покупают и используют эти модели. Новый проект под названием OpenWALDO, о котором впервые сообщило издание The Register AI, хочет это изменить.

OpenWALDO расшифровывается как Open Weights, Artifacts, Licenses, Data, Origins (открытые веса, артефакты, лицензии, данные, источники). Название громоздко, но идея проста: создать общий, открытый для проверки набор данных обучения — сырой текст и информацию, на которых учатся модели ИИ, — чтобы любая компания или исследователь могли использовать его как проверенную отправную точку.

Почему скрытые данные обучения важны для обычного бизнеса?

Скрытые данные обучения — это ответственность, а не просто философская проблема. Если модель обучалась на защищённых авторским правом книгах, собранных пользовательских разговорах или выходных данных конкурирующих систем ИИ, компании, создающие продукты на основе этой модели, могут столкнуться с юридическими рисками, о которых они даже не знают.

CIQ, компания инфраструктуры ИИ, стоящая за OpenWALDO, формулирует это просто: «Часто нет способа узнать, какие данные обучали конкретную модель, под какой лицензией и с какого согласия».

Для больницы, покупающей инструмент ИИ, адвокатской конторы, использующей ассистента на ИИ, или розничного торговца, создающего чат-бота для клиентов, эта непрозрачность представляет реальный риск. Вы не можете проверить то, что не видите.

Есть ещё и проблема расходов. Каждая лаборатория ИИ, обучающая свою модель втайне, повторяет работу, которую уже сделали другие. Единый общий чистый набор данных, утверждает команда OpenWALDO, позволил бы компаниям пропустить дублирующиеся усилия и добавить свои собственные приватные данные на основе проверенной исходной линии.

Как OpenWALDO соотносится с тем, что используют крупные лаборатории ИИ?

На данный момент разрыв значительный. Посмотрите на цифры:

OpenWALDO Типичная передовая модель
Размер набора данных 167,3 миллиарда токенов Десятки триллионов токенов
Типы источников Государственные документы, научные статьи, почтовые рассылки, произведения общественного достояния Не раскрыты
Прозрачность лицензии Полностью открыта В основном неизвестна
Управление Сообщество, открытый исходный код Закрытое, собственническое

Токен — это примерно три четверти английского слова, поэтому 167 миллиардов токенов — это большая библиотека, но всё ещё лишь часть того, что поглощали такие модели, как GPT-4 или серия Llama компании Meta во время обучения.

Куртцер проводит прямую параллель с Linux, операционной системой с открытым исходным кодом, которая теперь питает большинство серверов в интернете. Критики когда-то называли открытый код небезопасным и ненадёжным. Но он победил, потому что каждый мог его проверять, исправлять и улучшать.

«Linux победил не потому, что был сертифицирован как безопасный, — сказал Куртцер. — Он победил, потому что был проверяемым, разветвляемым и подтверждённым сообществом».

Будет ли OpenWALDO следовать этому пути или тихо исчезнет — действительно неясно. Пространство открытого исходного кода для обучения ИИ переполнено благими намерениями и слабым внедрением.

Честный вывод: если ваш бизнес зависит от инструмента ИИ, спросите у поставщика, какие данные его обучали и может ли он показать вам лицензию для этих данных. Вероятно, сегодня вы не получите полный ответ. Но вопрос ставит вас впереди большинства покупателей, и проекты вроде OpenWALDO существуют именно потому, что этот вопрос заслуживает ответа.

© 2026 AI2Day