Новый проект хочет создать открытые, общедоступные данные для обучения ИИ, которые может проверить каждый
OpenWALDO — это набор данных, созданный краудсорсингом, который любая компания может использовать как чистую, проверяемую основу для обучения моделей ИИ. Сейчас он совсем небольшой. Но идея, лежащая в его основе, очень многообещающая.

Ключевые моменты
- OpenWALDO, запущенный основателем CentOS и Rocky Linux Грегори Куртцером, — это открытый лицензированный набор данных, предназначенный в качестве публичной основы для обучения моделей ИИ.
- Проект финансируется компанией CIQ, занимающейся инфраструктурой ИИ и принадлежащей Куртцеру, и в настоящий момент содержит 167,3 миллиарда контрольных токенов из государственных документов, научных статей и произведений общественного достояния.
- Передовые модели ИИ обычно обучаются на десятках триллионов токенов, поэтому текущий набор данных OpenWALDO составляет лишь небольшую часть того, что нужно крупным моделям.
- CIQ утверждает, что скрытые данные обучения создают для бизнеса юридические и безопасностные риски, так как никто не может проверить, какой защищённый авторским правом или ограниченный материал встроен в модель.
- Пока ни одна компания публично не подтвердила обучение модели на OpenWALDO; CIQ не ответила на запрос по этому вопросу.
Большинство моделей ИИ строятся на основе секретов. Данные, используемые для обучения тому, что говорить, как рассуждать и чего избегать, практически никогда не раскрываются людям, которые покупают и используют эти модели. Новый проект под названием OpenWALDO, о котором впервые сообщило издание The Register AI, хочет это изменить.
OpenWALDO расшифровывается как Open Weights, Artifacts, Licenses, Data, Origins (открытые веса, артефакты, лицензии, данные, источники). Название громоздко, но идея проста: создать общий, открытый для проверки набор данных обучения — сырой текст и информацию, на которых учатся модели ИИ, — чтобы любая компания или исследователь могли использовать его как проверенную отправную точку.
Почему скрытые данные обучения важны для обычного бизнеса?
Скрытые данные обучения — это ответственность, а не просто философская проблема. Если модель обучалась на защищённых авторским правом книгах, собранных пользовательских разговорах или выходных данных конкурирующих систем ИИ, компании, создающие продукты на основе этой модели, могут столкнуться с юридическими рисками, о которых они даже не знают.
CIQ, компания инфраструктуры ИИ, стоящая за OpenWALDO, формулирует это просто: «Часто нет способа узнать, какие данные обучали конкретную модель, под какой лицензией и с какого согласия».
Для больницы, покупающей инструмент ИИ, адвокатской конторы, использующей ассистента на ИИ, или розничного торговца, создающего чат-бота для клиентов, эта непрозрачность представляет реальный риск. Вы не можете проверить то, что не видите.
Есть ещё и проблема расходов. Каждая лаборатория ИИ, обучающая свою модель втайне, повторяет работу, которую уже сделали другие. Единый общий чистый набор данных, утверждает команда OpenWALDO, позволил бы компаниям пропустить дублирующиеся усилия и добавить свои собственные приватные данные на основе проверенной исходной линии.
Как OpenWALDO соотносится с тем, что используют крупные лаборатории ИИ?
На данный момент разрыв значительный. Посмотрите на цифры:
| OpenWALDO | Типичная передовая модель | |
|---|---|---|
| Размер набора данных | 167,3 миллиарда токенов | Десятки триллионов токенов |
| Типы источников | Государственные документы, научные статьи, почтовые рассылки, произведения общественного достояния | Не раскрыты |
| Прозрачность лицензии | Полностью открыта | В основном неизвестна |
| Управление | Сообщество, открытый исходный код | Закрытое, собственническое |
Токен — это примерно три четверти английского слова, поэтому 167 миллиардов токенов — это большая библиотека, но всё ещё лишь часть того, что поглощали такие модели, как GPT-4 или серия Llama компании Meta во время обучения.
Куртцер проводит прямую параллель с Linux, операционной системой с открытым исходным кодом, которая теперь питает большинство серверов в интернете. Критики когда-то называли открытый код небезопасным и ненадёжным. Но он победил, потому что каждый мог его проверять, исправлять и улучшать.
«Linux победил не потому, что был сертифицирован как безопасный, — сказал Куртцер. — Он победил, потому что был проверяемым, разветвляемым и подтверждённым сообществом».
Будет ли OpenWALDO следовать этому пути или тихо исчезнет — действительно неясно. Пространство открытого исходного кода для обучения ИИ переполнено благими намерениями и слабым внедрением.
Честный вывод: если ваш бизнес зависит от инструмента ИИ, спросите у поставщика, какие данные его обучали и может ли он показать вам лицензию для этих данных. Вероятно, сегодня вы не получите полный ответ. Но вопрос ставит вас впереди большинства покупателей, и проекты вроде OpenWALDO существуют именно потому, что этот вопрос заслуживает ответа.



