एक नई परियोजना ओपन, साझा AI प्रशिक्षण डेटा बनाना चाहती है जिसका कोई भी निरीक्षण कर सके
OpenWALDO एक भीड़-स्रोत डेटासेट है जिसे कोई भी कंपनी AI मॉडल प्रशिक्षण के लिए एक स्वच्छ, ऑडिट योग्य आधार के रूप में उपयोग कर सकती है। अभी यह बहुत छोटा है। इसके पीछे का विचार नहीं है।

मुख्य बिंदु
- OpenWALDO, CentOS और Rocky Linux संस्थापक Gregory Kurtzer द्वारा लॉन्च किया गया, एक साझा, खुले लाइसेंस वाला डेटासेट है जो AI मॉडल प्रशिक्षण के लिए एक सार्वजनिक आधार है।
- यह परियोजना Kurtzer की AI बुनियादी ढांचा कंपनी CIQ द्वारा वित्त पोषित है और वर्तमान में सरकारी रिकॉर्ड, शैक्षणिक पत्र और सार्वजनिक-डोमेन साहित्य से 167.3 बिलियन संदर्भ टोकन रखती है।
- फ्रंटियर AI मॉडल आमतौर पर दसियों ट्रिलियन टोकन पर प्रशिक्षण देते हैं, जिसका अर्थ है कि OpenWALDO का वर्तमान डेटासेट बड़े मॉडल की जरूरत का एक छोटा अंश है।
- CIQ का तर्क है कि छिपे हुए प्रशिक्षण डेटा से व्यवसायों को कानूनी और सुरक्षा जोखिम होता है, क्योंकि कोई यह सत्यापित नहीं कर सकता कि कौन सी कॉपीराइट या प्रतिबंधित सामग्री मॉडल में शामिल हो सकती है।
- कोई कंपनी अभी तक OpenWALDO पर प्रशिक्षित मॉडल की सार्वजनिक रूप से पुष्टि नहीं की है; CIQ ने पूछे जाने पर कोई जवाब नहीं दिया।
अधिकांश AI मॉडल रहस्यों पर बनाए गए हैं। उन्हें यह सिखाने के लिए उपयोग किया जाने वाला डेटा कि उन्हें क्या कहना है, कैसे तर्क करना है और क्या बचना है, लगभग कभी भी उन लोगों को प्रकट नहीं किया जाता है जो इन मॉडल को खरीदते और उपयोग करते हैं। OpenWALDO नामक एक नई परियोजना, जिसे पहली बार The Register AI द्वारा रिपोर्ट किया गया था, इसे बदलना चाहती है।
OpenWALDO का मतलब है Open Weights, Artifacts, Licenses, Data, Origins। नाम लंबा है, लेकिन विचार सीधा है: प्रशिक्षण डेटा का एक साझा, सार्वजनिक रूप से निरीक्षणीय सेट बनाएं, कच्चा पाठ और जानकारी जो AI मॉडल से सीखते हैं, ताकि कोई भी कंपनी या शोधकर्ता इसे एक सत्यापित शुरुआती बिंदु के रूप में उपयोग कर सके।
साधारण व्यवसायों के लिए गुप्त प्रशिक्षण डेटा क्यों महत्वपूर्ण है?
छिपा हुआ प्रशिक्षण डेटा केवल दार्शनिक समस्या नहीं, बल्कि एक दायित्व है। यदि किसी मॉडल ने कॉपीराइट किताबों से सीखा है, उपयोगकर्ता की बातचीत को स्क्रैप किया है, या प्रतिद्वंद्वी AI सिस्टम के आउटपुट का उपयोग किया है, तो जो व्यवसाय उस मॉडल के शीर्ष पर उत्पाद बनाते हैं, वे इसे जाने बिना कानूनी जोखिम का सामना कर सकते हैं।
OpenWALDO के पीछे की AI अवसंरचना फर्म CIQ ने स्पष्ट रूप से कहा: "अक्सर कोई तरीका नहीं है कि यह जान सके कि किसी दिए गए मॉडल को किस डेटा ने प्रशिक्षित किया, किस लाइसेंस के तहत, या किसकी सहमति से।"
एक अस्पताल के लिए AI उपकरण खरीदना, एक कानूनी फर्म के लिए AI सहायक का उपयोग करना, या एक खुदरा विक्रेता के लिए ग्राहक चैटबॉट बनाना, वह अस्पष्टता एक वास्तविक जोखिम है। आप जो देख नहीं सकते उसे ऑडिट नहीं कर सकते।
एक बर्बादी की समस्या भी है। हर AI प्रयोगशाला अपने मॉडल को गुप्त रूप से प्रशिक्षित करते समय उस काम को दोहराती है जो दूसरों ने पहले ही कर चुके हैं। एक एकल, साझा, स्वच्छ डेटासेट, OpenWALDO टीम का तर्क है, कंपनियों को नकली प्रयास को छोड़ने और एक सत्यापित आधार के शीर्ष पर अपना निजी डेटा जोड़ने देगा।
OpenWALDO बड़ी AI प्रयोगशालाओं द्वारा उपयोग किए जाने वाले के साथ कैसे तुलना करता है?
अभी अंतर महत्वपूर्ण है। संख्याएं देखें:
| OpenWALDO | विशिष्ट फ्रंटियर मॉडल | |
|---|---|---|
| डेटासेट आकार | 167.3 बिलियन टोकन | दसियों ट्रिलियन टोकन |
| स्रोत प्रकार | सरकारी रिकॉर्ड, शैक्षणिक पत्र, मेलिंग सूचियां, सार्वजनिक-डोमेन साहित्य | गैर-प्रकटीकृत |
| लाइसेंस पारदर्शिता | पूरी तरह खुला | काफी हद तक अज्ञात |
| शासन | समुदाय, खुला स्रोत | बंद, मालिकाना |
एक टोकन मोटे तौर पर अंग्रेजी शब्द के तीन-चौथाई हिस्से के बराबर है, इसलिए 167 बिलियन टोकन एक बड़ी लाइब्रेरी है, लेकिन फिर भी GPT-4 या Meta के Llama सीरीज जैसे मॉडल द्वारा प्रशिक्षण के दौरान उपभोग किए गए का एक छोटा हिस्सा है।
Kurtzer Linux से सीधा समानांतर बनाता है, खुला स्रोत ऑपरेटिंग सिस्टम जो अब इंटरनेट के अधिकांश सर्वर को शक्ति देता है। आलोचकों ने एक बार खुले स्रोत कोड को असुरक्षित और अविश्वासी कहा। यह जीत गया, क्योंकि कोई भी इसका निरीक्षण, सुधार और सुधार कर सकता था।
"Linux ने प्रमाणित सुरक्षित होने से नहीं जीता," Kurtzer ने कहा। "यह निरीक्षणीय, forkable और समुदाय द्वारा सत्यापित होने से जीता।"
चाहे OpenWALDO उस रास्ते पर चले या चुप्पी से फीका पड़ जाए, यह वास्तव में अनिश्चित है। खुला स्रोत AI प्रशिक्षण स्थान अच्छे इरादों और पतले अपनाने से भरा है।
ईमानदार निष्कर्ष: यदि आपका व्यवसाय एक AI उपकरण पर निर्भर है, तो अपने विक्रेता से पूछें कि किस डेटा ने इसे प्रशिक्षित किया और क्या वे आपको उस डेटा के लिए लाइसेंस दिखा सकते हैं। आप आज संभवतः पूर्ण उत्तर नहीं पाएंगे। लेकिन पूछना आपको अधिकांश खरीदारों से आगे रखता है, और OpenWALDO जैसी परियोजनाएं मौजूद हैं क्योंकि उस सवाल का जवाब होना चाहिए।



