एक नई परियोजना ओपन, साझा AI प्रशिक्षण डेटा बनाना चाहती है जिसका कोई भी निरीक्षण कर सके

OpenWALDO एक भीड़-स्रोत डेटासेट है जिसे कोई भी कंपनी AI मॉडल प्रशिक्षण के लिए एक स्वच्छ, ऑडिट योग्य आधार के रूप में उपयोग कर सकती है। अभी यह बहुत छोटा है। इसके पीछे का विचार नहीं है।

AI2Day Newsdesk3 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

मुख्य बिंदु

  • OpenWALDO, CentOS और Rocky Linux संस्थापक Gregory Kurtzer द्वारा लॉन्च किया गया, एक साझा, खुले लाइसेंस वाला डेटासेट है जो AI मॉडल प्रशिक्षण के लिए एक सार्वजनिक आधार है।
  • यह परियोजना Kurtzer की AI बुनियादी ढांचा कंपनी CIQ द्वारा वित्त पोषित है और वर्तमान में सरकारी रिकॉर्ड, शैक्षणिक पत्र और सार्वजनिक-डोमेन साहित्य से 167.3 बिलियन संदर्भ टोकन रखती है।
  • फ्रंटियर AI मॉडल आमतौर पर दसियों ट्रिलियन टोकन पर प्रशिक्षण देते हैं, जिसका अर्थ है कि OpenWALDO का वर्तमान डेटासेट बड़े मॉडल की जरूरत का एक छोटा अंश है।
  • CIQ का तर्क है कि छिपे हुए प्रशिक्षण डेटा से व्यवसायों को कानूनी और सुरक्षा जोखिम होता है, क्योंकि कोई यह सत्यापित नहीं कर सकता कि कौन सी कॉपीराइट या प्रतिबंधित सामग्री मॉडल में शामिल हो सकती है।
  • कोई कंपनी अभी तक OpenWALDO पर प्रशिक्षित मॉडल की सार्वजनिक रूप से पुष्टि नहीं की है; CIQ ने पूछे जाने पर कोई जवाब नहीं दिया।

अधिकांश AI मॉडल रहस्यों पर बनाए गए हैं। उन्हें यह सिखाने के लिए उपयोग किया जाने वाला डेटा कि उन्हें क्या कहना है, कैसे तर्क करना है और क्या बचना है, लगभग कभी भी उन लोगों को प्रकट नहीं किया जाता है जो इन मॉडल को खरीदते और उपयोग करते हैं। OpenWALDO नामक एक नई परियोजना, जिसे पहली बार The Register AI द्वारा रिपोर्ट किया गया था, इसे बदलना चाहती है।

OpenWALDO का मतलब है Open Weights, Artifacts, Licenses, Data, Origins। नाम लंबा है, लेकिन विचार सीधा है: प्रशिक्षण डेटा का एक साझा, सार्वजनिक रूप से निरीक्षणीय सेट बनाएं, कच्चा पाठ और जानकारी जो AI मॉडल से सीखते हैं, ताकि कोई भी कंपनी या शोधकर्ता इसे एक सत्यापित शुरुआती बिंदु के रूप में उपयोग कर सके।

साधारण व्यवसायों के लिए गुप्त प्रशिक्षण डेटा क्यों महत्वपूर्ण है?

छिपा हुआ प्रशिक्षण डेटा केवल दार्शनिक समस्या नहीं, बल्कि एक दायित्व है। यदि किसी मॉडल ने कॉपीराइट किताबों से सीखा है, उपयोगकर्ता की बातचीत को स्क्रैप किया है, या प्रतिद्वंद्वी AI सिस्टम के आउटपुट का उपयोग किया है, तो जो व्यवसाय उस मॉडल के शीर्ष पर उत्पाद बनाते हैं, वे इसे जाने बिना कानूनी जोखिम का सामना कर सकते हैं।

OpenWALDO के पीछे की AI अवसंरचना फर्म CIQ ने स्पष्ट रूप से कहा: "अक्सर कोई तरीका नहीं है कि यह जान सके कि किसी दिए गए मॉडल को किस डेटा ने प्रशिक्षित किया, किस लाइसेंस के तहत, या किसकी सहमति से।"

एक अस्पताल के लिए AI उपकरण खरीदना, एक कानूनी फर्म के लिए AI सहायक का उपयोग करना, या एक खुदरा विक्रेता के लिए ग्राहक चैटबॉट बनाना, वह अस्पष्टता एक वास्तविक जोखिम है। आप जो देख नहीं सकते उसे ऑडिट नहीं कर सकते।

एक बर्बादी की समस्या भी है। हर AI प्रयोगशाला अपने मॉडल को गुप्त रूप से प्रशिक्षित करते समय उस काम को दोहराती है जो दूसरों ने पहले ही कर चुके हैं। एक एकल, साझा, स्वच्छ डेटासेट, OpenWALDO टीम का तर्क है, कंपनियों को नकली प्रयास को छोड़ने और एक सत्यापित आधार के शीर्ष पर अपना निजी डेटा जोड़ने देगा।

OpenWALDO बड़ी AI प्रयोगशालाओं द्वारा उपयोग किए जाने वाले के साथ कैसे तुलना करता है?

अभी अंतर महत्वपूर्ण है। संख्याएं देखें:

OpenWALDO विशिष्ट फ्रंटियर मॉडल
डेटासेट आकार 167.3 बिलियन टोकन दसियों ट्रिलियन टोकन
स्रोत प्रकार सरकारी रिकॉर्ड, शैक्षणिक पत्र, मेलिंग सूचियां, सार्वजनिक-डोमेन साहित्य गैर-प्रकटीकृत
लाइसेंस पारदर्शिता पूरी तरह खुला काफी हद तक अज्ञात
शासन समुदाय, खुला स्रोत बंद, मालिकाना

एक टोकन मोटे तौर पर अंग्रेजी शब्द के तीन-चौथाई हिस्से के बराबर है, इसलिए 167 बिलियन टोकन एक बड़ी लाइब्रेरी है, लेकिन फिर भी GPT-4 या Meta के Llama सीरीज जैसे मॉडल द्वारा प्रशिक्षण के दौरान उपभोग किए गए का एक छोटा हिस्सा है।

Kurtzer Linux से सीधा समानांतर बनाता है, खुला स्रोत ऑपरेटिंग सिस्टम जो अब इंटरनेट के अधिकांश सर्वर को शक्ति देता है। आलोचकों ने एक बार खुले स्रोत कोड को असुरक्षित और अविश्वासी कहा। यह जीत गया, क्योंकि कोई भी इसका निरीक्षण, सुधार और सुधार कर सकता था।

"Linux ने प्रमाणित सुरक्षित होने से नहीं जीता," Kurtzer ने कहा। "यह निरीक्षणीय, forkable और समुदाय द्वारा सत्यापित होने से जीता।"

चाहे OpenWALDO उस रास्ते पर चले या चुप्पी से फीका पड़ जाए, यह वास्तव में अनिश्चित है। खुला स्रोत AI प्रशिक्षण स्थान अच्छे इरादों और पतले अपनाने से भरा है।

ईमानदार निष्कर्ष: यदि आपका व्यवसाय एक AI उपकरण पर निर्भर है, तो अपने विक्रेता से पूछें कि किस डेटा ने इसे प्रशिक्षित किया और क्या वे आपको उस डेटा के लिए लाइसेंस दिखा सकते हैं। आप आज संभवतः पूर्ण उत्तर नहीं पाएंगे। लेकिन पूछना आपको अधिकांश खरीदारों से आगे रखता है, और OpenWALDO जैसी परियोजनाएं मौजूद हैं क्योंकि उस सवाल का जवाब होना चाहिए।

© 2026 AI2Day