एआई अपने शब्दों का बजट खुद बनाना सीखता है लिखना शुरू करने से पहले

एक नई शोध तकनीक एआई मॉडल को हर टोकन की कीमत गिनना सिखाती है, बिना गुणवत्ता को नुकसान पहुंचाए बेकार गणना को कम करती है।

AI2Day Newsdesk· 3 min read
A sleek, modern corporate security operations room photographed from a low angle looking toward a large curved desk with multiple dark monitors displaying abstr
Share

मुख्य बिंदु

  • Apple ML Research ने Length Value Model (LenVM) प्रकाशित किया है, एक ऐसी रूपरेखा जो भविष्यवाणी करती है कि एआई को अपने आउटपुट के हर एक चरण में कितने टोकन उत्पन्न करने की आवश्यकता होगी।
  • यह तकनीक प्रत्येक उत्पादित टोकन को एक छोटी नकारात्मक लागत मानती है, जहां टोकन पाठ का सबसे छोटा हिस्सा है जिसे एआई संसाधित करता है (लगभग एक शब्द का तीन-चौथाई), जो मॉडल को संक्षिप्त होने के लिए प्रेरित करता है।
  • वर्तमान एआई सिस्टम आउटपुट की लंबाई को केवल पूरे अनुक्रम के स्तर पर नियंत्रित करते हैं; LenVM टोकन दर टोकन काम करता है, जो बहुत बेहतर नियंत्रण देता है।
  • शोधकर्ता लंबाई नियंत्रण को एक मूल्य अनुमान समस्या के रूप में प्रस्तुत करते हैं, सुदृढ़ता सीखने से एक विधि उधार लेते हैं, एक प्रशिक्षण जो एआई को उसके व्यवहार के लिए पुरस्कृत या दंडित करता है।

हर बार जब एक चैटबॉट आपके सवाल का जवाब देता है, तो यह पाठ को एक बार में एक छोटे हिस्से में उत्पन्न करता है। इस हिस्से को टोकन कहा जाता है। अधिक टोकन का मतलब अधिक समय, अधिक बिजली, और सेवा चलाने वाले के लिए अधिक लागत है। उपयोगकर्ताओं के लिए, इसका मतलब अक्सर एक ऐसे उत्तर की प्रतीक्षा में अधिक समय है जो छोटा हो सकता था।

शोधकर्ताओं को पता है कि यह एक समस्या है। उनके समाधान, अब तक, सीधे-सादे रहे हैं। वे एक मॉडल को बता सकते हैं "अपना उत्तर 200 शब्दों से कम रखें" और सर्वश्रेष्ठ की उम्मीद कर सकते हैं। मॉडल को यह महसूस नहीं है कि उसके पास कितने शब्द बचे हैं, या वह हर शब्द जोड़ने के साथ कितना "खर्च" कर रहा है।

LenVM इसे बदल देता है। Apple ML Research द्वारा प्रकाशित यह सिस्टम मॉडल को हर डिकोडिंग चरण में शेष पीढ़ी की लंबाई की चल रही समझ देता है, जब यह प्रत्येक नया टोकन चुनता है। इसे एक टैक्सी मीटर की तरह सोचें जो हर दसवें मील के साथ टिकता है, न कि यात्रा की शुरुआत में उद्धृत एक निश्चित किराया।

चाल यह है कि वे मॉडल को परवाह करने के लिए कैसे सिखाते हैं। शोधकर्ताओं ने उत्पादित प्रत्येक टोकन को एक निरंतर छोटी सजा दी। क्योंकि मॉडल को अपने पुरस्कार को अधिकतम करने के लिए प्रशिक्षित किया जाता है, यह अपने आप सीखता है कि अनावश्यक शब्द महंगे हैं। यह प्रभाव में आत्म-संपादन बन जाता है।

यह एआई प्रशिक्षण की एक शाखा से उधार लेता है जिसे सुदृढ़ता सीखना कहा जाता है, जहां एक मॉडल अच्छे व्यवहार के लिए अंक अर्जित करता है और बुरे के लिए उन्हें खो देता है। यहां, "बुरा" केवल वर्बोज़ का अर्थ है।

क्या छोटा हमेशा बदतर होता है?

नहीं, और यही बात है। टीम के परिणाम दिखाते हैं कि मॉडल उन कार्यों पर लंबाई को ट्रिम करता है जिन्हें लंबे उत्तरों की आवश्यकता नहीं है, जबकि उन कार्यों पर गुणवत्ता को बरकरार रखता है जिन्हें वास्तव में गहराई की आवश्यकता है। लक्ष्य किसी भी कीमत पर एक छोटा उत्तर नहीं है; यह सही-लंबाई का उत्तर है।

साधारण उपयोगकर्ताओं के लिए यह दो तरीकों से मायने रखता है। पहला, दिन-प्रतिदिन की चैट टूल में तेज प्रतिक्रियाएं। दूसरा, कम चलने वाली लागत जो प्रदाता आगे बढ़ा सकते हैं बजाय सहना।

एआई उद्योग के लिए यह उन मॉडलों की ओर एक मार्ग खोलता है जो अपनी स्वयं की गणना का बजट बनाते हैं, बजाय एक इंजीनियर द्वारा एक कठोर सीमा निर्धारित किए जाने के।

© 2026 AI2Day