समान AI मेमोरी, कम टोकन: कैसे एक नया दृष्टिकोण एक प्रमुख एजेंट सिस्टम को बहुत कम लागत पर हराता है

दो AI सिस्टम एजेंटों को अपनी गलतियों से सीखना सिखाते हैं। एक हर बार हर सबक भेजता है। दूसरा केवल वह भेजता है जो प्रत्येक मॉडल वास्तव में उपयोग कर सकता है। अंतर बिल में दिखाई देता है।

AI2Day Newsdesk4 min read
A sleek, modern corporate security operations room photographed from a low angle looking toward a large curved desk with multiple dark monitors displaying abstr
Share

मुख्य बिंदु

  • ALTK-Evolve ने 168-कार्य बेंचमार्क पर ACE एजेंट-मेमोरी सिस्टम से मेल खाया या बेहतर प्रदर्शन किया, जबकि प्रति कार्य कंप्यूटिंग टोकन का सातवां हिस्सा जितना उपयोग किया।
  • DeepSeek-V3.2 पर, एक शक्तिशाली AI मॉडल, ALTK-Evolve ने 89.3% कार्य पूर्णता स्कोर की तुलना में ACE के 80.4%, लगभग ACE की टोकन लागत का 40% में प्राप्त किया।
  • एक कमजोर मॉडल, gpt-oss-120b पर, दोनों सिस्टम के बीच सटीकता लगभग समान थी, लेकिन ALTK-Evolve ने प्रति कार्य लगभग 116,000 टोकन का उपयोग किया जबकि ACE के 777,000 थे।
  • दोनों सिस्टम एजेंट के सीखे गए सबकों को एक छोटे सारांश में संपीड़ित करने से बचते हैं, लेकिन निर्णय लेने के समय उन सबकों तक कैसे पहुंचते हैं, इसमें वे तीव्र रूप से भिन्न होते हैं।
  • यह कार्य ALTK-Evolve टीम द्वारा Hugging Face पर साझा किया गया था।

एक नए कर्मचारी को मैनुअल के माध्यम से नहीं, बल्कि उन्हें गलतियां करने देकर और फिर उन्हें दिखाकर सिखाने की कल्पना करें कि क्या गलत हुआ। कमोबेश, यह वही है जो ये दोनों AI सिस्टम करते हैं। अंतर यह है कि आप कर्मचारी को कभी लिखा गया हर नोट देते हैं, या केवल वह नोट्स जो आज के काम के लिए प्रासंगिक हैं।

ये सिस्टम कौन सी समस्या को हल कर रहे हैं?

AI एजेंट, सॉफ़्टवेयर जो बहु-चरणीय कार्य स्वयं निष्पादित करता है, एक बताने वाले तरीके से विफल होता है। वे आमतौर पर नियम जानते हैं। वे बस उन्हें अविश्वसनीय रूप से लागू करते हैं।

एक AI एजेंट को कई सिमुलेटेड ऐप्स में एक बिल विभाजित करने जैसा कार्य दें, और यह गलत फ़ंक्शन कॉल कर सकता है, गलत व्यक्ति का रिकॉर्ड खींच सकता है, या उत्तर दे सकता है जब कोई उत्तर नहीं मांगा गया था। एजेंट के पास ज्ञान है। इसने अभी तक इसे स्वच्छ रूप से लागू करना नहीं सीखा है।

ACE (Agentic Context Engineering) और ALTK-Evolve दोनों इसे एजेंट के अपने पिछले प्रयासों से सबक खोदकर और फिर उन सबकों को अगली बार एजेंट के पास वापस भेजकर ठीक करते हैं जब यह काम करता है। कोई मानव लेबल नहीं। अंतर्निहित मॉडल को पुनः प्रशिक्षित नहीं करना। सिर्फ मेमोरी, निर्णय के क्षण में उपयोग की जाती है।

दोनों सिस्टम कहां असहमत हैं?

वे डिलीवरी पर असहमत हैं, और यही वह जगह है जहां लागत का अंतर आता है।

ACE एक बड़ी, सावधानीपूर्वक रखरखाव की गई प्लेबुक रखता है और हर एक चरण पर एजेंट के संदर्भ में, टेक्स्ट के ब्लॉक में पूरी चीज को इंजेक्ट करता है जो मॉडल काम करने से पहले पढ़ता है। यह संपूर्ण है। यह महंगा भी है।

ALTK-Evolve डिलीवरी को समायोज्य मानता है। एक शक्तिशाली मॉडल के साथ पर्याप्त गुंजाइश होने पर, यह पाठ के पूरे सेट को भेज सकता है। एक कमजोर मॉडल के लिए, यह केवल वर्तमान कार्य के लिए सबसे प्रासंगिक सबक का चयन करता है, उच्च-आत्मविश्वास दिशानिर्देशों का एक निश्चित मूल बनाए रखता है, और बाकी को भंडारण में छोड़ देता है। समान सबक दोनों मामलों में मौजूद हैं। कम लोग मॉडल तक पहुंचते हैं।

AppWorld बेंचमार्क पर परिणाम, 168 यथार्थवादी बहु-ऐप कार्यों का परीक्षण, नीचे दिखाए गए हैं।

मॉडल सिस्टम कार्य पूर्णता प्रति कार्य टोकन
DeepSeek-V3.2 (शक्तिशाली) ACE 80.4% 634,000
DeepSeek-V3.2 (शक्तिशाली) ALTK-Evolve 89.3% 263,000
gpt-oss-120b (कमजोर) ACE 54.8% 777,000
gpt-oss-120b (कमजोर) ALTK-Evolve 56.0% 116,000

टोकन पाठ की इकाइयां हैं जो AI मॉडल पढ़ता और लिखता है। अधिक टोकन का मतलब अधिक कंप्यूटिंग समय और उच्च लागत है।

कम सबक भेजना कभी-कभी बेहतर क्यों काम करता है?

कठिन कार्यों के लिए, एजेंट को सही सबक चुनना होगा, सभी के माध्यम से घूमना नहीं। आसान कार्यों पर एक कमजोर मॉडल के साथ, एक व्यापक प्लेबुक एक छोटा सा किनारा देता है, क्योंकि उत्तर सतह के करीब है और अधिक संदर्भ मदद करता है। कठिन कार्यों पर, संदर्भ का वही बाढ़ रास्ते में आता है।

एक शक्तिशाली मॉडल धागा खोए बिना अधिक संदर्भ को अवशोषित करता है। एक कमजोर मॉडल इसमें डूब सकता है।

दोनों सिस्टम एक महत्वपूर्ण सिद्धांत पर सहमत हैं: पाठों को एक छोटे सारांश में संपीड़ित न करें। एक पाठ जो पांच अलग-अलग कार्यों में दिखाई दिया, वह एक से अलग तरह से अर्थपूर्ण है। उन्हें एक साथ squashing करने से वह भेद खो जाता है। ALTK-Evolve ट्रैक करता है कि कितने स्वतंत्र एपिसोड प्रत्येक पाठ का उत्पादन करते हैं। ACE प्रति आइटम सहायक-बनाम-हानिकारक गणना रखता है। विभिन्न लेबल, समान अंतर्निहित तर्क।

आगे क्या होता है?

ALTK-Evolve टीम कहती है कि ठीक कितने सबक भेजने हैं, और यह विभिन्न शक्तियों के मॉडल में कैसे स्केल करता है, इसका सवाल उनके अगले पोस्ट का विषय है। तकनीकी पुस्तकालय और पूर्ण रिपोर्ट पहले से ही शोधकर्ताओं के लिए सार्वजनिक हैं जो दृष्टिकोण का परीक्षण करना चाहते हैं।

जो कोई भी AI एजेंट सिस्टम बना रहा है या भुगतान कर रहा है, व्यावहारिक बिंदु सीधा है: एक मॉडल को निर्णय लेने के समय क्या बताया जाता है, यह सटीकता और लागत दोनों को आकार देता है, और उन दोनों चीजों में व्यापार करना नहीं पड़ता है एक दूसरे के साथ।

सामान्य प्रश्न

क्या इसका मतलब है कि ACE एक बुरा सिस्टम है?

नहीं। ACE और ALTK-Evolve एक ही समस्या को हल करते हैं और कठिन हिस्सों पर सहमत हैं। ACE की अपनी दक्षता की कहानी इस बात पर केंद्रित है कि यह अपने मेमोरी स्टोर को कितनी सस्ती कीमत पर बनाता है। ALTK-Evolve की दक्षता का लाभ प्रति चरण कम सबक परोसने से आता है, जो एक पूरी तरह से अलग अक्ष है।

क्या यह सामान्य उपयोगकर्ताओं को सीधे प्रभावित करता है?

अभी तक उस उत्पाद में नहीं जो आप डाउनलोड कर सकते हैं। यह कार्य अनुसंधान चरण में है, सिमुलेटेड कार्यों के एक बेंचमार्क पर परीक्षण किया गया है। लेकिन यह लागत बचत जो इंगित करता है, वह किसी भी कंपनी के लिए महत्वपूर्ण है जो स्केल पर AI एजेंट चला रही है, और कम चलने की लागत आमतौर पर समय के साथ कम कीमतों में अनुवाद करती है।

© 2026 AI2Day