समान AI मेमोरी, कम टोकन: कैसे एक नया दृष्टिकोण एक प्रमुख एजेंट सिस्टम को बहुत कम लागत पर हराता है
दो AI सिस्टम एजेंटों को अपनी गलतियों से सीखना सिखाते हैं। एक हर बार हर सबक भेजता है। दूसरा केवल वह भेजता है जो प्रत्येक मॉडल वास्तव में उपयोग कर सकता है। अंतर बिल में दिखाई देता है।

मुख्य बिंदु
- ALTK-Evolve ने 168-कार्य बेंचमार्क पर ACE एजेंट-मेमोरी सिस्टम से मेल खाया या बेहतर प्रदर्शन किया, जबकि प्रति कार्य कंप्यूटिंग टोकन का सातवां हिस्सा जितना उपयोग किया।
- DeepSeek-V3.2 पर, एक शक्तिशाली AI मॉडल, ALTK-Evolve ने 89.3% कार्य पूर्णता स्कोर की तुलना में ACE के 80.4%, लगभग ACE की टोकन लागत का 40% में प्राप्त किया।
- एक कमजोर मॉडल, gpt-oss-120b पर, दोनों सिस्टम के बीच सटीकता लगभग समान थी, लेकिन ALTK-Evolve ने प्रति कार्य लगभग 116,000 टोकन का उपयोग किया जबकि ACE के 777,000 थे।
- दोनों सिस्टम एजेंट के सीखे गए सबकों को एक छोटे सारांश में संपीड़ित करने से बचते हैं, लेकिन निर्णय लेने के समय उन सबकों तक कैसे पहुंचते हैं, इसमें वे तीव्र रूप से भिन्न होते हैं।
- यह कार्य ALTK-Evolve टीम द्वारा Hugging Face पर साझा किया गया था।
एक नए कर्मचारी को मैनुअल के माध्यम से नहीं, बल्कि उन्हें गलतियां करने देकर और फिर उन्हें दिखाकर सिखाने की कल्पना करें कि क्या गलत हुआ। कमोबेश, यह वही है जो ये दोनों AI सिस्टम करते हैं। अंतर यह है कि आप कर्मचारी को कभी लिखा गया हर नोट देते हैं, या केवल वह नोट्स जो आज के काम के लिए प्रासंगिक हैं।
ये सिस्टम कौन सी समस्या को हल कर रहे हैं?
AI एजेंट, सॉफ़्टवेयर जो बहु-चरणीय कार्य स्वयं निष्पादित करता है, एक बताने वाले तरीके से विफल होता है। वे आमतौर पर नियम जानते हैं। वे बस उन्हें अविश्वसनीय रूप से लागू करते हैं।
एक AI एजेंट को कई सिमुलेटेड ऐप्स में एक बिल विभाजित करने जैसा कार्य दें, और यह गलत फ़ंक्शन कॉल कर सकता है, गलत व्यक्ति का रिकॉर्ड खींच सकता है, या उत्तर दे सकता है जब कोई उत्तर नहीं मांगा गया था। एजेंट के पास ज्ञान है। इसने अभी तक इसे स्वच्छ रूप से लागू करना नहीं सीखा है।
ACE (Agentic Context Engineering) और ALTK-Evolve दोनों इसे एजेंट के अपने पिछले प्रयासों से सबक खोदकर और फिर उन सबकों को अगली बार एजेंट के पास वापस भेजकर ठीक करते हैं जब यह काम करता है। कोई मानव लेबल नहीं। अंतर्निहित मॉडल को पुनः प्रशिक्षित नहीं करना। सिर्फ मेमोरी, निर्णय के क्षण में उपयोग की जाती है।
दोनों सिस्टम कहां असहमत हैं?
वे डिलीवरी पर असहमत हैं, और यही वह जगह है जहां लागत का अंतर आता है।
ACE एक बड़ी, सावधानीपूर्वक रखरखाव की गई प्लेबुक रखता है और हर एक चरण पर एजेंट के संदर्भ में, टेक्स्ट के ब्लॉक में पूरी चीज को इंजेक्ट करता है जो मॉडल काम करने से पहले पढ़ता है। यह संपूर्ण है। यह महंगा भी है।
ALTK-Evolve डिलीवरी को समायोज्य मानता है। एक शक्तिशाली मॉडल के साथ पर्याप्त गुंजाइश होने पर, यह पाठ के पूरे सेट को भेज सकता है। एक कमजोर मॉडल के लिए, यह केवल वर्तमान कार्य के लिए सबसे प्रासंगिक सबक का चयन करता है, उच्च-आत्मविश्वास दिशानिर्देशों का एक निश्चित मूल बनाए रखता है, और बाकी को भंडारण में छोड़ देता है। समान सबक दोनों मामलों में मौजूद हैं। कम लोग मॉडल तक पहुंचते हैं।
AppWorld बेंचमार्क पर परिणाम, 168 यथार्थवादी बहु-ऐप कार्यों का परीक्षण, नीचे दिखाए गए हैं।
| मॉडल | सिस्टम | कार्य पूर्णता | प्रति कार्य टोकन |
|---|---|---|---|
| DeepSeek-V3.2 (शक्तिशाली) | ACE | 80.4% | 634,000 |
| DeepSeek-V3.2 (शक्तिशाली) | ALTK-Evolve | 89.3% | 263,000 |
| gpt-oss-120b (कमजोर) | ACE | 54.8% | 777,000 |
| gpt-oss-120b (कमजोर) | ALTK-Evolve | 56.0% | 116,000 |
टोकन पाठ की इकाइयां हैं जो AI मॉडल पढ़ता और लिखता है। अधिक टोकन का मतलब अधिक कंप्यूटिंग समय और उच्च लागत है।
कम सबक भेजना कभी-कभी बेहतर क्यों काम करता है?
कठिन कार्यों के लिए, एजेंट को सही सबक चुनना होगा, सभी के माध्यम से घूमना नहीं। आसान कार्यों पर एक कमजोर मॉडल के साथ, एक व्यापक प्लेबुक एक छोटा सा किनारा देता है, क्योंकि उत्तर सतह के करीब है और अधिक संदर्भ मदद करता है। कठिन कार्यों पर, संदर्भ का वही बाढ़ रास्ते में आता है।
एक शक्तिशाली मॉडल धागा खोए बिना अधिक संदर्भ को अवशोषित करता है। एक कमजोर मॉडल इसमें डूब सकता है।
दोनों सिस्टम एक महत्वपूर्ण सिद्धांत पर सहमत हैं: पाठों को एक छोटे सारांश में संपीड़ित न करें। एक पाठ जो पांच अलग-अलग कार्यों में दिखाई दिया, वह एक से अलग तरह से अर्थपूर्ण है। उन्हें एक साथ squashing करने से वह भेद खो जाता है। ALTK-Evolve ट्रैक करता है कि कितने स्वतंत्र एपिसोड प्रत्येक पाठ का उत्पादन करते हैं। ACE प्रति आइटम सहायक-बनाम-हानिकारक गणना रखता है। विभिन्न लेबल, समान अंतर्निहित तर्क।
आगे क्या होता है?
ALTK-Evolve टीम कहती है कि ठीक कितने सबक भेजने हैं, और यह विभिन्न शक्तियों के मॉडल में कैसे स्केल करता है, इसका सवाल उनके अगले पोस्ट का विषय है। तकनीकी पुस्तकालय और पूर्ण रिपोर्ट पहले से ही शोधकर्ताओं के लिए सार्वजनिक हैं जो दृष्टिकोण का परीक्षण करना चाहते हैं।
जो कोई भी AI एजेंट सिस्टम बना रहा है या भुगतान कर रहा है, व्यावहारिक बिंदु सीधा है: एक मॉडल को निर्णय लेने के समय क्या बताया जाता है, यह सटीकता और लागत दोनों को आकार देता है, और उन दोनों चीजों में व्यापार करना नहीं पड़ता है एक दूसरे के साथ।
सामान्य प्रश्न
क्या इसका मतलब है कि ACE एक बुरा सिस्टम है?
नहीं। ACE और ALTK-Evolve एक ही समस्या को हल करते हैं और कठिन हिस्सों पर सहमत हैं। ACE की अपनी दक्षता की कहानी इस बात पर केंद्रित है कि यह अपने मेमोरी स्टोर को कितनी सस्ती कीमत पर बनाता है। ALTK-Evolve की दक्षता का लाभ प्रति चरण कम सबक परोसने से आता है, जो एक पूरी तरह से अलग अक्ष है।
क्या यह सामान्य उपयोगकर्ताओं को सीधे प्रभावित करता है?
अभी तक उस उत्पाद में नहीं जो आप डाउनलोड कर सकते हैं। यह कार्य अनुसंधान चरण में है, सिमुलेटेड कार्यों के एक बेंचमार्क पर परीक्षण किया गया है। लेकिन यह लागत बचत जो इंगित करता है, वह किसी भी कंपनी के लिए महत्वपूर्ण है जो स्केल पर AI एजेंट चला रही है, और कम चलने की लागत आमतौर पर समय के साथ कम कीमतों में अनुवाद करती है।



