अपने AI बिल को 40% कम करें मॉडल को बदले बिना: एक कंपनी ने ऐसे किया
AI राइटिंग फर्म Writer के एक नए अध्ययन से पता चलता है कि भाषा मॉडल के चारों ओर सॉफ्टवेयर रैपर को फिर से डिज़ाइन करने से, मॉडल को नहीं, लागत में लगभग 40% की कटौती होती है और काम का समय आधा हो जाता है।

मुख्य बिंदु
- Writer की शोध टीम ने मॉडल के चारों ओर ऑर्केस्ट्रेशन लेयर को फिर से डिज़ाइन करके प्रति AI कार्य की औसत लागत 41% कम की, जो 21 सेंट से 12 सेंट हो गई, न कि मॉडल को बदलकर।
- टोकन खपत, यानी प्रत्येक कार्य में संसाधित पाठ की मात्रा, 38% गिरकर 14,200 टोकन से 8,800 टोकन प्रति कार्य हो गई।
- कार्य की सफलता दर स्थिर रही या हल्के से सुधरी, जो 78% से 81% हो गई, जबकि माध्य कार्य समय 44% घटकर 48 सेकंड से 27 सेकंड हो गया।
- दक्षता लाभ केवल परीक्षण किए गए दो सबसे सक्षम मॉडलों पर विश्वसनीय रूप से रहा: Writer का अपना Palmyra X6 और Anthropic का Claude Sonnet 4.6।
- शोधकर्ताओं ने अपने निष्कर्ष एक पेपर में प्रकाशित किए जो कोई भी इंजीनियरिंग टीम आज लागू कर सकती है, क्योंकि इसमें अंतर्निहित AI मॉडल में कोई बदलाव नहीं होता है।
AI महंगा है। जो भी कंपनी एक छोटे डेमो से आगे बढ़ी है और AI टूल्स को वास्तविक पैमाने पर चलाना शुरू किया है, वह बिलिंग डैशबोर्ड में इसे महसूस करेगी। एंटरप्राइज AI सॉफ्टवेयर फर्म Writer के नए शोध पत्र से अब लागतें क्यों बढ़ती हैं, इसके कठोर आंकड़े मिलते हैं, और एक व्यावहारिक समाधान दिखाया गया है जिसमें आपको अपने AI मॉडल को बदलने या कुछ भी फिर से प्रशिक्षित करने की आवश्यकता नहीं है। संक्षिप्त संस्करण: समस्या मॉडल नहीं है। यह इसके चारों ओर की प्रणाली है।
एक "AI harness" वास्तव में क्या है और आपको इसकी परवाह क्यों करनी चाहिए?
एक AI harness, जिसे कभी-कभी ऑर्केस्ट्रेशन लेयर कहा जाता है, वह सॉफ्टवेयर है जो आपके एप्लीकेशन और AI मॉडल के बीच बैठा होता है। इसे एक स्टेज मैनेजर के रूप में सोचें। यह तय करता है कि मॉडल को कौन से निर्देश भेजने हैं, इसे कौन सी फाइलें देनी हैं, त्रुटियों को कैसे संभालना है, और विशेषज्ञ टूल्स को कब शामिल करना है। अधिकांश विकास टीमें इस लेयर को जल्दी से बनाती हैं और इसे डिस्पोजेबल गोंद कोड मानती हैं। Writer के शोधकर्ताओं का तर्क है कि यह AI इंजीनियरिंग में सबसे महंगी गलती है।
यह पेपर छह अलग-अलग AI मॉडलों का परीक्षण करता है, जिनमें Anthropic का Claude Sonnet 4.6, Google का Gemini Flash 3.5, और Writer का अपना Palmyra X6 शामिल हैं, 22 मानकीकृत व्यावसायिक कार्यों पर। उन्होंने मॉडल और कार्यों को समान रखा, फिर एक मानक harness की तुलना एक सावधानीपूर्वक अनुकूलित harness से की। परिणाम शोधकर्ताओं को भी आश्चर्यचकित कर गए। लागत 41% गिर गई। कार्य पूरा होने का समय 44% कम हुआ। गुणवत्ता में गिरावट नहीं आई।
तो पहले बर्बादी कहां जा रही थी? इसका नाम इंडस्ट्री में है: "tokenmaxxing"। एक टोकन पाठ का एक छोटा टुकड़ा है, मोटे तौर पर एक शब्द के तीन-चौथाई, जिसे एक AI मॉडल पढ़ता और उत्पन्न करता है। प्रदाता प्रति टोकन के आधार पर चार्ज करते हैं। Tokenmaxxing अंदाजे से काम लेने की आशा में हर AI अनुरोध में भारी मात्रा में पाठ डालने की आदत है, बजाय इसके कि अनुरोध को सावधानीपूर्वक इंजीनियर किया जाए। Writer के CTO Waseem AlShikh ने VentureBeat को स्पष्ट रूप से कहा: "आपका इनवॉइस टोकन-प्रति-कार्य गुणा मूल्य-प्रति-टोकन है, और अधिकांश टीमें केवल दूसरी संख्या को देखती हैं।" AI प्रदाताओं से कीमत में कटौती राहत जैसी लगती है। लेकिन अगर आपकी प्रणाली आवश्यक टोकन के तीन गुना अधिक जला रही है, तो सस्ते टोकन भी एक फूला हुआ बिल का मतलब है।
अनुकूलित harness इसे चार कदमों के माध्यम से ठीक करता है: प्रॉम्प्ट के उन हिस्सों को कैश करना जो कभी नहीं बदलते ताकि आप हर कॉल पर एक ही पाठ के लिए फिर से भुगतान न करें; बातचीत के इतिहास को संपीड़ित करना ताकि पुराना संदर्भ जमा न हो; खोज कार्यों को छोटे विशेषज्ञ सहायक एजेंटों को भेजना बजाय कच्चे दस्तावेजों को मुख्य बातचीत में डालने के; और बिना किसी बाधा के पुनः प्रयास लूप को काटना जो टोकन गणना को छत से ऊपर भेज देते हैं जब मॉडल को कोई त्रुटि आती है।
एक सावधानी के साथ ध्यान दें। सहायक दृष्टिकोण, जहां आप कार्यों को छोटे विशेषज्ञ मॉडलों को सौंपते हैं, केवल परीक्षण किए गए दो सबसे मजबूत मॉडलों पर विश्वसनीय रूप से काम करता है। Gemini Flash 3.5 जैसे हल्के मॉडल उन प्रतिनिधिमंडन कार्यों पर उपयोग योग्य विश्वसनीयता थ्रेशोल्ड के नीचे स्कोर करते हैं। यदि आपकी टीम एक छोटे, सस्ते मॉडल पर चलती है, तो इनमें से कुछ लाभ प्राप्त करना कठिन होगा।
लेकिन व्यापक सबक आपके द्वारा उपयोग किए गए मॉडल की परवाह किए बिना रहता है। अपने प्रॉम्प्ट को संरचित करें ताकि स्थिर भाग पहले आएं और गतिशील भाग अंत में आएं। यह एकल परिवर्तन प्रॉम्प्ट कैशिंग को वास्तव में काम करता है और आपको एक ही निर्देशों के लिए दो बार भुगतान करने से रोकता है।
एक ईमानदारी पूर्ण सीख: इससे पहले कि आप एक अधिक शक्तिशाली AI मॉडल पर एक और डॉलर खर्च करें, यह ऑडिट करें कि आपकी वर्तमान प्रणाली प्रति कार्य कितने टोकन जला रही है। यह संख्या, प्रति-टोकन मूल्य नहीं, वह जगह है जहां आपकी असली AI लागत छिपी होती है।



