अपने AI बिल को 40% कम करें मॉडल को बदले बिना: एक कंपनी ने ऐसे किया

AI राइटिंग फर्म Writer के एक नए अध्ययन से पता चलता है कि भाषा मॉडल के चारों ओर सॉफ्टवेयर रैपर को फिर से डिज़ाइन करने से, मॉडल को नहीं, लागत में लगभग 40% की कटौती होती है और काम का समय आधा हो जाता है।

AI2Day Newsdesk· 4 min read
A glowing neural network diagram rendered in deep blue and amber tones spreads across a dark server room background, with rows of blinking server racks visible
Share

मुख्य बिंदु

  • Writer की शोध टीम ने मॉडल के चारों ओर ऑर्केस्ट्रेशन लेयर को फिर से डिज़ाइन करके प्रति AI कार्य की औसत लागत 41% कम की, जो 21 सेंट से 12 सेंट हो गई, न कि मॉडल को बदलकर।
  • टोकन खपत, यानी प्रत्येक कार्य में संसाधित पाठ की मात्रा, 38% गिरकर 14,200 टोकन से 8,800 टोकन प्रति कार्य हो गई।
  • कार्य की सफलता दर स्थिर रही या हल्के से सुधरी, जो 78% से 81% हो गई, जबकि माध्य कार्य समय 44% घटकर 48 सेकंड से 27 सेकंड हो गया।
  • दक्षता लाभ केवल परीक्षण किए गए दो सबसे सक्षम मॉडलों पर विश्वसनीय रूप से रहा: Writer का अपना Palmyra X6 और Anthropic का Claude Sonnet 4.6।
  • शोधकर्ताओं ने अपने निष्कर्ष एक पेपर में प्रकाशित किए जो कोई भी इंजीनियरिंग टीम आज लागू कर सकती है, क्योंकि इसमें अंतर्निहित AI मॉडल में कोई बदलाव नहीं होता है।

AI महंगा है। जो भी कंपनी एक छोटे डेमो से आगे बढ़ी है और AI टूल्स को वास्तविक पैमाने पर चलाना शुरू किया है, वह बिलिंग डैशबोर्ड में इसे महसूस करेगी। एंटरप्राइज AI सॉफ्टवेयर फर्म Writer के नए शोध पत्र से अब लागतें क्यों बढ़ती हैं, इसके कठोर आंकड़े मिलते हैं, और एक व्यावहारिक समाधान दिखाया गया है जिसमें आपको अपने AI मॉडल को बदलने या कुछ भी फिर से प्रशिक्षित करने की आवश्यकता नहीं है। संक्षिप्त संस्करण: समस्या मॉडल नहीं है। यह इसके चारों ओर की प्रणाली है।

एक "AI harness" वास्तव में क्या है और आपको इसकी परवाह क्यों करनी चाहिए?

एक AI harness, जिसे कभी-कभी ऑर्केस्ट्रेशन लेयर कहा जाता है, वह सॉफ्टवेयर है जो आपके एप्लीकेशन और AI मॉडल के बीच बैठा होता है। इसे एक स्टेज मैनेजर के रूप में सोचें। यह तय करता है कि मॉडल को कौन से निर्देश भेजने हैं, इसे कौन सी फाइलें देनी हैं, त्रुटियों को कैसे संभालना है, और विशेषज्ञ टूल्स को कब शामिल करना है। अधिकांश विकास टीमें इस लेयर को जल्दी से बनाती हैं और इसे डिस्पोजेबल गोंद कोड मानती हैं। Writer के शोधकर्ताओं का तर्क है कि यह AI इंजीनियरिंग में सबसे महंगी गलती है।

यह पेपर छह अलग-अलग AI मॉडलों का परीक्षण करता है, जिनमें Anthropic का Claude Sonnet 4.6, Google का Gemini Flash 3.5, और Writer का अपना Palmyra X6 शामिल हैं, 22 मानकीकृत व्यावसायिक कार्यों पर। उन्होंने मॉडल और कार्यों को समान रखा, फिर एक मानक harness की तुलना एक सावधानीपूर्वक अनुकूलित harness से की। परिणाम शोधकर्ताओं को भी आश्चर्यचकित कर गए। लागत 41% गिर गई। कार्य पूरा होने का समय 44% कम हुआ। गुणवत्ता में गिरावट नहीं आई।

तो पहले बर्बादी कहां जा रही थी? इसका नाम इंडस्ट्री में है: "tokenmaxxing"। एक टोकन पाठ का एक छोटा टुकड़ा है, मोटे तौर पर एक शब्द के तीन-चौथाई, जिसे एक AI मॉडल पढ़ता और उत्पन्न करता है। प्रदाता प्रति टोकन के आधार पर चार्ज करते हैं। Tokenmaxxing अंदाजे से काम लेने की आशा में हर AI अनुरोध में भारी मात्रा में पाठ डालने की आदत है, बजाय इसके कि अनुरोध को सावधानीपूर्वक इंजीनियर किया जाए। Writer के CTO Waseem AlShikh ने VentureBeat को स्पष्ट रूप से कहा: "आपका इनवॉइस टोकन-प्रति-कार्य गुणा मूल्य-प्रति-टोकन है, और अधिकांश टीमें केवल दूसरी संख्या को देखती हैं।" AI प्रदाताओं से कीमत में कटौती राहत जैसी लगती है। लेकिन अगर आपकी प्रणाली आवश्यक टोकन के तीन गुना अधिक जला रही है, तो सस्ते टोकन भी एक फूला हुआ बिल का मतलब है।

अनुकूलित harness इसे चार कदमों के माध्यम से ठीक करता है: प्रॉम्प्ट के उन हिस्सों को कैश करना जो कभी नहीं बदलते ताकि आप हर कॉल पर एक ही पाठ के लिए फिर से भुगतान न करें; बातचीत के इतिहास को संपीड़ित करना ताकि पुराना संदर्भ जमा न हो; खोज कार्यों को छोटे विशेषज्ञ सहायक एजेंटों को भेजना बजाय कच्चे दस्तावेजों को मुख्य बातचीत में डालने के; और बिना किसी बाधा के पुनः प्रयास लूप को काटना जो टोकन गणना को छत से ऊपर भेज देते हैं जब मॉडल को कोई त्रुटि आती है।

एक सावधानी के साथ ध्यान दें। सहायक दृष्टिकोण, जहां आप कार्यों को छोटे विशेषज्ञ मॉडलों को सौंपते हैं, केवल परीक्षण किए गए दो सबसे मजबूत मॉडलों पर विश्वसनीय रूप से काम करता है। Gemini Flash 3.5 जैसे हल्के मॉडल उन प्रतिनिधिमंडन कार्यों पर उपयोग योग्य विश्वसनीयता थ्रेशोल्ड के नीचे स्कोर करते हैं। यदि आपकी टीम एक छोटे, सस्ते मॉडल पर चलती है, तो इनमें से कुछ लाभ प्राप्त करना कठिन होगा।

लेकिन व्यापक सबक आपके द्वारा उपयोग किए गए मॉडल की परवाह किए बिना रहता है। अपने प्रॉम्प्ट को संरचित करें ताकि स्थिर भाग पहले आएं और गतिशील भाग अंत में आएं। यह एकल परिवर्तन प्रॉम्प्ट कैशिंग को वास्तव में काम करता है और आपको एक ही निर्देशों के लिए दो बार भुगतान करने से रोकता है।

एक ईमानदारी पूर्ण सीख: इससे पहले कि आप एक अधिक शक्तिशाली AI मॉडल पर एक और डॉलर खर्च करें, यह ऑडिट करें कि आपकी वर्तमान प्रणाली प्रति कार्य कितने टोकन जला रही है। यह संख्या, प्रति-टोकन मूल्य नहीं, वह जगह है जहां आपकी असली AI लागत छिपी होती है।

© 2026 AI2Day