सामान्य GPU पर AI इमेज मॉडल चलाएं: Hugging Face 4-Bit डिफ्यूजन को आम लोगों तक लाता है

Nunchaku Lite नामक एक नया इंटीग्रेशन इमेज जेनरेट करने वाले AI को उपभोक्ता ग्राफिक्स कार्ड पर आधी मेमोरी के साथ और 30% तेज गति से चलाने देता है, कोई विशेषज्ञ सेटअप की आवश्यकता नहीं है।

AI2Day Newsdesk4 min read
IT team overwhelmed by multiple screens and tools
Share

मुख्य बिंदु

  • Hugging Face द्वारा जारी Nunchaku Lite, एक शीर्ष स्तरीय AI इमेज मॉडल को आवश्यक मेमोरी को लगभग 24 GB से घटाकर NVIDIA RTX 5090 पर लगभग 12 GB कर देता है।
  • यह तकनीक 4-बिट क्वांटाइजेशन का उपयोग करती है, जो मॉडल की संग्रहीत संख्याओं को संपीड़ित करने की एक विधि है ताकि यह कम जगह ले, साथ ही इमेज जेनरेशन को लगभग 30% तेज करता है।
  • RTX 5090 पर संपीड़ित मॉडल का उपयोग करके 1024×1024 इमेज अब लगभग 1.7 सेकंड में बन जाती है, बनाम बहुत भारी मानक संस्करण।
  • डेवलपर्स इन संपीड़ित मॉडल को Diffusers के अंदर एक पंक्ति के कोड के साथ लोड कर सकते हैं, जो AI इमेज जेनरेशन के लिए लोकप्रिय ओपन-सोर्स टूलकिट है।
  • NVIDIA RTX 30 और 40 सीरीज कार्ड समर्थित हैं, हालांकि नवीनतम संपीड़न प्रारूप को सबसे नए RTX 50 सीरीज हार्डवेयर की आवश्यकता है।

उच्च-गुणवत्ता वाली AI इमेज जेनरेट करना पहले एक ऐसे ग्राफिक्स कार्ड की मांग करता था जो अधिकांश लोगों के पास नहीं है। सर्वश्रेष्ठ टेक्स्ट-टू-इमेज मॉडल, जब पूर्ण गुणवत्ता में लोड किए जाते हैं, को 20 से 30 GB VRAM की आवश्यकता होती है, जो तेज मेमोरी है जो ग्राफिक्स कार्ड पर रहती है और भारी काम करती है। एक विशिष्ट उपभोक्ता कार्ड 8 से 16 GB रखता है। यह अंतर गंभीर AI इमेज टूल्स को डेटा केंद्रों में रखता है और होम स्टूडियो से बाहर रखता है।

Hugging Face द्वारा प्रकाशित एक नया इंटीग्रेशन उस अंतर को काफी हद तक कम करता है।

Nunchaku Lite क्या है और यह वास्तव में क्या करता है?

Nunchaku Lite अत्यधिक संपीड़ित AI इमेज मॉडल को सीधे Diffusers के अंदर लोड करने का एक तरीका है, जो इमेज जेनरेट करने वाले AI को चलाने के लिए व्यापक रूप से उपयोग की जाने वाली ओपन-सोर्स लाइब्रेरी है, बिना किसी अलग प्रोग्राम को स्थापित किए या शुरुआत से कुछ भी संकलित किए।

जो संपीड़न यह उपयोग करता है उसे SVDQuant कहा जाता है, जो Singular Value Decomposition Quantization का संक्षिप्त रूप है। क्वांटाइजेशन, आम तौर पर, AI मॉडल के अंदर बड़ी, सटीक संख्याओं को छोटी, अनियमित संख्याओं के साथ बदलना है, जैसे MP3 फ़ाइल एक स्टूडियो रिकॉर्डिंग को एक अंश आकार पर अनुमानित करती है। अधिकांश मौजूदा उपकरण यह केवल संग्रहीत वजन, मॉडल के सीखे गए ज्ञान पर करते हैं, और फिर गणना के समय उन्हें पूर्ण सटीकता में परिवर्तित करते हैं। यह मेमोरी बचाता है लेकिन चीजों को तेज नहीं करता है।

SVDQuant आगे जाता है। यह मॉडल की मुख्य गणना करने वाली परतों को संग्रहीत वजन और लाइव गणना दोनों के लिए 4-बिट सटीकता में चलाता है, जो मेमोरी उपयोग को कम करता है और प्रक्रिया को तेज करता है। मुश्किल हिस्सा यह है कि इन मॉडल के अंदर कुछ संख्याएं चरम आउटलायर हैं, और उन्हें 4 बिट में दबाने से गुणवत्ता नष्ट हो जाती है। SVDQuant उन समस्याग्रस्त मूल्यों को अलग से संभालता है, सबसे कठिन मामलों के लिए एक छोटा उच्च-सटीकता बफर रखता है और बाकी सब कुछ को क्वांटाइज करता है।

Nunchaku Lite उस दृष्टिकोण को Diffusers में लाता है, एक विशेषज्ञ इंजन की आवश्यकता नहीं है। एक डेवलपर संपीड़ित चेकपॉइंट को उसी तरह लोड करता है जैसे वह किसी अन्य मॉडल को लोड करता है: एक फ़ंक्शन कॉल, कोई स्थानीय संकलन नहीं।

इसे आज कौन उपयोग कर सकता है?

कोई भी संगत NVIDIA ग्राफिक्स कार्ड वाला व्यक्ति इसे आजमा सकता है। RTX 30 और 40 सीरीज कार्ड, जो पिछले चार वर्षों से अधिकांश उपभोक्ता बाजार को कवर करते हैं, INT4 संपीड़ित वेरिएंट के साथ काम करते हैं। नवीनतम NVFP4 प्रारूप, जो मेमोरी को और भी अधिक निचोड़ता है, NVIDIA के सबसे नए Blackwell कार्ड की आवश्यकता है: RTX 50 सीरीज, RTX PRO 6000, या B200। Volta और Hopper पीढ़ी सहित पुराने कार्ड अभी तक समर्थित नहीं हैं।

प्रारूप समर्थित कार्ड पीक मेमोरी (1024px इमेज) जेनरेशन समय
BF16 (मानक) केवल उच्च-अंत कार्ड ~24 GB आधारभूत
INT4 (Nunchaku Lite) RTX 30 & 40 सीरीज, A100, L40S ~12 GB ~30% तेज
NVFP4 (Nunchaku Lite) RTX 50 सीरीज, B200 ~12 GB ~30% तेज

साधारण उपयोगकर्ताओं के लिए, व्यावहारिक परिणाम स्पष्ट है: मॉडल जो पहले मध्य-श्रेणी गेमिंग पीसी पर लोड होने से इनकार करते थे, अब बिना किसी समस्या के चल सकते हैं। व्यापक दर्शकों के लिए इमेज टूल्स बनाने वाले डेवलपर्स को अधिक हार्डवेयर का समर्थन करने का एक सीधा रास्ता मिलता है।

इमेज गुणवत्ता के लिए इसका क्या मतलब है?

संपीड़न हमेशा एक व्यापार-बंद शामिल करता है। Nunchaku Lite एक मानक पूर्ण-सटीकता मॉडल की तुलना में लगभग 30% तेज है, लेकिन यह मूल Nunchaku इंजन की गति से मेल नहीं खाता है, जो आर्किटेक्चर-विशिष्ट शॉर्टकट का उपयोग करता है जो Nunchaku Lite लचीले रहने के लिए जानबूझकर बचाता है। संपीड़ित मॉडल में इमेज गुणवत्ता आम तौर पर मूल के बहुत करीब है, हालांकि सूक्ष्म अंतर बारीक विवरण पर दिखाई दे सकते हैं। SVDQuant पेपर के स्वयं के बेंचमार्क सुझाव देते हैं कि अंतर अधिकांश व्यावहारिक उपयोगों के लिए काफी छोटा है।

आम सवाल

इससे लाभ पाने के लिए क्या मुझे डेवलपर होना आवश्यक है?

अभी के लिए, हाँ। Nunchaku Lite Diffusers के माध्यम से काम करता है, एक Python कोडिंग लाइब्रेरी, इसलिए इन मॉडल को लोड करने के लिए कोड की एक छोटी राशि लिखने की आवश्यकता है। Diffusers पर बने उपभोक्ता अनुप्रयोग समय के साथ स्वचालित रूप से समर्थन जोड़ सकते हैं।

क्या यह Mac या AMD ग्राफिक्स कार्ड पर काम करेगा?

वर्तमान में नहीं। Nunchaku Lite NVIDIA-विशिष्ट CUDA कर्नेल पर निर्भर करता है, निम्न-स्तरीय कोड जो NVIDIA चिप्स को यह गणना तेजी से करने के लिए बताता है। AMD और Apple Silicon अभी इस स्तर पर समर्थित नहीं हैं।

क्या डेवलपर्स अपने कस्टम मॉडल को संपीड़ित कर सकते हैं?

हाँ। Hugging Face ने diffuse-compressor नामक एक साथी टूलकिट भी जारी किया है जो डेवलपर्स को नई मॉडल आर्किटेक्चर को क्वांटाइज करने देता है और परिणामों को मानक Diffusers रिपॉजिटरी के रूप में प्रकाशित करते हैं।

© 2026 AI2Day