Apple की नई ऑन-डिवाइस AI वॉयस तकनीक Siri को अधिक मानवीय बनाती है, बिना आपकी ऑडियो को क्लाउड में भेजे

Apple की मशीन लर्निंग टीम के एक शोध पत्र में Siri की अधिक अभिव्यक्तिपूर्ण नई वॉयस के पीछे की ऑडियो इंजन का खुलासा होता है। सभी प्रोसेसिंग आपके iPhone पर सीधे होती है, जिस चिप का आप पहले से उपयोग कर रहे हैं।

AI2Day Newsdesk3 min read
A close-up of a modern smartphone lying flat on a clean white surface, its screen glowing with a soft abstract blue and white conversational interface, no reada
Share

मुख्य बिंदु

  • Apple का AFM 3 Core Advanced मॉडल, कंपनी का सबसे सक्षम ऑन-डिवाइस AI, अब Siri की नई Expressive Voices सुविधा को शक्ति देता है।
  • सभी ऑडियो सीधे डिवाइस पर जेनरेट और प्रोसेस किया जाता है, जिसका अर्थ है कि कोई भी वॉयस डेटा Apple के सर्वर को नहीं भेजा जाता।
  • यह सिस्टम Apple Matrix Coprocessor पर चलता है, जो Apple की अपनी चिप्स में बनी एक विशेष प्रोसेसिंग यूनिट है।
  • एक नई ऑडियो आर्किटेक्चर संपीड़ित ऑडियो टोकन को वास्तविक समय में पूर्ण, प्राकृतिक-ध्वनि वाली भाषण में परिवर्तित करती है।
  • Apple ML Research ने अंतर्निहित शोध प्रकाशित किया, विस्तार से समझाया कि फोन पर तंग मेमोरी सीमाओं को कैसे पार किया गया।

जब Siri आपसे बात करता है, तो यह अब बहुत अधिक प्राकृतिक लगता है। यह कोई संयोग नहीं है। Apple ने चुपचाप एक परिष्कृत नई ऑडियो जनरेशन सिस्टम जारी की है, और Apple ML Research द्वारा प्रकाशित एक पेपर सटीक रूप से समझाता है कि यह कैसे काम करता है।

इस सुविधा को Siri Expressive Voices कहा जाता है। यह ऑडियो सिंथेसिस नामक एक प्रक्रिया का उपयोग करता है, जो शब्दों को स्क्रैच से जेनरेट करने वाली सॉफ्टवेयर है, न कि पहले से रिकॉर्ड किए गए क्लिप्स को एक साथ जोड़ने वाली। इसे एक बहुत ही उन्नत टेक्स्ट-टू-स्पीच इंजन के रूप में सोचें, सिवाय इसके कि रोबोटिक आवाज के बजाय, परिणाम समृद्ध और वास्तविक समय में कॉन्फ़िगर करने योग्य है।

यह वास्तव में कैसे काम करता है?

यह सिस्टम दो चरणों के माध्यम से टेक्स्ट को भाषण में परिवर्तित करता है। सबसे पहले, AFM 3 Core Advanced नामक एक बड़ा भाषा मॉडल, एक प्रकार की AI जो भाषा को समझती और जेनरेट करती है, ऑडियो जानकारी के कॉम्पैक्ट पैकेट बनाती है जिन्हें semantic tokens कहा जाता है। ये अभी तक आवाज नहीं हैं। वे अधिक एक संपीड़ित शॉर्टहैंड हैं कि ऑडियो क्या होना चाहिए।

दूसरा घटक, जिसे detokenizer कहा जाता है, फिर उन टोकन को वास्तविक ध्वनि तरंगों में अनपैक करता है जिन्हें आप सुन सकते हैं। यह पेपर इस दूसरे चरण को विस्तार से वर्णित करता है, क्योंकि यह वास्तव में कठिन हिस्सा है।

कठिनाई मेमोरी है। फोन के पास किसी भी समय सॉफ्टवेयर कितनी मेमोरी का उपयोग कर सकता है, इस पर सख्त सीमाएं होती हैं। उन सीमाओं में उच्च-गुणवत्ता वाली ऑडियो जनरेशन को निचोड़ने के लिए, Apple के इंजीनियरों ने एक तीन-भाग डिजाइन बनाया है जो सरल टोकन को RVQ नामक एक समृद्ध ऑडियो फॉर्मेट में परिवर्तित करता है, जो residual vector quantization के लिए खड़ा है। RVQ को ऑडियो निर्देशों के एक स्तरित सेट के रूप में सोचें जो क्रमिक रूप से ध्वनि की गुणवत्ता को तेज करता है, जैसे कि JPEG इमेज धुंधली लोड होती है और फिर तेज हो जाती है।

यह सब Apple Matrix Coprocessor, या AMX पर चलता है, एक समर्पित गणना यूनिट जो Apple Silicon चिप्स जैसे A-सीरीज़ और M-सीरीज़ में एम्बेड की गई है। AMX मुख्य प्रोसेसर या बैटरी को नुकसान पहुंचाए बिना गहन संख्या-क्रंचिंग को संभालता है।

यह महत्वपूर्ण क्यों है कि सब कुछ डिवाइस पर रहे?

संक्षिप्त उत्तर गोपनीयता है। क्योंकि ऑडियो सिंथेसिस पूरी तरह से ऑन-डिवाइस होती है, आपकी वॉयस और जो Siri आपको वापस कहता है वह कभी Apple के सर्वर तक नहीं जाता। इंटरसेप्ट करने, स्टोर करने, या सबपोएना देने के लिए कुछ नहीं है। उन उपयोगकर्ताओं के लिए जिन्हें वॉयस असिस्टेंट सुनने के बारे में चिंता है, यह आर्किटेक्चर केवल एक विपणन दावा नहीं है, बल्कि एक सार्थक डिजाइन विकल्प है।

प्रदर्शन अन्य लाभ है। स्थानीय प्रोसेसिंग का मतलब है कि एक दूर के सर्वर तक राउंड ट्रिप के लिए प्रतीक्षा नहीं करनी पड़ती। वॉयस प्रतिक्रिया लगभग तुरंत शुरू होती है।

घटक भूमिका चलता है
AFM 3 Core Advanced टेक्स्ट से semantic ऑडियो tokens जेनरेट करता है ऑन-डिवाइस
Detokenizer टोकन को ऑडियो तरंगों में परिवर्तित करता है Apple AMX चिप
RVQ प्रतिनिधित्व ऑडियो विस्तार को तेज और स्तरित करता है ऑन-डिवाइस

सामान्य उपयोगकर्ताओं के लिए इसका क्या मतलब है?

यदि आपका डिवाइस इस सुविधा को सपोर्ट करता है, तो Siri बस बेहतर लगता है। आपको कोई सेटिंग बदलने या किसी चीज में ऑप्ट इन करने की आवश्यकता नहीं है। सुधार एक सॉफ्टवेयर अपडेट के माध्यम से आता है।

व्यापक संकेत यह है कि Apple क्लाउड सर्वर पर निर्भर होने के बजाय चिप में गंभीर AI क्षमता को धकेल रहा है। यह दृष्टिकोण गोपनीयता और गति दोनों को प्राथमिकता देता है, और यह ऑडियो इंजन इस बात का सबसे स्पष्ट उदाहरण है कि व्यवहार में यह कैसा दिखता है।

© 2026 AI2Day