Fish Audio ने आवाज़ क्लोन करने के लिए 50 मिलियन डॉलर जुटाए, लेकिन सहमति के सवाल बाकी हैं
पालो अल्टो स्टार्टअप के 8 मिलियन उपयोगकर्ता हैं और 21 मिलियन डॉलर की वार्षिक आय है। इसके नए फंडिंग से एंटरप्राइज़ अनुबंधों और अधिक उन्नत मॉडलों में विस्तार होगा। अनुमतिहीन आवाज़ अपलोड के बारे में एक हाल के विवाद का पूरी तरह समाधान नहीं हुआ है।

मुख्य बिंदु
- Fish Audio ने मंगलवार को 50 मिलियन डॉलर के सीड राउंड को बंद किया, जिसका नेतृत्व Coreline Ventures और Capital Today ने किया।
- स्टार्टअप ने इस हफ्ते तक 21 मिलियन डॉलर की वार्षिक आवर्ती आय और 8 मिलियन से अधिक उपयोगकर्ताओं की रिपोर्ट दी।
- Fish Audio की आवाज़ लाइब्रेरी आंशिक रूप से उपयोगकर्ता-जमा की गई रिकॉर्डिंग से बनी है, जिनमें से कुछ मूल निर्माताओं की सहमति के बिना अपलोड किए गए थे।
- कंपनी ने अपनी आवाज़ हटाने की प्रक्रिया को स्वचालित किया है, सत्यापित दावे के बाद तीन मिनट से कम समय में हटाने का वादा करते हुए।
- Fish Audio 2025 के अंत तक एक ऑडियो-समझ मॉडल और एक स्पीच-टू-स्पीच मॉडल जारी करने की योजना बना रहा है।
पालो अल्टो का एक स्टार्टअप जो डेवलपर्स, गेम डिज़ाइनर और व्यवसायों को यथार्थवादी सिंथेटिक आवाज़ें उत्पन्न करने देता है, ने अभी शुरुआती चरण के फंडिंग का एक बड़ा इंजेक्शन सुरक्षित किया है, जो एआई वॉयस तकनीक के लिए निवेशकों की मजबूत भूख की पुष्टि करता है, भले ही क्षेत्र को किसकी आवाज़ किसकी है, इस बारे में कठिन सवालों से जूझना पड़ रहा है।
Fish Audio ने मंगलवार घोषणा की कि उसने 50 मिलियन डॉलर के सीड राउंड में 50 मिलियन डॉलर जुटाए हैं, जो कि शुरुआती फंडिंग का एक प्रकार है जो आमतौर पर किसी कंपनी ने बड़े पैमाने पर अपने आप को साबित करने से पहले आता है। Coreline Ventures और Capital Today ने राउंड का नेतृत्व किया, 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners और HF0 भी भाग ले रहे हैं।
Fish Audio वास्तव में क्या करता है?
कंपनी टेक्स्ट-टू-स्पीच मॉडल बनाती है, सॉफ्टवेयर जो लिखित शब्दों को बोली गई ऑडियो में परिवर्तित करता है, जिसमें अभिव्यक्ति और बारीक नियंत्रण पर ध्यान दिया जाता है। इसकी लाइब्रेरी 15,000 से अधिक प्राकृतिक-भाषा नियंत्रण प्रदान करती है, जिसका अर्थ है कि एक डेवलपर "घबराहट लेकिन आश्वस्त करने वाली ध्वनि" जैसी निर्देश लिख सकता है, बजाय तकनीकी स्लाइडर्स को समायोजित करने के।
Fish Audio ने पिछले साल पाँच मॉडल लॉन्च किए: चार स्पीच-जेनरेशन मॉडल और एक स्पीच-टू-टेक्स्ट मॉडल, जो विपरीत करता है और ऑडियो को लिखित पाठ में परिवर्तित करता है। तीन स्पीच मॉडल ओपन-सोर्स हैं, जिसका अर्थ है कि कोई भी कोड को स्वतंत्र रूप से डाउनलोड और उपयोग कर सकता है। इसका नवीनतम मॉडल, S2.1 Pro, केवल एक सशुल्क API के माध्यम से उपलब्ध है, एक प्रोग्रामिंग इंटरफेस जो अन्य ऐप्स को Fish Audio की तकनीक में प्लग करने देता है।
कंपनी अपनी जड़ें पूर्व Nvidia शोधकर्ता Shijia Liao की एक साइड प्रोजेक्ट में खोजती है। यह देखकर निराश कि सिंथेटिक आवाज़ें कितनी यांत्रिक लगती हैं, उन्होंने एक एकल GPU पर एक मॉडल को प्रशिक्षित किया, विशेष चिप जो भारी संख्या-क्रंचिंग करता है जो एआई को आवश्यक है, और कोड को सार्वजनिक रूप से पोस्ट किया। उस रिपॉज़िटरी को तब से GitHub पर 31,000 से अधिक स्टार मिले हैं, जो डेवलपर रुचि का एक मोटा माप है।
आज, भुगतान करने वाले ग्राहकों में HeyGen शामिल है, जो एआई अवतार को शक्ति देता है, और एंटरप्राइज़ वॉयस-एजेंट प्लेटफॉर्म। Fish Audio 21 मिलियन डॉलर की वार्षिक आवर्ती आय उत्पन्न करता है, पहली बार TechCrunch द्वारा रिपोर्ट किया गया।
क्या निर्माताओं को अपनी आवाज़ों के बिना अनुमति के उपयोग किए जाने के बारे में चिंतित होना चाहिए?
संभवतः हाँ। इस साल की शुरुआत में, कुछ कलाकारों ने दावा किया कि उनकी आवाज़ें Fish Audio के प्लेटफॉर्म पर उनकी सहमति के बिना दिखाई दीं। Fish Audio की वृद्धि की रणनीति का एक हिस्सा उपयोगकर्ताओं को मॉडल प्रशिक्षण के लिए आवाज़ें जमा करने के लिए कहना है, जब उनकी रिकॉर्डिंग का उपयोग किया जाता है तो योगदान के लिए मुआवजा दिया जाता है। सिस्टम विश्वास पर निर्भर करता है, और वह विश्वास टूट गया।
कंपनी ने तब से अपनी DMCA टेक-डाउन प्रक्रिया को स्वचालित किया है। DMCA, डिजिटल मिलेनियम कॉपीराइट अधिनियम, एक अमेरिकी कानून है जो निर्माताओं को ऑनलाइन प्लेटफॉर्म से अपनी कॉपीराइट सामग्री को हटाने की मांग करने के लिए एक औपचारिक मार्ग देता है। सीईओ Rissa Cao कहते हैं कि एक सत्यापित शिकायत अब तीन मिनट से कम समय में हटाने को ट्रिगर करती है।
प्रक्रिया में अंतर वास्तविक रहता है। कुछ भी किसी को दूसरे व्यक्ति की आवाज़ को उनके ज्ञान के बिना अपलोड करने से नहीं रोकता। आवाज़ तब तक लाइव रहती है जब तक प्रभावित निर्माता इसे खोज न ले और शिकायत दर्ज न करे।
Oskue Honda, लीड निवेशक Coreline Ventures के एक भागीदार, ने समस्या को सीधे स्वीकार किया: "सहमति, पारदर्शिता और विशेषता को उत्पाद में बनाया जाना चाहिए न कि बाद में सोचा जाना चाहिए।"
अगला क्या होता है?
Fish Audio अधिक उन्नत मॉडल विकसित करने और बड़े एंटरप्राइज़ क्लाइंट्स को आकर्षित करने के लिए फंडिंग का उपयोग करेगा। 2025 के लिए रोडमैप पर दो नए उत्पाद हैं: एक ऑडियो-समझ मॉडल, जो ऑडियो क्लिप के अर्थ और सामग्री की व्याख्या करेगा, और एक स्पीच-टू-स्पीच मॉडल जो एक बोली गई आवाज़ को वास्तविक समय में दूसरी में परिवर्तित करता है।
बाजार भीड़ है। ElevenLabs, WellSaid, Cartesia और Speechify सभी एक ही डेवलपर्स और व्यवसाय बजटों के लिए प्रतिस्पर्धा करते हैं। Fish Audio का तर्क है कि वह कम लागत पर अत्याधुनिक गुणवत्ता से मेल खा सकता है, आंशिक रूप से क्योंकि इसकी दुबली संस्थापन टीम प्रशिक्षण व्यय को कम रखती है।
सामान्य उपयोगकर्ताओं के लिए, व्यावहारिक निष्कर्ष सीधा है: किसी भी एआई ऑडियो प्लेटफॉर्म पर अपना नाम या आवाज़ खोजें जिसके लिए आपने स्पष्ट रूप से साइन अप नहीं किया है। यदि आप कुछ ढूंढते हैं, तो अधिकांश प्लेटफॉर्म के पास अब एक टेक-डाउन मार्ग है। Fish Audio का अब अधिकांश से तेज़ है।
सामान्य प्रश्न
क्या कोई कंपनी आपकी आवाज़ को आपसे पूछे बिना एआई को प्रशिक्षित करने के लिए कानूनी रूप से उपयोग कर सकती है?
अधिकांश क्षेत्राधिकारों में, नहीं। कॉपीराइट कानून और कुछ अमेरिकी राज्यों में, सार्वजनिकता अधिकार व्यक्तियों को अपनी आवाज़ के वाणिज्यिक उपयोग पर नियंत्रण देते हैं। कानूनी चित्र अभी भी विकसित हो रहा है, लेकिन किसी और की आवाज़ को सहमति के बिना अपलोड करना पहले से ही अपलोडर के लिए वास्तविक जोखिम रखता है।
सीड राउंड क्या है, और 50 मिलियन डॉलर इसके लिए बड़ी क्यों लगती है?
एक सीड राउंड स्टार्टअप का पहला औपचारिक बाहरी निवेश है, आमतौर पर उत्पाद बनाने और कर्मचारियों को नियुक्त करने के लिए उपयोग किया जाता है। पचास मिलियन डॉलर इस चरण में असामान्य रूप से बड़ा है, जो एआई बुनियादी ढांचे कंपनियों को बैक करने के लिए कितनी प्रतिस्पर्धा है इसे प्रतिबिंबित करता है, इससे पहले कि वे बाद के, अधिक महंगे फंडिंग राउंड तक पहुंचें।



