NVIDIA Magpie TTS: अल्ट्रा कम विलंबता के साथ ओपन सोर्स बहुभाषी वॉयस एजेंट

21 अगस्त 202611 बार देखा गया

NVIDIA से एक नया ओपन-वेट मॉडल 12 भाषाओं का समर्थन करता है और आपको अपने हार्डवेयर पर भाषण संश्लेषण को तैनात करने देता है। अनुकूलित आविष्कार के लिए धन्यवाद, पहला ऑडियो B200 त्वरक पर सिर्फ 32 एमएस में दिखाई देता है, जिससे प्राकृतिक वास्तविक समय संवाद सक्षम हो जाता है।.

NVIDIA Magpie TTS: अल्ट्रा कम विलंबता के साथ ओपन सोर्स बहुभाषी वॉयस एजेंट

वॉयस एजेंट की दुनिया में, विलंबता मुख्य मुद्रा है। जबकि उपयोगकर्ता प्रतिक्रिया के लिए इंतजार करता है, सहायक तीन कार्य करता है: भाषण को पहचानना, जवाब की सोच और आवाज जवाब को संश्लेषित करना। यदि प्रत्येक चरण दसियों मिलीसेकेंड को खाता है, तो संवाद अब जीवित महसूस नहीं करता है। हाल के NVIDIA रिलीज़ ने अगस्त 2026 में घोषणा की थी, यह दर्शाता है कि भाषण संश्लेषण अब बछड़े नहीं है: NVIDIA Magpie TTS मॉडल एक शीर्ष स्तरीय त्वरक पर 32 मिलीसेकेंड में पहला ऑडियो फ्रेम वितरित करता है और बारह भाषाओं को बोलता है।

क्या है और क्यों यह मायने रखता है

NVIDIA Magpie TTS 364 मिलियन मापदंडों के साथ एक खुला पाठ-से-भाषा प्रणाली है। यह सिर्फ एक शोध चेकपॉइंट नहीं है: उत्पादन के लिए, NVIDIA NVIDIA NIM सेवा स्टैक प्रदान करता है, जो आपको अपने सर्वर पर बहुभाषी संश्लेषण को तैनात करने देता है - जहां आपकी कंपनी का डेटा रहता है।

वर्तमान संस्करण 12 भाषाओं का समर्थन करता है: अंग्रेजी, स्पेनिश, फ्रेंच, जर्मन, इतालवी, वियतनामी, मंदारिन, हिंदी, जापानी, प्लस तीन नए जोड़ - अरबी, कोरियाई और ब्राजील पुर्तगाली। मौजूदा भाषाओं को भी अपग्रेड किया गया था: प्रशिक्षण डेटा को ताज़ा किया गया था और मॉडल को परिष्कृत किया गया था, इसलिए वास्तुकला को बदलने के बिना भाषण की गुणवत्ता में सुधार हुआ।

एक दिलचस्प विवरण: आवाज प्रति भाषा अलग संस्थाओं के रूप में संरचित नहीं हैं, लेकिन वक्ताओं का एक साझा बहुभाषी प्रतिनिधित्व के रूप में। एक "स्पीकर" प्रत्येक भाषा के लिए उपलब्ध पुरुष और महिला वेरिएंट के साथ सभी समर्थित भाषाओं को बोल सकता है। यह उन उत्पादों के लिए सुविधाजनक है जिन्हें एकाधिक क्षेत्रों में एक ब्रांड की आवाज की आवश्यकता होती है।

कोड-स्विचिंग - जब एक स्पीकर एक वाक्यांश के भीतर भाषाओं के बीच स्विच करता है - विशेष उल्लेख के योग्य होता है। हिंदी और जापानी के लिए, यह समर्थन विस्तारित किया गया था: एक आईपीए-आधारित grapheme-to-phoneme कनवर्टर और अनुकूलन उच्चारण शब्दकोशों का उपयोग किया जाता है।

क्या यह सब के बारे में था

प्रकाशित सामग्री में एनवीआईडीआईए एनआईएम का उपयोग करके एनवीआईडीआईए के अपने जीपीयू पर किए गए प्रदर्शन माप शामिल हैं। प्रमुख मीट्रिक TTFA (पहले ऑडियो के अनुरोध से समय) और RTFX (वास्तविक समय की तुलना में कई बार तेजी से मॉडल उत्पन्न होता है) हैं। डेटा तीन रनों का औसत है।

त्वरकTTFA, 1 धाराRTFX, 1 स्ट्रीमTTFA, 64 स्ट्रीमRTFX, 64 स्ट्रीम
NVIDIA B20032 ms12.1 ×239 ms319.81 ×
NVIDIA H10047 ms14.7 ×275 ms290.79 ×
DGX स्पार्क53 ms9.8 ×962 ms75.88 ×
NVIDIA A10079 ms12.2 ×395 ms197 ×

इन संख्याओं का मतलब क्या है?

  • एकल बातचीत। एक एकल स्ट्रीम पर, पहला ऑडियो जीपीयू के आधार पर 32-79 एमएस में आता है। प्राकृतिक संवाद के लिए, अनुशंसित अंत से अंत विलंबता बजट लगभग 200 मीटर है। भाषण मान्यता और भाषा मॉडल भी समय लेते हैं, लेकिन जब टीटीएस 32 एमएस (बी 200 के रूप में) के भीतर फिट बैठता है, तो संश्लेषण लगभग समग्र तस्वीर को प्रभावित करता है - बाकी बजट को एएसआर और एलएलएम को आवंटित किया जा सकता है।
  • कई समानांतर बातचीत। B200 पर 64 समवर्ती धाराओं के साथ, पहली ऑडियो के लिए समय 239 एमएस तक बढ़ता है, लेकिन थ्रूपुट लगभग 320 × वास्तविक समय तक पहुंचता है। दूसरे शब्दों में, मॉडल नाटकों की तुलना में सैकड़ों बार बोलने के एक मिनट को सिंक्रनाइज़ करता है - एक सर्वर पूरे कॉल सेंटर को संभाल सकता है।

एक महत्वपूर्ण बारीकी: एक ही वजन के साथ एक चेकपॉइंट पर उपलब्ध है Hugging Face - यह अनुसंधान और ठीक ट्यूनिंग के लिए है। हालांकि, माप NVIDIA NIM, यानी अनुकूलित उत्पादन स्टैक के माध्यम से तैनाती का उल्लेख करते हैं। यदि आपको लोड के तहत अनुमानित विलंबता की आवश्यकता है, तो एनआईएम क्या आप पर भरोसा करना चाहिए।

कैसे मॉडल इतनी तेजी से होने का प्रबंधन करता है

स्पीड दो वास्तुशिल्प परिवर्तनों का परिणाम है।

  • फ्रेम स्टैकिंग। डिकोडर अब एक के बजाय प्रति कदम दो ऑडियो फ्रेम की भविष्यवाणी करता है। डिकोडर पुनरावृत्ति की संख्या को हल किया जाता है, जिसका मतलब प्रत्येक भाषण खंड के लिए आधे गणना कार्य है।
  • स्थानीय ट्रांसफार्मर। ध्यान तंत्र एक ही बार में पूरे अनुक्रम के बजाय स्थानीय संदर्भों के साथ काम करता है। यह लंबे ऑडियो पर कम्प्यूटेशनल जटिलता को कम करता है और हस्तक्षेप को गति देता है। उसने कहा, लेखक वास्तुकला के इस हिस्से के विवरण का वर्णन करते हैं, बल्कि स्पायरिंग भी।

साथ में, ये परिवर्तन अपेक्षाकृत सस्ती हार्डवेयर पर भी मिलीसेकंड के दसियों में विलंबता रखते हैं।

एक काले बॉक्स के बजाय कास्केड

आवाज उत्पादों के डेवलपर्स को अक्सर एकीकृत भाषण मॉडल की पेशकश की जाती है: एक एपीआई कॉल और आपको मान्यता, संश्लेषण और मॉडल की प्रतिक्रिया भी मिलती है। यह सरल दिखता है, लेकिन इस दृष्टिकोण में डाउनसाइड है: आप किसी अन्य के लिए एक घटक को स्वैप नहीं कर सकते, ठीक-ट्यून एक एकल परत, डेटा रेजीडेंसी आवश्यकताओं को पूरा कर सकते हैं, या यहां तक कि यह भी समझ सकते हैं कि विलंबता कहाँ होती है।

एक cascaded वास्तुकला - जहां भाषण मान्यता (ASR), भाषा मॉडल (LLM), और संश्लेषण (TTS)) अलग-अलग सेवाओं के रूप में काम करते हैं - इन समस्याओं को हल करते हैं। प्रत्येक परत को स्वतंत्र रूप से कॉन्फ़िगर, अद्यतन और स्केल किया जा सकता है। NVIDIA Magpie TTS के खुले वजन और NVIDIA NIM कंटेनर के रूप में इसकी उपलब्धता इस दृष्टिकोण को यथार्थवादी बनाती है: आप अपने डेटा के बगल में सिंथेसाइज़र को तैनात करते हैं और बाहरी API को कॉल किए बिना पूर्वानुमान योग्य विलंबता प्राप्त करते हैं।

इसे कहाँ लागू करें

कुछ परिदृश्य हैं जहां स्थानीय तैनाती विकल्पों के साथ तेजी से बहुभाषी टीटीएस व्यावहारिक मूल्य प्रदान करता है:

  • ग्राहक समर्थन आवाज एजेंट - विशेष रूप से कई देशों में काम करने वाले लोग;
  • चिकित्सा सहायक, जहां डेटा गोपनीयता महत्वपूर्ण है;
  • उद्यम copilots कंपनी वर्कफ़्लो में एम्बेडेड;
  • अनुवाद प्रणाली पाठ के बजाय वॉयस आउटपुट की आवश्यकता है;
  • संवादात्मक एआई अनुप्रयोग जहां विलंबता सीधे उपयोगकर्ता अनुभव को प्रभावित करती है।

इन सभी उपयोग मामलों में आम डिनोमिनेटर तैनाती की आवश्यकता है: डेटा को संगठन की परिधि, उच्चारण और आवाज को उत्पाद को अनुकूलित करने की आवश्यकता नहीं होनी चाहिए, और लोड के तहत व्यवहार की भविष्यवाणी करना चाहिए। यह वास्तव में क्या नया NVIDIA Magpie TTS जारी पते: एक खुला मॉडल, उन्नत बहुभाषी समर्थन, न्यूनतम विलंबता, और प्रबंधित क्लाउड सेवा पर कोई निर्भरता नहीं है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
NVIDIA Magpie TTS: बहुभाषी तंत्रिका नेटवर्क का अवलोकन