Granite Speech 5.0 Turbo CTC: अल्ट्रा-फास्ट ट्रांसक्रिप्शन जिसकी सटीकता 4.85% WER तक है

10 सितम्बर 20262 बार देखा गया

IBM ने Granite Speech 5.0 Turbo CTC के दो मॉडल जारी किए हैं (प्रत्येक में 470 मिलियन पैरामीटर)। H200 एक्सेलेरेटर पर वे प्रति सेकंड 210 मिनट से अधिक ऑडियो को टेक्स्ट में बदलते हैं और खुले अंग्रेज़ी परीक्षणों में 4.85–5.00% की WER हासिल करते हैं; encoder-only डिज़ाइन एज डिवाइसों पर काम करने के लिए बनाया गया है।

Granite Speech 5.0 Turbo CTC: अल्ट्रा-फास्ट ट्रांसक्रिप्शन जिसकी सटीकता 4.85% WER तक है

कॉम्पैक्ट मॉडल तेज़ ट्रांसक्रिप्शन के लिए

अगस्त 2026 के अंत में, IBM ने 470 मिलियन पैरामीटर वाले दो नए स्पीच रिकग्निशन मॉडल पेश किए — granite-speech-5.0-470m-turboctc और granite-speech-5.0-470m-turboctc-nc। दोनों वेरिएंट कॉम्पैक्ट हैं और लोकल स्पीच-टू-टेक्स्ट के लिए डिज़ाइन किए गए हैं। विस्तारित डेटासेट पर प्रशिक्षित -nc वर्जन, CC-BY-NC-SA-4.0 लाइसेंस के तहत वितरित किया जाता है, जबकि सामान्य वर्जन Apache 2.0 के तहत उपलब्ध है। लाइसेंस का चुनाव सीधे डेटा से जुड़ा है: मुफ्त वर्जन कम स्रोतों का उपयोग करता है, इसलिए इसे कमर्शियल प्रोडक्ट्स में एम्बेड करना आसान है।

गति: प्रति सेकंड 3.5 घंटे से अधिक

NVIDIA H200 एक्सेलेरेटर पर, मॉडल 12,600 RTFx से अधिक का प्रदर्शन दिखाते हैं। बैच प्रोसेसिंग के साथ, यह एक सेकंड में साढ़े तीन घंटे से अधिक की भाषण को टेक्स्ट में बदलने के लिए पर्याप्त है। यह परिणाम नई आर्किटेक्चर और कम आउटपुट रेट द्वारा संभव हुआ है। मॉडल के प्रदर्शन का तुरंत आकलन करने के लिए, IBM ने WebGPU पर एक स्ट्रीमिंग डेमो तैयार किया है: यह सीधे ब्राउज़र में चलता है, लेकिन केवल Chrome और Edge समर्थित हैं। डेमो दिखाता है कि सिस्टम ऑडियो आने पर भाषण को कैसे पहचानता है।

लीडरबोर्ड क्या कहते हैं

OpenASR लीडरबोर्ड के डेटा के अनुसार, गैर-कमर्शियल मॉडल granite-speech-5.0-470m-turboctc-nc के लिए एग्रीगेटेड WER त्रुटि 4.85% है, और Apache-वर्जन granite-speech-5.0-470m-turboctc के लिए 5.00% है। अधिकांश परीक्षणों में -nc अधिक सटीक है, विशेष रूप से SPGI Speech डेटासेट पर। हालाँकि, सेगमेंटेड Earnings22 पर, यह मुफ्त वर्जन से काफी पीछे है। FFASR लीडरबोर्ड में, जो 25 अगस्त 2026 को अपडेट किया गया था, -nc पांचवें स्थान पर है, Apache-वर्जन नौवें स्थान पर है। दोनों मॉडलों को प्रतिभागियों में सबसे तेज़ बताया गया है।

एनकोडर-ओनली आर्किटेक्चर

इस लाइन के पिछले वर्जन के विपरीत, नए मॉडल सरल हैं: उनके पास अलग लैंग्वेज मॉड्यूल नहीं है। आधार में 16 Conformer ब्लॉक हैं, और आठवें ब्लॉक के आउटपुट पर self-conditioning लागू किया जाता है। Chunkwise attention क्वाड्रेटिक कंप्यूटेशनल ग्रोथ को रोकता है, और प्रशिक्षण CTC-लॉस को कम करता है। आउटपुट स्ट्रीम को पिछले एनकोडर के 50 कैरेक्टर के बजाय 12.5 टोकन प्रति सेकंड तक कम कर दिया गया है। मॉडल के टोकनाइज़र अलग हैं: granite-speech-5.0-470m-turboctc BPE का उपयोग करता है, जबकि granite-speech-5.0-470m-turboctc-nc SentencePiece का उपयोग करता है।

मूल log Mel-स्पेक्ट्रोग्राम की दर को 100 फ्रेम प्रति सेकंड से घटाकर 12.5 टोकन प्रति सेकंड करने के लिए, स्ट्राइड 2 के साथ तीन सबसैंपलिंग चरणों का उपयोग किया जाता है। पहले, फीचर्स को reshape ऑपरेशन द्वारा पैक किया जाता है, फिर पहले दो Conformer-ब्लॉक में stride=2 वाले कन्वोल्यूशन होते हैं। ऐसे ब्लॉकों में अवशिष्ट कनेक्शन भी रिज़ॉल्यूशन को कम करते हैं — पड़ोसी पोजीशन के औसत से।

समझौते और अनुप्रयोग

लैंग्वेज मॉडल को हटाने से पहले के मॉडल की तुलना में 20 गुना से अधिक थ्रूपुट में वृद्धि हुई है, जबकि आकार मामूली बना हुआ है — 470M पैरामीटर। लेकिन इसके लिए LM द्वारा प्रदान की जाने वाली सुविधाओं का त्याग करना पड़ा: नए मॉडल स्पीच ट्रांसलेशन और कीवर्ड बायसिंग का समर्थन नहीं करते हैं। इसलिए, उनका मुख्य उद्देश्य "एज" पर हाई-स्पीड ट्रांसक्रिप्शन है, जहां कम विलंबता महत्वपूर्ण है और व्यापक भाषा क्षमताओं की आवश्यकता नहीं है। प्रशिक्षण के लिए प्राकृतिक और सिंथेटिक दोनों डेटा का उपयोग किया गया था; खुले स्रोतों से, MLS डेटासेट का उपयोग 44,600 घंटे की मात्रा में किया गया था — यह दोनों वर्जन के लिए लागू किया गया था।

गति और सटीकता का यह संयोजन मॉडल को रीयल-टाइम कार्यों के लिए उपयुक्त बनाता है: वे सबटाइटल, मीटिंग रिकॉर्डिंग और किसी भी परिदृश्य के लिए उपयुक्त हैं जहां टेक्स्ट को बिना देरी के लोकल रूप से प्राप्त करने की आवश्यकता होती है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
Granite Speech 5.0 Turbo CTC: अल्ट्रा-फास्ट ट्रांसक्रिप्शन जिसकी सटीकता 4.85% WER तक है