Granite Speech 5.0 Turbo CTC: نسخ فائق السرعة بدقة تصل إلى 4.85% WER

10 سبتمبر 20262 الآراء

أصدرت IBM نموذجين من Granite Speech 5.0 Turbo CTC (470 مليون معلمة لكل منهما). على مسرّع H200، يحوّلان أكثر من 210 دقائق من الصوت إلى نص في الثانية ويحققان معدل خطأ في الكلمات (WER) يتراوح بين 4.85% و5.00% في الاختبارات الإنجليزية المفتوحة؛ صُمم التصميم القائم على المشفر فقط للعمل على الأجهزة الطرفية.

Granite Speech 5.0 Turbo CTC: نسخ فائق السرعة بدقة تصل إلى 4.85% WER

نماذج مدمجة للنسخ السريع

في نهاية أغسطس 2026، كشفت IBM عن نموذجين جديدين للتعرف على الكلام يضم كل منهما 470 مليون معامل — granite-speech-5.0-470m-turboctc و granite-speech-5.0-470m-turboctc-nc. كلا الإصدارين مدمجان ومصممان للتحويل المحلي من الكلام إلى نص. الإصدار -nc، الذي تم تدريبه على مجموعة بيانات موسعة، يُوزَّع بموجب ترخيص CC-BY-NC-SA-4.0، بينما الإصدار العادي متاح بموجب Apache 2.0. يرتبط اختيار الترخيص ارتباطًا مباشرًا بالبيانات: الإصدار الحر يستخدم مصادر أقل، لذا يسهل دمجه في المنتجات التجارية.

السرعة: أكثر من 3.5 ساعات في الثانية

على مسرع NVIDIA H200، تُظهر النماذج أداءً يتجاوز 12,600 RTFx. مع المعالجة المجمّعة، يكفي هذا لتحويل أكثر من ثلاث ساعات ونصف من الكلام إلى نص في ثانية واحدة. هذا الناتج يتحقق بفضل البنية الجديدة وتقليل معدل الإخراج. لتقييم أداء النموذج بسرعة، أعدّت IBM عرضًا توضيحيًا متدفقًا على WebGPU: يعمل مباشرة في المتصفح، لكنه يدعم Chrome وEdge فقط. يُظهر العرض كيف يتعرف النظام على الكلام أثناء تدفق الصوت.

ماذا تقول لوحات المتصدرين

وفقًا لبيانات OpenASR Leaderboard، يبلغ متوسط خطأ WER المجمّع للنموذج غير التجاري granite-speech-5.0-470m-turboctc-nc نسبة 4.85%، بينما يبلغ لإصدار Apache granite-speech-5.0-470m-turboctc نسبة 5.00%. في معظم الاختبارات، يكون -nc أكثر دقة، خاصة على مجموعة SPGI Speech. ومع ذلك، على مجموعة Earnings22 المجزأة، يتخلف بشكل ملحوظ عن الإصدار الحر. في تصنيف FFASR Leaderboard، الذي حُدِّث في 25 أغسطس 2026، يحتل -nc المركز الخامس، بينما يحتل إصدار Apache المركز التاسع. مع ذلك، وُصِف كلا النموذجين بأنهما الأسرع بين المشاركين.

بنية encoder-only

على عكس الإصدارات السابقة من هذه السلسلة، فإن النماذج الجديدة أبسط في التصميم: لا تحتوي على وحدة لغوية منفصلة. الأساس هو 16 كتلة Conformer، مع تطبيق self-conditioning عند مخرج الكتلة الثامنة. تمنع Chunkwise attention النمو التربيعي في الحسابات، بينما يقلل التدريب من خسارة CTC. تم تقليص دفق الإخراج إلى 12.5 رمزًا في الثانية بدلاً من 50 حرفًا في المشفرات السابقة. أدوات الترميز مختلفة بين النموذجين: granite-speech-5.0-470m-turboctc يستخدم BPE، بينما granite-speech-5.0-470m-turboctc-nc يستخدم SentencePiece.

لتقليل معدل طيف Mel اللوغاريتمي الأصلي من 100 إطار في الثانية إلى 12.5 رمزًا مستهدفًا، تُستخدم ثلاث مراحل من الاختزال بخطوة مقدارها 2. أولاً، تُعبَّأ الميزات بعملية reshape، ثم في أول كتلتين من Conformer تُستخدم التلافيف بخطوة stride=2. التوصيلات المتبقية في هذه الكتل تقلل الدقة أيضًا — عبر متوسط المواضع المجاورة.

المقايضات والتطبيقات

الاستغناء عن النموذج اللغوي حقق زيادة في الإنتاجية تتجاوز 20 ضعفًا مقارنة بالنماذج الأقدم، مع بقاء الحجم متواضعًا — 470M معامل. لكن هذا جاء على حساب الوظائف التي يوفرها LM: الإصدارات الجديدة لا تدعم ترجمة الكلام أو keyword biasing. لذلك، الغرض الأساسي منها هو النسخ عالي السرعة "على الحافة"، حيث تكون زمن الاستجابة المنخفض مهمًا ولا تتطلب إمكانيات لغوية واسعة. للتدريب، استُخدمت بيانات طبيعية واصطناعية على حد سواء؛ ومن المصادر المفتوحة، استُخدمت مجموعة بيانات MLS بحجم 44,600 ساعة — وقد طُبقت على كلا الإصدارين.

هذا المزيج من السرعة والدقة يجعل النماذج مناسبة للعمل في الوقت الفعلي: فهي مثالية للترجمات المصاحبة، وتسجيل الاجتماعات، وأي سيناريوهات تتطلب الحصول على النص محليًا دون تأخير.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
Granite Speech 5.0 Turbo CTC: نسخ فائق السرعة بدقة تصل إلى 4.85% WER