কমপ্যাক্ট মডেল দ্রুত ট্রান্সক্রিপশনের জন্য
২০২৬ সালের আগস্টের শেষে IBM ৪৭০ মিলিয়ন প্যারামিটার বিশিষ্ট দুটি নতুন স্পিচ রিকগনিশন মডেল উপস্থাপন করেছে — granite-speech-5.0-470m-turboctc এবং granite-speech-5.0-470m-turboctc-nc। উভয় ভেরিয়েন্টই কমপ্যাক্ট এবং লোকাল স্পিচ-টু-টেক্সটের জন্য তৈরি। -nc ভেরিয়েন্ট, যা বর্ধিত ডেটাসেটে প্রশিক্ষিত, CC-BY-NC-SA-4.0 লাইসেন্সে বিতরণ করা হয়, আর সাধারণ ভেরিয়েন্টটি Apache 2.0-এর অধীনে। লাইসেন্সের পছন্দ সরাসরি ডেটার সাথে সম্পর্কিত: ফ্রি ভেরিয়েন্ট কম উৎস ব্যবহার করে, তাই এটি বাণিজ্যিক পণ্যে এমবেড করা সহজ।

গতি: প্রতি সেকেন্ডে ৩.৫ ঘণ্টার বেশি
NVIDIA H200 অ্যাক্সেলারেটরে মডেলগুলো ১২,৬০০ RTFx-এর বেশি পারফরম্যান্স দেখায়। ব্যাচ প্রসেসিংয়ে এটি প্রতি সেকেন্ডে সাড়ে তিন ঘণ্টার বেশি বক্তৃতা টেক্সটে রূপান্তর করতে যথেষ্ট। এই ফলাফল নতুন আর্কিটেকচার এবং আউটপুট টেম্পো হ্রাসের মাধ্যমে নিশ্চিত করা হয়েছে। মডেলের কাজ দ্রুত মূল্যায়ন করতে IBM WebGPU-তে একটি স্ট্রিমিং ডেমো প্রস্তুত করেছে: এটি সরাসরি ব্রাউজারে চলে, তবে শুধুমাত্র Chrome এবং Edge সমর্থিত। ডেমোটি দেখায় যে সিস্টেমটি অডিও আসার সাথে সাথে কীভাবে বক্তৃতা শনাক্ত করে।
লিডারবোর্ড কী বলে
OpenASR লিডারবোর্ডের তথ্য অনুযায়ী, অ-বাণিজ্যিক মডেল granite-speech-5.0-470m-turboctc-nc-এর সমষ্টিগত WER ত্রুটি ৪.৮৫%, আর Apache-সংস্করণ granite-speech-5.0-470m-turboctc-এর ৫.০০%। বেশিরভাগ পরীক্ষায় -nc আরও নির্ভুল, বিশেষ করে SPGI Speech সেটে। তবে সেগমেন্টেড Earnings22-এ এটি ফ্রি সংস্করণের তুলনায় লক্ষণীয়ভাবে পিছিয়ে। FFASR লিডারবোর্ডে, যা ২০২৬ সালের ২৫ আগস্ট আপডেট করা হয়েছে, -nc পঞ্চম অবস্থানে, Apache-সংস্করণ নবম। এতে উভয় মডেলকে অংশগ্রহণকারীদের মধ্যে দ্রুততম বলা হয়েছে।
এনকোডার-অনলি আর্কিটেকচার
এই লাইনের আগের সংস্করণগুলোর বিপরীতে, নতুন মডেলগুলো আরও সহজ: এগুলোর আলাদা ভাষা মডিউল নেই। ভিত্তিতে রয়েছে ১৬টি Conformer ব্লক, এবং অষ্টম ব্লকের আউটপুটে self-conditioning প্রয়োগ করা হয়। Chunkwise attention গণনার দ্বিঘাত বৃদ্ধি রোধ করে, এবং প্রশিক্ষণ CTC-লস ন্যূনতম করে। আউটপুট স্ট্রিম পূর্বের এনকোডারগুলির ৫০ অক্ষরের পরিবর্তে প্রতি সেকেন্ডে ১২.৫ টোকেনে সংক্ষিপ্ত করা হয়েছে। মডেলগুলোর টোকেনাইজার আলাদা: granite-speech-5.0-470m-turboctc BPE ব্যবহার করে, আর granite-speech-5.0-470m-turboctc-nc — SentencePiece।
মূল log Mel-স্পেকট্রোগ্রামের ফ্রিকোয়েন্সি প্রতি সেকেন্ডে ১০০ ফ্রেম থেকে লক্ষ্যমাত্রা ১২.৫ টোকেনে কমাতে, ধাপ ২ সহ তিনটি সাবস্যাম্পলিং পর্যায় প্রয়োগ করা হয়। প্রথমে ফিচারগুলো reshape অপারেশনের মাধ্যমে প্যাক করা হয়, তারপর প্রথম দুটি Conformer-ব্লকে stride=2 সহ কনভোলিউশন থাকে। এই ধরনের ব্লকে অবশিষ্ট সংযোগগুলিও রেজোলিউশন হ্রাস করে — পার্শ্ববর্তী অবস্থানগুলির গড় করে।

কমপ্রোমাইজ এবং প্রয়োগ
ভাষা মডেল বাদ দেওয়া পূর্বের মডেলগুলির তুলনায় ২০ গুণের বেশি থ্রুপুট বৃদ্ধি দিয়েছে, আকারটি বিনয়ী — ৪৭০M প্যারামিটার — রয়ে গেছে। তবে এর জন্য LM যে ফাংশনগুলো দেয় তা ত্যাগ করতে হয়েছে: নতুন মডেলগুলো স্পিচ ট্রান্সলেশন এবং keyword biasing সমর্থন করে না। তাই এগুলোর মূল উদ্দেশ্য — "পেরিফেরিতে" উচ্চ-গতির ট্রান্সক্রিপশন, যেখানে কম লেটেন্সি গুরুত্বপূর্ণ, আর বিস্তৃত ভাষাগত ক্ষমতার প্রয়োজন নেই। প্রশিক্ষণের জন্য প্রাকৃতিক এবং সিন্থেটিক উভয় ডেটাই ব্যবহৃত হয়েছে; উন্মুক্ত উৎস থেকে ৪৪,৬০০ ঘণ্টার MLS ডেটাসেট ব্যবহার করা হয়েছে — এটি উভয় সংস্করণের জন্য প্রয়োগ করা হয়েছিল।
গতি এবং নির্ভুলতার এই সংমিশ্রণ মডেলগুলোকে রিয়েল-টাইম কাজের জন্য সুবিধাজনক করে তোলে: এগুলো সাবটাইটেল, মিটিং রেকর্ডিং এবং যেকোনো পরিস্থিতির জন্য উপযুক্ত যেখানে টেক্সট লোকালি বিলম্ব ছাড়া পেতে হয়।



