Model ringkas untuk transkripsi cepat
Pada akhir Agustus 2026, IBM memperkenalkan dua model pengenalan suara baru dengan masing-masing 470 juta parameter — granite-speech-5.0-470m-turboctc dan granite-speech-5.0-470m-turboctc-nc. Kedua varian ini ringkas dan ditujukan untuk speech-to-text lokal. Versi -nc, yang dilatih pada kumpulan data yang diperluas, didistribusikan di bawah lisensi CC-BY-NC-SA-4.0, sedangkan versi reguler menggunakan Apache 2.0. Pilihan lisensi terkait langsung dengan data: versi bebas menggunakan lebih sedikit sumber, sehingga lebih mudah diintegrasikan ke dalam produk komersial.

Kecepatan: lebih dari 3,5 jam per detik
Pada akselerator NVIDIA H200, model-model ini menunjukkan performa di atas 12.600 RTFx. Dengan pemrosesan batch, ini cukup untuk mengubah lebih dari tiga setengah jam ucapan menjadi teks dalam satu detik. Hasil ini dicapai berkat arsitektur baru dan pengurangan tempo keluaran. Untuk mengevaluasi kerja model dengan cepat, IBM menyiapkan demonstrasi streaming di WebGPU: demo ini berjalan langsung di browser, tetapi hanya mendukung Chrome dan Edge. Demo menunjukkan bagaimana sistem mengenali ucapan saat audio masuk.
Apa kata papan peringkat
Menurut data OpenASR Leaderboard, kesalahan WER agregat untuk model nonkomersial granite-speech-5.0-470m-turboctc-nc adalah 4,85%, sedangkan untuk versi Apache granite-speech-5.0-470m-turboctc — 5,00%. Pada sebagian besar pengujian, -nc lebih akurat, terutama pada kumpulan SPGI Speech. Namun, pada Earnings22 yang tersegmentasi, model ini terlihat kalah dibandingkan versi bebas. Dalam peringkat FFASR Leaderboard yang diperbarui pada 25 Agustus 2026, -nc menempati posisi kelima, sedangkan versi Apache — posisi kesembilan. Kedua model tersebut disebut sebagai yang tercepat di antara para peserta.
Arsitektur encoder-only
Berbeda dengan versi sebelumnya dari lini ini, model baru lebih sederhana: tidak memiliki modul bahasa terpisah. Dasarnya adalah 16 blok Conformer, dan pada keluaran blok kedelapan diterapkan self-conditioning. Chunkwise attention mencegah pertumbuhan komputasi kuadratik, dan pelatihan meminimalkan CTC-loss. Aliran keluaran dikurangi menjadi 12,5 token per detik, bukan 50 karakter seperti pada encoder sebelumnya. Tokenizer kedua model berbeda: granite-speech-5.0-470m-turboctc menggunakan BPE, sedangkan granite-speech-5.0-470m-turboctc-nc menggunakan SentencePiece.
Untuk mengurangi frekuensi log Mel-spektogram asli dari 100 frame per detik menjadi target 12,5 token, diterapkan tiga tahap subdisampling dengan langkah 2. Pertama, fitur dikemas menggunakan operasi reshape, kemudian pada dua blok Conformer pertama terdapat konvolusi dengan stride=2. Koneksi residual pada blok tersebut juga mengurangi resolusi — dengan merata-ratakan posisi yang berdekatan.

Kompromi dan penerapan
Penghapusan model bahasa menghasilkan peningkatan throughput lebih dari 20 kali lipat dibandingkan model sebelumnya, dengan ukuran yang tetap sederhana — 470M parameter. Namun, ini mengorbankan fungsi yang diberikan LM: model baru tidak mendukung terjemahan ucapan dan keyword biasing. Oleh karena itu, tujuan utamanya adalah transkripsi berkecepatan tinggi "di tepi", di mana latensi rendah penting dan kemampuan bahasa yang luas tidak diperlukan. Untuk pelatihan, digunakan data alami dan sintetis; dari sumber terbuka, digunakan dataset MLS dengan volume 44.600 jam — dataset ini dipakai untuk kedua versi.
Kombinasi kecepatan dan akurasi ini membuat model-model tersebut cocok untuk kerja real-time: model ini sesuai untuk subtitel, pencatatan rapat, dan skenario apa pun di mana teks perlu diperoleh secara lokal tanpa penundaan.



