Whisper Large V3
النسخة الثالثة من نظام التعرف على الخطابات المفتوحة المصدر بدعم 99 لغة.
لمحة عامة
Whisper Large V3
Description of the Whisper Large V3 neural network
Whisper Large V3 is the third version of an open-source automatic speech recognition (ASR) system developed by OpenAI. ويجري تدريب هذا النموذج على 000 680 ساعة من البيانات السمعية بـ 99 لغة في جميع أنحاء العالم، بما في ذلك الروسية. وبفضل التدريب على نطاق واسع وبنية التحول، يُظهر ويسبر لارج ف-3 درجة عالية من الدقة حتى في ظروف الضجيج واللكنات والخطاب غير الواضح.
The neural network is available for free local use through the faster-whisper or marginal.cpp tools, as well as through the paid OpenAI API and free access from Groq. الرمز المصدري للنموذج مفتوح تحت ترخيص معهد ماساتشوستس للتكنولوجيا يسمح للمطورين بدمجه في مشاريعهم دون قيود
مواصفات طراز Whisper Large V3
| الخصائص | القيمة |
|---|---|
| النوع | الوسائط المتعددة |
| الفئة | Voice, API, Open Source |
| المطور | OpenAI |
| تاريخ الإصدار | 6 تشرين الثاني/نوفمبر 2023 |
| اللغات الداعمة | 99 لغة، منها الروسية |
| الترخيص | MIT, open source |
| التوافر | OpenAI API, Groq, Hugging وجه النشر المحلي |
من هي شبكة (ويسبر لارج ف3) العصبية المناسبة؟
صانعو الوحدات وأجهزة البث
Whisper Large V3 is an excellent tool for creating text transcripts of podcasts, videos, and audio recordings. زيادة الدقة والدعم لـ 99 لغة تسمح لك بسرعة الحصول على الترجمات الفرعية الجاهزة أو الملخصات.
الباحثون والمربون
والنموذج مناسب لترجمة المقابلات والمحاضرات والحلقات الدراسية والمناقشات العلمية. The open-source code and the ability to run locally are especially important for researchers working with confidential audio data that cannot be uploaded to third-party services.
المطورون والمهندسون
Whisper Large V3 integrates into audio processing pipelines via Python Library (faster-whisper) or a C++ implementation (whisper.cpp). ويمكن للمطورين أن يدمجوا في تطبيقاتهم، أو خدمات المدخلات الصوتية، أو الدردشة.
الصحفيون والمحررون
وللحصول على دقائق في المؤتمرات الصحفية، وترجمة المقابلات، وتحرير المواد السمعية، يوفر النموذج حلا حرا وسريعا دون الاعتماد على أطراف ثالثة
كيف تستخدم الشبكة العصبية (ويسبر لارج ف-3)؟
النشر المحلي عن طريق جهاز إنذار أسرع
الطريقة الأكثر شعبية لإدارة (ويسبر لارج ف 3) هي استخدام مكتبة أسرع للبدء، تركيبه عن طريق الرزم:
إثبت بسرعة
ثمّ يَستوردُ النموذجَ، يَحْملُ النسخةَ الكبيرةَ 5، ويَدْعو طريقة التسلل مع الطريق إلى ملف صوتي The model will automatically detect the language and perform transcription.
النشر المحلي عن طريق الهمس(ج)
وبالنسبة لمستخدمي النوافذ، يوصى باستخدام WSL2 أو الهمس المكسور مسبقا. ويتيح هذا التنفيذ من الفئة " جيم ++ " أداءً عالياً واستهلاكاً منخفضاً للذاكرة، مما يجعل من المناسب تشغيله حتى على أجهزة بدون وحدة قوية من نوع GPU.
مستخدمة عن طريق API
Whisper Large V3 is available through the OpenAI API (paid, $0.006 per minute of audio), as well as through free access from Groq with limitations. On HuggingFace, the model can be downloaded and tested directly on the platform without local installation.
السمات الرئيسية لـ (ويسبر لارج ف-3)
كشف اللغة الآلية
ويمكن للنموذج أن يعترف بصورة مستقلة بلغة التسجيل الصوتي دون تشكيلة مسبقة. وهذا ملائم بصفة خاصة عند العمل مع الحوارات المتعددة اللغات أو عندما يكون غير معروف اللغة التي يسجل بها الخطاب.
ترجمة الصوت إلى الإنكليزية
وأثناء التصفيق، يمكن لـ(ويسبر لاج ف-3) ترجمة الخطاب في آن واحد إلى الإنكليزية. وهذا مفيد للعمل بالتسجيلات الصوتية بلغات نادرة أو لإنشاء عنوان فرعي باللغة الانكليزية.
مقاومة التدخل
ويحافظ النموذج على نوعية عالية من الاعتراف مع ضوضاء خلفية، وعدم وضوح القاموس، واللكنات، وضعف نوعية التسجيل. This is one of the key differences from many other ASR systems that sharply lose accuracy in difficult acoustic conditions.
(أ) مزايا (ويسبر لارج ف-3
أفضل نوعية بين النماذج المفتوحة
ويبيّن جهاز " Whisper Large V3 " أفضل مؤشرات دقة مفصّلة بين جميع الحلول المتاحة من مصادر مفتوحة باللغات الـ 99 المدعومة. وفيما يتعلق بتسجيلات الاستوديوهات النظيفة بالروسية، تبلغ نسبة الطوارئ حوالي 5 إلى 10 في المائة، وهو ما يماثل النظم التجارية.
رمز المصدر المفتوح الكامل
The model is distributed under the MIT license. وهذا يعني أنه يمكن تشغيلها محليا دون تكلفة، وتعديلها لمهامكم الخاصة، وإدماجها في مشاريع تجارية بدون رسوم ترخيص.
تعدد اللغات بدون تشكيلة إضافية
:: دعم 99 لغة والكشف التلقائي للغة القضاء على الحاجة إلى التحديد المسبق للغة التسجيل أو تغيير نماذج اللغات المختلفة. This significantly simplifies the work flow.
Disadvantages of Whisper Large V3
لا دعم وطني في الوقت الحقيقي
The standard implementation of Whisper Large V3 is not designed for real-time transcription. ومع ذلك، هناك عمليات تنفيذية (الحياة الخالصة، ويسبركس)، ومن خلال مبادرة غروك للآداب، فإن الرطوبة تقل عن ثانية.
الاحتياجات العالية من الخدمات العامة
التجهيز السريع للملفات الصوتية الكبيرة يتطلب مجهزاً للرسوم البيانية ويمكن أن يستغرق تجهيز التسجيلات الطويلة وقتا أطول بكثير في وحدة تحليل البرامج.
الهلوسة أثناء الصمت
ويدرج النموذج أحيانا كلمات وعبارات غير موجودة في أجزاء من الصمت أو مستويات ضوضاء منخفضة. وهذه مشكلة مشتركة في العديد من نظم إصلاح قطاع الخدمات وينبغي أخذها في الاعتبار عند تحقيق نتائج ما بعد التجهيز.
الصيغة الثابتة
Whisper Large V3 has not been updated since its release in November 2023. ولا يعرف النموذج المصطلحات والأسماء والمفاهيم الجديدة التي ظهرت بعد ذلك التاريخ. وقد يلزم إجراء تعديل إضافي للتعرف على المفردات الحديثة.
ما المهمات التي حلها (ويسبر لارج في 3)؟
تسلسل المطبوعات والمقابلات
ويتمثل الاستخدام الرئيسي للنموذج في تحويل التسجيلات الصوتية للمقابلات والتنبؤات والمحاضرات والاجتماعات إلى نصوص. وبفضل الدعم لـ 99 لغة، يتعامل ويسبر لارج ف-3 مع المحتوى المتعدد اللغات دون تغيير النماذج.
إنشاء الترجمة
النموذج يُمكِنُك أَنْ تُولّدَ بسرعة ترجمات فيديو بعشرات اللغاتِ. وتسمح سمة الترجمة المدمجة في اللغة الانكليزية بخلق ترجمات فرعية ثنائية اللغة لجمهور دولي.
الوصف الآلي
أما بالنسبة للصحفيين، والأمناء، والمساعدين، فيمكن لـ (ويسبر لارج ف-3) أن يسيّر تسجيل الاجتماعات والمؤتمرات الصحفية، ويوفّر ساعات العمل اليدوي.
سعر العجلة V3
Whisper Large V3 is available under a freemium model. ويمكن أن يكون النموذج مجانيا تماما على الصعيد المحلي باستخدام ما هو أسرع أو يهمس - لا توجد قيود على الحجم الصوتي أو وقت التجهيز.
وبالنسبة للذين يفضلون الوصول السحابي، يقدم المعهد الوطني للبحث والتدريب معلومات إضافية بمعدل 0.006 دولار للدقيقة الصوتية. وهناك أيضاً إمكانية الوصول بحرية عن طريق غروك مع فرض قيود (حد أقصى لعدد الطلبات لكل وحدة زمنية). On the HuggingFace platform, the model can be tested free of charge in a limited mode.
مدة استخدام العجلة V3
وبفضل رخصة معهد ماساتشوستس للتكنولوجيا، يمكن استخدام ويسبر لارج ف-3 لأي غرض، بما في ذلك لأغراض تجارية، دون دفع الإتاوات للمطور. قانون المصادر المفتوحة يسمح بتعديل النموذج، وتعديله على بياناتك الخاصة، وتوزيع التغييرات.
وتطبق شروط الخدمة الموحدة المفتوحة، عند استخدامها للمبادرة، بما في ذلك رسم لكل طلب. وعند استخدام غروك، تطبق قيوده الخاصة على حرية الوصول.
Wisper Large V3 availability
والنموذج متاح من خلال عدة قنوات:
- OpenAI API - الوصول المدفوع الأجر، والإدماج السهل، وليس هناك حاجة إلى موارد محلية.
- Groq - حرية الوصول إلى الحدود، والاختبارات القصوى.
- HuggingFace - اختبار الغيوم الحر، استضافة النموذج.
- النشر المحلي - عن طريق جهاز " بايتون " أسرع أو يهمس.
Whisper Large V3 supports 99 languages, including Russian, making it one of the most languages open ASR models on the market.
How Whisper Large V3 differs from alternatives
رمز المصدر المفتوح وحرية الوصول
وخلافاً للحلول الخاصة (مثلاً، Google Speech-to-Text أو Azure Speech)، فإن Whisper Large V3 مفتوحة تماماً ومجانية للاستخدام المحلي. ويكتسي هذا الأمر أهمية خاصة بالنسبة للبدء والباحثين والشركات ذات المتطلبات الصارمة المتعلقة بسرية البيانات.
جودة الاعتراف في 99 لغة
وتساند معظم نماذج تعميم مراعاة المنظور الجنساني المفتوحة المصدر مجموعة محدودة من اللغات أو تكون أقل دقة بكثير من اللغات النادرة. Whisper Large V3 is trained on 680,000 hours of languages audio data and shows high quality even in languages with limited speech corpora.
الترجمة التحريرية
القدرة على ترجمة الصوت إلى اللغة الانكليزية أثناء التصفيق هي سمة فريدة من نوعها من سمات ويسبر لارج ف-3 بين النماذج المفتوحة المتاحة دون تدريب إضافي أو إدماج مترجمين خارجيين.
خاتمة
ويسبر لارج ف-3 هو واحد من أقوى نظم التعرف على الخطابات المفتوحة المتاحة اليوم. وهو يجمع بين الدقة العالية في التدوين ب99 لغة، ومقاومة الضجيج، وإتمام الوصول المجاني عند استخدامه محليا. على الرغم من بعض العيوب، عدم وجود تجهيزات للمجاري المحلية، متطلبات عالية من وحدة تحديد المواقع، والطبيعة الثابتة للنموذج، ويسبر لاج ف-3 لا يزال أفضل خيار لترجمة المطبوعات، والمقابلات، والمحاضرات، وأي تسجيلات صوتية أخرى عندما تكون النوعية والاستقلالية من مقدمي السحابة.
الطباعة
الأسئلة المتكررة
أدوات مماثلة للمبادرة
انظر أيضا

وكيل تنفيذي نهائي للبرمجة يتكيف ديناميا مع مهام المطورين.

(إيمي) هي خدمة تخلق تلقائياً الموسيقى وأجهزة الصوت للفيديو عن طريق تحليل لقطات الفيديو.

خدمة التسجيل التلقائي للصوت والفيديو في النص بدعم أكثر من 100 لغة.

خدمة على الإنترنت لخلق صوت واقعي مستنسخ من تسجيل صوتي قصير ومن النص إلى الكلام.

(أداة الإنترنت المجانية من (جوجل التي تستخدم تعلم الآلات لتحويل الرسومات التقريبية إلى إيزوات ورسوم توضيحية.

منصة لتأهيل تطوير البرمجيات باستخدام مبني بصري لعموم (آي آي).

تمديد الكروم الذي يساعد على إدارة التذاكر، والتاريخ، والعلامات الكتابية مع مساعد آي.

Web platform for AI-powered image and cinematic video generation, featuring Australian-grade editing tools.