
Whisper
Newural network from OpenAI for speech recognition and converting audio into text.
لمحة عامة
Whisper
Description of the Whisper neural network
Whisper is an automatic speech recognition (ASR) system developed by OpenAI. ويجري تدريب الشبكة العصبية على مجموعة كبيرة من البيانات السمعية المتعددة اللغات يبلغ مجموعها 000 680 ساعة، مما يتيح لها ذلك. لترجمة الصوت بشكل فعال إلى النص النموذج يعمل محلياً بالكامل على حاسوب المستعمل ولا يرسل البيانات إلى خواديم "الإنترنت" يضمن سرية المعلومات المجهزة
ويدعم الشاحن 99 لغة، منها الروسية (بدقة تبلغ نحو 95 في المائة)، ويمكنه معالجة التسجيلات المنخفضة الجودة، والضوضاء الخلفية، والموسيقى، والتدخلات الخارجية. ويمكن للنظام أن يؤدي في وقت واحد عملية التسجيل والترجمة، وأن ينشئ أيضا عنوانا فرعيا للفيديو.
خصائص العجلات ...
| Characteristic Value |
|---|
| Type |
| مطور |
| Categories , Text-to-Speech, Developer Tools, Speech-to-Text, Free, Opensource |
| Business model Free |
| Languages s 99 languages (including Russian, accuracy:95%) |
| :: حجم بيانات التدريب 000 680 ساعة من البيانات المتعددة اللغات |
| النماذج المتاحة |
| Installation type ), Local (pip install), works without sending data to OpenAI servers |
| Date of first publication on the website of March 7, 2023 of |
| المصدر: |
| Tags , github, opensource, free |
من هي شبكة (ويسبر) العصبية المناسبة؟
المطورون والباحثون
Whisper is ideal for developers who need to integrate speech recognition into their applications or services. وتسمح مدونة المصادر المفتوحة بتعديل النموذج لأداء مهام محددة، ويخضع التركيب المحلي للرقابة الكاملة على البيانات. ويمكن للباحثين أن يستخدموا (ويسبر) لتحليل المواد السمعية، وإجراء المقابلات العملية، والعمل مع مكتب الخطابات.
مستخدمون يعملون مع ظروف سمعية صعبة
ويظهر النموذج مقاومة عالية لضوضاء الخلفية والموسيقى والتردد والتدخل الهاتفي. وهذا يجعله أمرا لا غنى عنه لترجمة التسجيلات التي تجرى في ظروف غير سليمة - في المؤتمرات أو في الأماكن العامة، أو في سوء الاتصال.
مبتكرو الوحدات وأخصائيو وسائط الإعلام
ويسبر مناسب لكتابة المقاطع والمحاضرات والمقابلات والمحادثات الهاتفية فالقدرة على إنشاء عنوان فرعي للفيديو تجعله أداة مفيدة لإنتاج الفيديو وخلق محتوى متاح.
كيف تستخدم الشبكة العصبية؟
التركيب والإنشاء
ويركب الشاحن عن طريق مدير حزمة (بايتون) باستخدام قيادة (بيب إنستال) وهو لا يتطلب التسجيل أو إرسال البيانات إلى خواديم برنامج " فتح آي " - وكل شيء يعمل محليا. Python مطلوب للتركيب، والأداة نفسها متاحة على GitHub مع رمز المصدر المفتوح.
اختيار نموذج وتشغيل
وبعد التركيب، اختار أحد النماذج الخمسة المتاحة - من النماذج الصغيرة )الصغيرة، وإن كانت أقل دقة( إلى كبيرة )الدقة القصوى مع مزيد من وقت التجهيز(. عملية التجهيز تبدأ من خط القيادة ويستغرق البث لمدة ساعة واحدة على الحاسوب المتوسط 10-15 دقيقة؛ ويعجل استخدام وحدة تحديد المواقع بشكل كبير العملية.
العمل مع الملفات الصوتية
ويقوم المستعمل بتحميل ملف صوتي، ويختار لغة (أو يتيح طريقة الكشف الآلي)، ويبدأ التسجيل، ويتلقى بعد التجهيز ملفا نصيا مع النص. وإذا لزم الأمر، يمكن تحرير النتيجة وتصديرها.
السمات الرئيسية للمنشار ...
الاعتراف بالكلمات في ظروف صعبة
(ويسبر) يقاوم الضوضاء الخلفية، الموسيقى، الصدى، جودة التسجيل السيئة. وهو يعالج التداخل الهاتفي واللكنات غير العادية، مما يجعله أداة موثوقة للعمل مع مختلف المواد السمعية.
الدعم المتعدد اللغات والكشف الآلي عن اللغات
النظام يدعم 99 لغة، بما في ذلك الروسية، ويمكن أن يحدد تلقائيا لغة المتكلم. كما يمكن للمرء أن يعترف بتغيير اللغة في تسجيل واحد، وهو أمر مفيد للمؤتمرات والمقابلات الدولية.
التشغيل المحلي والمرونة النموذجية
التجهيز المحلي الكامل يضمن خصوصية البيانات خمسة خيارات نموذجية (من صغيرة إلى كبيرة) تتيح لك الاختيار بين السرعة والدقة حسب المهمة.
? Subtitle creation and concur translation
ويمكن للمنبح أن يترجم في نفس الوقت ويترجم الصوت، وينشئ أيضا عنوانا فرعيا للفيديو - وهذا يزيد من استخدامه في إنتاج وسائط الإعلام.
مزايا ويسبر ...
ارتفاع قدرة التسجيلات المزعجة
خلافاً للعديد من البدائل، (ويسبر) لا يتم طرده بلكنات غير عادية أو بملفات صوتية مزعجة. ويظهر النموذج دقة تقديرية عالية حتى في وجود ضوضاء خلفية أو موسيقى أو صدى.
دعم العديد من اللغات
يعمل النظام مع 99 لغة، بما في ذلك لهجات نادرة. وهذا يجعلها أداة عالمية للمشاريع الدولية ويعمل بها مواد صوتية متعددة اللغات.
السرية والمصدر المفتوح
ويدير الشاحن محليا - لا ترسل البيانات إلى خواديم الوكالة. رمز المصدر المفتوح يسمح لك بالدراسة والتعديل وتكييف النموذج مع احتياجاتك دون قيود
? Free to use
والنموذج حر تماما ولا يتطلب التسجيل لتنصيبه واستخدامه. وهذا يجعلها متاحة لمجموعة واسعة من المستعملين - من فرادى المطورين إلى المنظمات الكبيرة.
اختلالات الحاجز ...
لا تطبيق منفصل جاهز
ولا يتوفر العجلات كتطبيق مستقل قابل للتنزيل مع وصلة بينية. لاستعماله، يجب أن تضعه عبر خط القيادة ولديه مهارات (بايتون) الأساسية
حدود نمط الاختبار
وتتاح الشبكة العصبية بطريقة اختبار لعدد محدود من المستعملين، مما يمكن أن يخلق صعوبات في الوصول إلى بعض فئات المستعملين.
ما المهام التي يحلها (ويسبر)؟
Transcribing noisy audio
ويتعامل الشاحن بفعالية مع تسجيلات صوتية تحتوي على ضوضاء خلفية أو موسيقى أو ذات جودة منخفضة. وهذا يجعل من الضروري العمل مع التسجيلات الميدانية والمحادثات الهاتفية والمقابلات.
الاعتراف في المؤتمرات الدولية
وبفضل الدعم المقدم إلى 99 لغة والقدرة على التعرف على التحول اللغوي في تسجيل واحد، فإن ويسبر مناسب لتجهيز المواد من الاجتماعات والمؤتمرات الدولية والمقابلات مع اللغات المختلطة.
إنشاء الترجمة التحريرية ووثائق النصوص
ويمكن للنموذج أن يخلق عنوانا فرعيا للفيديو ويولد الوثائق النصية من التسجيلات الصوتية - المحاضرات، والإذاعة، والمكالمات الهاتفية.
تسعير العجلات ...
ويوزع العجلات مجانا تماما. ويحتوي النموذج على رمز المصدر المفتوح ولا يتطلب أي دفع مقابل الاستخدام أو التركيب أو تحميل. الشبكة العصبية متاحة مجاناً
(ب) مصطلحات استخدام العجلات ...
ولا يحتاج الشاحن إلى تسجيل للتركيب والاستخدام. The tool is distributed with open source code and installed locally. المستعمل يحصل على وصول كامل إلى رمز المصدر النموذج دون الحاجة إلى التوقيع على اتفاقات الترخيص أو الذهاب من خلال إجراء التحقق.
توافر العجلات ...
Whisper is a cross-platform tool, installed via the pip package manager, and works on both CPU and GPU. وهي متاحة لجميع المستعملين؛ ولا يلزم وجود شبكة البرامج المواضيعية لأن النموذج يعمل محلياً بالكامل. (بيثون) مطلوب للتركيب
كيف يختلف (ويسبر) عن البدائل
والفرق الرئيسي بين خدمات ويسبر وغيرها من خدمات الاعتراف بالكلمات هو قدرتها العالية على التكيف مع اللهجات غير العادية والتسجيلات المزعجة. عندما تنهار البدائل وترتكب الأخطاء، (ويسبر) يُقدّم نوعية ثابتة من الوصف. وبالإضافة إلى ذلك، فإن التشغيل المحلي الكامل دون إرسال بيانات إلى الخواديم ورمز المصدر المفتوح يفصلها عن معظم الحلول التجارية. ويوفر الدعم المقدم إلى 99 لغة والقدرة على الاختيار بين خمسة نماذج (من السرعة إلى الدقة القصوى) للمستعملين المرونة التي نادرا ما يوفرها المنافسون.
خاتمة ...
Whisper from OpenAI is a powerful and free speech recognition tool that stands out from its alternatives thanks to open source code, local operation, and high resilience to noisy and low-quality recordings. وتقديم الدعم لـ 99 لغة، واختيار نموذجي مرن، والقدرة على تجاوز الصوت وترجمته في نفس الوقت يجعله حلا عالميا للمطورين والباحثين ومبتكري المحتوى وأي شخص يعمل بمواد صوتية للكلمات. وعلى الرغم من عدم وجود تطبيق جاهز وبعض القيود على طريقة الاختبار، يظل ويسبر واحدا من أفضل الخيارات المتاحة لمهام التصفيف وخلق الحق في الاشتراك.
الأسئلة المتكررة
أدوات مماثلة للمبادرة
انظر أيضا

منشور على الإنترنت يغطي الأخبار والاستعراضات وتحليل الاستخبارات الاصطناعية.

منصة سحاب لإطلاق تطبيقات مكافحة الإرهاب مباشرة في مصفف الجو بدون تركيب.

شبكة عصبية مفتوحة لحل المشاكل المعقدة في الرياضيات والبرمجة والمنطق.

A neural network for generating short videos from text descriptions or images.
A community for daily discovery and discussion of new technology products.

منبر لإنشاء نظم متعددة الوكلاء وأجهزة دردشة لدعم العملاء الآليين وتوليد الرصاص.

مساعد شؤون الإعلام لإنشاء موجزات قصيرة للفيديو، ووثائق PDF، والصفحات الشبكية.

الشبكة العصبية لتوليد الصور والفيديوات القصيرة من الوصفات النصية.



