
Whisper
ওপেনজিএ থেকে বাক স্বাধীনতা এবং অডিওতে রূপান্তর করার জন্য ওপেনজিএল নেটওয়ার্ক।.
সারসংক্ষেপ
বিচ্ছিন্ন --disallow-test
নেটওয়ার্ক বর্ণনা দে-লেভেলি
ওপেনএআই (এএসআর) তৈরী করা একটি স্বয়ংক্রিয় ভাষণের স্বীকৃতি। নিউরাল নেটওয়ার্ক বহুভাষী অডিও উপাত্তের একটি বিশাল কুঠরীতে প্রশিক্ষণ দিচ্ছে যা মোট ৬,০০০ ঘন্টা ধরে কাজ করে যাচ্ছে। সহজে নকল করা এবং অডিও পাঠ্যাংশে অনুবাদ করা। মডেলটি স্থানীয়ভাবে ব্যবহারকারী কম্পিউটারের মাধ্যমে সম্পূর্ণভাবে পরিচালনা করে এবং তাতে ডাটা পাঠায় না। তথ্য আদান-প্রদানকারীর গোপনীয়তা নিশ্চিত করার নিশ্চয়তা দেয়।
রুশ সহ ৯৯টা ভাষাকে সমর্থন করে (১৯০%), এবং স্বল্প মানের রেকর্ডিং, শব্দ, সঙ্গীত এবং অতিরিক্ত হস্তক্ষেপের মাধ্যমে তা নিয়ন্ত্রণ করতে পারে। এই ব্যবস্থা একই সাথে অনুবাদ এবং অনুবাদ করতে পারে এবং ভিডিওর সাবটাইটেল তৈরি করতে পারে।
বৈশিষ্ট্য ভোরোনেজ
ASCII অক্ষরের মান ৎ-দে---- সাজান---- কেবল টাইপ- টি- এম- এল বক্তৃতা স্বীকৃতি ব্যবস্থা (Spec-TE) wdfs ডেভেলপার খোলা XKB বিভাগ-টু-স্পিচ, ডেভেলপার টুল, কথা বলার সরঞ্জাম, মুক্ত, ওপেন সোর্স খোলা XKB বিজনেস মডেল কেবল ফ্রি ই-মেইল মডেল ইউক্রেইনিয়ের ভাষা (রুশ, সঠিক মানের ৯০%) XKB প্রশিক্ষণ উপাত্তের আকার × ৬,০০০ ঘন্টা বহুভাষী ডাটার মাধ্যমে ৫টি মডেলে বিদ্যমান মডেলগুলো: ছোট (fast থেকে বড়) Gadu ইনস্টলেশনের ধরন স্থানীয় (PI ইনস্টল), OpenIA সার্ভারে তথ্য প্রেরণের জন্য ছাড়া কর্ম সঞ্চালিত হবে। গত ৭ মার্চ, ২০২৩ তারিখ ওয়েবসাইটে প্রথম প্রকাশনার তারিখ। ঘটে যাওয়া সোর্স কোড খোলা হয়েছে Seahorse ট্যাগ tmp, ওপেন সোর্স, বিনামূল্যে
কে? ধরো---- December বোধ করছে নিশ্চলউড
ডেভেলপার এবং গবেষক
যে সমস্ত ডেভেলপার তাদের অ্যাপ্লিকেশন বা সেবা দিয়ে কথা বলতে চান, তাদের জন্য বিতর্ক আদর্শ। ওপেন সোর্স কোড দ্বারা সুনির্দিষ্ট কর্ম সঞ্চালনের জন্য মডেল পরিবর্তন করা যাবে। স্থানীয় ইনস্টলেশন সম্পর্কিত সম্পূর্ণ তথ্য নিজের সুবিধা উপলব্ধ করে। কিন্তু, আপনি কি এই বিষয়ে একমত হবেন?
# # ব্যবহারকারী কঠিন অবস্থায় কাজ করছে
মডেলটি আওয়াজ, সঙ্গীত, প্রতিধ্বনি এবং টেলিফোন হস্তক্ষেপের প্রতি উচ্চ প্রতিরোধ প্রদর্শন করে। এটা অসিদ্ধ অবস্থায় — সম্মেলনগুলোতে, জনসাধারণের জায়গায় অথবা দুর্বল সংযোগের দ্বারা প্রদর্শিত রেকর্ডিংগুলোর জন্য অপরিহার্য করে তোলে ।
# বিষয়বস্তু নির্মাতা এবং প্রচার মাধ্যমের বিশেষজ্ঞ
টিরান পডকাস্ট, ভাষণ, সাক্ষাৎকার এবং ফোন কথোপকথনের জন্য উপযুক্ত। ভিডিওর সাবটাইটেল তৈরি করার ক্ষমতাটি ভিডিও নির্মাণ করার জন্য এটি ব্যবহার করা হয় এবং গ্রহণযোগ্য বিষয়বস্তু তৈরি করার জন্য।
নেচারাল নেটওয়ার্ক কিভাবে ব্যবহার করবে? নির্ধারণ করুন
# ইনস্টলেশন এবং প্রস্তুতি
pip ইনস্টল কমান্ড ব্যবহার করে Python প্যাকেজ ম্যানেজারের সাহায্যে pip ইনস্টল করা হয়েছে। এর জন্য নিবন্ধন বা ওপেনএআই সার্ভারে পাঠানো দরকার নেই — সব কিছু স্থানীয়ভাবে কাজ করে । ইনস্টলেশনের জন্য পাইথন আবশ্যক, এবং এই টুলটি উন্মুক্ত সোর্স কোডের সাথে উপলব্ধ রয়েছে।
একটি মডেল বেছে নেওয়া এবং চলমান
ইনস্টলেশনের পর, ৫টি প্রাপ্তিসাধ্য মডেলের মধ্যে একটি বেছে নিন — ছোট (সবচেয়ে কম) কিন্তু অনেক বেশি সঠিক (সবচেয়ে বেশি)। কমান্ড-লাইন থেকে প্রসেস আরম্ভ করা হয়েছে। গড় কম্পিউটারের একটি ঘন্টা পডকাস্ট ১০-১৫ মিনিট লাগে; জিপিইউ ব্যবহার করে উল্লেখযোগ্য গতি বৃদ্ধি পায়।
অডিও ফাইলের সাথে কাজ করা
ব্যবহারকারী একটি অডিও ফাইল আপলোড করে (অথবা একটি ভাষা নির্বাচন করুন স্বয়ংক্রিয়ভাবে অটো-dodle মোড সক্রিয় করা হয়), এবং কপি করার পর একটি টেক্সট ফাইল গ্রহণ করে। যদি প্রয়োজন হয়, তাহলে ফল সম্পাদন করা এবং এক্সপোর্ট করা যাবে।
কা. পূ. নির্ধারণ করুন
চ্যালেঞ্জপূর্ণ পরিস্থিতিতে ভাষণের স্বীকৃতি
শব্দ, সঙ্গীত, প্রতিধ্বনি এবং খারাপ চিত্রের গুণগত মান বজায় রাখার ক্ষেত্রে বাধা সৃষ্টি করে । এটা টেলিফোন হস্তক্ষেপ করে ও অস্বাভাবিক উচ্চারণ করে, এটাকে বিভিন্ন ধরনের অডিও বিষয়বস্তুর সঙ্গে কাজ করার জন্য এক নির্ভরযোগ্য হাতিয়ার করে তোলে ।
বহুভাষী সমর্থন এবং স্বয়ংক্রিয় ভাষা সনাক্তকরণ
এই পদ্ধতিটি ৯৯টা ভাষাকে সমর্থন করে, যার মধ্যে রাশিয়ার ভাষাও রয়েছে। একটি একক রেকর্ডিং মধ্যে ভাষা পরিবর্তনকে চিহ্নিত করতে পারে, যা আন্তর্জাতিক সম্মেলন এবং সাক্ষাৎকারের জন্য প্রয়োজনীয়।
স্থানীয় অপারেশন এবং মডেল ব্যবস্থাপনা
সম্পূর্ণ স্থানীয় প্রসেস দ্বারা তথ্য গোপনীয়তা নিশ্চিত করা হয় । ৫ মডেল নির্বাচন করুন (সবচেয়ে বড় ও বড়)। কাজের জন্য অ্যানিমেশনের গতি ও সঠিক তথ্যের পরিমাপ করা যাবে।
###রক্ষা সৃষ্টি এবং অনুবাদ
এ ছাড়া, ভিডিওর জন্য সাবটাইটেল তৈরি করা — এটা প্রচার মাধ্যমের উৎপাদনে এর ব্যবহার বৃদ্ধি করে ।
কা. পূ. --------- কৃতজ্ঞতা জ্ঞাপন করার যোগ্য
# উচ্চপ্রতিষ্ঠিত আওয়াজের জন্য
অনেক বিকল্প বিকল্পের বিপরীতে, অস্বাভাবিক উচ্চারণ অথবা আওয়াজের অডিও ফাইল থেকে বাদ দেওয়া যায় না । মডেলটি ব্যাকগ্রাউন্ড, সঙ্গীত অথবা প্রতিধ্বনিত করার ক্ষেত্রে উচ্চ স্বীকৃতি প্রদান করে।
অনেক ভাষার জন্য সমর্থন
এই পদ্ধতি ৯৯টা ভাষায় কাজ করে, যার মধ্যে বিরল উপভাষাও রয়েছে। এর ফলে এটি বহুভাষী অডিও উপাদান দিয়ে আন্তর্জাতিক প্রকল্পের জন্য একটি সার্বজনীন টুল এবং কাজ করে।
# গোপনীয় এবং উন্মুক্ত সূত্র
FIBUN - স্থানীয় অবস্থানে কোনো তথ্য পাঠানো হয়নি । ওপেন সোর্স কোড আপনাকে পড়তে, পরিবর্তন করতে এবং আপনার নিজের প্রয়োজনের সাথে খাপ খাইয়ে নিতে দেয়।
মুক্ত ব্যবহার করার জন্য
মডেলটি সম্পূর্ণ মুক্ত এবং এর নিবন্ধনের প্রয়োজন নেই। এর ফলে, অনেক ব্যবহারকারীর — ব্যক্তি - বিশেষদের কাছ থেকে বড় সংগঠনগুলোর — ব্যাপক মাত্রায় প্রবেশাধিকার পাওয়া যায় ।
শোকাচ্ছন্নতা নির্ধারণ করুন
কোনো পৃথক অ্যাপ্লিকেশন নেই
ইন্টারফেসসহ স্বতন্ত্র অ্যাপ্লিকেশনের সাথে সংযোগ স্থাপন করা যাবে না। এটি ব্যবহার করতে হলে, আপনাকে কমান্ড লাইন থেকে এটি ইনস্টল করতে হবে এবং Python এর মৌলিক দক্ষতা আছে।
# পরীক্ষাকরণের সীমা
বেশ কয়েকটি ব্যবহারকারীর জন্য নিউরাল নেটওয়ার্ক পরীক্ষা মোডে পাওয়া যাচ্ছে, যার ফলে ব্যবহারকারীদের জন্য কিছু ধরনের সমস্যার সৃষ্টি হতে পারে।
সমাধান কী? --------= ফাইলগুলি মূল্যায়
# টারান শব্দ উচ্চারণ করছে
এ ছাড়া, অডিও রেকর্ডিংগুলোর মধ্যে শব্দ, সঙ্গীত অথবা গুণগত মানও রয়েছে । এটা হল ফিল্ড রেকর্ডিং, ফোন কথোপকথন এবং সাক্ষাৎকারের মাধ্যমে কাজ করা ।
আন্তর্জাতিক সম্মেলনে ভাষণের স্বীকৃতি
৯৯টা ভাষাকে সমর্থন করার জন্য এবং একটি ভিডিওর মধ্যে পরিবর্তন করার ক্ষমতা, আন্তর্জাতিক সভা, সম্মেলন এবং মিশ্র ভাষার সাথে সাক্ষাৎকারের জন্য উপযুক্ত।
সাবটাইটেল তৈরি এবং টেক্সট ডকুমেন্ট
মডেলটি ভিডিওর সাবটাইটেল তৈরি করতে এবং অডিও রেকর্ডিং, বক্তৃতা, পডকাস্ট এবং ফোন কলের মাধ্যমে টেক্সট তৈরি করতে পারে।
পৃথকীকরণ রূপঃ
এই বিষয়টি সম্পূর্ণ বিনামূল্যে বিতরণ করা হয়। মডেলের জন্য উন্মুক্ত সোর্স কোড রয়েছে এবং এর ব্যবহার, ইনস্টলেশন অথবা ইনস্টলেশনের জন্য কোনো ক্ষতিপূরণ প্রয়োজন নেই ডাউনলোড। বিনামূল্যের জন্য নিউরাল নেটওয়ার্ক উপলব্ধ।
হ্রাসের জন্য ব্যবহার নির্ধারণ করুন
বৈবাহিক নিবন্ধনের প্রয়োজন নেই। এই সরঞ্জামটি ওপেন সোর্স কোড দিয়ে ভাগ করা হয়েছে এবং স্থানীয়ভাবে ইনস্টল করা হয়েছে। ব্যবহারকারীরা মডেলের সোর্স কোডে সম্পূর্ণ প্রবেশ করে লাইসেন্স চুক্তি স্বাক্ষর না করে অথবা যাচাই প্রক্রিয়া দিয়ে যেতে পারে।
উপলব্ধ রয়েছে --------- গণনা প্রক্রিয়া
সিপিআই প্যাকেজ ব্যবস্থাপকের মাধ্যমে পপিপ প্যাকেজ ব্যবস্থাপকের মাধ্যমে বিচ্ছিন্নকরণ টুল। সকল ব্যবহারকারীর জন্য এটি উপলব্ধ রয়েছে; কোনো VPN-র প্রয়োজন নেই কারণ মডেলটি সম্পূর্ণরূপে চালনা করে। ইনস্টলেশনের জন্য Python প্রয়োজন।
যেভাবে বিকল্প বিষয়গুলো থেকে আলাদা DER-----ঁঁ সহায়তা ব্যবস্থা
শব্দচিত্র এবং অন্যান্য বক্তৃতার ক্ষেত্রে যে পার্থক্য রয়েছে, তা অস্বাভাবিক উচ্চারণ এবং আওয়াজের আওয়াজের ক্ষেত্রে উচ্চপ্রতিজ্ঞ। যেখানে বিকল্প ও ভুল করা যায়, সেখানে ভুল সংশোধন করা সম্ভব নয় । এছাড়াও সার্ভার এবং ওপেন সোর্স কোড ছাড়া সম্পূর্ণ স্থানীয় অপারেশন অধিকাংশ বাণিজ্যিক সমাধান ছাড়া করা হয়েছে। ৯৯টা ভাষা এবং পাঁচটি মডেলের মধ্যে বেছে নেওয়ার ক্ষমতা (বিশেষ করে সর্বোচ্চ সঠিক) ব্যবহারকারীদের এই প্রতিযোগিতাকে খুব কমই প্রদান করে থাকে।
অন্তর্ভুক্ত উহ...
ওপেনএআই হচ্ছে একটি শক্তিশালী এবং বাক স্বাধীনতা মাধ্যম, যা বিকল্প উৎস কোড, স্থানীয় অপারেশন এবং স্বল্পমেয়াদী রেকর্ডিংের মাধ্যমে উচ্চপ্রতিষ্ঠিত। ৯৯টা ভাষাকে সমর্থন, নমনীয় মডেল নির্বাচন এবং একই সাথে অডিওর মাধ্যমে অডিওর বিষয়বস্তু নিয়ে কাজ করা নির্মাতা, গবেষক, কনটেন্ট নির্মাতা এবং যে কারো কাছে এটি একটি সার্বজনীন সমাধান। একটি প্রস্তুত আবেদনের অভাব এবং পরীক্ষা মোডের কিছু সীমাবদ্ধতা সত্ত্বেও, প্রতিলিপি এবং সাবটাইটেল তৈরির কাজের জন্য সব থেকে ভালো উপায় রয়েছে।.
সাধারণ প্রশ্নোত্তর
অনুরূপ AI টুল
অতিরিক্ত দেখুন

AI ব্যবহার করে লেখা লেখা বর্ণনার মাধ্যমে ছবি এবং অন্যান্য দৃশ্যমান বিষয়বস্তুর জন্য ওপেন প্ল্যাটফর্ম।.

ভিডিও তৈরি এবং সম্পাদনা করার জন্য AI প্ল্যাটফর্ম, সরাসরি ক্রোম ব্রাউজারের সাথে কাজ করা।.

বিভিন্ন লেখা, ছবি এবং অডিও তৈরির জন্য একটি বহুমুখী AI সহযোগী।.

জিটিপি-৫ এবং ক্লড্যুদ ৪. ৫ সহ ৫০০ এরও বেশি AI মডেলে প্রবেশ না করে তাদের খরচ বাঁচানোর ক্ষমতা আছে।.

শিক্ষা উপকরণ এবং পথ বাছাই করার জন্য AI টুলগুলির ক্যাটালগ।.

অনলাইন AI বাকেশন প্লাটফর্ম, যা বিখ্যাত চরিত্র এবং তারকাদের কণ্ঠস্বরের সাথে অডিও তৈরি করে।.

ভিডিও প্রজন্ম, সম্পাদনা এবং সম্পাদনা করার জন্য AI, যার মধ্যে অ্যাভাটার, লিপ-ক্লো্যাট এবং ভয়েসের আওয়াজও রয়েছে।.

বিভিন্ন বিন্যাসে লেখা ও সম্পাদনা করার জন্য AI সহায়ক।.



