ভয়েস এজেন্টদের জগতে, মুদ্রাই প্রধান। ব্যবহারকারী সাড়া দেবার জন্য অপেক্ষা করে, সহকারী তিনটি কাজ করে: কথাকে চেনা, উত্তরের চিন্তা করা, এবং কণ্ঠস্বরের উত্তর প্রদান করা। যদি প্রতিটি ধাপ দশ মিলি খেয়ে ফেলে, তাহলে ডায়ালগ আর জীবিত থাকে না। আগস্টের ২০ তারিখে এনভিডিএ-এর সম্প্রতি প্রকাশিত এক বিজ্ঞপ্তিতে দেখা যাচ্ছে যে ভাষণ আর বোতলের বোতলের উপর কব্জা করা নয়: এনভিএএএএএএআই টিটিএস মডেল ৩২ মিটার উপরে একটি অডিও প্রকাশ করে এবং ১২টি ভাষায় কথা বলে।
মডেলটা আসলে কি এবং কেন তা গুরুত্বপূর্ণ?
এনআইভিএ মাগপি টিটিএস একটি খোলা টেক্সট-স্পেচ সিস্টেম যার ৩৬ মিলিয়ন পরামিতি রয়েছে। এটি শুধু একটি গবেষণাগার নয়: ক্রিপ্টিয়া এনভিআইআইআইএ সার্ভিস স্ট্যাকস-এর প্রস্তাব দিয়েছে, যেখানে আপনি আপনার কোম্পানির তথ্য বিশ্লেষণের সুযোগ করে দেবেন।
বর্তমান সংস্করণটি ১২টা ভাষাকে সমর্থন করে: ইংরেজী, স্প্যানিশ, জার্মান, ইতালীয়, ম্যান্ডারিন, হিন্দি, জাপানি এবং আরও তিনটে নতুন বাইবেল — আরবি, কোরিয়ান এবং ব্রাজিলিয়ান পর্তুগিজ । উপস্থিত ভাষাও আপগ্রেড করা হয়েছে: প্রশিক্ষণ সংক্রান্ত তথ্য সতেজ করা হয়েছে এবং মডেলটিকে পরিষ্কার করা হয়েছে।
একটি মজার বিবরণ: কন্ঠগুলো প্রত্যেক ভাষাতেই আলাদা করে বানানো হয় না। বক্তাদের একটি বহুভাষী প্রতিনিধিত্ব হিসেবে। একটি "কথা" বলতে পারে সব ভাষা, পুরুষ আর মহিলা ভাষা সব ভাষার জন্য সহজলভ্য। এটি পণ্যের জন্য সুবিধাজনক যা একাধিক অঞ্চলের একটি ব্র্যান্ডের ভয়েস প্রয়োজন।
কোড বদল- যখন কোন বক্তার ভাষাতে ভাষা পরিবর্তন করা হয়, তখন তার বিশেষ উল্লেখ প্রয়োজন। হিন্দি আর জাপানীদের জন্য এই সমর্থনটি প্রসারিত হয়েছে: আইপিএ-ভিত্তিক গ্রাফমেমে-পোফোন রূপান্তরিত করা আর স্বনির্ধারিত শব্দকোষ ব্যবহার করা হয়েছে।

লতিেন্সি: এসব কি ছিল
এই সকল উপাদানের মধ্যে এনআইভিডিআইএ-এর নিজস্ব জিপিইউএস ব্যবহার করা হয়েছে। কি ধরনের মেট্রিক হলো টিটিএফএ (প্রথমবার প্রথম অডিওর অনুরোধ করে) এবং আরটিএফএক্স (কতবার মডেলটি আসল সময়ের চেয়ে দ্রুত)। এই তথ্য তিনটি রানের গড়তম।
| নিষ্ক্রিয় | টিটিএফএ, ১ স্রোত | আরটিএফএক্স, ১ স্ট্রিম | টিটিএফএ, ৬৪ নদী | আরটিএফএক্স, ৬৪ প্রবাহ |
|---|---|---|---|---|
| NVADA B | ৩২ মিটার | ১২.১x | ২৩৩ মিটার | ৩১৯.১ কোয়েক |
| এনভিডিয়া | ৪৭ মিটার | ১৪.৪ | ২৭৫ মিটার | ২৯০.৯x |
| ডিজিএক্স বিমানবন্দর | ৫৩ মিটার | ৯.৮x | ৯৬২ মিটার | ৭৫.৮৮৪ |
| এনভিডিয়া | ৭৯ মিটার | ১২.২x | ৩৯৫ মিটার | ১৯৭x |
এই সংখ্যা চর্চার মানে কি।
- একটা কথোপকথন। জিপিইউ-এর উপর নির্ভর করে ৩২-৭৯ মিটার পর্যন্ত প্রথম অডিও এসেছে। প্রাকৃতিক সংলাপের জন্য সুপারিশকৃত বাজেট প্রায় ২০০ মিনিট। বক্তৃতার স্বীকৃতি এবং ভাষার মডেলও সময় নেয়, কিন্তু যখন টিএসটিএস ৩২ মিটার (বি২০০ মিটার পর্যন্ত) এর মধ্যে অবস্থান করে, তখন সামগ্রিক চিত্রকে তেমন একটা প্রভাবিত করে না — এর বাকি খরচ ASR এবং Lmm এর জন্য বরাদ্দ করা যেতে পারে ।
- ( গীত. ২০০৮ সালের মধ্যে ৬৪টি ধারার প্রবাহে প্রথমবার ২৩৯ মিটার বৃদ্ধি পায়, কিন্তু তা প্রায় ৩২০টি রিয়েল টাইমে পৌঁছে যায়। অন্য কথায় বলা যায়, মডেলটি এর চেয়ে কয়েক মিনিটের বেশি কথাবার্তা বলে থাকে ।
একটি গুরুত্বপূর্ণ নিউনসেন্স: একই ওজনসহ একটি চেকপয়েন্ট পাওয়া যাচ্ছে Hugging Face - এটা গবেষণা আর ভালো কাজের জন্য. তবে পরিমাপ অনুযায়ী এনভিডিআইআই এম এর মাধ্যমে পাঠানো পরিমাপ। যদি তোমার ভার বহন করতে না হয়, তাহলে NIM যা বিশ্বাস করা উচিত।

মডেল কিভাবে এত দ্রুত হতে পারে
দুই স্থাপত্যগত পরিবর্তনের ফলাফলের গতি।
- ফ্রেম স্ট্যাকিং. ডিকোডার এখন দু'টি অডিও ফ্রেম প্রতি রোলের পরিবর্তে একটি ধাপ দ্বারা অনুমান করছে। ডিকুরের সংখ্যা সমাধান করা হয়েছে, যার মানে প্রত্যেকটা বক্তৃতার অংশের অর্ধেক হিসাবকৃত কাজ।
- স্থানীয় পরিবর্তনশীল। স্থানীয় প্রেক্ষাপটের সাথে সম্পূর্ণ ধারার পরিবর্তে দৃষ্টিকোন সময়ে কাজ করে। এটা দীর্ঘ অডিও ও গতির গতির পরিমাণকে হ্রাস করে । লেখকেরা এই স্থাপত্যের এই অংশের বিস্তারিত বর্ণনার কথা বলেছেন।
একই সাথে, সস্তা হার্ডওয়্যারের উপর এমনকি দশ মিলিটারের মধ্যে এই পরিবর্তন করা হয়েছে।
কালো বাক্সের পরিবর্তে ক্যালক্রেণ্ঠন
ভয়েস পণ্যের নির্মাতারা প্রায়ই বক্তৃতার মডেলকে প্রদান করে: একটি API কল এবং আপনি স্বীকৃতি, বিশ্লেষণ এবং এমনকি মডেলদের প্রতিক্রিয়াও পাবেন। এটি খুব সহজ মনে হচ্ছে, কিন্তু এই পদ্ধতিটির একটি ছোট অংশ রয়েছে: আপনি কোন একটি স্তর, একটি স্তর, ভাল মানের প্রয়োজন, অথবা এমনকি উপলব্ধি করতে পারেন না যে কোথায় লতি থাকতে হবে।
ইতিহাসবিদরা — কোথায় বক্তৃতার স্বীকৃতি (ASR), ভাষার আদর্শ (এলএম) এবং বিশ্লেষণ (টি. [ অধ্যয়ন প্রশ্নাবলি] প্রতিটি স্তর কনফিগার করা, আপডেট করা ও পরিমাপ করা যাবে । এনআইভিডিএ মাগিয়ে টিটিএস-এর উন্মুক্ত ওজন এবং তার যোগ্যতা এই ধারণাটিকে বাস্তব সম্মত করেছে: আপনি আপনার তথ্যর পাশে রাখুন এবং বাইরের তথ্য ব্যবহার না করে সরাসরি তথ্য পেতে পারেন।

কোথায় এটি প্রয়োগ করা হবে
বেশ কয়েকটি দৃশ্য রয়েছে যেখানে স্থানীয় স্থাপনার জন্য দ্রুত বহুভাষী টিএস (টিএস) সুযোগ প্রদান করে থাকে:
- গ্রাহকের সমর্থন ভয়েস এজেন্ট — বিশেষ করে একাধিক দেশের যারা কার্যক্রম পরিচালনা করে;
- মেডিকেল সহকারীKDE-র ব্যক্তিগত তথ্য কোথায় অত্যন্ত গুরুত্বপূর্ণ;
- একটি অ্যানালগ এবং ডিজিটাল ঘড়িComment কোম্পানির কর্মফলে লগ করা;
- অনুবাদ পদ্ধতি আউটপুটের ক্ষেত্রে, এর পরিবর্তে প্রাপ্ত ভয়েস আউটপুট;
- কথোপকথনের অ্যাপ্লিকেশন যেখানে সরাসরি ব্যবহারকারীর অভিজ্ঞতার প্রভাব রয়েছে।
এই সকল ব্যবহারের ক্ষেত্রে সাধারণ হরের প্রয়োজনীয় চাহিদা ধার্য করা হচ্ছে: সংস্থার অবস্থান, উচ্চারণ এবং কণ্ঠস্বরকে এই পণ্যের সাথে খাপ খাইয়ে নিতে হবে না। এটা আসলে নতুন এনভিডিএ মাগিয়েট টিটিএস-এর একটি ঠিকানা: একটি উন্মুক্ত মডেল, উন্নত বহুভাষী সমর্থন, ন্যূনতম ল্যাটেন্সি এবং একটি শক্তিশালী মেঘ সার্ভিসের উপর কোন স্বাধীনতা নেই।



