ডায়ালেক্ট: বুঝি, কিন্তু তৈরি করতে পারি না
আধুনিক বড় ভাষার মডেলগুলো ডায়ালেক্টাল ইংরেজি বোঝার ক্ষেত্রে বেশ ভালো কাজ করে — তারা ভাষার আঞ্চলিক রূপে তৈরি প্রশ্ন বা নির্দেশ বুঝতে পারে। কিন্তু মডেলকে একই স্টাইলে উত্তর দিতে বললে, এটি প্রায় সবসময়ই স্ট্যান্ডার্ড ইংরেজিতে চলে যায়, বেশিরভাগ ক্ষেত্রে আমেরিকান আদর্শকে লক্ষ্য করে। একটি কৌতূহলোদ্দীপক ব্যবধান তৈরি হয়: মডেল ডায়ালেক্ট শোনে, এটি পুরোপুরি ব্যাখ্যা করে, কিন্তু "সাহিত্যিক" ভাষায় কথা বলে। গবেষণা সাহিত্যে এই ঘটনাকে robustness-generation gap বলা হয় — অ-মানক ইনপুটের প্রতি সহনশীলতা এবং নিজের জেনারেশনে তা পুনরুৎপাদন করার ক্ষমতার মধ্যে পার্থক্য।
এই ব্যবধানটিই গবেষণা করতে চেয়েছেন DiaLLM-এর লেখকরা, যার কাজ সম্প্রতি arXiv-এ প্রকাশিত হয়েছে (2607.07669)। তারা প্রশ্ন তুলেছেন: ওপেন ভাষার মডেলগুলোকে কি শুধু ডায়ালেক্ট বোঝাই নয়, সক্রিয়ভাবে সেগুলোতে কথা বলতেও শেখানো সম্ভব — এবং যদি সম্ভব হয়, তাহলে কোন প্রশিক্ষণ পদ্ধতি সবচেয়ে ভালো ফল দেয়।
DiaLLM কী প্রস্তাব করে
গবেষকরা কোনো একটি নির্দিষ্ট ডায়ালেক্টে মডেলকে ফাইন-টিউন করেননি। এর পরিবর্তে, তারা ওপেন LLM-এর তিনটি পরিবার নিয়ে ইন্টারন্যাশনাল কর্পাস অফ ইংলিশ (International Corpus of English) -এ তাদের প্রি-ট্রেনিং চালিয়ে যান। এই ধরনের কর্পাসে অস্ট্রেলিয়ান থেকে ভারতীয় পর্যন্ত অসংখ্য জাতীয় ও আঞ্চলিক ভাষার রূপের পাঠ্য থাকে।
এরপর প্রশিক্ষণকে দুটি দিকে ভাগ করা হয়েছিল: ইমপ্লিসিট প্যারাডাইম, যেখানে মডেল নিজে উদাহরণ থেকে ডায়ালেক্টের বৈশিষ্ট্য শেখে, এবং এক্সপ্লিসিট প্যারাডাইম, যেখানে মডেলকে স্পষ্টভাবে ডায়ালেক্টাল ফর্মুলেশন বেছে নিতে শেখানো হয়। প্রতিটি দিককে আরও তিনটি অ্যালাইনমেন্ট কৌশলের একটির সাথে যুক্ত করা হয়েছিল। ফলস্বরূপ একটি পরীক্ষামূলক ম্যাট্রিক্স তৈরি হয়েছে, যা প্রশিক্ষণের প্রতিটি ধাপের অবদান আলাদাভাবে মূল্যায়ন করতে দেয়।
লেখকদের দাবি অনুযায়ী, অস্ট্রেলিয়ান, ভারতীয় এবং উত্তরাঞ্চলীয় ইংরেজি রূপের জন্য এই ধরনের উপাদানগুলির এটি প্রথম নিয়ন্ত্রিত তুলনা। এর আগে কেউ একটি অভিন্ন পরীক্ষামূলক ভিত্তিতে এই পদ্ধতিগুলি পরীক্ষা করেনি।

পরীক্ষাগুলো কী দেখিয়েছে
প্রধান উপসংহার — ডায়ালেক্ট বোঝার ক্ষমতা এবং এটি তৈরি করার ক্ষমতা সত্যিই সরাসরি সম্পর্কিত নয়। একটি থেকে অন্যটি অনুসরণ করে না: একটি মডেল ডায়ালেক্টাল গঠন পুরোপুরি প্রক্রিয়া করতে পারে এবং তবুও জোর দিয়ে স্ট্যান্ডার্ড ভাষায় উত্তর দিতে পারে।
আরেকটি বিষয়ও কৌতূহলোদ্দীপক। স্বয়ংক্রিয় বেঞ্চমার্কে মডেলগুলির ফলাফল মূলত ধারাবাহিক প্রি-ট্রেনিং এবং supervised fine-tuning (SFT) দ্বারা নির্ধারিত হয়েছিল। টেস্ট মেট্রিক্সে অ্যালাইনমেন্টের প্রভাব প্রায় অদৃশ্য ছিল। কিন্তু এর অর্থ এই নয় যে অ্যালাইনমেন্ট অকেজো: এটি উত্তরের শৈলী ব্যাপকভাবে পরিবর্তন করেছে, শুধু মানক বেঞ্চমার্কগুলো এই ধরনের পরিবর্তনের প্রতি সংবেদনশীল নয়। অর্থাৎ, যদি মডেলগুলোকে শুধু সংখ্যা দিয়ে মূল্যায়ন করা হয়, তাহলে ভুলভাবে সিদ্ধান্ত নেওয়া যেতে পারে যে সব পদ্ধতি সমতুল্য।
কেন ডায়ালেক্ট তৈরি করা একটি কঠিন কাজ
লেখকরা আলাদাভাবে একটি নির্দিষ্ট ভাষার রূপের সাথে স্পষ্ট অভিযোজন এবং ডায়ালেক্টের সাথে সম্পর্কহীন আরও বিস্তৃত অ্যালাইনমেন্টের তুলনা করেছেন। স্পষ্ট পদ্ধতি সত্যিই এমন পাঠ্য তৈরি করেছিল যা স্বয়ংক্রিয় শ্রেণিবিভাজক এবং মানুষ উভয়েই আত্মবিশ্বাসের সাথে ডায়ালেক্টাল হিসেবে চিনতে পেরেছিল। বিস্তৃত অ্যালাইনমেন্টের তুলনায় এই ধরনের উত্তরগুলো বেশি স্কোর পেয়েছে।
কিন্তু এখানে একটি অপ্রত্যাশিত সূক্ষ্মতা আবিষ্কৃত হয়েছে। যে পদ্ধতিটি সবচেয়ে আক্রমণাত্মকভাবে "ডায়ালেক্ট রিওয়ার্ড" অপ্টিমাইজ করেছে, অর্থাৎ ডায়ালেক্টাল এক্সপ্রেশনের জন্য মডেলকে সবচেয়ে সক্রিয়ভাবে উৎসাহিত করেছে, শেষ পর্যন্ত মানব-মূল্যায়নকারীদের পছন্দ হয়নি। অ্যালগরিদমে অন্তর্নির্মিত আনুষ্ঠানিক মানদণ্ড মানসম্পন্ন ডায়ালেক্টাল বক্তৃতা সম্পর্কে মানুষের ধারণার সাথে মেলেনি। অতিরিক্ত ভাষাতাত্ত্বিক বিশ্লেষণ নিশ্চিত করেছে: আনুষ্ঠানিক অপ্টিমাইজেশন এবং প্রকৃত গুণমানের মধ্যে একটি ব্যবধান রয়েছে, যা তিনটি মডেল পরিবারের মধ্যে দুটিতে বিশেষভাবে লক্ষণীয়।

সুতরাং, তিনটি অ্যালাইনমেন্ট কৌশলের কোনোটিই নিঃশর্ত শ্রেষ্ঠত্ব দেখায়নি। "মডেলটিকে ডায়ালেক্টে ফাইন-টিউন করুন এবং ডায়ালেক্টে কথা বলা সহকারী পান" — এই ধরনের কোনো সহজ রেসিপি নেই। ব্যবধান বন্ধ করতে আরও সূক্ষ্ম রিওয়ার্ড ডিজাইন প্রয়োজন — যা মানক ভাষা থেকে বিচ্যুতির জন্য একক জরিমানার মধ্যে সীমাবদ্ধ নয় — এবং প্রশিক্ষণের জন্য আরও ভালো মানের ডায়ালেক্টাল রিসোর্স প্রয়োজন।
উপসংহার ও সম্ভাবনা
DiaLLM-এর কাজ মূল্যবান কারণ এটি একটি পদ্ধতিগত চিত্র দেয় যে কীভাবে প্রশিক্ষণের বিভিন্ন ধাপ ডায়ালেক্টাল জেনারেশনকে প্রভাবিত করে। অনুশীলনকারীদের জন্য এর অর্থ: যদি আপনি চান আপনার সহকারী অস্ট্রেলিয়ান বা ভারতীয় ইংরেজিতে কথা বলুক, তবে শুধু ধারাবাহিক প্রি-ট্রেনিং যথেষ্ট নয়। একটি সুচিন্তিত অ্যালাইনমেন্ট প্রয়োজন হবে, এবং এর ফলাফল শুধু স্বয়ংক্রিয় বেঞ্চমার্ক দিয়েই নয়, জীবন্ত ডায়ালেক্ট ভাষাভাষীদের অংশগ্রহণেও যাচাই করা উচিত।
সুসংবাদ: লেখকরা কোড, চেকপয়েন্ট এবং মানব পছন্দের ডেটাসেট প্রকাশ করার পরিকল্পনা করছেন। এটি অন্যান্য দলকে পরীক্ষা চালিয়ে যেতে এবং শক্তিবর্ধক শিক্ষার আরও জটিল পদ্ধতি চেষ্টা করার সুযোগ দেবে।
আপাতত মূল উপসংহারটি প্রায় প্যারাডক্সিক্যাল শোনায়: বড় ভাষার মডেলগুলো ডায়ালেক্ট বোঝার ক্ষেত্রে ক্রমশ ভালো হচ্ছে, কিন্তু সেগুলোতে কথা বলার তাদের ক্ষমতা একটি অমীমাংসিত সমস্যা থেকে যাচ্ছে, যা শুধু প্রশিক্ষণ ডেটার পরিমাণ বাড়িয়ে সমাধান করা যাবে না।



