ইংরেজি-কেন্দ্রিক «প্রশিক্ষণ» — সমস্যার মূল
আধুনিক বড় ভাষার মডেল নিশ্চিন্তে কয়েক ডজন ভাষায় কথা বলতে পারে, কিন্তু নিরাপত্তা নিয়ে ভাবতে তাকে শেখানো হয়েছে মূলত ইংরেজিতে। অ্যালাইনমেন্ট পর্যায়, যেখানে মডেলটি সীমাবদ্ধতা পায় — ক্ষতিকর কন্টেন্ট, বিষাক্ত মন্তব্য, বিপজ্জনক পরামর্শের বিরুদ্ধে — প্রায় সম্পূর্ণভাবে ইংরেজি ডেটা এবং ইংরেজি পরীক্ষার উপর ভিত্তি করে তৈরি। «রেড টিম» সেট, অ্যানোটেটরদের জন্য নির্দেশিকা, রেফারেন্স রিফিউজাল উদাহরণ — এই সবই প্রথমে ইংরেজির জন্য।
পদ্ধতিগতভাবে এই সমস্যাটি বর্ণনা করেছেন গবেষক নাম্যা ভাটনাগর তাঁর কাজ «Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs» (arXiv:2608.18131, বিভাগ Computer Science > Artificial Intelligence) এ। নিবন্ধটি ২৬ জুলাই ২০২৬ তারিখে জমা দেওয়া হয়েছে এবং IEEE SLT 2026 — স্পিচ টেকনোলজি সংক্রান্ত সম্মেলনে উপস্থাপনের জন্য ঘোষিত। এতে একটি প্রভাব নথিভুক্ত করা হয়েছে, যাকে নিরাপত্তার বিভ্রম বলা উচিত: মডেলটি দেখতে নির্ভরযোগ্যভাবে সুরক্ষিত, যতক্ষণ কথোপকথন ইংরেজিতে কথা বলে, এবং এই ভাষার বাইরে তা সুরক্ষিত থাকা বন্ধ করে দেয়।

এই ফাঁকটি ব্যাখ্যাযোগ্য: মডেলটি তার প্রশিক্ষণের উদাহরণগুলির মাধ্যমে একটি বাক্যের ক্ষতিকরতা চিনতে পারে। বাংলা, তামিল বা মারাঠি বাক্যাংশ একই বার্তা নিয়ে ফিল্টারের নজরের বাইরে থেকে যেতে পারে — ডেটাতে এমন কোনো «ক্ষতিকর» উদাহরণ ছিল না। ফলে একটি স্টিরিওটাইপিকাল উত্তর সেখানে চলে যায়, যেখানে ইংরেজি সমতুল্য শুরু থেকেই ব্লক হয়ে যেত।
ভয়েস: যখন ত্রুটি সাথে সাথে দেখা যায়
সবচেয়ে বিপজ্জনকভাবে এই ফাঁকটি ভয়েস ইন্টারফেসে প্রকাশ পায়। কথোপকথন সহায়কদের দীর্ঘ যাচাইয়ের অধিকার নেই: এখুনি উত্তর দিতে হবে, এবং ব্যবহারকারীর বক্তব্য জীবন্ত — সুর, সংক্ষিপ্ত রূপ এবং ভাষার মিশ্রণ সহ। এমন পরিস্থিতিতে ইংরেজি-কেন্দ্রিক ফিল্টার অ-ইংরেজি ইনপুটের জন্য কাজ করে না, এবং সিস্টেম এমন উত্তর দিতে পারে যা সামাজিক স্টিরিওটাইপকে শক্তিশালী করে — বর্ণ, আঞ্চলিক, ধর্মীয় বা পেশাগত পরিচয়ের ভিত্তিতে।
ভারতের ভাষাগতভাবে বৈচিত্র্যময় জনগোষ্ঠীর মধ্যে স্থাপিত ভয়েস প্রযুক্তির জন্য, লেখকের মতে, এটি একটি সমালোচনামূলক ব্যর্থতার মোড। ব্যবহারকারী তাৎক্ষণিকভাবে, মৌখিক আকারে, পুনরায় যাচাই বা চ্যালেঞ্জ করার সুযোগ ছাড়াই ক্ষতিকর উত্তর পান। এবং ঠিক অ-ইংরেজিভাষী সম্প্রদায়গুলিই প্রধান ক্ষতিগ্রস্ত অঞ্চল: যে পক্ষপাতমূলক বক্তব্য মডেলটি ইংরেজিতে অনুমতি দিত না, তা আঞ্চলিক ভাষায় কোনো সুরক্ষা ছাড়াই শোনা যায়। এটি ভবিষ্যত প্রজন্মের সিস্টেমের কোনো অনুমানমূলক ঝুঁকি নয়, বরং আজই কাজে একটি লক্ষণীয় ত্রুটি।
INCLUDE: পক্ষপাত পরিমাপের জন্য ভারতীয় দৃষ্টিভঙ্গি
সমস্যার মাত্রা মূল্যায়ন করতে, শুধু বিবৃতি যথেষ্ট নয় — একটি পরিমাপের সরঞ্জাম দরকার। লেখক INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases) উপস্থাপন করেছেন: একটি বহুভাষিক মূল্যায়ন বেঞ্চমার্ক, যা ভারতীয় প্রেক্ষাপটে সামাজিক-সাংস্কৃতিক পক্ষপাতের পরিমাণগত মূল্যায়নের জন্য তৈরি।
বেঞ্চমার্কটি ছয়টি ভাষায় 2604টি প্রম্পটের উপর নির্মিত:
- ইংরেজি;
- হিন্দি;
- বাংলা;
- মারাঠি;
- তামিল;
- হিংলিশ — হিন্দি এবং ইংরেজির একটি সংকর, যা দৈনন্দিন জীবনে অনেক ভারতীয় ব্যবহার করেন।
মূল ধারণা — ইংরেজি পরীক্ষাগুলি আক্ষরিকভাবে অনুবাদ করা নয়, বরং ভারতীয় সাংস্কৃতিক বাস্তবতার মাধ্যমে পক্ষপাত খোঁজা। এই সেটে দশটি মডেল চালানো হয়েছে — ওপেন এবং ক্লোজড সোর্স — এবং মোট 14,988টি পক্ষপাত সূচক সংগ্রহ করা হয়েছে। এই পরিমাণ পৃথক «ভুল» নয়, বরং পদ্ধতিগত নিদর্শন দেখতে দেয়।
পরিমাপের সবচেয়ে অপ্রত্যাশিত ফলাফল
পরিসংখ্যান বিশ্লেষণ দুটি মূল পর্যবেক্ষণ দিয়েছে, এবং প্রতিটি আলাদা মনোযোগের দাবি রাখে।
ওপেন মডেলগুলিতে বাংলা সবচেয়ে খারাপ পারফর্ম করেছে। এই ভাষায় গড় পক্ষপাতের মাত্রা ওপেন সোর্স মডেলগুলির মধ্যে সর্বোচ্চ ছিল। এটি একটি বিশেষভাবে অপ্রীতিকর সংকেত: ওপেন LLM-গুলিকে প্রায়শই পুনরায় প্রশিক্ষণ দেওয়া হয় এবং স্থানীয়ভাবে স্থাপন করা হয়, এবং তাই তারাই ভারত ও বাংলাদেশের অন্যতম বৃহত্তম ভাষায় সবচেয়ে বেশি «পিছলে যায়»।

ইংরেজি একটি মোড় দিয়ে অবাক করেছে। ওপেন মডেলগুলিতে এটি সর্বনিম্ন গড় পক্ষপাতের মাত্রা দিয়েছে, কিন্তু ক্লোজড মডেলগুলিতে — বিপরীতে, সর্বোচ্চ। «মালিকানাধীন মডেল ওপেন মডেলের চেয়ে নিরাপদ» এই পরিচিত চিত্রটি এখানে কাজ করে না: ইংরেজিতে ক্লোজড LLM-গুলি অপ্রত্যাশিতভাবে ওপেন মডেলগুলির কাছে হেরে যায়। অন্য কথায়, ভাষা অনুসারে পক্ষপাতের বন্টন দৃঢ়ভাবে নির্ভর করে আপনি কোন শ্রেণীর মডেলের সাথে কাজ করছেন তার উপর।
উপসংহার: নিরাপত্তা আক্ষরিকভাবে অনুবাদ করা যায় না
গবেষণার প্রধান শিক্ষা — সাংস্কৃতিক পক্ষপাত একটি সার্বজনীন ইংরেজি ফিল্টার দিয়ে ধরা পড়ে না। ইংরেজি নিয়মের সহজ অনুবাদ অন্যান্য ভাষায় রক্ষা করে না: স্টিরিওটাইপ স্থানীয় প্রেক্ষাপটে প্রোথিত, এবং মডেলকে সেই ভাষা এবং সংস্কৃতিতে সেগুলি চিনতে শিখতে হবে যেখানে সেগুলি উদ্ভূত হয়।
শিল্পের অ্যালাইনমেন্টের অনুশীলনটি পুনর্বিবেচনা করা উচিত: প্রশিক্ষণে অ-ইংরেজি পরিস্থিতি অন্তর্ভুক্ত করা, লক্ষ্য ভাষাভাষী সম্প্রদায়ের অ্যানোটেটর নিয়োগ করা এবং INCLUDE-এর মতো বহুভাষিক বেঞ্চমার্কের মাধ্যমে নিয়মিত মডেল চালানো। অন্যথায় একটি প্যারাডক্স তৈরি হয়: মডেল যত বেশি ভাষা জানে, তত বিস্তৃত শ্রোতা যাদের তার সুরক্ষা কভার করে না।

যদি নিরাপত্তা ইংরেজি-কেন্দ্রিক থাকতে থাকে, তবে «অ্যালাইনমেন্ট বিভ্রম» LLM-এর প্রতিটি নতুন প্রজন্মে পুনরুত্পাদিত হবে। সবচেয়ে ঝুঁকিপূর্ণ পয়েন্ট হিসাবে বৃহৎ অ-ইংরেজি ভাষার ভয়েস সিস্টেমগুলিই থাকবে — এবং এর মূল্য দিতে হবে বাস্তব ব্যবহারকারীদের।



