LLM সুরক্ষা ফিল্টার ইংরেজির বাইরে ব্যর্থ: কীভাবে মডেল অন্যান্য ভাষায় স্টেরিওটাইপ শক্তিশালী করে

9 সেপ্টেম্বর 2026৪ প্রদর্শন

গবেষকরা বৃহৎ ভাষা মডেলগুলির নিরাপত্তায় একটি গুরুতর আন্তঃভাষিক ভারসাম্যহীনতা চিহ্নিত করেছেন: তাদের অ্যালাইনমেন্ট মূলত ইংরেজির উপর কেন্দ্রীভূত, তাই অন্যান্য ভাষায় মডেলগুলি সীমাবদ্ধতা অতিক্রম করা এবং ক্ষতিকারক পক্ষপাত পুনরুৎপাদন করা সহজতর। নতুন INCLUDE বেঞ্চমার্ক, যা দশটি মডেল এবং ছয়টি ভারতীয় ভাষায় পরীক্ষা করা হয়েছে, দেখিয়েছে যে পক্ষপাতের মাত্রা ভাষা এবং মডেলের ধরনের উপর নির্ভর করে উল্লেখযোগ্যভাবে ভিন্ন।

LLM সুরক্ষা ফিল্টার ইংরেজির বাইরে ব্যর্থ: কীভাবে মডেল অন্যান্য ভাষায় স্টেরিওটাইপ শক্তিশালী করে

ইংরেজি-কেন্দ্রিক «প্রশিক্ষণ» — সমস্যার মূল

আধুনিক বড় ভাষার মডেল নিশ্চিন্তে কয়েক ডজন ভাষায় কথা বলতে পারে, কিন্তু নিরাপত্তা নিয়ে ভাবতে তাকে শেখানো হয়েছে মূলত ইংরেজিতে। অ্যালাইনমেন্ট পর্যায়, যেখানে মডেলটি সীমাবদ্ধতা পায় — ক্ষতিকর কন্টেন্ট, বিষাক্ত মন্তব্য, বিপজ্জনক পরামর্শের বিরুদ্ধে — প্রায় সম্পূর্ণভাবে ইংরেজি ডেটা এবং ইংরেজি পরীক্ষার উপর ভিত্তি করে তৈরি। «রেড টিম» সেট, অ্যানোটেটরদের জন্য নির্দেশিকা, রেফারেন্স রিফিউজাল উদাহরণ — এই সবই প্রথমে ইংরেজির জন্য।

পদ্ধতিগতভাবে এই সমস্যাটি বর্ণনা করেছেন গবেষক নাম্যা ভাটনাগর তাঁর কাজ «Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs» (arXiv:2608.18131, বিভাগ Computer Science > Artificial Intelligence) এ। নিবন্ধটি ২৬ জুলাই ২০২৬ তারিখে জমা দেওয়া হয়েছে এবং IEEE SLT 2026 — স্পিচ টেকনোলজি সংক্রান্ত সম্মেলনে উপস্থাপনের জন্য ঘোষিত। এতে একটি প্রভাব নথিভুক্ত করা হয়েছে, যাকে নিরাপত্তার বিভ্রম বলা উচিত: মডেলটি দেখতে নির্ভরযোগ্যভাবে সুরক্ষিত, যতক্ষণ কথোপকথন ইংরেজিতে কথা বলে, এবং এই ভাষার বাইরে তা সুরক্ষিত থাকা বন্ধ করে দেয়।

এই ফাঁকটি ব্যাখ্যাযোগ্য: মডেলটি তার প্রশিক্ষণের উদাহরণগুলির মাধ্যমে একটি বাক্যের ক্ষতিকরতা চিনতে পারে। বাংলা, তামিল বা মারাঠি বাক্যাংশ একই বার্তা নিয়ে ফিল্টারের নজরের বাইরে থেকে যেতে পারে — ডেটাতে এমন কোনো «ক্ষতিকর» উদাহরণ ছিল না। ফলে একটি স্টিরিওটাইপিকাল উত্তর সেখানে চলে যায়, যেখানে ইংরেজি সমতুল্য শুরু থেকেই ব্লক হয়ে যেত।

ভয়েস: যখন ত্রুটি সাথে সাথে দেখা যায়

সবচেয়ে বিপজ্জনকভাবে এই ফাঁকটি ভয়েস ইন্টারফেসে প্রকাশ পায়। কথোপকথন সহায়কদের দীর্ঘ যাচাইয়ের অধিকার নেই: এখুনি উত্তর দিতে হবে, এবং ব্যবহারকারীর বক্তব্য জীবন্ত — সুর, সংক্ষিপ্ত রূপ এবং ভাষার মিশ্রণ সহ। এমন পরিস্থিতিতে ইংরেজি-কেন্দ্রিক ফিল্টার অ-ইংরেজি ইনপুটের জন্য কাজ করে না, এবং সিস্টেম এমন উত্তর দিতে পারে যা সামাজিক স্টিরিওটাইপকে শক্তিশালী করে — বর্ণ, আঞ্চলিক, ধর্মীয় বা পেশাগত পরিচয়ের ভিত্তিতে।

ভারতের ভাষাগতভাবে বৈচিত্র্যময় জনগোষ্ঠীর মধ্যে স্থাপিত ভয়েস প্রযুক্তির জন্য, লেখকের মতে, এটি একটি সমালোচনামূলক ব্যর্থতার মোড। ব্যবহারকারী তাৎক্ষণিকভাবে, মৌখিক আকারে, পুনরায় যাচাই বা চ্যালেঞ্জ করার সুযোগ ছাড়াই ক্ষতিকর উত্তর পান। এবং ঠিক অ-ইংরেজিভাষী সম্প্রদায়গুলিই প্রধান ক্ষতিগ্রস্ত অঞ্চল: যে পক্ষপাতমূলক বক্তব্য মডেলটি ইংরেজিতে অনুমতি দিত না, তা আঞ্চলিক ভাষায় কোনো সুরক্ষা ছাড়াই শোনা যায়। এটি ভবিষ্যত প্রজন্মের সিস্টেমের কোনো অনুমানমূলক ঝুঁকি নয়, বরং আজই কাজে একটি লক্ষণীয় ত্রুটি।

INCLUDE: পক্ষপাত পরিমাপের জন্য ভারতীয় দৃষ্টিভঙ্গি

সমস্যার মাত্রা মূল্যায়ন করতে, শুধু বিবৃতি যথেষ্ট নয় — একটি পরিমাপের সরঞ্জাম দরকার। লেখক INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases) উপস্থাপন করেছেন: একটি বহুভাষিক মূল্যায়ন বেঞ্চমার্ক, যা ভারতীয় প্রেক্ষাপটে সামাজিক-সাংস্কৃতিক পক্ষপাতের পরিমাণগত মূল্যায়নের জন্য তৈরি।

বেঞ্চমার্কটি ছয়টি ভাষায় 2604টি প্রম্পটের উপর নির্মিত:

  • ইংরেজি;
  • হিন্দি;
  • বাংলা;
  • মারাঠি;
  • তামিল;
  • হিংলিশ — হিন্দি এবং ইংরেজির একটি সংকর, যা দৈনন্দিন জীবনে অনেক ভারতীয় ব্যবহার করেন।

মূল ধারণা — ইংরেজি পরীক্ষাগুলি আক্ষরিকভাবে অনুবাদ করা নয়, বরং ভারতীয় সাংস্কৃতিক বাস্তবতার মাধ্যমে পক্ষপাত খোঁজা। এই সেটে দশটি মডেল চালানো হয়েছে — ওপেন এবং ক্লোজড সোর্স — এবং মোট 14,988টি পক্ষপাত সূচক সংগ্রহ করা হয়েছে। এই পরিমাণ পৃথক «ভুল» নয়, বরং পদ্ধতিগত নিদর্শন দেখতে দেয়।

পরিমাপের সবচেয়ে অপ্রত্যাশিত ফলাফল

পরিসংখ্যান বিশ্লেষণ দুটি মূল পর্যবেক্ষণ দিয়েছে, এবং প্রতিটি আলাদা মনোযোগের দাবি রাখে।

ওপেন মডেলগুলিতে বাংলা সবচেয়ে খারাপ পারফর্ম করেছে। এই ভাষায় গড় পক্ষপাতের মাত্রা ওপেন সোর্স মডেলগুলির মধ্যে সর্বোচ্চ ছিল। এটি একটি বিশেষভাবে অপ্রীতিকর সংকেত: ওপেন LLM-গুলিকে প্রায়শই পুনরায় প্রশিক্ষণ দেওয়া হয় এবং স্থানীয়ভাবে স্থাপন করা হয়, এবং তাই তারাই ভারত ও বাংলাদেশের অন্যতম বৃহত্তম ভাষায় সবচেয়ে বেশি «পিছলে যায়»।

ইংরেজি একটি মোড় দিয়ে অবাক করেছে। ওপেন মডেলগুলিতে এটি সর্বনিম্ন গড় পক্ষপাতের মাত্রা দিয়েছে, কিন্তু ক্লোজড মডেলগুলিতে — বিপরীতে, সর্বোচ্চ। «মালিকানাধীন মডেল ওপেন মডেলের চেয়ে নিরাপদ» এই পরিচিত চিত্রটি এখানে কাজ করে না: ইংরেজিতে ক্লোজড LLM-গুলি অপ্রত্যাশিতভাবে ওপেন মডেলগুলির কাছে হেরে যায়। অন্য কথায়, ভাষা অনুসারে পক্ষপাতের বন্টন দৃঢ়ভাবে নির্ভর করে আপনি কোন শ্রেণীর মডেলের সাথে কাজ করছেন তার উপর।

উপসংহার: নিরাপত্তা আক্ষরিকভাবে অনুবাদ করা যায় না

গবেষণার প্রধান শিক্ষা — সাংস্কৃতিক পক্ষপাত একটি সার্বজনীন ইংরেজি ফিল্টার দিয়ে ধরা পড়ে না। ইংরেজি নিয়মের সহজ অনুবাদ অন্যান্য ভাষায় রক্ষা করে না: স্টিরিওটাইপ স্থানীয় প্রেক্ষাপটে প্রোথিত, এবং মডেলকে সেই ভাষা এবং সংস্কৃতিতে সেগুলি চিনতে শিখতে হবে যেখানে সেগুলি উদ্ভূত হয়।

শিল্পের অ্যালাইনমেন্টের অনুশীলনটি পুনর্বিবেচনা করা উচিত: প্রশিক্ষণে অ-ইংরেজি পরিস্থিতি অন্তর্ভুক্ত করা, লক্ষ্য ভাষাভাষী সম্প্রদায়ের অ্যানোটেটর নিয়োগ করা এবং INCLUDE-এর মতো বহুভাষিক বেঞ্চমার্কের মাধ্যমে নিয়মিত মডেল চালানো। অন্যথায় একটি প্যারাডক্স তৈরি হয়: মডেল যত বেশি ভাষা জানে, তত বিস্তৃত শ্রোতা যাদের তার সুরক্ষা কভার করে না।

যদি নিরাপত্তা ইংরেজি-কেন্দ্রিক থাকতে থাকে, তবে «অ্যালাইনমেন্ট বিভ্রম» LLM-এর প্রতিটি নতুন প্রজন্মে পুনরুত্পাদিত হবে। সবচেয়ে ঝুঁকিপূর্ণ পয়েন্ট হিসাবে বৃহৎ অ-ইংরেজি ভাষার ভয়েস সিস্টেমগুলিই থাকবে — এবং এর মূল্য দিতে হবে বাস্তব ব্যবহারকারীদের।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
LLM সুরক্ষা ফিল্টার ইংরেজির বাইরে ব্যর্থ: কীভাবে মডেল অন্যান্য ভাষায় স্টেরিওটাইপ শক্তিশালী করে