টোকেন সমান নয়: RACER ওয়েট স্তরে মাল্টিমোডাল মডেল থেকে ব্যাকডোর পরিষ্কার করে

19 সেপ্টেম্বর 2026১৬ প্রদর্শন

গবেষকরা RACER প্রস্তাব করেছেন — মাল্টিমোডাল LLM মেরামতের একটি পদ্ধতি, যা ব্যাকডোরের চিহ্ন ইনপুট ডেটায় নয়, বরং স্তরগুলির মধ্যে উপস্থাপনার অসঙ্গতিতে খোঁজে, আলাদাভাবে ছবি ও টেক্সটের জন্য। পদ্ধতিটির জন্য কয়েকশো পরিচ্ছন্ন উদাহরণই যথেষ্ট, এবং এতে আক্রমণের ট্রিগার, লক্ষ্য, এমনকি মডেলটি সংক্রমিত কি না তা জানারও প্রয়োজন হয় না।

টোকেন সমান নয়: RACER ওয়েট স্তরে মাল্টিমোডাল মডেল থেকে ব্যাকডোর পরিষ্কার করে

পিছনের দরজা ব্যবহারকারীর কাছ থেকে নয়, পাইপলাইন থেকে আসে

মাল্টিমোডাল মডেলগুলো 점점 더 ঘনিষ্ঠভাবে প্রায়োগিক পরিস্থিতিতে যুক্ত হচ্ছে: তারা স্ক্রিনশট পড়ে, পণ্যের ছবি বিশ্লেষণ করে, নথির স্ক্যান নিয়ে প্রশ্নের উত্তর দেয়। সুবিধার সঙ্গে সঙ্গেই পণ্যে ঢুকে পড়ে অন্যের দুর্বলতাও। মডেল তৈরি হয় রেডিমেড উপাদান থেকে — ভিজ্যুয়াল এনকোডার, প্রজেকশন, ভাষার অংশ — এবং সংযোজনের প্রতিটি ধাপে সেখানে একটি লুকানো ট্রিগার ঢুকে পড়তে পারে। কখনো তা ছবিতে লুকানো থাকে, কখনো টেক্সটে, আবার কখনো দুটি সংকেতের সমন্বয় প্রয়োজন হয়।

এরপর শুরু হয় অপ্রিয় পরিস্থিতি। যে টুলগুলো "বিষাক্ত" ক্লাসিফায়ারের সঙ্গে বেশ ভালোভাবে মানিয়ে নিয়েছিল, মাল্টিমোডাল মডেলে তারা লক্ষণীয়ভাবে দুর্বল হয়ে পড়ে: অনেক বেশি স্তর, অনেক বেশি ভিন্ন মোডালিটি, অনেক বেশি জটিল অভ্যন্তরীণ উপস্থাপনার জ্যামিতি। আর যে সমাধানগুলো বিশেষভাবে MLLM-এর জন্য তৈরি করা হয়েছিল, সেগুলো বেশিরভাগ ক্ষেত্রেই ইনপুটে কাজ করে — সন্দেহজনক অনুরোধ নেটওয়ার্কে পৌঁছানোর আগেই ছেঁকে ফেলে। ফিল্টার একটি নির্দিষ্ট আক্রমণ থামাতে পারে, কিন্তু সংক্রমণটি ওয়েটেই থেকে যায়। ফিল্টার এড়িয়ে যাওয়া — আক্রমণকারীর উদ্ভাবনী ক্ষমতার প্রশ্ন।

স্তরভিত্তিক অসঙ্গতি আক্রমণের ছাপ হিসেবে

arXiv:2608.24354 গবেষণাপত্রের লেখকরা (Jiali Wei এবং আরও আটজন সহ-লেখক; বিভাগ cs.CR, cs.AI, cs.CL, জমা — আগস্ট ২০২৬) এমন একটি বিষয়ের দিকে মনোযোগ দিয়েছেন, যা শুধু ইনপুট ও আউটপুট দেখলে সহজেই এড়িয়ে যাওয়া যায়। পিছনের দরজা একটি স্তরে নয়, বরং গতিপথে চিহ্ন রেখে যায়: স্তর থেকে স্তরে যাওয়ার সময় উপস্থাপনাগুলো অস্বাভাবিকভাবে পরিবর্তিত হয়। এটিকে স্তরভিত্তিক অসঙ্গতি-বিষমতা নাম দেওয়া হয়েছে।

মূল বিষয়টি হলো — অসঙ্গতিটি পুরো নেটওয়ার্ক জুড়ে সমানভাবে ছড়িয়ে থাকে না। এটি মোডালিটির সঙ্গে যুক্ত এবং আরও গুরুত্বপূর্ণভাবে, টোকেনের সেই অঞ্চলে সীমাবদ্ধ যেখানে ট্রিগারের বৈশিষ্ট্য অবস্থিত। অন্য কথায়, মডেল উপস্থাপনার একটি সংকীর্ণ অংশের উপর "নির্ভর" করে, এবং ঠিক সেখানেই এমন একটি বিচ্যুতি ঘটে, যা পরিষ্কার ডেটায় ঘটে না।

এখান থেকেই ব্যবহারিক সিদ্ধান্ত: যদি পুরো উপস্থাপনা জুড়ে অসঙ্গতি গড় করা হয়, তাহলে উপকারী বৈশিষ্ট্যের শব্দে সংকেতটি ম্লান হয়ে যায়। প্রথমে মডেল যা ইতিমধ্যে মিশিয়ে ফেলেছে, তা আলাদা করতে হবে।

RACER কীভাবে গঠিত

মোডালিটি অনুযায়ী বিভাজন

মডেল-স্তরের পুনরুদ্ধার ফ্রেমওয়ার্ক — ইনফারেন্সের উপর একটি ওভারলে নয় — নাম পেয়েছে RACER (Region-Aware Consistency Repair)। যুক্তিটি এমন: মিলিত উপস্থাপনাকে আবার ভিজ্যুয়াল ও টেক্সট টোকেন-অঞ্চলে ভাগ করা হয়, প্রতিটির জন্য আলাদাভাবে স্তরভিত্তিক অসঙ্গতি গণনা করা হয়, তারপর আবার একত্র করা হয়, তবে এবার মোডালিটি বিবেচনায় নেওয়া ওয়েট সহ। কাজটি গভীর স্তরগুলোর একটি উইন্ডোতে চলে — যেখানে স্থিতিশীল, দিকনির্দেশিত বিচ্যুতি তৈরি হয়।

ফলাফল — একটি অঞ্চল-সচেতন লক্ষ্য ফাংশন। এটি পুরো ভেক্টর জুড়ে সাধারণ মেট্রিকের চেয়ে স্থানীয় অসঙ্গতির প্রতি বেশি সংবেদনশীল, এবং উপকারী বৈশিষ্ট্যগুলোকে পিছনের দরজার সংকেত চাপা দিতে দেয় না।

সাধারণ ফাইন-টিউনিংয়ের বদলে min-max

এরপর চালু হয় প্রতিদ্বন্দ্বিতামূলক স্কিম। min-max অপ্টিমাইজেশনের মাধ্যমে ফ্রেমওয়ার্ক প্রথমে সবচেয়ে খারাপ বিশৃঙ্খলা খুঁজে বের করে — যা সনাক্ত করা অসঙ্গতিকে সর্বাধিক বাড়িয়ে তোলে — তারপর মডেলকে এমনভাবে ফাইন-টিউন করে যাতে এই বিশৃঙ্খলা তাকে ভেঙে না ফেলে। সহজ কথায়: নিজেদের উপর আক্রমণ করে উপস্থাপনার সেই দিকগুলোকে কঠিন করে তোলা হয়, যেগুলোর উপর ক্ষতিকর আচরণ নির্ভর করে।

ব্যবহারিক দিকটিও প্রযুক্তিগত দিকের চেয়ে কম গুরুত্বপূর্ণ নয়। পদ্ধতিটির মাত্র ১০০টি পরিষ্কার উদাহরণ প্রয়োজন। এটির ট্রিগার নিজেই, আক্রমণের লক্ষ্য লেবেল, এমনকি প্রদত্ত মডেলটি সংক্রমিত কিনা তা জানারও প্রয়োজন নেই। এটি মৌলিক: সুরক্ষা "আক্রমণ অনুমান করো" কাজে পরিণত হয় না।

পরিমাপ কী দেখিয়েছে

লেখকরা পদ্ধতিটি তিনটি উন্মুক্ত মাল্টিমোডাল মডেলে ৩৬টি পিছনের দরজার কনফিগারেশনে চালিয়েছেন — ছবিতে, টেক্সটে এবং একসঙ্গে উভয় চ্যানেলে ট্রিগার সহ। গড় ASR (আক্রমণ সফল হওয়ার অনুপাত) ১.১%-এ নামিয়ে আনা সম্ভব হয়েছে, এবং ৩৬টির মধ্যে ৩২টি কনফিগারেশনে সূচকটি শূন্যে নেমে এসেছে।

দ্বিতীয় ফলাফলটিও কম গুরুত্বপূর্ণ নয়, যদিও এটি নিয়ে কম কথা বলা হয়: পরিষ্কার কাজে উপযোগিতা সংরক্ষিত থাকে। তাছাড়া সংক্রমিত মডেল এবং প্রাথমিকভাবে পরিষ্কার মডেল — উভয় ক্ষেত্রেই, অর্থাৎ পুনরুদ্ধার একটি কার্যকর মডেলকে সতর্ক কিন্তু অকেজোতে পরিণত করে না। আক্রমণাত্মক পরিষ্কার পদ্ধতির জন্য এটি সাধারণ মূল্য, এবং এখানে পরিমাপ অনুযায়ী তা এড়ানো সম্ভব হয়েছে।

এটি বাস্তবে কী পরিবর্তন করে

ইনপুট ফিল্টারিং এবং ওয়েট পুনরুদ্ধারের মধ্যে পার্থক্য একাডেমিক নয়। ফিল্টার মডেলের চারপাশের অবকাঠামোতে বাস করে: এটি রক্ষণাবেক্ষণ করতে হয়, নতুন ধরনের আক্রমণের জন্য আপডেট করতে হয়, এবং তবুও অন্য চ্যানেল দিয়ে এড়িয়ে যাওয়া সম্ভব। ওয়েট স্তরে সংশোধন উপসর্গ নয়, কারণ দূর করে, এবং ইনফারেন্সে বিলম্ব যোগ করে না।

আরও বিস্তৃত একটি বিষয়ও আছে। আমরা মডেলের নিরাপত্তা মূল্যায়ন করতে অভ্যস্ত তার পরীক্ষার উত্তর দিয়ে, কিন্তু RACER দেখায় যে তথ্যবহুল সংকেত মধ্যবর্তী উপস্থাপনায় লুকিয়ে থাকে — নেটওয়ার্ক কীভাবে ভাবে, তার মধ্যে, কী বলে তার মধ্যে নয়। যদি এই পদ্ধতি তিনটি পরীক্ষিত আর্কিটেকচারের বাইরে ছড়িয়ে পড়ে, তাহলে MLLM সরবরাহকারীদের জন্য তুলনামূলকভাবে সস্তা একটি স্বাস্থ্যবিধি পদক্ষেপ তৈরি হয়: একশোটি পরিষ্কার উদাহরণ এবং ওয়েট প্রকাশের আগে কিছুটা গণনা। সীমাবদ্ধতাগুলোও স্পষ্ট — গবেষণাটি আক্রমণের একটি নির্দিষ্ট শ্রেণির দিকে তাকায় এবং মডেলের অভ্যন্তরে প্রবেশাধিকার প্রয়োজন, তাই বন্ধ API-মডেলের জন্য স্কিমটি সরাসরি প্রযোজ্য নয়।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
টোকেন সমান নয়: RACER ওয়েট স্তরে মাল্টিমোডাল মডেল থেকে ব্যাকডোর পরিষ্কার করে