ভূমিকা: কেন জেলব্রেক একটি সমস্যা
আধুনিক ভাষা মডেলগুলো ক্ষতিকারক বা বিপজ্জনক অনুরোধ প্রত্যাখ্যান করার চেষ্টা করে, কিন্তু কোনো সুরক্ষাই নিখুঁত নয়। জেলব্রেক-আক্রমণ এমন প্রম্পট তৈরি করে যা এই সীমাবদ্ধতাগুলোকে এড়িয়ে যায়: তারা একটি অনুমানমূলক পরিস্থিতি কল্পনা করতে বলে, ভূমিকা পরিবর্তন করতে বলে, কাজটিকে "নিরাপদ" উপায়ে পুনর্লিখন করতে বলে এবং আরও অনেক কিছু। গবেষক এবং সুরক্ষাকারীরা বুঝতে চান যে এই ধরনের আক্রমণ আসলে কতটা বিপজ্জনক।
বেশিরভাগ আক্রমণ ব্ল্যাক-বক্স মোডে কাজ করে: আক্রমণকারীর কাছে মডেলের ওজনগুলিতে অ্যাক্সেস নেই, এর অভ্যন্তরীণ প্রক্রিয়া বিশ্লেষণ করার কোনো সুযোগ নেই। শুধুমাত্র একটি API আছে, যেখানে অনুরোধ পাঠানো এবং উত্তর পাওয়া যায়। তাই আক্রমণকারীর সমস্ত প্রচেষ্টা টেক্সট নির্বাচনের মধ্যে সীমাবদ্ধ। একটি আক্রমণ কতটা ভালো তা মূল্যায়ন করতে, শুধু সুরক্ষা এড়ানো গেছে কিনা তা নয়, কী মূল্যে তা-ও বুঝতে হবে।
সাধারণত একটি সহজ মেট্রিক ব্যবহার করা হয় — সফল প্রচেষ্টার অনুপাত (ASR)। কিন্তু এটি দেখায় না যে কতগুলো অনুরোধ করতে হয়েছে। আর আসলে মডেলের কাছে যতবার আবেদন করা হয়, সেটাই প্রায়শই বাস্তবে প্রধান সীমাবদ্ধতা হয়ে দাঁড়ায়: যত বেশি অনুরোধ, তত বেশি ধরা পড়ার সম্ভাবনা, সময় এবং অর্থের দিক থেকে আক্রমণ তত বেশি ব্যয়বহুল।
ASR একটি প্রতারণামূলক মেট্রিক হিসেবে
আসুন দুটি আক্রমণের পদ্ধতি কল্পনা করি। প্রথমটি শত শত প্রম্পটের ভেরিয়েন্ট চেষ্টা করে, যতক্ষণ না একটি কাজ করে। দ্বিতীয়টি একটি পূর্ব-যাচাইকৃত টেমপ্লেট ব্যবহার করে এবং তিনটি প্রচেষ্টায় ফলাফল পায়। যদি উভয়ের সাফল্যের শতাংশ একই হয়, তাহলে ASR-এর দিকে তাকালে তারা সমান মনে হবে। কিন্তু বাস্তব পরিস্থিতিতে দ্বিতীয় পদ্ধতিটি স্পষ্টতই বেশি বিপজ্জনক: এটি দ্রুততর, সস্তা এবং কম চিহ্ন রেখে যায়।
এই কারণেই শুধুমাত্র ASR-এর ভিত্তিতে তুলনা করা এমন এক ধরনের শ্যুটিং প্রতিযোগিতার মতো, যেখানে একজন তিন মিটার থেকে গুলি করে, আর অন্যজন ত্রিশ মিটার থেকে, কিন্তু বিজয় নির্ধারিত হয় হিটের সংখ্যা দিয়ে। শর্তগুলো বিবেচনা না করলে ফলাফল অর্থহীন। জেলব্রেকের জন্য, এই শর্তটি হওয়া উচিত মডেলের কাছে আবেদনের বাজেট।

Fair-ASR: আবেদন গণনা করা
সম্প্রতি arXiv-এ প্রকাশিত একটি কাজে গবেষকরা Fair-ASR প্রোটোকল প্রস্তাব করেছেন। এর মূল কথা হলো — একই সীমিত সংখ্যক টার্গেট কলের মধ্যে আক্রমণগুলোর তুলনা করা। টার্গেট কল হলো আক্রমণকৃত মডেলের কাছে সরাসরি আবেদন: প্রম্পট পাঠানো হলো, উত্তর পাওয়া গেল। এই সীমাবদ্ধতা সহজে নিয়ন্ত্রণ করা যায়, এটি যেকোনো পদ্ধতির জন্য একই এবং মডেলের অভ্যন্তরীণ কাঠামো জানার প্রয়োজন হয় না।
এটি কেন গুরুত্বপূর্ণ? কিছু মেট্রিক গণনাগত জটিলতা বিবেচনা করার চেষ্টা করে, যেমন FLOPS-এর মাধ্যমে। কিন্তু বন্ধ এবং মালিকানাধীন মডেলগুলোর জন্য এই ধরনের অনুমান সঠিক নয়। আর আবেদনের সংখ্যা — একটি সরাসরি এবং বোধগম্য সূচক। যদি একটি আক্রমণ ১০টি অনুরোধে সফল হয়, আর অন্যটির ১০০০টি প্রয়োজন হয়, তাহলে ১০-এর বাজেটে দ্বিতীয়টি আদৌ ঘটবে না।
এছাড়াও গবেষকরা আলাদাভাবে তথাকথিত আক্রমণকারীর কলগুলোর উপর নজর রাখার পরামর্শ দেন — সহায়ক সরঞ্জামগুলোর কাছে আবেদন, যেমন অন্য একটি ভাষা মডেল যা প্রম্পট তৈরি করে। এটি সম্পূর্ণ চিত্র দেখতে দেয়: প্রথমত, টার্গেট মডেলে কতগুলো অনুরোধ গেছে, দ্বিতীয়ত, কত অতিরিক্ত সম্পদ প্রয়োজন হয়েছে।

সৎ তুলনায় কী পরিবর্তন হলো
লেখকরা Fair-ASR ব্যবহার করে ১১টি পরিচিত আক্রমণ পুনর্মূল্যায়ন করেছেন এবং আবিষ্কার করেছেন যে বরাদ্দকৃত বাজেটের উপর নির্ভর করে তাদের র্যাঙ্কিং ব্যাপকভাবে পরিবর্তিত হয়। একটি আক্রমণ যা শত কলের মধ্যে শক্তিশালী দেখায়, পাঁচটির মধ্যে দুর্বল হতে পারে, এবং এর বিপরীতও। এর অর্থ হলো, কার্যকারিতা সম্পর্কে পুরানো সিদ্ধান্তগুলো অন্তত অসম্পূর্ণ ছিল।
আরও অপ্রত্যাশিত ছিল যে সহজ পদ্ধতিগুলো কোথাও যায়নি। এলোমেলো প্রম্পট ব্যাঘাত এবং হাতে তৈরি টেমপ্লেটগুলো অত্যন্ত প্রতিযোগিতামূলক থাকে যখন টার্গেট মডেলের অ্যাক্সেস সীমিত। তাদের বড় গণনাগত সম্পদের প্রয়োজন হয় না এবং প্রায় সঙ্গে সঙ্গেই কাজ করে।
কিন্তু LLM-নিয়ন্ত্রিত আক্রমণ, যেখানে একটি সহায়ক মডেল নিজেই এড়ানোর ভেরিয়েন্ট তৈরি করে, খারাপ ফল দেখিয়েছে। তারা টার্গেট মডেল এবং নিজস্ব জেনারেশন উভয়েই অনেক কল ব্যয় করে। এই ধরনের পরীক্ষিত আক্রমণগুলোর মধ্যে কোনোটি উভয় সূচকেই সঙ্গে সঙ্গে কার্যকর প্রমাণিত হয়নি। হয় ফলাফল বড় বাজেটে অর্জিত হয়, অথবা আক্রমণটি সহায়ক কলের দিক থেকে খুব ব্যয়বহুল।
ReCode: গবেষণার ভিত্তিতে একটি কার্যকর আক্রমণ
কাঙ্ক্ষিত কার্যকারিতা এবং প্রকৃত খরচের মধ্যে এই ব্যবধান গবেষকদের নিজস্ব পদ্ধতি তৈরি করতে প্ররোচিত করেছে — একটি কম্পোজিশনাল আক্রমণ, ReCode। এটি ডিসেনসিটাইজিং রিরাইটিং ব্যবহার করে: মূল ক্ষতিকারক অনুরোধটি এমনভাবে পুনর্লিখন করা হয় যাতে এটি নিরপেক্ষ দেখায় এবং প্রতিরক্ষামূলক প্রতিক্রিয়া সৃষ্টি না করে। তারপর দুটি সহজ এবং সস্তা প্রিমিটিভ ব্যবহার করা হয়, যা Fair-ASR পুনর্মূল্যায়নের সময় ভালোভাবে নিজেদের প্রমাণ করেছে।
ফলাফল চিত্তাকর্ষক দেখায়। মাত্র ২০টি টার্গেট কলের বাজেটে ReCode GPT-5-এ ৮৫% সাফল্য অর্জন করে, এবং গড়ে প্রতিটি অনুরোধের জন্য শুধুমাত্র ৭.১৯টি সহায়ক সরঞ্জামের কল খরচ হয়। তুলনার জন্য, এই সীমিত বাজেটে অনেক অন্যান্য আক্রমণ কার্যত অকেজো। আর যেগুলো তুলনামূলক সূচক নিয়ে গর্ব করতে পারে, সেগুলো সাধারণত কয়েকগুণ বেশি সহায়ক সম্পদ প্রয়োজন হয়।

সিদ্ধান্ত
গবেষণাটি একটি স্পষ্ট সংকেত দেয়: শুধুমাত্র সফল প্রচেষ্টার অনুপাতের ভিত্তিতে আক্রমণ মূল্যায়ন করা আর সম্ভব নয়। একটি অভিন্ন রেফারেন্স পয়েন্ট প্রয়োজন, এবং টার্গেট মডেলের কাছে আবেদনের সংখ্যা — উপলব্ধ ব্যবস্থাগুলোর মধ্যে সবচেয়ে স্বচ্ছ এবং সর্বজনীন। Fair-ASR ঠিক এই ধরনের পদ্ধতি প্রস্তাব করে, এবং এটি ভবিষ্যতের তুলনার জন্য একটি মান হয়ে উঠতে পারে।
যারা মডেল রক্ষা করেন, তাদের জন্য গুরুত্বপূর্ণ ব্যবহারিক সিদ্ধান্ত: আক্রমণকারী হিসেবে কৃত্রিম বুদ্ধিমত্তা জড়িত জটিল আক্রমণগুলোর উপর আটকে থাকা উচিত নয়। সহজ এবং সস্তা পদ্ধতি — এলোমেলো ব্যাঘাত, টেমপ্লেট — সীমিত সম্পদের মধ্যে একটি বাস্তব হুমকি থেকে যায়। সুরক্ষার বিরুদ্ধে তাদের স্থিতিস্থাপকতাই প্রথমে পরীক্ষা করা উচিত। জটিল LLM-নিয়ন্ত্রিত আক্রমণগুলো সম্ভবত ল্যাব রিপোর্টে চিত্তাকর্ষক, কিন্তু বাস্তব পরিস্থিতিতে তারা খুব ব্যয়বহুল এবং যতটা বিপজ্জনক মনে হয় ততটা নয়।



