কেন চেকপয়েন্ট পরীক্ষা করবেন, শুধু তাদের উত্তর নয়
একটি ওপেন মডেল ডিপ্লয়মেন্টের জন্য প্রস্তুত করার সময় বোঝা গুরুত্বপূর্ণ যে কে এবং কীভাবে এটি পরিবর্তন করেছে। সাধারণ ফাইন-টিউনিং ছাড়াও অ্যাবলিটারেশন নামে একটি কৌশল রয়েছে — এটি এমন একটি পদ্ধতি যা অ্যাক্টিভেশন থেকে ক্ষতিকারক অনুরোধ প্রত্যাখ্যানের সংকেতকে বিন্দুমাত্র নির্ভুলভাবে মুছে ফেলে। মডেলটি বাহ্যিকভাবে মূলের মতোই থাকে, কিন্তু কার্যত অভ্যন্তরীণ 'স্টপ' ছাড়াই কাজ করে। জেনারেশনের মাধ্যমে এই ধরনের হস্তক্ষেপ সনাক্ত করা কঠিন: রানটাইম-গার্ড টেস্ট প্রম্পট চালায় এবং উত্তর মূল্যায়ন করে, আর্টিফ্যাক্টটি নিজেই নয়। যদি ক্ষতিকারক পরিস্থিতি যাচাইকরণ সেটে না পড়ে, তাহলে পরিবর্তনটি কেউ লক্ষ্য করবে না। তাই সৎ ওজন অডিট ইনফারেন্সের আগে করা উচিত, এর সময় নয়।
পরীক্ষার দুটি অক্ষ: অ্যাক্টিভেশন গ্যাপ এবং ওজনের চিহ্ন
ক্রিপ্টোগ্রাফি এবং নিরাপত্তার ক্ষেত্রে উপস্থাপিত গবেষণাটি একটি সস্তা দ্বি-সংকেত অডিট বর্ণনা করে যার জন্য থ্রেশহোল্ড নির্বাচনের প্রয়োজন হয় না এবং বাহ্যিক আচরণগত পরীক্ষার উপর নির্ভর করে না। সন্দেহজনক চেকপয়েন্টটি দুটি অক্ষ বরাবর একটি প্রত্যয়িত রেফারেন্সের সাথে তুলনা করা হয়:
- Reference-anchored activation refusal-gap — প্রার্থী এবং রেফারেন্সের মধ্যে প্রত্যাখ্যানের সাথে সম্পর্কিত অ্যাক্টিভেশনগুলির মধ্যে ব্যবধান। যদি অ্যাবলিটারেশন প্রত্যাখ্যানের প্যাটার্ন মুছে ফেলে থাকে, তাহলে ব্যবধানটি সৎ ফাইন-টিউনিংয়ের চেয়ে ভিন্নভাবে আচরণ করে।
- Weight-recovery energy — ওজন পুনরুদ্ধারের শক্তি: প্রার্থীকে বেস সংস্করণে ফিরিয়ে আনতে কতটা শক্তিশালী প্যারামিটার পরিবর্তন প্রয়োজন। এই সংকেত এমন হস্তক্ষেপও ধরে যা অ্যাক্টিভেশনে প্রায় প্রতিফলিত হয় না।
সংকেতগুলি নেতিবাচকভাবে সম্পর্কযুক্ত, তাই তাদের সম্মিলিত z-পরিসংখ্যান প্রতিটি অক্ষের চেয়ে আলাদাভাবে বেশি তথ্যপূর্ণ। প্রথম অক্ষটি নির্দিষ্টতার জন্য দায়ী: এটি দেখায় যে প্রত্যাখ্যান প্রক্রিয়াটি সত্যিই প্রভাবিত হয়েছে কিনা। দ্বিতীয়টি সম্পূর্ণতার জন্য: এটি মডিফিকেশনকে সূক্ষ্ম ওজন পরিবর্তনে লুকিয়ে রাখতে দেয় না।

পদ্ধতিটি বাস্তবে কতটা নির্ভরযোগ্য
অডিটটি 273টি চেকপয়েন্টের একটি রেজিস্ট্রিতে পরীক্ষা করা হয়েছিল, যা বিভিন্ন ওপেন আর্কিটেকচার কভার করে। নমুনার মধ্যে, সম্মিলিত z-সংকেত প্রায় ত্রুটিমুক্তভাবে 57টি পাবলিক অ্যাবলিটারেশনকে 37টি সাধারণ ফাইন-টিউনিং, মার্জ এবং ইনস্ট্রাকশন-টিউনিং কেস থেকে আলাদা করেছে: AUROC 0.95। আলাদাভাবে, একই সংকেত উল্লেখযোগ্যভাবে খারাপ ফলাফল দেয় — 0.84 এবং 0.90। আরও মজার বিষয় হল, ইউডেন সূচক দ্বারা ক্রমাঙ্কিত থ্রেশহোল্ডটি নতুন, পূর্বে অদেখা পরিবারগুলিতে স্থানান্তরিত হয়। সেখানে ভারসাম্যপূর্ণ নির্ভুলতা ছিল 0.89, মিথ্যা পজিটিভের হার 0.11। 57টি অ্যাবলিটারেশনের মধ্যে, পদ্ধতিটি শুধুমাত্র 4টি মিস করেছে — প্রাথমিক ফিল্টারের মানদণ্ডে এটি একটি ভাল ফলাফল।
দুর্বল পয়েন্ট: যখন উভয় অক্ষ প্রতারিত হয়
দুটি সংকেতের উপর ভিত্তি করে কোনো অডিট আক্রমণের সমস্ত পরিস্থিতি বন্ধ করে না। লেখকরা সততার সাথে দুটি ধরণের ব্যর্থতা তালিকাভুক্ত করেছেন।
প্রথম — জাল রেফারেন্স। যদি আক্রমণকারী রেফারেন্স পয়েন্ট নিয়ন্ত্রণ করে, তাহলে সে এমন একটি মানদণ্ড বেছে নিতে পারে যাতে base-to-candidate পার্থক্যটি নির্মাণগতভাবে শূন্য হয়। তখন মডেল প্রশিক্ষণেরও প্রয়োজন নেই: উভয় অক্ষই স্বাভাবিক দেখাবে।
দ্বিতীয় — থ্রেশহোল্ডের উপর white-box আক্রমণ। যদি ওজনের মালিকের মডেলটিতে সম্পূর্ণ অ্যাক্সেস থাকে, তাহলে সে ইচ্ছাকৃতভাবে চেকপয়েন্টটি এমনভাবে ফাইন-টিউন করতে পারে যাতে এটি সিদ্ধান্তের সীমানার বাইরে থাকে, কিন্তু গার্ডের দৃষ্টিকোণ থেকে অনিরাপদ থাকে এবং সংগতি বজায় রাখে।
এই কারণেই লেখকরা পদ্ধতিটিকে কার্যকর ট্রিয়াজ বলে অভিহিত করেছেন, হস্তক্ষেপের বিরুদ্ধে সুরক্ষা নয়। এটি দ্রুত স্পষ্টতই পরিষ্কার এবং সন্দেহজনক চেকপয়েন্টগুলিকে বাছাই করতে দেয়, তবে এটি নিরাপত্তার একমাত্র বাধা হিসাবে কাজ করতে পারে না।

উপসংহার: প্রথম ফিল্টারের জন্য একটি টুল
দ্বি-সংকেত যাচাইকরণ ভাল কারণ এটির জন্য শুধুমাত্র একটি বিশ্বস্ত রেফারেন্স এবং দুটি সস্তা পরিমাপ প্রয়োজন, এবং ফলাফলটি নির্দিষ্ট রেজিস্ট্রির জন্য সহজেই ক্রমাঙ্কিত করা যায়। প্রধান সীমাবদ্ধতা — প্রত্যয়িত মানদণ্ডের উপর নির্ভরতা এবং লক্ষ্যযুক্ত white-box আক্রমণের প্রতি দুর্বলতা। উপরন্তু, পরিসংখ্যান এখনও একটি একক রেজিস্ট্রিতে সংগ্রহ করা হয়েছে, তাই উল্লেখযোগ্যভাবে ভিন্ন আর্কিটেকচারে নির্ভুলতা পরিবর্তিত হতে পারে। তবুও, ওপেন ওজনের ইকোসিস্টেমের জন্য এটি একটি ব্যবহারিক পদক্ষেপ: আগে জেনারেশনের উপরিভাগের পরীক্ষা এবং সম্পূর্ণ রিভার্স-ইঞ্জিনিয়ারিংয়ের মধ্যে বেছে নিতে হত, এখন একটি মধ্যবর্তী বিকল্প উপস্থিত হয়েছে যা প্রথম ফিল্টার হিসাবে ব্যবহার করা যেতে পারে।



