শিরোনাম: LLM-এজেন্টদের জন্য 'কন্ট্রোল লেয়ার' কতটা বিপজ্জনক
আধুনিক ভাষার মডেলগুলো খুব কমই একা কাজ করে। প্রায়শই এগুলো এজেন্টিক হারনেসের মধ্যে স্থাপন করা হয় — একটি মধ্যস্থ স্তর, যা মডেলকে টুল, এক্সটেনশন, দীর্ঘমেয়াদী মেমোরি, অনুমতি এবং বাহ্যিক কর্মের অ্যাক্সেস দেয়। এই স্তরটিই সিদ্ধান্ত নেয় মডেল কী করতে পারবে এবং কী পারবে না।
সমস্যা হলো, বিদ্যমান নিরাপত্তা বেঞ্চমার্কগুলো সাধারণত শুধুমাত্র পৃথক আক্রমণের দৃশ্যকল্প বা সীমিত অপারেশনাল শর্ত পরীক্ষা করে। এর ফলে বোঝা কঠিন যে হারনেসের কাজের কোন পর্যায়ে ত্রুটি ঘটে: কনফিগারেশনের সময়, টুল কলের মুহূর্তে, বা ঘটনার পরে পুনরুদ্ধারের সময়। গবেষকরা HarnessRisk প্রস্তাব করেছেন — একটি বেঞ্চমার্ক যা এজেন্টিক হারনেসের নিরাপত্তাকে সম্পূর্ণভাবে, তার জীবনচক্রের সব পর্যায়ে পর্যবেক্ষণ করে।
হারনেসের জীবনচক্রের ছয়টি পর্যায়
গবেষণাপত্রের লেখকরা হারনেসের নিরাপত্তাকে ছয়টি অপারেশনাল পর্যায়ে বিভক্ত করেছেন:
- Harness Configuration — প্যারামিটার এবং অ্যাক্সেস অধিকার সেটআপ;
- Capability Extension — নতুন ক্ষমতা এবং এক্সটেনশন সংযুক্ত করা;
- Runtime Operation — রিয়েল-টাইমে কাজ সম্পাদন;
- State Persistence — অবস্থা সংরক্ষণ এবং পুনরুদ্ধার;
- Action Control — কর্ম এবং টুলের উপর নিয়ন্ত্রণ;
- Incident Recovery — ত্রুটির প্রতিক্রিয়া এবং ঘটনার পরে পুনরুদ্ধার।
প্রতিটি পর্যায় তার নিজস্ব দায়িত্বের ক্ষেত্রের জন্য দায়ী, এবং দুর্বলতা যেকোনো একটিতে প্রকাশ পেতে পারে। এই বিভাজনই তুলনা করা সম্ভব করে যে একই অবস্থার মধ্যে বিভিন্ন হারনেস আক্রমণ মোকাবেলা করে কেমন।

HarnessRisk-এর ভিতরে কী আছে: দৃশ্যকল্প এবং মেট্রিক্স
বেঞ্চমার্কে ১২৮টি বিচ্ছিন্ন দৃশ্যকল্প সংগ্রহ করা হয়েছে। প্রতিটি দৃশ্যকল্প কৌশলে সাজানো: মডেলের সামনে একটি নিরাপদ ব্যবহারকারীর কাজ রাখা হয়, কিন্তু ওয়ার্কফ্লোর অবিশ্বস্ত আর্টিফ্যাক্টের ভিতরে একটি প্রতিকূল নির্দেশ লুকানো থাকে। মডেলকে আর্টিফ্যাক্টে এমবেড করা আক্রমণে না পড়ে বৈধ লক্ষ্য সম্পন্ন করতে হবে।
প্রতিটি ট্র্যাজেক্টোরি চারটি মেট্রিক্সে মূল্যায়ন করা হয়:
- Utility — মূল কাজটি কতটা ভালোভাবে সম্পন্ন হয়েছে;
- Attack Success Rate — সফলভাবে পরিচালিত আক্রমণের অনুপাত;
- Persistence — আক্রমণের প্রভাব কতক্ষণ স্থায়ী হয়;
- Detection — সিস্টেম কতটা কার্যকরভাবে ঝুঁকি লক্ষ্য করে।
এই পদ্ধতি শুধু 'হ্যাক হয়েছে বা হয়নি' তা নয়, মডেলের উপযোগিতার জন্য নিরাপত্তার মূল্যও দেখতে দেয়।
পরীক্ষা কী দেখিয়েছে
পরীক্ষাগুলো তিনটি হারনেস, ছয়টি ভাষার মডেল এবং মডেল-হারনেসের ১৪টি সংমিশ্রণে পরিচালিত হয়েছিল। ফলাফল ভিন্নধর্মী ছিল: আক্রমণের সাফল্য ১২.৬% থেকে ৮০.৯% পর্যন্ত পরিবর্তিত হয়েছিল, এবং Utility ৭৫.০% থেকে ৯৭.৬% এর মধ্যে ছিল। সহজ ভাষায়, একই মডেল একটি কনফিগারেশনে প্রায় অজেয় হতে পারে এবং অন্য কনফিগারেশনে স্পষ্টতই দুর্বল।
তিনটি হারনেসেই সবচেয়ে দুর্বল পর্যায় হলো Harness Configuration। আক্রমণ প্রায়শই জটিল এক্সপ্লয়েটের কারণে নয়, বরং 'অনুমোদিত' ওয়ার্কফ্লোরের মধ্যে নিরাপত্তাকে প্রভাবিত করে এমন প্যারামিটার পরিবর্তন করা যায় বলে সফল হয়। এটি একটি উদ্বেগজনক সংকেত: এমনকি সঠিক দেখানো হারনেসও আক্রমণকারীকে খেলার নিয়ম বদলাতে দিতে পারে।
ঝুঁকি শনাক্তকরণের সাথেও একটি আকর্ষণীয় ফলাফল জড়িত। কিছু কনফিগারেশন ৯০% এর বেশি রানে আক্রমণ শনাক্ত করে, কিন্তু তবুও উল্লেখযোগ্য সংখ্যক সফল আক্রমণ ঘটতে দেয়। অর্থাৎ মডেল 'বুঝতে পারে' যে বিপজ্জনক কিছু ঘটছে, কিন্তু সেই বোঝাপড়াকে নিরাপদ আচরণে রূপান্তর করে না। হুমকি সম্পর্কে সচেতনতা নিজেই সিস্টেমকে রক্ষা করে না।

উপসংহার: নিরাপত্তা 'গড়ে' পরিমাপ করা যায় না
HarnessRisk-এর প্রধান শিক্ষা হলো এজেন্টিক সিস্টেমের নিরাপত্তা মডেল এবং হারনেসের নির্দিষ্ট সংমিশ্রণের উপর heavily নির্ভর করে। 'মডেল নিরাপদ' বা 'হারনেস নিরাপদ' — এই ধরনের গড় মূল্যায়ন খুব কমই বলে, যদি না বিবেচনা করা হয় যে তারা কোন কনফিগারেশনে কাজ করে।
এজেন্টদের হারনেসের একাধিক দায়িত্বের ক্ষেত্রে মূল্যায়ন করা প্রয়োজন — প্রাথমিক কনফিগারেশন থেকে ঘটনার পরে পুনরুদ্ধার পর্যন্ত। এবং আলাদাভাবে পরীক্ষা করা উচিত যে সাধারণ কাজের আর্টিফ্যাক্টে এমবেড করা আক্রমণের সময় মডেল কেমন আচরণ করে। শুধুমাত্র তখনই দুর্বল স্থানগুলো লক্ষ্য করা যায়, যা ক্লাসিক্যাল বেঞ্চমার্কে অলক্ষিত থেকে যায়।



