অভ্যন্তরীণ প্রক্রিয়ায় প্রবেশাধিকার ছাড়াই AI এজেন্টদের মূল্যায়ন

28 সেপ্টেম্বর 2026১১ প্রদর্শন

এই নিবন্ধে সাতটি হুমকির শ্রেণির ভিত্তিতে স্বায়ত্তশাসিত সিস্টেম পরীক্ষা করার একটি পদ্ধতি বর্ণনা করা হয়েছে: SAGE-RT জেনারেটর প্রতিটি শ্রেণির জন্য ১২০টি করে আক্রমণের পরিস্থিতি তৈরি করে। CrewAI এবং AutoGen-এর পরীক্ষায় এজেন্টদের আচরণগত দুর্বলতার উচ্চ মাত্রা, পাশাপাশি নিয়ন্ত্রণ ও গোপনীয়তার ঝুঁকি দেখা গেছে, বিশেষ করে মাল্টি-এজেন্ট কনফিগারেশনে।

অভ্যন্তরীণ প্রক্রিয়ায় প্রবেশাধিকার ছাড়াই AI এজেন্টদের মূল্যায়ন

ব্ল্যাক-বক্স মূল্যায়ন বলতে কী বোঝায়

ব্ল্যাক-বক্স পদ্ধতিতে এজেন্ট সিস্টেমের পর্যবেক্ষণযোগ্য আচরণ মূল্যায়ন করা হয়। পরীক্ষা চালাতে সিস্টেমের শুধু একটি প্রাথমিক বিবরণ দরকার, বিশেষ অ্যাক্সেসের প্রয়োজন হয় না।

এই পদ্ধতি পর্যবেক্ষণযোগ্য আচরণকে ঝুঁকির শ্রেণির সঙ্গে যুক্ত করে। অভ্যন্তরীণ প্রক্রিয়ায় অ্যাক্সেস ছাড়াই মূল্যায়ন করা যায়।

ব্যবহারিক মানদণ্ড: বিশেষ অ্যাক্সেস পাওয়া না গেলেও সিস্টেমের প্রাথমিক বিবরণ দেওয়া সম্ভব হলে ব্ল্যাক-বক্স পরীক্ষা বেছে নিন।

পরীক্ষাটি কী নিয়ে গঠিত

এই ফ্রেমওয়ার্কে ঝুঁকির শ্রেণিবিন্যাস এবং স্বয়ংক্রিয় রেড টিমিং একত্র করা হয়েছে। লেখকেরা এজেন্টের আচরণকে ঝুঁকির শ্রেণির সঙ্গে যুক্ত করে এমন সাতটি ক্ষেত্র চিহ্নিত করেছেন।

SAGE-RT প্রতিটি ক্ষেত্রের জন্য 120টি adversarial scenario তৈরি করে। মূল্যায়নে মানুষের যাচাই এবং LLM বিচারকেরাও অন্তর্ভুক্ত।

  • শ্রেণিবিন্যাস: ঝুঁকির সাতটি ক্ষেত্র।
  • পরিস্থিতি: প্রতিটি ক্ষেত্রের জন্য স্বয়ংক্রিয় রেড টিমিং।
  • ফলাফল যাচাই: মানুষের যাচাই এবং LLM বিচারক।

নির্বাচনের মানদণ্ড: মানুষের যাচাই এবং LLM বিচারকের মাধ্যমে পরবর্তী যাচাইসহ পরিস্থিতি স্বয়ংক্রিয়ভাবে তৈরি করার প্রয়োজন হলে এই পদ্ধতিটি উপযুক্ত।

পরীক্ষায় কী দেখা গেছে

লেখকেরা এজেন্টের দুটি আর্কিটেকচার—CrewAI এবং AutoGen—এবং চারটি বেস মডেল পরীক্ষা করেছেন।

পরিমাপকফলাফল
গড় governance risk56,25%
multi-agent কনফিগারেশনে Privacy risk65%
এজেন্টের আচরণগত দুর্বলতা85% পর্যন্ত

এই মানগুলো বিভিন্ন পরিমাপক বর্ণনা করে। এগুলোকে একটি সামগ্রিক ঝুঁকি মূল্যায়নে একীভূত করা উচিত নয়।

ব্যবহারিক মানদণ্ড: ফলাফলের তুলনা করার সময় পরিমাপের মূল বিভাগ এবং কনফিগারেশনের প্রেক্ষাপট অক্ষুণ্ণ রাখা জরুরি।

এক ধাপের মূল্যায়ন কেন যথেষ্ট নয়

লেখকেরা উল্লেখ করেছেন যে প্রচলিত মূল্যায়নগুলো এক ধাপেই সীমাবদ্ধ। ধারাবাহিকভাবে একাধিক কাজ করার সময় যে দুর্বলতাগুলো দেখা দেয়, সেগুলো এসব মূল্যায়নে ধরা পড়ে না।

ঝুঁকিগুলো এজেন্টের কাজের ধরনের সঙ্গে সম্পর্কিত:

  • অবিশ্বস্ত ইনপুট পড়ে;
  • প্রকৃত অনুমতিসহ টুল ব্যবহার করে;
  • স্বায়ত্তশাসিতভাবে কাজ করে।

এই বিষয়গুলোর সমন্বয়ে নিরাপত্তার ঝুঁকিপূর্ণ ক্ষেত্র বাড়ে। মূল্যায়নের মানদণ্ড হলো—শুধু একটি উত্তর নয়, একাধিক ধাপে এজেন্টের আচরণও পরীক্ষা করা।

কখন ব্ল্যাক-বক্স পদ্ধতি বেছে নেবেন

এজেন্টের অভ্যন্তরীণ অ্যাক্সেস পাওয়া না গেলে ঝুঁকি মূল্যায়নের জন্য এই পদ্ধতি উপযুক্ত। সিস্টেমের একটি প্রাথমিক বিবরণ দেওয়াই যথেষ্ট।

পর্যবেক্ষণযোগ্য আচরণকে ঝুঁকির শ্রেণির সঙ্গে যুক্ত করতে হলেও এই পদ্ধতি কার্যকর। একাধিক ধাপে তৈরি হওয়া দুর্বলতা শনাক্ত করতে এক ধাপের মূল্যায়ন যথেষ্ট নয়।

ব্যবহারিক মানদণ্ড: বিশেষ অ্যাক্সেস ছাড়াই আচরণ পরীক্ষা করতে এবং একাধিক ধাপে তৈরি হওয়া ঝুঁকি বিবেচনায় নিতে হলে এই পদ্ধতি বেছে নিন।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান