Aegis: AI এজেন্টদের জন্য ফিউজ — মডেলের প্রস্তাব বিশ্বস্ত সিদ্ধান্ত স্তরের মাধ্যমে যায়

25 আগস্ট 2026১৭ প্রদর্শন

Aegis-এর নতুন সিস্টেম এজেন্টের টুল-কলের অনুরোধগুলো আটকে দেয় এবং সেগুলো বাস্তবে কার্যকর করার আগে একটি বাহ্যিক যাচাইকরণ প্রক্রিয়ার মাধ্যমে পাঠায়। বিশেষ স্ক্রিপ্ট কর্পাসের পরীক্ষায় এটি শূন্য ঝুঁকিপূর্ণ পার্শ্বপ্রতিক্রিয়া অর্জন করতে সক্ষম হয়েছে, যেখানে সাধারণ প্রম্পট-সীমাবদ্ধতা এমন নিশ্চয়তা দিতে পারেনি।

Aegis: AI এজেন্টদের জন্য ফিউজ — মডেলের প্রস্তাব বিশ্বস্ত সিদ্ধান্ত স্তরের মাধ্যমে যায়

সমস্যা: টেক্সট থেকে কর্ম

আধুনিক এজেন্ট AI সিস্টেম কেবল সাড়া দেওয়ার চেয়ে আরও বেশি কিছু করতে পারে- তারা বহিস্থিত সরঞ্জাম দিয়ে কাজ করতে পারে: ফাইল পরিবর্তন, বার্তা পাঠানো, বার্তা পাঠানো এবং কর্ম সঞ্চালনের অবস্থা পরিবর্তন করতে পারে । এই বিষয়টি নিরাপত্তার উপর মনোযোগ প্রদান করে: এদিকে ক্ষতিকর টেক্সটগুলো হচ্ছে প্রধান হুমকি, এখন তা ক্ষতিকর কাজের পার্শ্ববর্তী প্রভাব। প্রচলিত প্রম্পট- লেভেল পরিমাপক মডেল আচরণ প্রভাবিত করতে পারে, কিন্তু তারা সত্যিকারের মৃত্যুদণ্ডের সীমা তৈরি করতে পারে না: মডেলটি একটি পদক্ষেপ নিতে পারে, এবং অতিরিক্ত যাচাই ছাড়া সরাসরি এটি কার্যকর করা হবে।

এটাই সেই জায়গা কর্ম খেলা শুরু হয়, এজেন্ট ব্যবস্থাপনার জন্য একটি ভিন্ন পদ্ধতি প্রদান করা হয়। মডেলটির 'ভাল আচরণ' এর উপর নির্ভর করার পরিবর্তে, এগিস মডেলস যেমন প্রস্তাবের মাধ্যমে প্রস্তাবগুলো পাশ কাটিয়ে যায়।

কিভাবে এ্যাগিস কর্ম: মডেল প্রোমোস, পরিবেশ নির্ধারণ

এগরিসের মূল নীতি সংক্ষেপে সংক্ষেপে সংক্ষেপে সংক্ষেপে বর্ণনা করা যেতে পারে: মডেলটি প্রস্তাব করছে, বিশ্বস্তভাবে মৃত্যুদণ্ড কার্যকর পরিবেশ...এই জল্লাদ মঞ্চে নয়.

সুরক্ষার তৃতীয় স্তর

আইজেসিস বিভিন্ন মাত্রাসহ মডেল থেকে প্রতিটি প্রস্তাব মূল্যায়ন করেছেন:

  • সক্রিয় নীতি সহ Completion: সিস্টেমটি চেক করছে বর্তমান নীতির বিরুদ্ধে প্রস্তাবিত ব্যবস্থা পরীক্ষা করে দেখতে।
  • নিযুক্তিকরণ যাচাই: বিশ্বস্ত সার্ভার নিশ্চিত করেছে যে সত্যিকার অর্থে এই পদক্ষেপটি একটি অনুমোদন প্রক্রিয়া থেকে এসেছে এবং সে পথে কোন পরিবর্তন হয়নি।
  • নিষ্ক্রিয় করা আচরণযদি সিস্টেম পুরোপুরি নিশ্চিত না হয়ে থাকে যে এটা নিরাপদ, তাহলে তা মেনে নিতে অস্বীকার করা হবে- এর মানে হচ্ছে ডিফল্ট নীতি হচ্ছে "প্রত্যেক স্পষ্টভাবে নিষিদ্ধ"।

সিনেটের নির্ধারিত সমাধান পদ্ধতি বিশেষ মনোযোগ দিতে পারে। যখন একটি বিতর্কিত বিভাগে একটি প্রস্তাব আসে, তখন একটি অগণতান্ত্রিক সিদ্ধান্তের পরিবর্তে একটি অস্পষ্ট অনুমোদন পথ চালু হয়। এর মানে হল যে কোন সিস্টেমের কোন অংশ নিজের সিদ্ধান্ত নিতে পারে না — একাধিক অংশগ্রহণকারীর একমত হওয়া দরকার। এর ফলে একটি সাহায্যমূলক সিদ্ধান্ত গ্রহণ করা হয় এবং এই ঝুঁকি কমিয়ে আনা হয় যে, একক একটি সমস্যা বা ভুল একটি বিপদজনক পদক্ষেপের দিকে ঠেলে দেয়।

পরীক্ষামূলক বিশ্লেষণ: টেস্ট কী দেখায়

অ্যাপিসের কার্যকারিতা যাচাই করার জন্য, লেখকরা একটি ধারাবাহিক পরীক্ষা চালিয়েছেন। এই পরীক্ষাগুলোতে পাঁচজন পরিবার, ৪২টি কাজ, তিনটি শর্ত এবং পরিবারের মধ্যে দশ বার পুনরাবৃত্তি করা হয়েছে। মোট ডাটার পরিমাণ ছিল ৬,৩০০টি লগ লাইন ।

সংখ্যাসূচক ফলাফল

  • প্রম্পট-কেবল-শুধুমাত্র উপায়, ঝুঁকিপূর্ণ ছিদ্র দিয়ে ৭৯টা লাইন তুলনার পথ সহ সনাক্ত করা হয়েছে।
  • আইজিসি শাসনের অধীনে (২,১০০ লাইন), অনুমানকৃত টুলগুলির শূণ্যের অ্যাপ্লিকেশন এবং কোনো সীমা ঝুঁকিপূর্ণ পার্শ্ববর্তী প্রক্রিয়া সম্পন্ন করা রেকর্ড করা হয়েছে.
  • ১,৮৩২ লাইন আইজিসি সরকার বিশ্বস্তভাবে হত্যা করা হয়েছে।
  • ১,০১৯ লাইন "পরিষদ" থেকে সমাধান করা হয়েছে।

অন্তর্ভুক্ত ও সীমা

গবেষণা লেখকেরা গুরুত্বপূর্ণ কোন বিষয়ের উপর জোর দিয়েছেন: ফলাফল হচ্ছে: স্বায়ত্তশাসিত এজেন্টদের সাধারণ নিরাপত্তা প্রমাণ করবেন নাএটা একটা সংকীর্ণ সিস্টেম ।

এর মানে হচ্ছে এএগিস একটি নিরাপদ ফিউজ (নিরাপত্তার ক্ষেত্রে) কাজ করে: এটি মডেল তৈরি করে না, কিন্তু এটি মডেলটির উদ্দেশ্য এবং প্রকৃত কাজের মধ্যে একটি নির্ভরযোগ্য প্রতিবন্ধকতা তৈরি করে। কিন্তু, এর জন্য আরও বেশি গবেষণা প্রয়োজন ।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
Agis - AI এজেন্টের পর্যালোচনা ব্যবস্থা