অন্টোলজিক্যাল ট্রাস্ট: কীভাবে সময়মতো লক্ষ্য করা যায় যে AI-এজেন্ট মূল কাজ থেকে সরে যাচ্ছে

30 আগস্ট 2026৭ প্রদর্শন

লেখকরা একটি অনলাইন RGE মনিটর প্রস্তাব করেন, যা এজেন্টের প্রতি আস্থাকে «ভূমিকা», «লক্ষ্য» এবং «প্রমাণ» উপাদানে বিশ্লেষণ করে এবং দীর্ঘ ট্র্যাজেক্টোরি জুড়ে সেগুলো ট্র্যাক করে। এই পদ্ধতি সঞ্চিত ড্রিফট ধরা সম্ভব করে, এমনকি যখন প্রতিটি পৃথক ধাপ গ্রহণযোগ্য মনে হয়, এবং OSWorld, FinanceBench এবং EICU-AC পরীক্ষায় এটি বিদ্যমান হিউরিস্টিকস, জজ-মডেল এবং শিল্ডের চেয়ে বেশি নির্ভুল প্রমাণিত হয়।

অন্টোলজিক্যাল ট্রাস্ট: কীভাবে সময়মতো লক্ষ্য করা যায় যে AI-এজেন্ট মূল কাজ থেকে সরে যাচ্ছে

আধুনিক AI-এজেন্টরা দীর্ঘ কর্মের ধারা সম্পাদন করতে সক্ষম: ফাংশন কল করা, পরিষেবার প্রতিক্রিয়া প্রক্রিয়া করা, মধ্যবর্তী সিদ্ধান্ত নেওয়া। পর্যবেক্ষকের পক্ষে প্রতিটি ধাপ অনুসরণ করা কঠিন, তাই নিরাপত্তা নিয়ন্ত্রণের জন্য সাধারণত স্বয়ংক্রিয় মনিটর ব্যবহার করা হয়। কিন্তু কী হবে যদি পৃথক ধাপগুলো নিখুঁত দেখায়, অথচ পুরো শৃঙ্খলটি ধীরে ধীরে ব্যবহারকারীর অনুরোধ থেকে সরে যায়?

কেন স্থানীয় পরীক্ষা-নিরীক্ষা রক্ষা করে না

দীর্ঘমেয়াদী এজেন্ট প্রতিটি ধাপে সঠিক টুলকে বিশ্বাসযোগ্য আর্গুমেন্টসহ কল করতে পারে, এবং তবুও অলক্ষ্যে সরে যেতে পারে: মূল কাজের পরিবর্তে সে আরও বিস্তৃত বা সম্পর্কিত কাজ সমাধান করতে শুরু করে, ব্যবহারকারী প্রদান করেননি এমন প্রমাণ "টেনে আনে"। এই ধরনের বিচ্যুতি সঞ্চয়কে ট্র্যাজেক্টরি ড্রিফট বলা হয়। বিদ্যমান যাচাই ব্যবস্থাগুলো সাধারণত পৃথক কর্মের স্থানীয় সামঞ্জস্য দেখে, অথবা পুরো ট্র্যাজেক্টরির উপর সাধারণ রায় দেয়, অথবা সামগ্রিক ঝুঁকি মূল্যায়ন করে। সমস্যা হলো, তারা মধ্যবর্তী প্রিফিক্সগুলো বিশ্লেষণ করে না — অর্থাৎ কাজটি সম্পাদনের সময় ট্র্যাজেক্টরি এবং কাজের মধ্যে সম্পর্ক কীভাবে বিকশিত হয়।

arXiv-এ সাম্প্রতিক একটি কাজ (2608.17718) এই ফাঁকটি বন্ধ করার চেষ্টা করে এমন একটি পদ্ধতি বর্ণনা করে। লেখকরা "অন্টোলজিকাল ট্রাস্ট" ধারণাটি প্রস্তাব করেন: এটি পুরো পথের বৈশিষ্ট্য নয়, বরং ট্র্যাজেক্টরির প্রতিটি প্রিফিক্সের বৈশিষ্ট্য, এবং তা মূল কাজের সাপেক্ষে সংজ্ঞায়িত।

ট্রাস্টের তিনটি উপাদান

সময়মতো বিচ্যুতি লক্ষ্য করার জন্য, ট্রাস্টকে উপাদানে বিভক্ত করতে হবে। RGE মনিটর ঠিক এটিই করে — এর নাম Role, Goal, Evidence থেকে এসেছে। আনুষ্ঠানিকভাবে, ট্র্যাজেক্টরি প্রিফিক্সের প্রতি ট্রাস্ট তিনটি অক্ষে মূল্যায়ন করা হয়:

  • ভূমিকা — এজেন্ট কি ব্যবহারকারীর দেওয়া ক্ষমতার সীমার মধ্যে থাকে, নাকি ধীরে ধীরে নিজেকে আরও বিস্তৃত ভূমিকা "নিযুক্ত" করে?
  • লক্ষ্য — বর্তমান চলাচলের দিক কি অনুমোদিত লক্ষ্যের সাথে সামঞ্জস্যপূর্ণ, নাকি একই রকম কিন্তু সম্পর্কিত লক্ষ্য দ্বারা প্রতিস্থাপিত হয়?
  • প্রমাণ — এজেন্ট কি পর্যবেক্ষণে প্রকৃতপক্ষে উপস্থিত ডেটার উপর নির্ভর করে, নাকি অন্তর্নিহিত অনুমান এবং অননুমোদিত তথ্যের উপর?

এই ত্রিমুখী নিয়ন্ত্রণ পার্থক্য করতে সাহায্য করে, উদাহরণস্বরূপ, যে এজেন্ট কাজ করা বন্ধ করে দিয়েছে এবং যে এজেন্ট কেবল কাজটি সম্পাদনের অনুমোদিত পদ্ধতি পরিবর্তন করছে।

যাচাই কীভাবে কাজ করে

একটি গুরুত্বপূর্ণ বিবরণ: RGE একটি "ব্ল্যাক বক্স" নয় যা একটি একক এন্ড-টু-এন্ড মডেল দিয়ে ট্র্যাজেক্টরি মূল্যায়ন করে। ভাষা মডেল এখানে কেবল কাজ এবং পৃথক ধাপগুলোর কাঠামোবদ্ধ উপস্থাপনা পেতে ব্যবহৃত হয়। ট্রাস্ট অবস্থা আপডেট করা, তিনটি উপাদানে প্রজেকশন এবং হস্তক্ষেপের সিদ্ধান্ত — সবকিছু নির্ধারক। এর ফলে আউটপুটে একটি পুনরুত্পাদনযোগ্য ট্রাস্ট ট্র্যাজেক্টরি পাওয়া যায়: সঠিকভাবে বলা সম্ভব যে কোন মুহূর্তে এবং কোন নির্দিষ্ট উপাদানের কারণে সন্দেহ তৈরি হয়েছে। এটি একটি গুরুত্বপূর্ণ প্রকৌশল সিদ্ধান্ত, কারণ এটি বড় মডেলের অনিয়মের উপর নির্ভরতা হ্রাস করে এবং অডিট সহজ করে।

এটি কতটা কার্যকর

পদ্ধতিটি যাচাই করতে লেখকরা তিনটি ভিন্ন পরিবেশের ভিত্তিতে ট্র্যাজেক্টরির একটি কর্পাস সংগ্রহ করেছেন: OSWorld, FinanceBench এবং EICU-AC। কর্পাসে বেনাইন (স্বাভাবিক) সম্পাদন, জোড়া প্রিফিক্সসহ ড্রিফট উদাহরণ এবং তথাকথিত "সিউডো-সামঞ্জস্যপূর্ণ" ব্যর্থতা অন্তর্ভুক্ত ছিল — যখন কর্মগুলো যৌক্তিক দেখায়, কিন্তু আসলে ভুল।

এই উপাদানের উপর RGE প্রিফিক্সে ড্রিফট সনাক্তকরণের ক্ষেত্রে অভিযোজিত নিয়ম-ভিত্তিক বেসলাইন, জাজ-মডেল এবং শিল্ডগুলোকে ছাড়িয়ে গেছে। দুটি বৃহত্তর মূল্যায়নকারী মডেলের সাথে এটি প্রতিটি বেঞ্চমার্কে 93% এর বেশি Drift F1 অর্জন করে, পাশাপাশি বেনাইন কেসের কভারেজ 95.8% এর কম নয় এমন স্তরে বজায় রাখে। অন্য কথায়, এটি প্রকৃত ড্রিফট খুব কমই মিস করে এবং স্বাভাবিক কাজকে মিথ্যা অ্যালার্ম দিয়ে ভরাট করে না।

তবে গবেষকরা সততার সাথে সীমাবদ্ধতাটিও চিহ্নিত করেছেন। "সিউডো-সামঞ্জস্যপূর্ণ" ব্যর্থতা একটি কঠিন ক্ষেত্রে থেকে যায়: তাদের সনাক্তকরণ heavily নির্ভর করে কাজের ফলাফল বাহ্যিকভাবে দৃশ্যমান কিনা তার উপর। যদি বাইরের জগতে সাফল্য বা ব্যর্থতার স্পষ্ট নিশ্চিতকরণ না থাকে, তাহলে মনিটর সবসময় সাবধানে ছদ্মবেশী বিচ্যুতিকে সাধারণ অনিশ্চয়তা থেকে আলাদা করতে পারে না। এটি একটি ত্রুটি নয় — এটি যেকোনো পদ্ধতির কাঠামোগত সীমা যার বিশ্বের সম্পূর্ণ শব্দার্থবিদ্যায় অ্যাক্সেস নেই।

উপসংহার

এই কাজ থেকে প্রধান শিক্ষা — কেবল পৃথক ধাপ নয়, সামগ্রিকভাবে ট্র্যাজেক্টরির আকৃতির দিকেও নজর রাখা প্রয়োজন। ব্যবহারিক পদ্ধতি এমন হতে পারে: প্রতিটি প্রিফিক্সের জন্য নিজেকে প্রশ্ন করা, এজেন্টের ভূমিকা পরিবর্তিত হয়েছে কিনা, লক্ষ্য প্রতিস্থাপিত হয়েছে কিনা এবং "বিদেশী" প্রমাণ আছে কিনা। এই তিনটি প্রশ্নই দীর্ঘমেয়াদী এজেন্টদের উপর আরও স্বচ্ছ এবং যাচাইযোগ্য তত্ত্বাবধানের ভিত্তি তৈরি করে। এবং সম্ভবত, ভবিষ্যতে "অন্টোলজিকাল ট্রাস্ট" AI-এজেন্টদের জন্য আজকের নির্ভুলতা বা লেটেন্সির মতোই একটি সাধারণ মেট্রিকে পরিণত হবে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
অন্টোলজিক্যাল ট্রাস্ট: কীভাবে সময়মতো লক্ষ্য করা যায় যে AI-এজেন্ট মূল কাজ থেকে সরে যাচ্ছে