অভিজ্ঞতার সাথে পরিবর্তনশীল সতর্কতা: অজানা পরিস্থিতিতে নিরাপদ সিদ্ধান্তের জন্য RATTL পদ্ধতি
যখন কোনো এজেন্ট বাস্তব জগতে কাজ করে, তখন সে প্রায় সবসময়ই পরিবেশ কীভাবে কাজ করে সে সম্পর্কে অসম্পূর্ণ তথ্যের সম্মুখীন হয়। বিশেষ করে রিয়েল-টাইমে কাজ করতে হয় এমন সিস্টেমগুলির জন্য এই সমস্যাটি তীব্র: রোবট, স্বায়ত্তশাসিত যানবাহন বা বড় ভাষা মডেলের উপর ভিত্তি করে পরিষেবা। এতটা সতর্ক থাকা অসম্ভব যে সব সম্ভাব্য পরিস্থিতি বিবেচনায় নেওয়া যায়, আর অতিরিক্ত সাহসী আচরণ দুর্ঘটনার কারণ হতে পারে। একটি ভারসাম্য প্রয়োজন, এবং ঠিক এটিই খুঁজে বের করার চেষ্টা করছে Deep Kumar Ganguly এবং Jan Kretinsky-এর গবেষণায় প্রস্তাবিত নতুন পদ্ধতি।
কাজটি কোথা থেকে এসেছে
লেখকরা «Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making» (arXiv:2608.17574) শিরোনামের কাজটি উপস্থাপন করেছেন। নিবন্ধটি আগস্ট ২০২৬ সালে জমা দেওয়া হয়েছিল এবং IJCAI-ECAI ২০২৬ সম্মেলনের RobustifAI ওয়ার্কশপে গৃহীত হয়েছিল। কেন্দ্রবিন্দুতে রয়েছে — RATTL, বা Risk-Adversarial Total-Reward Learning। এটি এমন একটি পদ্ধতি যা এজেন্টকে পরিবেশের গতিশীলতা আংশিকভাবে জানা থাকা অবস্থায় ঝুঁকি মূল্যায়ন করে সিদ্ধান্ত নিতে দেয়।
RATTL-এর মূল ধারণা হল সতর্কতার মাত্রা স্থির নয়, বরং সরাসরি নির্ভর করে এজেন্ট তার পরিবেশ সম্পর্কে আসলে কতটা অনিশ্চিত তার উপর। যদি প্রমাণ কম থাকে — সাবধানে কাজ করি। যদি সেগুলি বেশি হয় — আমরা আরও সাহসী পদক্ষেপ নিতে পারি। এই অভিযোজনযোগ্যতাই পদ্ধতিটিকে শাস্ত্রীয় পদ্ধতি থেকে আলাদা করে, যেখানে ঝুঁকির মাত্রা আগে থেকেই নির্ধারিত থাকে এবং অপরিবর্তিত থাকে।
পদ্ধতিটি কীভাবে কাজ করে: অনিশ্চয়তা ব্যাসার্ধ হিসেবে
RATTL-এর ভিত্তি হল অজানা পরিবেশের গতিশীলতার উপর Bayesian posterior। সহজভাবে বললে, এজেন্ট পর্যবেক্ষণ জমা হওয়ার সাথে সাথে বিশ্ব কীভাবে কাজ করে সে সম্পর্কে তার ধারণা ক্রমাগত আপডেট করে। কিন্তু পরিকল্পনার জন্য এটি যথেষ্ট নয়: এই ধারণাগুলি কতটা ভুল হতে পারে তাও বুঝতে হবে।
লেখকদের সমাধান হল পরিবেশের সম্ভাব্য মডেলগুলির একটি সেটকে তথাকথিত Wasserstein-অনিশ্চয়তা সেট আকারে বিবেচনা করা। এই সেটের ব্যাসার্ধ — বর্তমান প্রত্যাশা থেকে বিচ্যুতি আমরা কতটা দূর допускаем তার পরিমাপ — posterior-এর একটি একঘেয়ে ফাংশন হিসাবে নির্ধারিত হয়। প্রাথমিক পর্যায়ে, যখন ডেটা কম, ব্যাসার্ধ বড়: এজেন্ট допускает যে পরিবেশ প্রায় যেকোনোভাবে আচরণ করতে পারে। প্রমাণ আসার সাথে সাথে ব্যাসার্ধ সংকুচিত হয়, এবং «সম্ভাব্য জগতের» বৃত্ত সংকীর্ণ হয়।
এই প্রক্রিয়াটি একটি আকর্ষণীয় ইন্টারপোলেশন প্রভাব দেয়। চরমে, যখন ব্যাসার্ধ সর্বাধিক, এজেন্টের আচরণ সবচেয়ে খারাপ পরিস্থিতিতে নিরাপদ এমন কৌশল — худший случай রোবাস্টনেস নিশ্চিত করার সমতুল্য। যখন ব্যাসার্ধ শূন্যের দিকে趨яет, এজেন্ট একটি ঝুঁকি-নিরপেক্ষ অপটিমাইজারে পরিণত হয় যা কেবল প্রত্যাশিত মোট পুরস্কার সর্বাধিক করে। মধ্যবর্তী বিন্দুতে আমরা আচরণের একটি অবিচ্ছিন্ন বর্ণালী পাই — অত্যন্ত রক্ষণশীল থেকে প্রায় আত্মবিশ্বাসী পর্যন্ত।
এই ধরনের মানদণ্ড নির্মাণ Entropic Value-at-Risk-এর ভিত্তিতে থাকা দ্বৈততার উপর নির্ভর করে। এই সংযোগটি ঝুঁকির মাত্রা নির্বাচনকে অনিশ্চয়তার ব্যাসার্ধ নির্বাচনে রূপান্তরিত করতে দেয়, যা গণনাগতভাবে সুবিধাজনক এবং ধারণাগতভাবে স্পষ্ট: বিমূর্ত «সতর্কতা সহগ»-এর পরিবর্তে আমরা একটি জ্যামিতিক পরিমাণ নিয়ে কাজ করি যা পরিচিত মডেল থেকে допустимое বিচ্যুতি হিসাবে ব্যাখ্যা করা যেতে পারে।
গ্যারান্টি এবং নিরাপত্তা: «Safety Sandwich»
লেখকরা শুধু হিউরিস্টিকসেই সীমাবদ্ধ থাকেননি। তারা দেখিয়েছেন যে RATTL-এ পরিকল্পনার কাজটি ট্রানজিয়েন্ট অবস্থা এবং কমপ্যাক্ট স্টেট স্পেসের শর্তে সঠিক। এর অর্থ হল অ্যালগরিদম অসীম ট্র্যাজেক্টোরিতে «ভেঙে পড়ে না» এবং ইউটিলিটি ফাংশনের অর্থপূর্ণ মান দেয়।
কেন্দ্রীয় তাত্ত্বিক ফলাফলের নাম দেওয়া হয়েছে Safety Sandwich — «নিরাপত্তার স্যান্ডউইচ»। RATTL-এর মান সর্বদা দুটি চরম মানের মধ্যে থাকে। নীচে থেকে এটি অজ্ঞাত রোবাস্ট মান দ্বারা সীমাবদ্ধ — অর্থাৎ, যে মূল্যায়ন এজেন্ট পেত যদি তার কাছে কোনো ডেটা না থাকত এবং সে সবচেয়ে খারাপের জন্য প্রস্তুত থাকত। উপরে থেকে — গতিশীলতার সম্পূর্ণ জ্ঞান থাকলে সর্বোত্তম। posterior সত্য মডেলের চারপাশে কেন্দ্রীভূত হওয়ার সাথে সাথে এই সীমানাগুলির মধ্যে ব্যবধান কমে যায় এবং RATTL-এর মূল্যায়ন সর্বোত্তমের দিকে趋яет। অন্য কথায়, পদ্ধতিটি নিশ্চিত করে যে শুরুতে অতিরিক্ত সতর্কতা বিপর্যয়করভাবে কম পুরস্কারের দিকে নিয়ে যায় না, এবং শেষে আত্মবিশ্বাস এজেন্টকে অবশিষ্ট ঝুঁকির প্রতি অন্ধ করে না।
উদাহরণে আচরণ: বিমূর্ততা থেকে অনুশীলনে
চিত্রণের জন্য, লেখকরা বাইনারি বিপদের সাথে ক্যানোনিকাল উদাহরণ বিবেচনা করেন — এমন একটি পরিস্থিতি যেখানে পরিবেশের দুটি অবস্থা রয়েছে, একটি নিরাপদ এবং অন্যটি মারাত্মক বিপজ্জনক। এই ক্ষেত্রে, RATTL-এর প্ররোচিত মানদণ্ড Conditional Value-at-Risk-এ сводится হয় এমন একটি স্তরের সাথে যা posterior-এর এনট্রপি দ্বারা নির্ধারিত হয়। অন্য কথায়, এজেন্টের বিশ্বাসের বন্টন যত বেশি «ছড়িয়ে পড়া», সে তত কঠোর ক্ষতির থ্রেশহোল্ড বেছে নেয়।

আরেকটি কার্যকরী উদাহরণ কৌতূহলী আচরণ দেখায়: এজেন্ট কার্যকর পদক্ষেপ দীর্ঘ সময়ের জন্য স্থগিত রাখে, যতক্ষণ না সনাক্তকরণের একটি তীক্ষ্ণ থ্রেশহোল্ড অর্জিত হয়। অর্থাৎ, সে অ-অপটিমালিটি সহ্য করতে প্রস্তুত — যেমন ধীরে চলা বা ইচ্ছাকৃতভাবে সবচেয়ে লাভজনক কৌশল না বেছে নেওয়া — যতক্ষণ না সে অন্ধভাবে ঝুঁকি নেয়। প্রমাণ যথেষ্ট বিশ্বাসযোগ্য হওয়ার সাথে সাথে একটি গুণগত লাফ ঘটে: এজেন্ট আত্মবিশ্বাসী পদক্ষেপে স্যুইচ করে। এটি একজন মানুষের আচরণের স্মরণ করিয়ে দেয় যে অপরিচিত জায়গায় প্রথমে ধীরে হাঁটে এবং চারপাশে তাকায়, তারপর রাস্তা চিনে গেলে গতি বাড়ায়।
এই ধরনের কাজের মোড রিয়েল-টাইম সিস্টেমের জন্য বিশেষভাবে গুরুত্বপূর্ণ। লেখকরা জোর দেন যে RATTL ক্রমাগত ডেটা প্রবাহের শর্তে কাজ করা এজেন্টদের নিরাপত্তার জন্য ডিজাইন করা হয়েছে, যার মধ্যে বড় ভাষা মডেলের উপর ভিত্তি করে সিস্টেমও রয়েছে। তাদের জন্য অজ্ঞাততা কেবল শারীরিক পরিবেশের কারণেই নয়, ব্যবহারকারীদের আচরণ বা প্রক্রিয়াকৃত পাঠ্যের গুণমানের অনিশ্চয়তার কারণেও arises।

কেন এটি গুরুত্বপূর্ণ
RATTL-এর প্রধান অবদান — «সতর্কতা বনাম দক্ষতা»-র কঠোর দ্বিধা প্রত্যাখ্যানে। এর পরিবর্তে, লেখকরা তাদের একটি প্রক্রিয়ার দুটি দিক হিসাবে বিবেচনা করার প্রস্তাব দেন: আমরা যত বেশি জানি, তত সাহসী হতে পারি, এবং একই সাথে আমাদের জ্ঞানের মাত্রা এবং допустимый ঝুঁকির মধ্যে একটি স্পষ্ট সংযোগ বজায় রাখতে চাই। এই ধরনের পদ্ধতি স্বয়ংক্রিয় সিদ্ধান্ত গ্রহণের পদ্ধতিগুলিকে আরও স্বচ্ছ এবং অনুমানযোগ্য করে তোলে, যা ব্যবহারিক বাস্তবায়নের জন্য গুরুত্বপূর্ণ।
বড় স্টেট স্পেস নিয়ে কাজ করার সময় গণনাগত জটিলতার প্রশ্নটি খোলা থাকে, তবে তাত্ত্বিক ভিত্তি ইতিমধ্যে স্থাপন করা হয়েছে। সম্ভবত, অদূর ভবিষ্যতে আমরা নির্দিষ্ট ডোমেনের জন্য RATTL-এর পরিবর্তন দেখতে পাব — ড্রোন পরিচালনা থেকে AI-ভিত্তিক সহকারী পর্যন্ত, যারা নিজের অভিজ্ঞতা থেকে শেখে, নিজেদের বা আশেপাশের লোকদের ঝুঁকিতে না ফেলে।



