কেন একটি কৌশল যথেষ্ট নয়: টেকসই MDP-এর জন্য অভিযোজিত নীতি পোর্টফোলিও

30 আগস্ট 2026১০ প্রদর্শন

লেখকরা একটি একক রক্ষণশীল নীতির পরিবর্তে সহজ র্যান্ডমাইজড কৌশলগুলির একটি পূর্ব-সংগৃহীত সেট ব্যবহার করার প্রস্তাব দেন, যা কাজ চলাকালীন একটি হালকা অনলাইন-সিলেক্টর দ্বারা নির্বাচিত হয়। এই পদ্ধতিটি ক্ষতি হ্রাস করে যখন পরিবেশের প্রকৃত গতিশীলতা ধীরে ধীরে স্পষ্ট হয়ে ওঠে, যদিও পোর্টফোলিওগুলির যাচাইকরণ এবং সংশ্লেষণ গণনাগতভাবে জটিল হয়ে ওঠে।

কেন একটি কৌশল যথেষ্ট নয়: টেকসই MDP-এর জন্য অভিযোজিত নীতি পোর্টফোলিও

কেন একটি মাত্র কৌশল যথেষ্ট নয়: টেকসই MDP-র জন্য অভিযোজিত পলিসি পোর্টফোলিও

ক্লাসিক্যাল মার্কভ ডিসিশন প্রসেস (MDP) ধরে নেয় যে পরিবেশের গতিবিদ্যা সঠিকভাবে জানা আছে। বাস্তবে এটি প্রায় কখনোই সত্য নয়: আমরা কেবল সম্ভাব্য পরিস্থিতির একটি সেট রূপরেখা দিতে পারি। রোবাস্ট MDP (robust MDP) এটিকে আমূলভাবে মোকাবেলা করে — এমন একটি পলিসি খোঁজে যা সম্ভাব্য সবচেয়ে খারাপ ট্রানজিশনেও যথেষ্ট ভালো কাজ করবে। কিন্তু এই পদ্ধতির একটি লুকানো মূল্য আছে: এটি সবচেয়ে খারাপ পরিস্থিতির জন্য তৈরি, এবং তাই প্রায়শই অতিরিক্ত রক্ষণশীল হয়ে ওঠে।

এটি বিশেষভাবে লক্ষণীয় যখন অনিশ্চয়তা সময়ের সাথে সাথে হ্রাস পায়। পরিবেশ এজেন্টের সামনে উন্মোচিত হয়, এবং এর গতিবিদ্যার কিছু অংশ পর্যবেক্ষণযোগ্য এবং আংশিকভাবে শনাক্তযোগ্য হয়ে ওঠে। উন্মোচনের আগে গণনা করা সর্বোত্তম পলিসি এই নতুন তথ্য ব্যবহার করে না। মূলত, আমরা এমন জায়গাতেও সবচেয়ে খারাপ পরিস্থিতির জন্য খেলতে থাকি যেখানে আমরা ইতিমধ্যে জানি যে সেটি ঘটেনি। টোয়েন্টে এবং অ্যান্টওয়ার্প বিশ্ববিদ্যালয়ের গবেষকরা — Kasper Engelen, Sebastian Junges, Guillermo A. Pérez এবং Marnix Suilen — তাদের কাজ «Adaptive Policy Portfolios for Robust Markov Decision Processes» (arXiv:2608.17929, cs.AI/cs.LO) এ আরও নমনীয় পদ্ধতির প্রস্তাব করেছেন।

অভিযোজিত পোর্টফোলিও: একটি পলিসির বদলে পলিসির সেট

একটি একক রোবাস্ট পলিসির পরিবর্তে, লেখকরা একটি পলিসি পোর্টফোলিও বিবেচনা করেন — র্যান্ডমাইজড মেমোরিলেস পলিসির একটি সসীম সেট, যা আগে থেকেই, অফলাইনে সংশ্লেষিত হয়। এগুলির পাশাপাশি একটি হালকা অনলাইন-সিলেক্টর ব্যবহার করা হয়, যা কাজের সময় পোর্টফোলিও থেকে সবচেয়ে উপযুক্ত পলিসি বেছে নেয়। এটি মেশিন লার্নিংয়ে মডেল এনসেম্বলের মতো, তবে একটি স্পষ্ট তাত্ত্বিক কাঠামো সহ।

এই ধরনের পোর্টফোলিওর গুণমানের মূল মেট্রিক হল রোবাস্ট রিগ্রেট (robust regret)। সম্ভাব্য পরিবেশের সেট থেকে প্রতিটি নির্দিষ্ট পরিবেশের জন্য, এটি পরিমাপ করে যে অনলাইন-সিলেক্টর দ্বারা নির্বাচিত পলিসি সেই আদর্শ পলিসির চেয়ে কতটা পিছিয়ে, যা আমরা তৈরি করতাম যদি আমরা সেই পরিবেশটি আগে থেকে জানতাম। অন্য কথায়, একটি পোর্টফোলিও ভালো বলে বিবেচিত হয় যদি এর সেরা সদস্য যেকোনো পরিবেশের জন্য সর্বোত্তমের যথেষ্ট কাছাকাছি থাকে। এই দৃষ্টিভঙ্গি জোর স্থানান্তর করে সবচেয়ে খারাপ পরিস্থিতির গ্যারান্টি থেকে অভিযোজনের মূল্যের দিকে।

অনুরূপ ধারণা আগে Ghavamzadeh et al. (2016) দ্বারা বিকশিত হয়েছিল, তবে নিরাপদ পলিসি উন্নতির জন্য আনুমানিক পদ্ধতি এবং রিলাক্সেশনের উপর ফোকাস করে। নতুন কাজটি এই ক্ষেত্রের তাত্ত্বিক ভিত্তিকে উল্লেখযোগ্যভাবে এগিয়ে নিয়ে যায়।

সার্টিফিকেশন এবং সংশ্লেষণের জটিলতা

পোর্টফোলিওটি কেবল একটি ইঞ্জিনিয়ারিং হিউরিস্টিক নয়। লেখকরা পোর্টফোলিও নিয়ে কাজ করার সময় উদ্ভূত কাজগুলির একটি সূক্ষ্ম তাত্ত্বিক-জটিলতা বিশ্লেষণ দেন।

প্রথম কাজটি হল একটি প্রদত্ত পোর্টফোলিওর সার্টিফিকেশন: এটি কি নিশ্চিত করা যায় যে সমস্ত সম্ভাব্য পরিবেশের জন্য একটি গ্রহণযোগ্য রিগ্রেট সহ একটি পলিসি পাওয়া যাবে? দেখা যাচ্ছে, এই কাজটি ইতিমধ্যেই অ্যাসাইক্লিক (s,a)-আয়তক্ষেত্রাকার RMDP-তে ডিটারমিনিস্টিক পোর্টফোলিওর জন্য ∀R-সম্পূর্ণ। এর অর্থ হল এমনকি অল্প সংখ্যক পলিসির গুণমান যাচাই করাও একটি গণনাগতভাবে কঠিন কাজ, যা বাস্তব অসমতার সিস্টেম সমাধানের জটিলতার সাথে তুলনীয়।

আরও কঠিন হল সীমিত আকারের (unary-bounded) পোর্টফোলিওর সংশ্লেষণ কাজ। সাধারণ মূলদ পলিটোপের জন্য এটি ∃∀R-সম্পূর্ণ হতে দেখা যায় — এমনকি একটি নির্দিষ্ট ডিসকাউন্ট ফ্যাক্টর এবং অ্যাসাইক্লিক গতিবিদ্যার সাথেও। এই ধরনের জটিলতা নির্দেশ করে যে এখানে কোনো সহজ কম্বিনেটরিয়াল অ্যালগরিদম নেই: সমস্যাটি বিচ্ছিন্ন অনুসন্ধান এবং বীজগাণিতিক জটিলতা উভয়কেই একত্রিত করে। উল্লেখযোগ্যভাবে, এমনকি একটি একক পলিসির ক্ষেত্রেও তুচ্ছ নয় এবং উভয় অক্ষেই «ব্যয়বহুল»।

কীভাবে এটি অনুশীলনের কাছাকাছি আনা যায়?

জটিলতা সম্পর্কে প্রাপ্ত ফলাফল ভয় দেখাতে পারে, তবে লেখকরা নেতিবাচক সিদ্ধান্তে থেমে থাকেন না। তারা একটি নির্দিষ্ট অফলাইন পোর্টফোলিও নির্মাণের প্রস্তাব করেন যা রানটাইম স্পেশালাইজেশন (runtime specialization) অনুমতি দেয়। অর্থ হল আগে থেকে পলিসির একটি সেট প্রস্তুত করা, এবং পরিবেশের সাথে মিথস্ক্রিয়া চলাকালীন বর্তমান পর্যবেক্ষণের অধীনে নির্বাচন দ্রুত সামঞ্জস্য করা। এই পদ্ধতিটি কঠোর গ্যারান্টিগুলিকে ব্যবহারিক নমনীয়তার সাথে একত্রিত করতে দেয়।

উপসংহার সহজ: যে কাজগুলিতে অনিশ্চয়তা সময়ের সাথে সাথে আংশিকভাবে প্রকাশিত হয়, একটি একক স্থির কৌশল অবশ্যই একটি অভিযোজিত সেটের চেয়ে দুর্বল। পলিসি পোর্টফোলিও উচ্চতর গণনাগত জটিলতার মূল্য দেয়, তবে বিনিময়ে ভুল করার অধিকার এবং ডেটা আসার সাথে সাথে স্যুইচ করার ক্ষমতা দেয়। এটি সম্পূর্ণ রক্ষণশীল পদ্ধতি থেকে অনিশ্চয়তার অধীনে বুদ্ধিমান সিদ্ধান্ত গ্রহণের সিস্টেমের দিকে একটি গুরুত্বপূর্ণ পদক্ষেপ।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
কেন একটি কৌশল যথেষ্ট নয়: টেকসই MDP-এর জন্য অভিযোজিত নীতি পোর্টফোলিও