কীভাবে DecPOMDP-তে "বিস্ফোরণ" মোকাবেলা করবেন: এজেন্ট গণনা থেকে কৌশল গণনায় পরিবর্তন

30 আগস্ট 2026১১ প্রদর্শন

একটি নতুন বৈজ্ঞানিক গবেষণাপত্রে এমন একটি পদ্ধতি প্রস্তাব করা হয়েছে যা অসম্পূর্ণ পর্যবেক্ষণযোগ্যতা সহ বহু-এজেন্ট সিদ্ধান্ত গ্রহণের মডেলগুলিকে এমনকি বিপুল সংখ্যক এজেন্টের ক্ষেত্রেও গণনাগতভাবে সমাধানযোগ্য করে তোলে। এজেন্টদের মধ্যে প্রতিসাম্য বিবেচনা করার পরিবর্তে, লেখকরা নীতিগুলির একটি সংক্ষিপ্ত গণনার দিকে যান এবং দেখান যে এটি কীভাবে জটিলতার সূচকীয় বৃদ্ধি এড়াতে সাহায্য করে।

কীভাবে DecPOMDP-তে "বিস্ফোরণ" মোকাবেলা করবেন: এজেন্ট গণনা থেকে কৌশল গণনায় পরিবর্তন

কেন DecPOMDP পরিকল্পনাকারীদের জন্য একটি চ্যালেঞ্জ

Decentralized Partially Observable Markov Decision Process (DecPOMDP) — অনিশ্চয়তার মধ্যে বহু-এজেন্ট সিদ্ধান্ত গ্রহণের জন্য সবচেয়ে সাধারণ মডেলগুলির মধ্যে একটি। এজেন্টরা বিশ্বের সম্পূর্ণ চিত্র দেখতে পায় না, সীমিতভাবে যোগাযোগ করে এবং স্থানীয় পর্যবেক্ষণের উপর ভিত্তি করে কাজ করতে বাধ্য হয়। এই সাধারণতার জন্য মূল্য দিতে হয়: এজেন্টের সংখ্যার সাথে সাথে কাজের জটিলতা দ্রুতগতিতে (এক্সপোনেনশিয়ালি) বৃদ্ধি পায় এবং ইতিমধ্যে দশটি সত্তার জন্য সম্পূর্ণ বিকল্প অনুসন্ধান অপ্রাপ্য হয়ে পড়ে।

অনুশীলনে, এর অর্থ হল শাস্ত্রীয় অ্যালগরিদমগুলি দ্রুত "মাত্রার অভিশাপে" আটকে যায়। এমনকি অংশগ্রহণকারীদের সংখ্যার সামান্য পরিবর্তনও গণনার হিমবাহের মতো বৃদ্ধির দিকে নিয়ে যায়, তাই গবেষকরা ক্রমাগত অনুসন্ধানের স্থান সংকুচিত করার উপায় খুঁজছেন।

এজেন্ট গণনা: কীভাবে প্রতিসাম্য সাহায্য করে এবং ক্ষতি করে

একটি স্বজ্ঞাত কৌশল — প্রতিসাম্য ব্যবহার করা। যদি এজেন্টরা পরস্পর বিনিময়যোগ্য হয়, তবে তাদের তালিকা নাম ধরে রাখার প্রয়োজন নেই: প্রতিটি "সাধারণ" অবস্থায় বা ভূমিকায় কতজন এজেন্ট রয়েছে তা জানা যথেষ্ট। এজেন্ট গণনার উপর ভিত্তি করে এই পদ্ধতিটি সিস্টেমের গতিশীলতা সংক্ষিপ্তভাবে বর্ণনা করতে এবং সমাধানের মূল্যায়ন উল্লেখযোগ্যভাবে সহজ করতে দেয়। মডেলের জটিলতা এজেন্টের সংখ্যার সাপেক্ষে বহুপদী (পলিনমিয়াল) হয়ে যায়।

তবে এই পদ্ধতির একটি অন্ধকার দিক রয়েছে। যখন আমরা অবস্থা থেকে কৌশল (পলিসি)-তে স্থানান্তরিত হই, তখন পলিসি সংমিশ্রণের সম্ভাব্য স্থানটি বিপর্যয়করভাবে দ্রুত বাড়তে শুরু করে। সাম্প্রতিক গবেষণার লেখকরা এই প্রভাবটিকেই DecPOMDP-এর "বিস্ফোরণ" বলে অভিহিত করেছেন: মডেলটি বর্ণনার জন্য সংক্ষিপ্ত হয়ে ওঠে, কিন্তু সমাধানের স্থানটি অগ্রহণযোগ্য আকারে ফুলে যায়।

নতুন দৃষ্টান্ত: কৌশল গণনা

arXiv (2608.17749)-এ উপস্থাপিত নাজলা নূর কারাবুলুত এবং তানিয়া ব্রাউনের কাজে, পদ্ধতিটি উল্টে দেওয়ার প্রস্তাব করা হয়েছে। এজেন্ট গণনা করার পরিবর্তে, লেখকরা পলিসি গণনা করার প্রস্তাব করেন। ধারণাটি হল এজেন্টদের তাদের কৌশল অনুসারে গ্রুপ করা: যদি বেশ কয়েকটি এজেন্ট একই পলিসি অনুসরণ করে, তবে তাদের একটি উপাদানে একত্রিত করা যেতে পারে যার ওজন এই ধরনের এজেন্টের সংখ্যার সমান। এটি অনুসন্ধানের স্থানকে আমূল হ্রাস করে।

এই ধরনের মডেলগুলিকে policy-counted DecPOMDP বলা হয়। নতুন উপস্থাপনা স্কিমের জন্য ধন্যবাদ, কাজটি এজেন্টের সংখ্যার সাপেক্ষে ট্র্যাক্টেবল হয়ে ওঠে — অর্থাৎ এটি এক্সপোনেনশিয়ালি বিস্ফোরিত হওয়া বন্ধ করে দেয়। এটি একটি গুরুত্বপূর্ণ ধারণাগত পরিবর্তন: আমরা কাকে গণনা করতে হবে তা দেখি না, বরং কোন কৌশলগুলি কতবার দেখা যায় তা দেখি।

ডায়নামিক প্রোগ্রামিং-এর উপর ভিত্তি করে অ্যালগরিদম

নতুন মডেলটি অনুশীলনে ব্যবহার করার জন্য, লেখকরা policy-counted ডায়নামিক প্রোগ্রামিং পদ্ধতি তৈরি করেছেন। এটি পলিসিগুলির সংক্ষিপ্ত উপস্থাপনার উপর নির্ভর করে এবং প্রতিটি এজেন্টকে আলাদাভাবে বিস্তার না করেই সংমিশ্রণগুলি পরীক্ষা করে। সম্পূর্ণ অনুসন্ধানের পরিবর্তে, অ্যালগরিদম সমষ্টিগত গ্রুপগুলির সাথে কাজ করে, যা গণনাগত জটিলতাকে বহুপদী সীমার মধ্যে রাখতে দেয়।

মূলত, এটি শাস্ত্রীয় ডায়নামিক প্রোগ্রামিং এবং অবস্থার স্থানের বুদ্ধিমান সংকোচনের একটি সংকর। এই পদ্ধতিটি কেবল বৃহত্তর কাজগুলি সমাধান করা সম্ভব করে না, বরং নতুন অ্যাপ্লিকেশনের পথও খুলে দেয়।

বাস্তব সিস্টেমের জন্য এর অর্থ কী

যদিও কাজটি তাত্ত্বিক প্রকৃতির, এর ব্যবহারিক সম্ভাবনা বিশাল। DecPOMDP রোবোটিক্স, লজিস্টিকস, স্বায়ত্তশাসিত পরিবহন ব্যবস্থা এবং বিতরণকৃত কম্পিউটিং-এ ব্যাপকভাবে ব্যবহৃত হয়। এক্সপোনেনশিয়াল খরচ বৃদ্ধি ছাড়াই বিপুল সংখ্যক এজেন্টের সাথে কাজগুলি সমাধান করার ক্ষমতা — এটি ড্রোনের পুরো ঝাঁক বা স্বায়ত্তশাসিত গাড়ির বহরের আচরণ পরিকল্পনার দিকে একটি পদক্ষেপ।

অবশ্যই, শিল্প সরঞ্জামগুলিতে এখনও অনেক দূর, তবে "বিস্ফোরণ" সমস্যাটি গণনার দৃষ্টিভঙ্গি পরিবর্তনের মাধ্যমে সমাধান করা যেতে পারে এই সত্যটি গবেষকদের একটি নতুন দিকনির্দেশনা দেয়। সম্ভবত, শীঘ্রই আমরা policy-counted DecPOMDP-এর উপর ভিত্তি করে লাইব্রেরি এবং পরিকল্পনাকারী দেখতে পাব, যা সেখানে মোকাবেলা করবে যেখানে আগে গণনাগুলি কেবল শেষ হওয়ার সময় পেত না।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
কীভাবে DecPOMDP-তে "বিস্ফোরণ" মোকাবেলা করবেন: এজেন্ট গণনা থেকে কৌশল গণনায় পরিবর্তন