নিউরোসিম্বলিক ওয়ার্ল্ড মডেল: পুনঃপ্রশিক্ষণ ছাড়াই দক্ষতা স্থানান্তরের দিকে এক ধাপ

30 আগস্ট 2026১৭ প্রদর্শন

গবেষকরা একটি পদ্ধতি প্রস্তাব করেছেন যেখানে পুরস্কার পূর্বাভাস শুধুমাত্র লুকানো অবস্থার ব্যাখ্যাযোগ্য প্রতীকী উপাদানগুলির একটি অংশের সাথে যুক্ত। এই স্থাপত্যটি পরিবেশের সাথে মিথস্ক্রিয়া ছাড়াই নতুন কাজে মডেল স্থানান্তর করতে দেয় এবং সাধারণীকরণে সম্পূর্ণ নিউরাল পদ্ধতির তুলনায় উল্লেখযোগ্যভাবে এগিয়ে থাকে।

নিউরোসিম্বলিক ওয়ার্ল্ড মডেল: পুনঃপ্রশিক্ষণ ছাড়াই দক্ষতা স্থানান্তরের দিকে এক ধাপ

ল্যাটেন্ট স্পেসে পরিকল্পনা থেকে দক্ষতা স্থানান্তর

আধুনিক রিইনফোর্সমেন্ট লার্নিং আর কেবল কর্মের এলোমেলো চেষ্টার মধ্যে সীমাবদ্ধ নয়। model-based RL পদ্ধতিতে, এজেন্ট প্রথমে বিশ্বের একটি অভ্যন্তরীণ মডেল তৈরি করে — পরিবেশ তার কর্মে কীভাবে সাড়া দেয় — এবং তারপর এই মডেলটি পরিকল্পনার জন্য ব্যবহার করে। নিউরাল ওয়ার্ল্ড মডেলগুলি এটি ল্যাটেন্ট স্পেসে করতে সক্ষম: তারা পর্যবেক্ষণগুলিকে ভেক্টরে সংকুচিত করে এবং পরিবেশের গঠন সম্পর্কে স্পষ্ট ধারণা ছাড়াই পরবর্তী অবস্থা এবং পুরস্কার পূর্বাভাস দেয়। এটি শক্তিশালী, তবে এই পদ্ধতির একটি উল্লেখযোগ্য সীমাবদ্ধতা রয়েছে: মডেলটি সাধারণত একটি নির্দিষ্ট কাজের সাথে অত্যন্ত আবদ্ধ হয়ে যায়।

নতুন প্রিপ্রিন্ট arXiv:2608.17959-এর লেখক — Isidoro Tamassia, Lennert De Smet এবং Giuseppe Marra — বিশ্ব মডেলের কাঠামো নিজেই পুনর্বিবেচনার প্রস্তাব দিয়েছেন। তাদের ধারণা হল ল্যাটেন্ট অবস্থা থেকে সাংকেতিক উপাদানগুলিকে আলাদা করা যার উপর পুরস্কার নির্ভর করে এবং শুধুমাত্র সেগুলির পূর্বাভাস দেওয়া। এই ধরনের নিউরোসিম্বলিক মডেল পরিবেশের সাথে মিথস্ক্রিয়ায় একটি অতিরিক্ত ধাপ ছাড়াই নতুন কাজে দক্ষতা স্থানান্তর করতে সক্ষম — অর্থাৎ zero-shot মোডে। কাজের v2 সংস্করণটি ২৪ আগস্ট ২০২৬-এ উপস্থাপন করা হয়েছিল।

কেন সাধারণ বিশ্ব মডেলগুলি কাজের সাথে "আটকে যায়"

একটি শাস্ত্রীয় নিউরাল ওয়ার্ল্ড মডেল একটি নির্দিষ্ট পরিবেশ এবং একটি নির্দিষ্ট পুরস্কার ফাংশনের ডেটার উপর প্রশিক্ষিত হয়। প্রশিক্ষণের সময়, ল্যাটেন্ট উপস্থাপনাগুলি এমনভাবে গঠিত হয় যাতে সেগুলি সেই পুরস্কারের জন্য সুবিধাজনক হয়, তবে সেগুলি ব্যাখ্যাযোগ্য বা অন্যান্য লক্ষ্যে স্থানান্তরযোগ্য হতে বাধ্য নয়। তাই কাজ পরিবর্তনের সময় — যেমন লক্ষ্য অবস্থা বা পুরস্কারের নিয়ম পরিবর্তন — এজেন্টকে কার্যত নতুন করে শিখতে হয়: অভ্যন্তরীণ বৈশিষ্ট্যগুলিতে প্রয়োজনীয় কাঠামো থাকে না।

একটি এজেন্ট কল্পনা করুন যে একটি গোলকধাঁধায় লক্ষ্যে পৌঁছানোর পথটি চমৎকারভাবে পরিকল্পনা করে, কিন্তু ভিন্ন পুরস্কার বিন্যাস সহ অন্য গোলকধাঁধায় স্থানান্তরিত হলে বিভ্রান্ত হয়ে যায়। তার ল্যাটেন্ট অবস্থাগুলি পূর্ববর্তী পুরস্কারের জন্য "তৈরি", পরিবেশের উদ্দেশ্যমূলক বৈশিষ্ট্যের জন্য নয়। এটিই মূল সমস্যা যা লেখকরা সমাধান করার চেষ্টা করছেন।

নিউরোসিম্বলিক ফর্মুলেশন কী পরিবর্তন করে

সম্পূর্ণ ল্যাটেন্ট অবস্থা থেকে পুরস্কার পূর্বাভাস দেওয়ার পরিবর্তে, লেখকরা এতে একটি কাঠামোবদ্ধ সাংকেতিক অংশ আলাদা করার প্রস্তাব করেন। পুরস্কারের পূর্বাভাস শুধুমাত্র এই ধরনের সাংকেতিক উপাদানগুলির একটি ছোট উপসেটের উপর নির্ভর করে — যেমন এজেন্টের অবস্থান, চাবির উপস্থিতি বা খোলা দরজা। পর্যবেক্ষণের পুনর্গঠন একটি পৃথক কাজ হিসাবে থাকে এবং সম্পূর্ণ ল্যাটেন্ট অবস্থা ব্যবহার করতে পারে।

দুটি লক্ষ্যের এই বিভাজন — ছবি পুনর্গঠন এবং প্রতীকগুলির মাধ্যমে পুরস্কার পূর্বাভাস — স্থানান্তরের সময় মডেলের আচরণকে মৌলিকভাবে পরিবর্তন করে। যদি নতুন পুরস্কার ফাংশন একই সাংকেতিক অবস্থা-স্থানের উপর সংজ্ঞায়িত হয়, তাহলে এজেন্টকে পরিবেশটি নতুন করে অন্বেষণ করতে হবে না। সে ইতিমধ্যে প্রয়োজনীয় সাংকেতিক তথ্য বের করতে জানে এবং এখন কেবল পুনরায় গণনা করে যে নতুন পুরস্কার সে যা পর্যবেক্ষণ করে তার সাথে কীভাবে সম্পর্কিত।

সুবিধা এবং উন্মুক্ত প্রশ্ন

গবেষণার প্রধান ফলাফল হল পরীক্ষামূলক নিশ্চিতকরণ যে নিউরোসিম্বলিক বিশ্ব মডেলগুলি নতুন পুরস্কার ফাংশনে বিশুদ্ধ নিউরাল পদ্ধতির চেয়ে ভাল সাধারণীকরণ দেয়। এটি একটি গুরুত্বপূর্ণ যুক্তি যে সাংকেতিক স্তর যোগ করা সত্যিই স্থানান্তরে সাহায্য করে, কেবল স্থাপত্যকে জটিল করে না।

কিন্তু এই ধরনের স্থাপত্য নিজস্ব চ্যালেঞ্জও তৈরি করে।

  • কোন অবস্থার উপাদানগুলিকে সাংকেতিক হিসাবে বিবেচনা করা হবে এবং কোনটি পুনর্গঠনের জন্য "কাঁচা" রাখা হবে তা নির্ধারণ করতে হবে।
  • সাংকেতিক স্থানটি যথেষ্ট অভিব্যক্তিপূর্ণ হতে হবে যাতে এতে বিভিন্ন ধরনের কাজ সংজ্ঞায়িত করা যায় — অন্যথায় স্থানান্তর লক্ষ্যগুলির একটি সংকীর্ণ শ্রেণিতে সীমাবদ্ধ থাকবে।
  • পুরস্কার পূর্বাভাস এবং পুনর্গঠনের পৃথক প্রশিক্ষণ আরও জটিল: মডেলটি ভিজ্যুয়াল তথ্য হারাতে পারবে না যা শুধুমাত্র পর্যবেক্ষণ পুনর্গঠনের জন্য প্রয়োজন।

এটি কেন প্রয়োজন

অতিরিক্ত প্রশিক্ষণ ছাড়া দক্ষতা স্থানান্তর রিইনফোর্সমেন্ট লার্নিংয়ের অন্যতম মূল লক্ষ্য। বর্তমানে, প্রতিটি নতুন পরিস্থিতি প্রায়শই ডেটা সংগ্রহ এবং পরিবেশের সাথে মিথস্ক্রিয়ার একটি নতুন পর্যায় বোঝায়। নিউরোসিম্বলিক বিশ্ব মডেলগুলি এই পরিবর্তনকে উল্লেখযোগ্যভাবে সস্তা করতে পারে: এটি যথেষ্ট যে নতুন কাজটি এজেন্টের কাছে ইতিমধ্যে পরিচিত সাংকেতিক অবস্থার পরিপ্রেক্ষিতে বর্ণনা করা হয়। মূলত, এটি এমন এক ধাপ যেখানে এজেন্ট কেবল "বিশ্ব কেমন দেখায়" নয়, "এই বিশ্বে লক্ষ্য অর্জনের জন্য কী গুরুত্বপূর্ণ" তাও বোঝে।

কাজটি কৃত্রিম বুদ্ধিমত্তা এবং মেশিন লার্নিং ক্ষেত্রের (cs.AI, cs.LG) অন্তর্গত এবং এখনও গবেষণামূলক ফলাফলের প্রকৃতি বহন করে। তবে দিকটি আশাব্যঞ্জক দেখাচ্ছে: ব্যাখ্যাযোগ্য সাংকেতিক স্তর সাধারণীকরণ এবং মডেলের সিদ্ধান্তে আস্থা উভয় ক্ষেত্রেই সাহায্য করে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
নিউরোসিম্বলিক ওয়ার্ল্ড মডেল: পুনঃপ্রশিক্ষণ ছাড়াই দক্ষতা স্থানান্তরের দিকে এক ধাপ