UniWM: একটি মডেল, "পরিকল্পনা + দৃষ্টি" জোড়ার পরিবর্তে — রোবটরা পূর্বাভাস ও কাজ করতে শেখে

5 সেপ্টেম্বর 2026১৭ প্রদর্শন

নতুন আর্কিটেকচারটি ভিজ্যুয়াল পূর্বাভাস এবং কর্ম নির্বাচনকে একটি একক মাল্টিমোডাল ব্যাকবোনে একীভূত করে, যার সাথে স্তরক্রমিক মেমরি রয়েছে। চারটি নেভিগেশন বেঞ্চমার্কে এটি সাফল্যের হার ৩০% পর্যন্ত বৃদ্ধি করে এবং অজানা ডেটায় জিরো-শট স্থানান্তর দেখায়, যার মধ্যে মানবসদৃশ রোবট নিয়ন্ত্রণও অন্তর্ভুক্ত।

UniWM: একটি মডেল, "পরিকল্পনা + দৃষ্টি" জোড়ার পরিবর্তে — রোবটরা পূর্বাভাস ও কাজ করতে শেখে

শিরোনাম: "প্রথমে ভাবো, তারপর দেখো" সমস্যা: কেন রোবটের একটি একক মডেল প্রয়োজন

রোবট নিয়ন্ত্রণের ক্লাসিক্যাল পদ্ধতি দেখতে পাইপলাইনের মতো: প্রথমে সিস্টেম কর্মের একটি ক্রম পরিকল্পনা করে, তারপর একটি পৃথক ভিশন মডিউল ক্যামেরায় যা সত্যিই দেখা যায় তার সাথে পরিকল্পনাটি মেলানোর চেষ্টা করে। বাস্তবে এই সংযোগ প্রায়ই ব্যর্থ হয়: পূর্বাভাস প্রকৃত চিত্রের সাথে মেলে না, ত্রুটিগুলি জমা হতে থাকে এবং দীর্ঘ দূরত্বে রোবট "সূত্র হারিয়ে ফেলে" এবং বিশৃঙ্খলভাবে কাজ করতে শুরু করে।

ইঞ্জিনিয়াররা দীর্ঘদিন ধরে একটি একক আর্কিটেকচারে পূর্বাভাস এবং নিয়ন্ত্রণ একত্রিত করার উপায় খুঁজছিলেন, যাতে মডেলটি কেবল কমান্ড জারি করে না বরং সমান্তরালভাবে তাদের পরিণতি "কল্পনা" করতে পারে। এরকম একটি সমাধান হল মেমরি সহ একটি ইউনিফাইড ওয়ার্ল্ড মডেল — UniWM। এটি বিচ্ছিন্ন মডিউলগুলির একটি সংযোগ হিসাবে নয়, বরং একটি একক মাল্টিমোডাল অটোরিগ্রেসিভ সিস্টেম হিসাবে নির্মিত যা কর্মগুলিকে স্পষ্টভাবে দৃশ্যত পূর্বাভাসিত ফলাফলের সাথে সংযুক্ত করে।

UniWM কীভাবে কাজ করে: কল্পনা নিয়ন্ত্রণের অংশ হয়ে ওঠে

মূল ধারণা হল ভিজ্যুয়াল পূর্বাভাসকে একটি সহায়ক পদক্ষেপ নয়, বরং সিদ্ধান্ত গ্রহণের একটি অবিচ্ছেদ্য অংশ করা। মডেলটি ইনপুট হিসাবে একটি এগোসেন্ট্রিক ক্যামেরা থেকে বর্তমান ফ্রেম এবং কর্মের ইতিহাস পায়, তারপর অটোরিগ্রেসিভভাবে কেবল পরবর্তী ধাপই নয়, বরং এর সাথে সম্পর্কিত ভবিষ্যতের ভিজ্যুয়াল চিত্রও তৈরি করে। ফলাফল একটি বন্ধ লুপ: কর্ম পরিকল্পনা রোবটটি চলতে শুরু করার আগেই তার "মাথায়" যাচাই করা হয়।

এর ফলে পূর্বাভাস এবং প্রকৃত নিয়ন্ত্রণের মধ্যে অসঙ্গতি দূর হয়। যখন মডেল একটি কর্ম নির্বাচন করে, তখন এটি ইতিমধ্যেই জানে যে এই কর্মের পরে চোখের সামনের ছবিটি কীভাবে পরিবর্তিত হবে। এটি নেভিগেশনে বিশেষভাবে গুরুত্বপূর্ণ, যেখানে প্রতিটি কমান্ড পরবর্তী পর্যবেক্ষণকে প্রভাবিত করে — যেমন বাঁক নেওয়া বা বাধা এড়ানোর সময়।

UniWM বিভিন্ন ধরনের ডেটা — ছবি, টেক্সট, গতির কমান্ড — প্রক্রিয়াকরণের জন্য একটি একক ব্যাকবোন ব্যবহার করে। এটি প্রশিক্ষণকে সহজ করে এবং আর্কিটেকচার পুনর্নির্মাণ ছাড়াই বিভিন্ন ধরণের কাজের মধ্যে জ্ঞান স্থানান্তর করতে মডেলটিকে সক্ষম করে।

মেমরি: কেন রোবট ভুলে যায় না যে সে কোথায় যাচ্ছিল

দীর্ঘমেয়াদী নেভিগেশনের অন্যতম প্রধান সমস্যা হল প্রসঙ্গ ধরে রাখা। যদি মডেলটি কেবল বর্তমান ফ্রেম দেখে, তবে এটি একাধিক কৌশলের পরে সহজেই দিকনির্দেশনা হারিয়ে ফেলে। UniWM-এ এই সমস্যাটি একটি শ্রেণিবদ্ধ মেমরি প্রক্রিয়া দ্বারা সমাধান করা হয়। এটি দুটি স্তরকে একত্রিত করে:

  • স্বল্পমেয়াদী মেমরি — সাম্প্রতিক পারসেপচুয়াল সংকেত ধরে রাখে, যেমন সাম্প্রতিক ফ্রেম এবং সাম্প্রতিক কর্ম;
  • দীর্ঘমেয়াদী মেমরি — ট্র্যাজেক্টোরির সামগ্রিক প্রসঙ্গ সংরক্ষণ করে, যা মডেলটিকে বুঝতে সাহায্য করে যে রোবটটি শুরুর বিন্দুর সাপেক্ষে কোথায় রয়েছে এবং কোন অংশগুলি ইতিমধ্যে অতিক্রম করা হয়েছে।

এই কাঠামো দীর্ঘ পরিকল্পনার দিগন্তে সুসংগত যুক্তি বজায় রাখতে সক্ষম করে। মডেলটি কেবল তাত্ক্ষণিক চিত্রের প্রতি প্রতিক্রিয়া জানায় না — এটি পুরো পথটি বিবেচনা করে, যা বড় স্থান এবং জটিল পরিস্থিতির জন্য গুরুত্বপূর্ণ।

সংখ্যা এবং বাস্তবে যাচাইকরণ

ডেভেলপাররা চারটি নেভিগেশন বেঞ্চমার্ক — Go Stanford, ReCon, SCAND এবং HuRoN — পাশাপাশি 1X Humanoid Dataset-এ মডেলটি পরীক্ষা করেছেন, যাতে হিউম্যানয়েড রোবটের ডেটা রয়েছে। ফলাফলগুলি শক্তিশালী বেসলাইনের তুলনায় উল্লেখযোগ্য অগ্রগতি নির্দেশ করে।

  • নেভিগেশন সাফল্য 30% পর্যন্ত বেড়েছে — অর্থাৎ রোবটটি এখন লক্ষ্যে পৌঁছাতে অনেক বেশি সক্ষম।
  • ট্র্যাজেক্টোরি ত্রুটি উল্লেখযোগ্যভাবে হ্রাস পেয়েছে: মডেলটি পরিকল্পিত রুট আরও নির্ভুলভাবে অনুসরণ করে, কম বিচ্যুত হয় এবং অপ্রয়োজনীয় কৌশল করে না।
  • জিরো-শট জেনারেলাইজেশন পূর্বে অজানা TartanDrive ডেটাসেটে নিশ্চিত করা হয়েছে — মডেলটি অতিরিক্ত প্রশিক্ষণ ছাড়াই নতুন ডেটাতে শেখা প্যাটার্ন প্রয়োগ করতে সক্ষম হয়েছে।
  • স্কেলেবিলিটি হিউম্যানয়েড রোবটের উচ্চ-মাত্রিক নেভিগেশনে যাচাই করা হয়েছে, যেখানে জটিল কাইনেমেটিক্সের কারণে কর্ম এবং ভিজ্যুয়াল ফিডব্যাকের বিশেষভাবে সুনির্দিষ্ট সমন্বয় প্রয়োজন।

এই ফলাফলগুলি দেখায় যে একটি একক মডেল বহু-ধাপের পাইপলাইনগুলিকে প্রতিস্থাপন করতে সক্ষম, যা আগে জটিল রোবোটিক্সের জন্য বাধ্যতামূলক বলে মনে করা হত। তাছাড়া, উন্নতিগুলি একটি নির্দিষ্ট বেঞ্চমার্কের সাথে খাপ খাওয়ানোর মাধ্যমে নয়, বরং পূর্বাভাস এবং নিয়ন্ত্রণের পদ্ধতিগত সমন্বয়ের মাধ্যমে অর্জিত হয়।

রোবোটিক্সের জন্য এর অর্থ কী

পৃথক পরিকল্পনা এবং দৃষ্টি প্রত্যাখ্যান করা কেবল একটি প্রযুক্তিগত সরলীকরণ নয়। এটি একটি দৃষ্টান্ত পরিবর্তন: বিভিন্ন মডেলের ফলাফল "আঠা দিয়ে জোড়া" দেওয়ার পরিবর্তে, রোবট বিশ্বের একটি সামগ্রিক উপস্থাপনা পায়, যেখানে কর্ম এবং এর ভিজ্যুয়াল পরিণতি অবিচ্ছেদ্য। এই পদ্ধতি সিস্টেমটিকে আরও নির্ভরযোগ্য এবং আচরণকে আরও অনুমানযোগ্য করে তোলে।

কাজটি ECCV 2026-এ গৃহীত হয়েছে এবং 12টি চিত্র সহ 22 পৃষ্ঠা জুড়ে রয়েছে — এটি আর্কিটেকচার এবং পরীক্ষাগুলির বিস্তারিত বিবরণ সহ একটি সম্পূর্ণ গবেষণা। এখন দেখার অপেক্ষা কখন এই ধরনের সমাধান স্বায়ত্তশাসিত মেশিন এবং ড্রোনের জন্য মান হয়ে উঠবে, যেখানে নির্ভুলতার সামান্য উন্নতিও নির্ণায়ক হতে পারে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
UniWM: একটি মডেল, "পরিকল্পনা + দৃষ্টি" জোড়ার পরিবর্তে — রোবটরা পূর্বাভাস ও কাজ করতে শেখে