কেন গভীরতা সবসময় রোবটকে সাহায্য করে না
আধুনিক "ভিশন-ল্যাঙ্গুয়েজ-অ্যাকশন" (VLA) মডেলগুলিতে একটি নিয়ম প্রতিষ্ঠিত হয়েছে: ভিশন-ল্যাঙ্গুয়েজ ব্যাকবোনের স্তর যত গভীর, উপস্থাপনা তত বেশি বিমূর্ত এবং নিয়ন্ত্রণের জন্য তত বেশি উপযোগী বলে মনে করা হয়। তবে রোবোটিক ম্যানিপুলেশন একটি বড় যুক্তি নয়, বরং ঘন ঘন ক্লোজড-লুপ স্থানিক সংশোধনের একটি ক্রম। তাদের জন্য, অত্যধিক বিমূর্ততা প্রায়শই অপ্রয়োজনীয় হয়ে ওঠে: এতে আরও গণনার প্রয়োজন হয় এবং নিম্ন-স্তরের জ্যামিতিক বিবরণ মুছে যায়, যা ছাড়া সঠিক নিয়ন্ত্রণ অসম্ভব।
কল্পনা করুন একটি রোবট একটি কাপের দিকে পৌঁছাচ্ছে। প্রতিটি ফ্রেমে, এটিকে গতিপথে ছোট ছোট সংশোধন করতে হয় এবং এই সংশোধনগুলি বস্তুর সঠিক অবস্থানের উপর নির্ভর করে। যদি মডেলটি ইনপুট ডেটাকে খুব গভীরভাবে বিমূর্ত করে থাকে, তবে এটি প্রয়োজনীয় কোণ বা স্থানচ্যুতি "দেখতে" নাও পেতে পারে। আর যদি প্রতিবার সবকিছু নতুন করে গণনা করতে হয় — তাহলে প্রকৃত নিয়ন্ত্রণের জন্য সময়ই থাকবে না।
এই ধরনের নেটওয়ার্কগুলিতে সম্পদ সাশ্রয়ের বিদ্যমান উপায় — একটি পূর্ব-নির্বাচিত স্তরে তাড়াতাড়ি প্রস্থান বা সংলগ্ন ধাপে কর্মের ধারাবাহিকতা পরীক্ষা করার মতো হিউরিস্টিকস। কিন্তু তারা মূল প্রশ্নের উত্তর দেয় না: বর্তমান উপস্থাপনা কি এই মুহূর্তে সঠিক পদক্ষেপ নেওয়ার জন্য যথেষ্ট? সাধারণত সিদ্ধান্তটি বাহ্যিক নিয়মের ভিত্তিতে নেওয়া হয়, ডেটার নিজস্ব বিষয়বস্তুর ভিত্তিতে নয়।
তাই লেখকদের একটি দল LoopVLA আর্কিটেকচার প্রস্তাব করেছে, যা "কখন থামা যায় সেই মুহূর্ত"কে আনুষ্ঠানিক করার এবং এটি সরাসরি শেখার প্রক্রিয়ায় অন্তর্ভুক্ত করার চেষ্টা করে।

পর্যাপ্ততা মূল্যায়ন সহ পুনরাবৃত্তিমূলক পরিমার্জন
LoopVLA-এর ধারণা — কঠোর স্তরের শৃঙ্খলের পরিবর্তে একটি পুনরাবৃত্তিমূলক লুপ ব্যবহার করা। একই Transformer ব্লক মাল্টিমোডাল টোকেনগুলিতে বেশ কয়েকবার প্রয়োগ করা হয়, ধীরে ধীরে উপস্থাপনাকে পরিমার্জিত করে। প্রতিটি পুনরাবৃত্তিতে, মডেল দুটি ফলাফল দেয়: একটি প্রার্থী ক্রিয়া এবং একটি sufficiency score — একটি সংখ্যা যা ভবিষ্যদ্বাণী করে যে পরিমার্জন চালিয়ে যাওয়া উচিত কিনা।
এটি মডেলের নিজের সাথে একটি অভ্যন্তরীণ সংলাপের মতো: প্রথম পাসে এটি দ্রুত কাজ করে, তবে সম্ভবত যথেষ্ট নির্ভুল নয়; দ্বিতীয় পাসে — ইতিমধ্যে আরও আত্মবিশ্বাসী, তবে এখনও সন্দেহ করতে পারে। Sufficiency score হল এই আত্মবিশ্বাসের সূচক।
সব পুনরাবৃত্তিতে সাধারণ প্যারামিটার — এটি ক্লাসিক্যাল গভীর নেটওয়ার্কগুলির থেকে একটি মৌলিক পার্থক্য। মডেলটি স্তরের পরম সংখ্যার সাথে আবদ্ধ হওয়া বন্ধ করে দেয়: উপস্থাপনার সাথে যা ঘটে তা আরও গুরুত্বপূর্ণ। এটি বিবর্তিত অবস্থা ভেক্টরের পরিবর্তনের গতিবিদ্যার উপর ভিত্তি করে বিভিন্ন উদাহরণের জন্য বিভিন্ন পয়েন্টে থামার অনুমতি দেয়। প্রতিটি পুনরাবৃত্তির জন্য মডেলটি একই প্যারামিটার সেট ব্যবহার করে, তাই শেখা স্থিতিশীল হয় এবং ধাপের সংখ্যার আলাদা টিউনিংয়ের প্রয়োজন হয় না। ইনফারেন্স পর্যায়ে, বিভিন্ন উদাহরণের জন্য লুপটি বিভিন্ন সংখ্যক বার চলতে পারে, যা কার্যকরভাবে মডেলটিকে জটিলতায় অভিযোজিত করে তোলে।

কীভাবে মডেলকে পর্যাপ্ততা বুঝতে শেখানো হয়
"এখানে থামা যেতে পারে" এমন সরাসরি লেবেলিং নেই। তাই লেখকরা একটি self-supervised কৌশল প্রয়োগ করেছেন — তারা কনফিডেন্স-স্কোরের বিতরণকে সংলগ্ন পুনরাবৃত্তিতে কর্মের আপেক্ষিক গুণমানের সাথে সারিবদ্ধ করে। সহজভাবে বললে, মধ্যবর্তী sufficiency scores বর্তমান ক্রিয়াটি পূর্ববর্তী পাসের ক্রিয়ার চেয়ে কতটা ভাল বা খারাপ তার সাথে মিলতে শুরু করে। এইভাবে পর্যাপ্ততার সংকেত বাহ্যিক অ্যানোটেশন থেকে নয়, পলিসি থেকেই আসে।
ফলস্বরূপ, "উপস্থাপনা পরিমার্জন → ক্রিয়া পূর্বাভাস → পর্যাপ্ততা মূল্যায়ন" এই সংযোগটি একটি একক সিস্টেম হিসাবে শেখে, যেখানে থামার সিদ্ধান্ত সরাসরি নিয়ন্ত্রণের লক্ষ্য ফাংশনের সাথে যুক্ত। এটিকে আত্মবিশ্বাসের ডিস্টিলেশন হিসাবে কল্পনা করা যেতে পারে: মডেলটি কখন একটি ক্রিয়া যথেষ্ট ভাল তা সম্পর্কে জ্ঞান পরবর্তী পুনরাবৃত্তি থেকে আগের পুনরাবৃত্তিতে স্থানান্তর করে। এটি এটিকে ইতিমধ্যেই প্রাথমিক পর্যায়ে বুঝতে দেয় যে আরও কাজের প্রয়োজন কিনা।
এটি বাস্তবে কী দেয়
তিনটি বেঞ্চমার্ক — LIBERO, LIBERO-Plus এবং VLA-Arena — নিয়ে পরীক্ষায়, মডেলটি দেখিয়েছে যে বুদ্ধিমান থামা সত্যিই কাজ করে। LoopVLA শক্তিশালী বেসলাইন VLA-পলিসিগুলির তুলনায় প্যারামিটারের সংখ্যা 45% কমায় এবং ইনফারেন্স থ্রুপুট 1.7 গুণ পর্যন্ত বাড়ায়। একই সাথে, কাজ সম্পাদনের সাফল্যের হার কমে না, বরং কিছু ক্ষেত্রে এমনকি বেড়েও যায়।
এটাকে ফলিত রোবোটিক্সের ভাষায় অনুবাদ করলে, দ্বিগুণ লাভ পাওয়া যায়:
- গণনামূলক বোঝা কমানো: প্রতিটি নিয়ন্ত্রণ ধাপে কম অপারেশন, যা অনবোর্ড সিস্টেমের জন্য বিশেষভাবে গুরুত্বপূর্ণ।
- নির্ভুলতা বজায় রাখা: মডেলটি যেখানে জ্যামিতিক বিবরণ গুরুত্বপূর্ণ সেখানে সেগুলি হারায় না, এবং যেখানে মোটামুটি বিমূর্ততা যথেষ্ট সেখানে সম্পদ নষ্ট করে না।
এই ফলাফলগুলি বাস্তব সিস্টেমের জন্য বিশেষভাবে গুরুত্বপূর্ণ যেখানে গণনামূলক সম্পদ সীমিত, যেমন মোবাইল রোবট বা শিল্প ম্যানিপুলেটর। গতিশীলভাবে থামার ক্ষমতা শক্তি আরও দক্ষতার সাথে ব্যবহার করতে এবং পরিবেশের পরিবর্তনে দ্রুত সাড়া দিতে দেয়। মজার বিষয় হল, প্যারামিটার সাশ্রয় আর্কিটেকচার সরল করার মাধ্যমে নয়, বরং ইতিমধ্যে বিদ্যমান উপাদানগুলির আরও যুক্তিসঙ্গত ব্যবহারের মাধ্যমে অর্জিত হয়। শেয়ার্ড ওয়েট সহ পুনরাবৃত্তিমূলক ব্লক — এটি একটি ছোট মডেল নয়, বরং একটি মডেল যা সময়মতো থামতে জানে।

সারসংক্ষেপ
LoopVLA — একটি উদাহরণ যে "যত গভীর, তত ভাল" এই মতবাদকে প্রত্যাখ্যান করে অভিযোজিত গণনা ব্যবস্থাপনার পক্ষে নেওয়া সিদ্ধান্ত কীভাবে কর্মক্ষমতা এবং দক্ষতা উভয়ই উন্নত করতে পারে। মডেলটি সময়মতো থামতে শেখে, এবং এটি নেটওয়ার্কের শর্তহীন গভীরকরণের চেয়ে বেশি ফলপ্রসূ বলে প্রমাণিত হয়। এই পদ্ধতি বাস্তব রোবটের জন্য আরও ব্যবহারিক VLA-সিস্টেমের পথ খুলে দেয়, যেখানে প্রতিটি মিলিসেকেন্ড এবং প্রতিটি ওয়াট গুরুত্বপূর্ণ।



