বিশ্ব মডেল পতন ছাড়া: গাউসিয়ান অনুমানের পরিবর্তে কনট্রাস্টিভ ইনভার্স ডায়নামিক্স

4 সেপ্টেম্বর 2026১৩ প্রদর্শন

AC-MTM-এর নতুন পদ্ধতি JEPA-মডেলগুলোকে প্রশিক্ষণ দেয়, ল্যাটেন্ট ট্রানজিশনের মাধ্যমে অ্যাকশন নির্ধারণ করে; এটি উপস্থাপনা সংকোচনের বিরুদ্ধে একটি স্থিতিশীল সংকেত দেয় এবং জটিল OGBench পরীক্ষায় ফলাফল উল্লেখযোগ্যভাবে উন্নত করে।

বিশ্ব মডেল পতন ছাড়া: গাউসিয়ান অনুমানের পরিবর্তে কনট্রাস্টিভ ইনভার্স ডায়নামিক্স

একটি সাম্প্রতিক arXiv প্রিপ্রিন্ট arXiv:2608.17542-এ, যা ১৮ আগস্ট ২০২৬-এ জমা দেওয়া হয়েছে, Jack Boylan এবং Chris Hokamp JEPA-ওয়ার্ল্ড মডেলের কলাপস মোকাবিলার একটি অপ্রত্যাশিত উপায় প্রস্তাব করেছেন। ল্যাটেন্ট স্পেসে পূর্বনির্ধারিত আকৃতি চাপিয়ে দেওয়ার পরিবর্তে, তারা ট্রানজিশন ডেটা থেকেই ডিজেনারেসির বিরুদ্ধে সংকেত আহরণ করেন। পদ্ধতিটির নাম দেওয়া হয়েছে AC-MTM — Action-Contrastive Masked Transition Modeling — এবং পরীক্ষা-নিরীক্ষা অনুসারে, এটি জটিল ভিজ্যুয়াল পরিবেশে বিশেষভাবে কার্যকরভাবে কাজ করে।

কেন JEPA-মডেল কলাপস হয়

JEPA (Joint Embedding Predictive Architecture) পদ্ধতি পিক্সেল নয়, বরং ভবিষ্যতের এমবেডিং পূর্বাভাসের চারপাশে নির্মিত। এটি সুবিধাজনক, কিন্তু এই ধরনের লক্ষ্য ফাংশনের একটি তুচ্ছ সমাধান রয়েছে: এনকোডার একটি ধ্রুবকের উপর স্থির হয়ে যেতে পারে এবং যেকোনো ইনপুটের জন্য একই উপস্থাপনা দিতে পারে। তাহলে পূর্বাভাসের ত্রুটি শূন্য হয়ে যায়, এবং ওয়ার্ল্ড রিলেশনশিপের কোনো শেখা ঘটে না। এই কারণেই JEPA-এর সকল ব্যবহারিক বাস্তবায়ন কলাপসের বিরুদ্ধে অতিরিক্ত প্রক্রিয়া যোগ করে — রেগুলারাইজার থেকে আর্কিটেকচারাল সীমাবদ্ধতা পর্যন্ত।

একটি সাধারণ কৌশল হল ল্যাটেন্ট ডিস্ট্রিবিউশন রেগুলারাইজেশন। উদাহরণস্বরূপ, LeWorldModel (LeWM) মডেলটি SIGReg ব্যবহার করে — একটি রেগুলারাইজার যা উপস্থাপনাগুলোকে আইসোট্রপিক গাউসিয়ান নয়েজের মতো দেখাতে বাধ্য করে। এটি প্রশিক্ষণ স্থিতিশীল করে, কিন্তু একটি কঠোর অনুমানের মূল্যে: ল্যাটেন্ট স্পেসকে অবশ্যই একটি নির্দিষ্ট ডিস্ট্রিবিউশনের সাথে মিলতে হবে, যা পরিবেশের গতিবিদ্যার সাথে সম্পর্কিত নয়। নতুন কাজের লেখকরা দাবি করেন যে, কলাপস রোধকারী চাপ বাইরে থেকে নয়, বরং রাজ্যগুলোর মধ্যে ট্রানজিশন থেকেই আসতে পারে।

গাউসিয়ান সীমাবদ্ধতার পরিবর্তে কনট্রাস্টিভ ইনভার্স ডায়নামিক্স

AC-MTM LeWM-এর মতো ল্যাটেন্ট পূর্বাভাসের সরাসরি লক্ষ্য বজায় রাখে, কিন্তু এর সাথে একটি সহায়ক ইনভার্স ডায়নামিক্স হেড যোগ করে। এই হেডটি শুধুমাত্র প্রশিক্ষণের সময় বিদ্যমান থাকে এবং একটি ডিসক্রিমিনেটিভ কাজ সমাধান করে: এক জোড়া ল্যাটেন্ট অবস্থা থেকে, এটি নির্ধারণ করতে হবে কোন নির্দিষ্ট অ্যাকশন মডেলটিকে প্রথম থেকে দ্বিতীয় অবস্থায় নিয়ে গেছে। Action-NCE লস ফাংশন প্রতিটি ল্যাটেন্ট ট্রানজিশনকে ব্যাচের সমস্ত অ্যাকশনের মধ্যে তার সৃষ্টিকারী অ্যাকশনটি সনাক্ত করতে বাধ্য করে।

এই ধরনের গঠন টার্গেট নেটওয়ার্ক, stop-gradient, প্রি-ট্রেইন্ড এনকোডার বা রিকনস্ট্রাকশনের প্রয়োজন হয় না। মূল বিষয় হল — একটি কলাপসড এনকোডার, যা সমস্ত অবস্থার জন্য একই উপস্থাপনা দেয়, শারীরিকভাবে একটি অ্যাকশনকে অন্য অ্যাকশন থেকে আলাদা করতে পারে না। অর্থাৎ, ইনভার্স ডায়নামিক্সের কাজটি অসম্ভব হয়ে পড়ে, এবং এটি ডিজেনারেসির বিরুদ্ধে একটি প্রমাণযোগ্য সংকেত দেয়। চাপটি ডেটার গঠন থেকে আসে, কৃত্রিম নির্দেশ থেকে নয়।

প্রশিক্ষণ শেষ হওয়ার পরে, ইনভার্স ডায়নামিক্স শাখাটি কেবল বাদ দেওয়া হয়। টেস্টের সময় এনকোডিং, সরাসরি পূর্বাভাস, প্ল্যানিং এবং গণনাগত খরচ LeWM-এর মতোই থাকে — ইনফারেন্সে কোনো অতিরিক্ত বোঝা নেই।

পরীক্ষা-নিরীক্ষায় কী দেখা গেছে

পদ্ধতিটি সামঞ্জস্যপূর্ণ প্ল্যানিং প্রোটোকল সহ চারটি স্ট্যান্ডার্ড pixel-control কাজে পরীক্ষা করা হয়েছে। AC-MTM স্থিরভাবে স্ক্র্যাচ থেকে প্রশিক্ষণ নেয় এবং গড়ে SIGReg-এর সাথে তুলনীয় ফলাফল দেখায়। অর্থাৎ, গাউসিয়ান রেগুলারাইজার বাদ দিলে সাধারণ পরিবেশে মানের কোনো ক্ষতি হয় না।

আরও আকর্ষণীয় চিত্র OGBench Visual Scene জটিল বেঞ্চমার্কে। সেখানে AC-MTM ৮০,০±২,০% সাফল্য অর্জন করে, যেখানে SIGReg — মাত্র ৫৮,০±২,০%। প্রতিটি প্রশিক্ষণ সিডে উন্নতি ২০–২৪ শতাংশ পয়েন্ট। স্কেল বোঝার জন্য: ৫০টি এপিসোডের একটি র্যান্ডম পলিসির একক রান ৫২% বেসলাইন দেয়, তাই পদ্ধতিগুলোর মধ্যে পার্থক্য সত্যিই তাৎপর্যপূর্ণ।

এছাড়াও, কনট্রাস্টিভ ইনভার্স ডায়নামিক্স ডিস্ট্রিবিউশনাল অনুমানের উপর নির্ভর করে না। লেখকরা অ্যাকশন স্পেস এবং পর্যবেক্ষণযোগ্যতা সম্পর্কে যে অনুমানগুলোর অধীনে পদ্ধতিটি কাজ করে তা চিহ্নিত করেছেন, তবে এই শর্তগুলো গাউসিয়ানিটির প্রয়োজনীয়তার চেয়ে লক্ষণীয়ভাবে নরম।

ব্যবহারিক ফলাফল

কাজের প্রধান উপসংহার: কলাপস এড়াতে, উপস্থাপনাগুলো কেমন হওয়া উচিত তা আগে থেকে সিদ্ধান্ত নেওয়ার প্রয়োজন নেই। একটি এমন কাজ সেট করাই যথেষ্ট, যা একটি ডিজেনারেট এনকোডার নিশ্চিতভাবে ব্যর্থ করবে। এই ধরনের পদ্ধতি কেবল আরও নীতিগত নয়, বরং জটিল ভিজ্যুয়াল কাজেও ভালো ফলাফল দেয়, যেখানে SIGReg-এর গাউসিয়ান সীমাবদ্ধতা শেখার ক্ষেত্রে বাধা দেয়।

কোড প্রকাশিত হয়েছে, তাই ফলাফলগুলি সহজেই পুনরুত্পাদন এবং নিজের প্রকল্পে অভিযোজিত করা যায়। যারা JEPA-ধারণার উপর ওয়ার্ল্ড মডেল তৈরি করছেন, তাদের জন্য AC-MTM একটি ব্যবহারিক বিকল্প: ইনফারেন্সে অতিরিক্ত খরচ ছাড়া, টার্গেট নেটওয়ার্ক এবং stop-gradient ছাড়া, এবং প্রশিক্ষণ সংকেতের আরও স্বাভাবিক উৎস সহ।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
বিশ্ব মডেল পতন ছাড়া: গাউসিয়ান অনুমানের পরিবর্তে কনট্রাস্টিভ ইনভার্স ডায়নামিক্স