যেখানে সংখ্যা নয়, মাত্রাই গুরুত্বপূর্ণ — সেখানে কার্যকরী স্মৃতি
মনে একটি অবিচ্ছিন্ন চলক ধরে রাখা — ঘূর্ণনের কোণ, গতি, কার্সরের অবস্থান, চাপের বল — এবং তা মসৃণভাবে সমন্বয় করা: সম্ভবত এটিই কার্যকরী স্মৃতির সবচেয়ে সৎ পরীক্ষা। "সাত" মনে রাখা কঠিন নয়, কিন্তু স্বাভাবিক সীমানাহীন একটি মাত্রা ধরে রাখা, যা যত খুশি ক্ষুদ্র ভগ্নাংশে সরে যেতে পারে — সম্পূর্ণ ভিন্ন শ্রেণির সমস্যা।
কৃত্রিম নেটওয়ার্কের সঙ্গে এর সম্পর্ক ঐতিহাসিকভাবে টানাপোড়েনের। অবিচ্ছিন্ন আকর্ষকযুক্ত মডেল — অর্থাৎ এমন স্থিতিশীল অবস্থা যেগুলো কয়েকটি বিচ্ছিন্ন বিন্দু নয়, বরং একটি মসৃণ পৃষ্ঠ গঠন করে — টিকে থাকে শুধু মুখের কথায়: প্যারামিটার একটু সরালেই আচরণ ভেঙে পড়ে।

কেন প্রচলিত রিকারেন্ট আর্কিটেকচারগুলো অবস্থাকে "কোয়ান্টাইজ" করে
সাধারণ রিকারেন্ট সমাধানগুলো, GRU ও LSTM সহ, সাধারণত অবিচ্ছিন্ন ম্যানিফোল্ড শিখতে পারে না। ধারাবাহিকতার বদলে তারা অবস্থার স্থানকে বিচ্ছিন্ন বিন্দু-আকর্ষকে ভাগ করে ফেলে: নেটওয়ার্ক যেন ইনপুটকে নিকটতম "তাক"-এ গোল করে ফেলে। শ্রেণীবিভাগের জন্য এটি সুবিধাজনক, পরিমাণগত মূল্যায়নের জন্য — মৃত্যুদণ্ড।
একদল গবেষক (Zhaotian Gu, Jie Su, Weiwei Wang, Chang Liu, Tianyi Qian, Dahui Wang) আর্কিটেকচার জটিল করার বদলে একটি নির্দিষ্ট গণনামূলক কৌশল দিয়ে এটি সারানোর প্রস্তাব দিয়েছেন। কাজটি Transactions on Machine Learning Research-এ প্রকাশিত (আগস্ট ২০২৬), প্রিপ্রিন্ট arXiv:2608.01947 হিসেবে q-bio.NC, cs.AI ও cs.NE বিভাগে পাওয়া যায়।
বিয়োগের বদলে ভাগ: ন্যূনতম মডেল
ধারণাটি এসেছে স্নায়ুবিজ্ঞান থেকে। ভাগ (divisive normalization) — একটি প্রামাণ্য ক্রিয়া যা কর্টিকাল সার্কিটে সর্বত্র পরিলক্ষিত হয়, এবং লেখকেরা এর চারপাশে একটি ন্যূনতম, বীজগণিতীয়ভাবে বিচ্ছিন্ন রিকারেন্ট নেটওয়ার্ক গড়ে তুলেছেন — Recurrent Divisive Normalization Network, সংক্ষেপে RDNN। ভেতরে বাড়তি কিছু নেই: শুধু ভাগের গতিশীলতা এবং তার সঙ্গে যা আসে।
এরপর — গণনামূলক স্নায়ুবিজ্ঞানের জন্য প্রচলিত পদক্ষেপ: কার্যকরী স্মৃতির চিরায়ত সমস্যাগুলোতে গতিশীল সিস্টেমের বিশ্লেষণ। এবং এখানেই জৈবপদার্থবৈজ্ঞানিক সীমাবদ্ধতা অপ্রত্যাশিতভাবে সুবিধায় পরিণত হয়। নেটওয়ার্ক উচ্চ নির্ভুলতাসহ স্থিতিশীল ধীর ম্যানিফোল্ডে অভিসৃত হয়: ট্রাজেক্টরিগুলো ছড়িয়ে পড়ে না, বরং একটি সংকীর্ণ পৃষ্ঠে গিয়ে পড়ে এবং শান্তভাবে তার উপর চলতে থাকে।

গ্রেডিয়েন্টের কী হয়
কাজটির আলাদা একটি অংশ — সময়ের মধ্য দিয়ে ব্যাকপ্রোপাগেশন (BPTT) দিয়ে প্রশিক্ষণের বিশ্লেষণ। ভাগ একটি স্থানীয় গ্রেডিয়েন্ট স্কেলিং যোগ করে, যা বর্তমান সক্রিয়তার উপর নির্ভরশীল: ব্লক যত বেশি উত্তেজিত, প্যারামিটার আপডেট তত সংযতভাবে তার ভাগে পড়ে। ফলে একটি অন্তর্নির্মিত ব্রেক তৈরি হয়, যা ঠিক যেখানে দরকার সেখানেই সক্রিয় হয়।
প্রভাবটি পর্যবেক্ষণযোগ্য: নেটওয়ার্কের কার্যকর র্যাঙ্ক লক্ষণীয়ভাবে স্ব-সংকুচিত হয়, এবং রিকারেন্ট গতিশীলতা একটি সংকীর্ণ নিম্নমাত্রিক উপস্থানে আবদ্ধ হয়ে পড়ে। একই সঙ্গে লেখকেরা স্পষ্ট নিম্নর্যাঙ্ক ফ্যাক্টরাইজেশনের সঙ্গে পার্থক্য তুলে ধরেন — সেখানে এমন সীমাবদ্ধতা প্রায়ই অপ্টিমাইজেশনের রোগ সৃষ্টি করে, কিন্তু এখানে তা নিজে থেকেই জন্মায়, সক্রিয়তার পার্শ্বপ্রতিক্রিয়া হিসেবে।
অ্যাবলেশন: ভাগ ছাড়া ম্যানিফোল্ড ভেঙে পড়ে
সবচেয়ে বক্তব্যবহুল অংশ — বিয়োগমূলক নিবারণের সঙ্গে তুলনা। এমন প্রতিস্থাপন স্থির স্মৃতি ধরে রাখতে পারে: স্থির বিন্দু সংরক্ষণ করা সমস্যা নয়। কিন্তু ইনপুট সংকেত সময়ের সঙ্গে বদলাতে শুরু করলেই ম্যানিফোল্ড "ভেঙে যায়" (manifold shattering) — ধারাবাহিকতা ঠিক যেখানে সবচেয়ে বেশি দরকার সেখানেই হারিয়ে যায়।
এখান থেকে যে সিদ্ধান্তে আসা যায়, তা মনে রাখা উচিত: ভাগ কোনো জৈবিক কৌতূহল নয়, যা কর্টেক্স থেকে উত্তরাধিকারে পাওয়া গেছে, বরং একটি কার্যকর গণনামূলক প্রক্রিয়া। এটি দরকার যাতে নেটওয়ার্ক উচ্চনির্ভুল অবিচ্ছিন্ন উপস্থাপনা শিখতে পারে, শুধু নিখুঁত বিচ্ছিন্নকরণ নয়।

অনুশীলনে এটি নিয়ে কী করা যায়
ব্যবহারিক তাৎপর্য এই নয় যে সব রিকারেন্ট মডেল তড়িঘড়ি নতুন করে লিখতে হবে। বরং এটি একটি স্মারক: নরমালাইজেশন শুধু প্রশিক্ষণের স্থিতিশীলতা বা শুধু নিয়মিতকরণের বিষয় নয়। এটি অভ্যন্তরীণ অবস্থার স্থানের জ্যামিতি নির্ধারণের একটি উপায়, এবং এখানে ভাগের বিয়োগের উপর স্পষ্ট সুবিধা রয়েছে।
যদি সমস্যাটি একটি অবিচ্ছিন্ন মাত্রা ধরে রাখা এবং তা মসৃণভাবে হালনাগাদ করা দাবি করে — নিয়ন্ত্রণে, ট্র্যাকিংয়ে, "কোনটি" নয় বরং "কতটুকু" ধরনের যেকোনো সিস্টেমে — তাহলে গুণনমূলক নরমালাইজেশনসহ স্কিমগুলোর দিকে নজর দেওয়া বুদ্ধিমানের কাজ। খরচ ন্যূনতম, বিনিময়ে নেটওয়ার্ক যা গোল করা উচিত নয় তা গোল করা বন্ধ করে দেয়।



