ক্ষেত্র: content লক্ষ্য ভাষা: বাংলা (bn)
SuperMemo-2 পদ্ধতিতে ব্যবধানভিত্তিক পুনরাবৃত্তি: ভাষার মডেল ভুলে না গিয়ে কীভাবে আরও প্রশিক্ষণ দেওয়া যায়
যখন একটি বড় ভাষার মডেলকে নতুন ডেটার উপর প্রশিক্ষণ দেওয়া হয়, তখন এটি আগে অর্জিত জ্ঞান হারানোর ঝুঁকিতে থাকে। এই ঘটনাটি প্রত্যেকেরই পরিচিত যারা একটি সংকীর্ণ ক্ষেত্রে নিউরাল নেটওয়ার্ককে আরও প্রশিক্ষণ দেওয়ার চেষ্টা করেছেন: অপ্টিমাইজেশনের কয়েকটি ধাপের পরে, মডেলটি সাধারণ জ্ঞান "ভুলে" যেতে পারে। সমস্যা কমানোর ক্লাসিক উপায় হল replay, অর্থাৎ প্রশিক্ষণ সেটে পুরানো উদাহরণ মিশ্রিত করা। কিন্তু সাধারণত এই replay খুব মোটামুটিভাবে সাজানো হয়: পুরানো এবং নতুন ডেটা কেবল একটি নির্দিষ্ট অনুপাতে মিশ্রিত হয়। এতে সমস্ত পুরানো উদাহরণকে সমানভাবে গুরুত্বপূর্ণ মনে করা হয়, যদিও বাস্তবে কিছু জ্ঞান দ্রুত মুছে যায়, আবার অন্যগুলো দীর্ঘস্থায়ী হয়।
arXiv-এ সাম্প্রতিক একটি কাজের লেখকরা (2608.17530) continual pre-training-কে অভিযোজিত পুনরাবৃত্তি পরিকল্পনার কাজ হিসেবে পুনর্বিবেচনার প্রস্তাব দেন। একবারে সিদ্ধান্ত নেওয়ার পরিবর্তে কতটা ইতিহাস মিশ্রিত করা হবে, মডেলটিকে প্রতিটি মুহূর্তে বেছে নিতে হবে কোন উদাহরণ প্রশিক্ষণে ফিরিয়ে আনা হবে। এটি একটি স্থির সময়সূচী অনুসরণ না করে মেমরির প্রকৃত ফাঁকগুলিতে সাড়া দেওয়ার সুযোগ দেয়।

কার্ড থেকে মডেল প্যারামিটারে
ধারণাটি জ্ঞানীয় বিজ্ঞান থেকে নেওয়া হয়েছে, আরও স্পষ্টভাবে — SuperMemo-2 (SM-2) অ্যালগরিদম থেকে, যা কয়েক দশক ধরে কার্ড মুখস্থ করার সময় ব্যবধানভিত্তিক পুনরাবৃত্তি পরিকল্পনার জন্য ব্যবহৃত হচ্ছে। SM-2 নির্দেশ দেয় কখন কার্ডটি দেখাতে হবে যাতে জ্ঞান সুসংহত হয় এবং অদৃশ্য না হয়। নতুন Spaced Repetition Training (SRT) পদ্ধতিতে এই নীতিটি নিউরাল নেটওয়ার্ক প্রশিক্ষণে স্থানান্তরিত হয়।
SRT প্রতিটি প্রশিক্ষণ উদাহরণের জন্য নিজস্ব পুনরাবৃত্তি অবস্থা বজায় রাখে। মডেলটি উদাহরণটি কতটা ভালোভাবে মনে রেখেছে তা বোঝার জন্য perplexity ব্যবহার করা হয় — এটি একটি পরিমাপ যে মডেলটি ডেটা কতটা আত্মবিশ্বাসের সাথে পূর্বাভাস দেয়। যদি perplexity দ্রুত বৃদ্ধি পায়, তাহলে এর অর্থ উদাহরণটি ভুলে যেতে শুরু করেছে, এবং প্রশিক্ষণে পুনরায় অন্তর্ভুক্তির জন্য এটিকে উচ্চ অগ্রাধিকার দেওয়া হয়। এই পদ্ধতিটি স্বয়ংক্রিয়ভাবে প্রশিক্ষণে "পুরানো" উদাহরণ (যা জ্ঞান ধরে রাখার জন্য প্রয়োজন) এবং "নতুন" উদাহরণ (যা এখনও সুসংহত হয়নি) উভয়ই ফিরিয়ে আনার সুযোগ দেয়।
গুরুত্বপূর্ণ বিষয় হল, SRT মডেলের আর্কিটেকচার, লস ফাংশন বা অপ্টিমাইজার স্পর্শ করে না। সমস্ত পরিবর্তন শুধুমাত্র ডেটা স্যাম্পলিং কৌশলের সাথে সম্পর্কিত। অর্থাৎ, পাইপলাইনে বড় ধরনের পরিবর্তন ছাড়াই পদ্ধতিটি বিদ্যমান প্রশিক্ষণ প্রক্রিয়ার উপর প্রয়োগ করা যেতে পারে।
পরীক্ষাগুলি কী দেখিয়েছে
পদ্ধতিটি সময়গতভাবে বিভক্ত Wikipedia এবং কোড কর্পাসে পরীক্ষা করা হয়েছিল — অর্থাৎ এমন ডেটাতে যা স্বাভাবিকভাবেই সময়কালে বিভক্ত। ফলাফলগুলি নিষ্পাপ আরও প্রশিক্ষণ এবং অভিন্ন replay-এর তুলনায় উল্লেখযোগ্যভাবে ভালো ছিল। SRT পুরানো জ্ঞানে 5 থেকে 37 শতাংশ পয়েন্ট নির্ভুলতা পুনরুদ্ধার করেছে, যা নিষ্পাপ প্রশিক্ষণ মুছে ফেলতে সক্ষম হয়েছিল। একই সময়ে, নতুন ডেটাতে কর্মক্ষমতা খারাপ হয়নি, এবং কিছু ক্ষেত্রে এমনকি বৃদ্ধি পেয়েছে।
বিশেষ করে বড় মডেলগুলিতে আচরণটি আকর্ষণীয়: সেখানে SRT বিস্তৃত বেঞ্চমার্কে সুষম কর্মক্ষমতা বজায় রাখে, যেখানে নিষ্পাপ আরও প্রশিক্ষণ এবং সাধারণ replay উল্লেখযোগ্য অবনতির দিকে নিয়ে যায়। এটি ইঙ্গিত দেয় যে মডেলের আকার বৃদ্ধির সাথে সাথে, যখন ডেটা এবং প্রশিক্ষণের ধাপ আরও বেশি হয়, পুনরাবৃত্তি পরিকল্পনা আরও গুরুত্বপূর্ণ হয়ে ওঠে।

ভাষার বাইরে
মজার বিষয় হল, নীতিটি শুধু পাঠ্যের সাথে কাজ করে না। ভিজ্যুয়াল এবং ট্যাবুলার ডেটার সাথে পরীক্ষাগুলি দেখিয়েছে: পুনরাবৃত্তি পরিকল্পনা সর্বত্র প্রযোজ্য যেখানে recall সংকেত পরিমাপ করা যায়, অর্থাৎ বোঝা যায় যে মডেলটি একটি নির্দিষ্ট উদাহরণ ভুলে যাচ্ছে। কার্যত এটি continual learning-এর জন্য একটি সর্বজনীন প্রক্রিয়া, যা মোডালিটির সাথে আবদ্ধ নয়।
কাজ থেকে প্রধান উপসংহার — গড় replay পরিত্যাগ করে পৃথক পুনরাবৃত্তি সময়সূচীর পক্ষে যাওয়া stability-plasticity ভারসাম্যে স্পষ্ট লাভ দেয়। মডেলটি নতুন জিনিস শিখতে থাকে, কিন্তু একই সাথে "পাঠ্য পুনরাবৃত্তি করে" ঠিক তখনই যখন এটি ভুলতে শুরু করে। এই পদ্ধতিটি বড় ভাষার মডেলগুলির আরও অর্থপূর্ণ আরও প্রশিক্ষণের দিকে একটি স্বাভাবিক পদক্ষেপ বলে মনে হয়।



