যখন "ভুলে যাওয়া" ফিরে আসে
বড় ভাষার মডেলগুলির আনলার্নিং প্রক্রিয়া সাধারণত впечатляюще দেখায়: অবাঞ্ছিত তথ্য মুছে ফেলার পদ্ধতির পরে, মডেলটি নিষিদ্ধ বিষয়ে লেখা তৈরি করা বন্ধ করে দেয়। কিন্তু এই ধরনের পরিষ্কার করা খুব কমই স্থায়ী হয়। যদি এর পরে সেই একই ডেটার একটি ছোট অংশে সাধারণ ফাইন-টিউনিং করা হয়, জ্ঞান প্রায় চেষ্টা ছাড়াই ফিরে আসে। TOFU ডেটাসেটের সাথে পরীক্ষাগুলি দেখায় যে মাত্র বিশটি ভুলে যাওয়া উদাহরণে পুনরায় প্রশিক্ষণ দেওয়া সমস্ত পরিচিত আনলার্নিং পদ্ধতির জন্য লক্ষ্য সেটে মেট্রিক্স উল্লেখযোগ্যভাবে পুনরুদ্ধার করতে সক্ষম। এখানে সমস্যাটি নির্দিষ্ট কৌশলের মানের নয়, বরং অপ্টিমাইজেশন প্রক্রিয়ার বৈশিষ্ট্যের: ভুলে যাওয়ার পদ্ধতির পরে একটি বিশেষ লস জ্যামিতি তৈরি হয়, যার মাধ্যমে পুনরায় প্রশিক্ষণ সহজেই ফিরে যাওয়ার পথ তৈরি করে।

মার্জিন ক্লিফ: জ্ঞান ফেরতের একীভূত পরিস্থিতি
বিজ্ঞানীরা চৌদ্দটি পোস্ট-হক আনলার্নিং পদ্ধতির আচরণ বিশ্লেষণ করেছেন — গ্রেডিয়েন্ট-ভিত্তিক, পছন্দ-ভিত্তিক এবং ডিস্টিলেশন-ভিত্তিক — এবং একটি অদ্ভুত নিয়মিততা আবিষ্কার করেছেন। প্রতিটি পদ্ধতি এবং মডেলের আকারের জন্য, পৃথক টোকেনের স্তরে উত্তরের মার্জিন পরিমাপ করা যায়, অর্থাৎ যে ব্যবধানে মডেল একটি টোকেনকে অন্যটির চেয়ে পছন্দ করে। দেখা গেছে যে আনলার্নিংয়ের পরে এই মার্জিন প্রায় সবসময় একটি সংকীর্ণ ব্যান্ডে মিলিত হয়, যা ধরে রাখা (retain) ডেটাসেট দ্বারা নির্ধারিত স্তরের সামান্য উপরে অবস্থিত। এই ঘটনাটি 42টি সম্ভাব্য পদ্ধতি-মডেল আকারের সংমিশ্রণের মধ্যে 41টিতে দেখা গেছে, এবং এটির নামকরণ করা হয়েছে "মার্জিন ক্লিফ" — ভূতাত্ত্বিক ক্লিফের সাথে সাদৃশ্য রেখে, যার পরে আর কিছুই নেই।

কেন ক্লিফ তৈরি হয়
গাণিতিকভাবে দেখানো সম্ভব হয়েছে যে ক্লিফ তখনই তৈরি হয় যখন retain-সেটের সাথে সংযোগ ভুলে যাওয়া বিষয়বস্তুর ডায়াগনস্টিক লজিটগুলিকে একটি নির্দিষ্ট থ্রেশহোল্ডের উপরে ধরে রাখে। এটি অপ্টিমাইজেশন বন্ধ করার জন্য যথেষ্ট: টোকেন-স্যাচুরেটিং পদ্ধতির মূল লস ফাংশন একটি স্থির বিন্দুতে পৌঁছে যায়, যদিও ভুলে যাওয়া এখনও নিশ্চিত নয়। পরীক্ষার 42টি কক্ষের মধ্যে 34টিতে যাচাই করা হয়েছে যে লস স্যাচুরেশনই সেই "মিথ্যা সাফল্য" তৈরি করে, যার কারণে জ্ঞান ফিরে আসা তুচ্ছ হয়ে যায়।
মার্জিন ক্যালিব্রেশন: ক্লিফ কীভাবে মেরামত করবেন
গবেষণার লেখকরা মার্জিন ক্যালিব্রেশন (MC) নামে একটি প্লাগইন-পলিশ প্রস্তাব করেছেন। এটি আনলার্নিংয়ের একটি স্বাধীন পদ্ধতি নয়, বরং একটি অতিরিক্ত মডিউল যা যেকোনো বিদ্যমান পদ্ধতির উপরে বসানো হয়। স্যাচুরেটিং লসের উপর নির্ভর না করে, MC একটি নন-স্যাচুরেটিং মার্জিনাল হিঞ্জ যোগ করে: এটি একটি নির্দিষ্ট টোকেনের per-token মার্জিনকে retain-ডেটাতে প্রাপ্ত রেফারেন্স উত্তরের মার্জিনের সাথে তুলনা করে। অতিরিক্তভাবে, মূল প্রশিক্ষণ বিতরণের সাথে সম্পর্কহীন একটি নির্দেশনা কর্পাসে একটি KL-প্রোব প্রয়োগ করা হয়। এই হাইব্রিড চাপের মাধ্যমে, ভুলে যাওয়ার পাশে সংকেতের শক্তি পুনরুদ্ধার করা সম্ভব হয় ঠিক সেই জায়গাগুলিতে যেখানে মূল লস একটি স্থির বিন্দুতে "আটকে" গেছে।
তাত্ত্বিক অংশ আত্মবিশ্বাস যোগ করে: যদি বিভিন্ন উপাদানের গ্রেডিয়েন্টগুলি আধিপত্য অনুসারে সারিবদ্ধ হয়, তাহলে MC-এর স্থির সেটটি ক্লিফের সাথে ছেদ করার পাশে থাকে। এটি মার্জিন বাড়ানোর আক্রমণের বাজেটের উপরের সীমা অনুমান করার সুযোগ দেয়: যদি একজন আক্রমণকারী প্রশিক্ষণ পুনরাবৃত্তি করার চেষ্টা করে, তাকে গুরুতর প্রতিরোধের মধ্য দিয়ে যেতে হবে, পলিশ করা ঢাল বরাবর পিছলে যেতে পারবে না।
ফলাফল: আক্রমণের বিরুদ্ধে জয় এবং মূল্যের প্রশ্ন
MC-এর কার্যকারিতা তিনটি বেঞ্চমার্কে পরীক্ষা করা হয়েছে: Llama-3-এর তিনটি আকার এবং তিনটি ভুলে যাওয়ার স্তর সহ TOFU, Llama-2-7B-hf-এ MUSE-News এবং Phi-3.5-এর একটি পৃথক প্যানেল। নির্দিষ্ট ক্ষেত্রে কনফিগারেশন পরিবর্তন না করেই, প্লাগইন-পলিশ 14টি জোড়া forget-এগ্রিগেট তুলনায় জিতেছে এবং পুনরায় প্রশিক্ষণ পরীক্ষার সমস্ত উপলব্ধ কক্ষ পূরণ করেছে। সংখ্যাগুলি নিজেদের পক্ষে কথা বলে: আক্রমণের পরে প্যানেল জুড়ে গড় ROUGE-L মেট্রিক 0.41 থেকে 0.18-এ নেমে এসেছে — অর্থাৎ মডেলটি ভুলে যাওয়া লেখাগুলি প্রায় পুনরুত্পাদন বন্ধ করে দিয়েছে, এমনকি যখন এটিকে "পুনরায় প্রশিক্ষণ" দেওয়ার চেষ্টা করা হয়েছিল। অতিরিক্তভাবে, MC 14টির মধ্যে 13টি ক্ষেত্রে সদস্যতার কাঁচা AUC (ডেটা প্রশিক্ষণ সেটে ছিল কিনা তা নির্ধারণের মেট্রিক) হ্রাস করেছে।

তবে একটি খারাপ দিকও আছে। সমস্ত পরীক্ষায় retain-পাশে মডেলের উপযোগিতা হ্রাস লক্ষ্য করা গেছে: প্লাগইন আনলার্নিংকে আরও গভীর করে, কিন্তু মডেলটি ধরে রাখা জ্ঞানের সাথে সম্পর্কিত কাজগুলি আরও খারাপভাবে সম্পাদন করে। এই আপসটি প্রয়োগের পরিস্থিতিতে অন্তর্ভুক্ত করা প্রয়োজন: retain-ডেটাতে কর্মক্ষমতা গুরুত্বপূর্ণ এমন কাজগুলির জন্য, থ্রেশহোল্ডগুলির সূক্ষ্ম টিউনিং বা হালকা নিয়মিতকরণের প্রয়োজন হবে।
retain-রেফারেন্স ছাড়া প্রোডাকশন ভেরিয়েন্ট
উপরে বর্ণিত MC স্কিমটি retain-ডেটাতে প্রশিক্ষিত "রেফারেন্স" উত্তর থেকে প্রাপ্ত রেফারেন্স মার্জিনের উপর নির্ভর করে। কিন্তু বাস্তবে, মূল প্রশিক্ষণ বিতরণে প্রায়শই অ্যাক্সেস থাকে না। এই ধরনের ক্ষেত্রে, একটি পৃথক ডিপ্লয়মেন্ট ভেরিয়েন্ট সরবরাহ করা হয়েছে: এটি retain-প্রশিক্ষিত রেফারেন্স ব্যবহার না করেই একই উন্নতি অর্জন করতে দেয়, এটিকে পূর্বনির্ধারিত থ্রেশহোল্ড বা সাধারণ নির্দেশনা কর্পাস থেকে নিয়ন্ত্রণ মার্জিন দিয়ে প্রতিস্থাপন করে। এটি পদ্ধতিটিকে বাস্তব পণ্যগুলিতে প্রযোজ্য করে তোলে, যেখানে আনলার্নিংয়ের জন্য ডেটা ইতিমধ্যে সিস্টেম থেকে মুছে ফেলা হয়েছে এবং রেফারেন্স পুনরুদ্ধার করা অসম্ভব বা গোপনীয়তা নীতির দ্বারা নিষিদ্ধ।
উপসংহার
গবেষণা থেকে প্রধান ব্যবহারিক উপসংহার: ভাষার মডেলগুলির আনলার্নিংকে নির্ভরযোগ্য বলে মনে করা যায় না যতক্ষণ না অপ্টিমাইজেশন জ্যামিতি বিবেচনা করা হয়। "মার্জিন ক্লিফ" ব্যাখ্যা করে কেন কাগজে অনেক সুন্দর পদ্ধতি এমনকি দুর্বল পুনরায় প্রশিক্ষণ আক্রমণও সহ্য করতে পারে না, এবং ভবিষ্যতের কাজের দিকনির্দেশনা দেখায়। মার্জিন ক্যালিব্রেশন হল প্রথম প্লাগইনগুলির মধ্যে একটি যা উদ্দেশ্যমূলকভাবে এই ঘটনার সাথে লড়াই করে, এবং যদিও এটি এখনও পার্শ্ব প্রতিক্রিয়া ছাড়া সমস্যার সমাধান করে না, এটি সঠিক কাঠামো নির্ধারণ করে: "একবার ভুলে গেলে — চিরতরে ভুলে যাওয়া" এর পরিবর্তে, এমন একটি লস ল্যান্ডস্কেপ তৈরি করার কথা ভাবা উচিত যেখানে ভুলে যাওয়া জিনিস ফিরে আসা অলাভজনক এবং শক্তিগতভাবে ব্যয়বহুল হয়।



