সেলফ-ডিস্টিলেশন হারানো LLM কর্মক্ষমতা ফিরিয়ে আনে: কীভাবে লুকানো স্পেস সারিবদ্ধকরণ ভুলে যাওয়া এবং সংকোচনের বিরুদ্ধে লড়াই করে

7 সেপ্টেম্বর 2026২৯ প্রদর্শন

SDFT পদ্ধতি, যা লেখকগণ প্রস্তাব করেছেন, মডেলগুলিকে সূক্ষ্ম-টিউনিং, কোয়ান্টাইজেশন বা প্রুনিং-এর কারণে সৃষ্ট অবক্ষয়ের পরে ক্ষমতা পুনরুদ্ধার করতে সাহায্য করে। CKA মেট্রিকের মাধ্যমে গবেষকরা নিশ্চিত করেছেন যে কর্মক্ষমতা পুনরুদ্ধার শিক্ষার্থী এবং শিক্ষকের অভ্যন্তরীণ ম্যানিফোল্ডগুলির সারিবদ্ধকরণের সাথে সম্পর্কযুক্ত।

সেলফ-ডিস্টিলেশন হারানো LLM কর্মক্ষমতা ফিরিয়ে আনে: কীভাবে লুকানো স্পেস সারিবদ্ধকরণ ভুলে যাওয়া এবং সংকোচনের বিরুদ্ধে লড়াই করে

বড় ভাষার মডেল খুব কমই ব্যবহারকারীর সাথে তার আসল আকারে দেখা করে। চালু করার আগে এটিকে সংলাপের জন্য অতিরিক্ত প্রশিক্ষণ দেওয়া হয়, সংকুচিত করা হয়, কোয়ান্টাইজ করা হয় এবং কিছু ওজন বাদ দেওয়া হয়। এই প্রতিটি ধাপ ব্যবহারিক সুবিধা নিয়ে আসে, কিন্তু প্রায় সবসময়ই একটি ছাপ রেখে যায়: মডেলটি খারাপভাবে যুক্তি দেখাতে শুরু করতে পারে, বিরল তথ্য ভুলে যেতে পারে বা শৈলীর অনুভূতি হারাতে পারে। প্রশ্ন হল, বিশাল ডেটাসেটে সম্পূর্ণ পুনঃপ্রশিক্ষণ ছাড়াই কি দক্ষতা ফিরিয়ে আনা সম্ভব?

অতিরিক্ত প্রশিক্ষণ এবং সংকোচনের পরে কেন গুণমান ক্ষতিগ্রস্ত হয়

বিপর্যয়কর ভুলে যাওয়া সাধারণত Supervised Fine-Tuning (SFT) এর সাথে থাকে। মডেলটিকে উত্তরের নতুন ফরম্যাটের সাথে খাপ খাওয়ানো হয়, এবং ওজন আপডেট করা অনিচ্ছাকৃতভাবে পুরনো জ্ঞানের কিছু অংশ ওভাররাইট করে। কোয়ান্টাইজেশন এবং প্রুনিং ভিন্নভাবে কাজ করে: তারা মেমোরি সাশ্রয় করে এবং আউটপুট দ্রুত করে, কিন্তু সঠিক গণনাকে আনুমানিক গণনা দিয়ে প্রতিস্থাপন করে এবং কিছু সংযোগ বন্ধ করে দেয়। ফলে শুধু মডেলের আচরণই বিকৃত হয় না, তার জ্ঞানের অভ্যন্তরীণ উপস্থাপনাও বিকৃত হয়।

বাহ্যিক লক্ষণ বিভিন্ন হতে পারে — বাস্তবিক নির্ভুলতা হারানো থেকে শুরু করে একঘেয়ে উত্তর। তবে কারণটি সাধারণ: মডেলটি যে লুকানো স্থানের কাঠামোতে "চিন্তা করে", তা আসল সংস্করণের সাথে মিলে যাওয়া বন্ধ করে দেয়।

পুনঃপ্রশিক্ষণের পরিবর্তে স্ব-আসব distillation

arXiv:2604.15794 গবেষণাপত্রে গবেষকরা Self-Distillation Fine-Tuning (SDFT) ফ্রেমওয়ার্ক প্রস্তাব করেছেন। ধারণাটি হল মডেলটিকেই পুনরুদ্ধারের উৎস হিসেবে ব্যবহার করা। ক্ষতিগ্রস্ত সংস্করণটি ছাত্র হিসেবে কাজ করে, এবং তার "সুস্থ" সংস্করণটি — সংকোচনের আগে বা SFT-এর আগে সংরক্ষিত — শিক্ষক হিসেবে কাজ করে। অতিরিক্ত প্রশিক্ষণের পর্যায়ে, ছাত্র তার উত্তর এবং অভ্যন্তরীণ অবস্থাগুলিকে শিক্ষকের কাছাকাছি পৌঁছানোর জন্য সামঞ্জস্য করে।

এটি বড় মডেল থেকে ছোট মডেলে জ্ঞানের ধ্রুপদী স্থানান্তর নয়। এখানে শিক্ষক এবং ছাত্র আসলে জীবনের বিভিন্ন পর্যায়ে একই আর্কিটেকচার। তাই প্রক্রিয়াটিকে স্ব-আসব distillation বলা হয়: মডেলটি মৌলিকভাবে নতুন কিছু শেখে না, বরং তার হারানো অভ্যন্তরীণ সামঞ্জস্য ফিরে পায়।

লুকানো ম্যানিফোল্ডের সারিবদ্ধকরণ কী দেখায়

লেখকরা ধারণা থেকে শুরু করেন যে LLM-এর জেনারেটিভ ক্ষমতা মৌলিকভাবে উচ্চ-মাত্রিক ম্যানিফোল্ডের উপর নির্ভর করে যা লুকানো স্তরগুলি গঠন করে। মডেলের গুণমান পৃথক নিউরন দ্বারা নির্ধারিত হয় না, বরং এই স্থানে অ্যাক্টিভেশনগুলি কীভাবে সাজানো হয় তা দ্বারা নির্ধারিত হয়। সেগুলিকে বিন্দুর মেঘ হিসেবে কল্পনা করা যেতে পারে: একটি ভালভাবে প্রশিক্ষিত মডেলের ক্ষেত্রে, মেঘের একটি বৈশিষ্ট্যপূর্ণ কাঠামো থাকে, এবং সংকোচন বা ভুলে যাওয়া তা ধ্বংস করে।

পুনরুদ্ধার পরিমাপ করার জন্য, গবেষণায় Centered Kernel Alignment (CKA) প্রয়োগ করা হয় — শিক্ষক এবং ছাত্রের অভ্যন্তরীণ উপস্থাপনার সাদৃশ্যের একটি মেট্রিক। CKA সুবিধাজনক কারণ এটি অর্থোগোনাল রূপান্তর এবং স্কেলিং-এর প্রতি অপরিবর্তনীয়। এটি অভিন্ন ঘূর্ণন বা স্থানাঙ্কের প্রসারণ নিয়ে আপত্তি করে না, বরং অ্যাক্টিভেশনের কনফিগারেশনের পরিবর্তনই ধরে।

পরীক্ষাগুলি কর্মক্ষমতা পুনরুদ্ধার এবং CKA-সারিবদ্ধকরণ বৃদ্ধির মধ্যে একটি শক্তিশালী সম্পর্ক দেখিয়েছে। ছাত্রের ম্যানিফোল্ড শিক্ষকের ম্যানিফোল্ডের যত কাছাকাছি, মডেলটি হারানো দক্ষতা তত ভালভাবে ফিরিয়ে আনে। এটি নিশ্চিত করে: স্ব-আসব distillation এলোমেলোভাবে কাজ করে না, বরং কারণ এটি লুকানো স্থানের জ্যামিতিক কাঠামোকে সারিবদ্ধ করে।

ব্যবহারিক উপসংহার

আসব distillation-এর মাধ্যমে মডেল পুনরুদ্ধারের ধারণাটি নিজেই নতুন নয়। পদ্ধতির নতুনত্ব — কেন এটি কাজ করে তার ব্যাখ্যা এবং সেই ব্যাখ্যা যাচাই করার উপায়ে। CKA একটি ডায়াগনস্টিক টুল হয়ে উঠতে পারে: যদি কোয়ান্টাইজেশন বা প্রুনিং-এর পরে সারিবদ্ধকরণ দ্রুত হ্রাস পায়, তাহলে মডেলটির "মেরামত" প্রয়োজন। SDFT, ঘুরে, প্রশিক্ষণের সম্পূর্ণ চক্রে ফিরে না গিয়ে এই মেরামত সম্পাদন করতে দেয়।

গবেষণাটি কর্মক্ষমতা পুনরুদ্ধারের ব্যবহারিক ফ্রেমওয়ার্ককে উপস্থাপনার জ্যামিতিক তত্ত্বের সাথে সংযুক্ত করে। এটি LLM-এর ভিতরে সংকোচনের সময় কী ঘটে এবং কেন স্ব-আসব distillation হারানো ক্ষমতা ফিরিয়ে আনতে সক্ষম তার একটি স্পষ্ট চিত্র দেয়।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
সেলফ-ডিস্টিলেশন হারানো LLM কর্মক্ষমতা ফিরিয়ে আনে: কীভাবে লুকানো স্পেস সারিবদ্ধকরণ ভুলে যাওয়া এবং সংকোচনের বিরুদ্ধে লড়াই করে