খোলা মডেলের গোপনীয়তা অডিট
পাবলিক ওয়েট সুবিধাজনক, কিন্তু তারা একটি লুকানো ঝুঁকিও তৈরি করে। একটি কোম্পানি ওপেন-ওয়েট মডেল নিয়ে অভ্যন্তরীণ ডেটাবেসে — চিঠিপত্র, মেডিকেল ডেটা বা কর্পোরেট নথিতে — তা পুনঃপ্রশিক্ষণ দিতে পারে। ব্যবহারকারী সাধারণত জানেন না যে প্রশিক্ষণে কোন রেকর্ডগুলো ঢুকেছে, আর নিয়ন্ত্রক ও ক্লায়েন্টদের জন্য এটি একটি মৌলিক প্রশ্ন। প্রশিক্ষণ সেটে "সদস্যপদ" যাচাই — মেম্বারশিপ ইনফারেন্স — ঠিক এই প্রশ্নের উত্তর দেয়: মডেলের আচরণ থেকে কি বোঝা যায় যে একটি নির্দিষ্ট টেক্সট অভিযোজনের সময় ব্যবহৃত হয়েছিল?
কাজটি জটিল হয় কারণ আমাদের কাছে সাধারণত পুনঃপ্রশিক্ষণের পরের চেকপয়েন্ট এবং তার আগের ওপেন ভার্সনটিই থাকে। একই খণ্ডের উপর দুটি চেকপয়েন্টের প্রতিক্রিয়া তুলনা করে, পুনঃপ্রশিক্ষণের প্রভাবকে মডেলের সাধারণ আচরণ থেকে আলাদা করার চেষ্টা করা যেতে পারে।
ডিফিউশন ভাষা মডেলের বৈশিষ্ট্য
ক্লাসিক LLM টেক্সট টোকেনে টোকেনে, বাম থেকে ডানে তৈরি করে। ডিসক্রিট ডিফিউশন ভাষা মডেল (dLLM) ভিন্নভাবে কাজ করে: তারা একসাথে একাধিক মাস্ক করা অবস্থান পুনর্গঠন করতে সক্ষম। ক্রমিক পূর্বাভাসের পরিবর্তে, মডেলটি নির্বিচারে মাস্কের সেটসহ টেক্সট ইনপুট নেয় এবং একটি ফরোয়ার্ড পাসে সব "গর্তের" জন্য সম্ভাবনা দেয়।
এই ক্ষমতা dLLM-কে গোপনীয়তা অডিটের জন্য বিশেষভাবে আকর্ষণীয় করে তোলে। মডেলটি একটি নির্দিষ্ট অংশ মনে রাখে কিনা তা পরীক্ষা করতে হলে, টোকেনের কিছু অংশ লুকিয়ে প্রতিক্রিয়া দেখা যায়। তবে প্রশ্ন হলো কোন অবস্থানগুলো মাস্ক করতে হবে এবং উত্তরটি কীভাবে ব্যাখ্যা করতে হবে।
কেন সাধারণ মাস্ক গড় পদ্ধতি কাজ করে না
প্রথম স্বজ্ঞা হলো অনেকগুলো এলোমেলো মাস্ক চেষ্টা করে পুনর্গঠন ত্রুটির গড় নেওয়া। পুরনো SAMA পদ্ধতিটি ঠিক এভাবেই কাজ করে: মডেলটি কয়েক ডজন এলোমেলো ভেরিয়েন্টে চালানো হয়, তারপর সংকেত গড় করা হয়।
এই সমাধানের দুটি ত্রুটি রয়েছে। প্রথমত, এলোমেলো মাস্ক প্রায়ই "বিরক্তিকর" অবস্থানগুলো ধরে, যা মডেল পুনঃপ্রশিক্ষণ ছাড়াই একইভাবে পূর্বাভাস দেয় — দরকারী সংকেত শব্দে ডুবে যায়। দ্বিতীয়ত, প্রতিটি রান সম্পদ খরচ করে: একটি নমুনার জন্য কয়েক ডজন মডেল পাস প্রয়োজন, যা বড় ডেটাসেটের স্কেলে একটি ব্যয়বহুল অপারেশনে পরিণত হয়। এলোমেলোভাবে নয়, বরং অর্থপূর্ণভাবে মাস্ক বেছে নেওয়ার একটি উপায় প্রয়োজন।
আত্মবিশ্বাস বলে দেয় কোথায় মাস্ক করতে হবে
নতুন প্রিপ্রিন্টের লেখকরা JUMP (জয়েন্ট আনসার্টেইনটি-গাইডেড মাস্ক প্রোবিং) পদ্ধতি প্রস্তাব করেছেন। ধারণাটি হলো রেফারেন্স-মডেল — পুনঃপ্রশিক্ষণের আগের চেকপয়েন্ট — "মিথ্যা আবিষ্কারক" হিসেবে ব্যবহার করা।
প্রথমে রেফারেন্স-মডেলটি মূল টেক্সটে চালানো হয় এবং যে অবস্থানগুলোতে এটি সবচেয়ে কম আত্মবিশ্বাসী তা খুঁজে বের করা হয়। ধারণা করা হয় যে পুনঃপ্রশিক্ষণের সময় ঠিক এই জায়গাগুলোই সবচেয়ে বেশি পরিবর্তিত হয়: যদি এই বিন্দুতে নির্দিষ্ট তথ্য প্রবাহিত হয়, মডেলটি তা শিখতে বাধ্য ছিল। তারপর এই কম-আত্মবিশ্বাসী অবস্থানগুলো একসাথে মাস্ক করা হয়, এবং টার্গেট মডেলটি একটি অনুরোধে সেগুলো পুনর্গঠন করে।
এরপর টার্গেট এবং রেফারেন্স মডেলের পুনর্গঠনের মধ্যে ব্যবধান তুলনা করা হয়। এলোমেলো বিচ্যুতি বিবেচনায় না নিতে, ট্রাঙ্কেশন প্রয়োগ করা হয়: শুধুমাত্র সেই পার্থক্যগুলোই সমষ্টিতে অন্তর্ভুক্ত হয় যা একটি নির্দিষ্ট থ্রেশহোল্ড অতিক্রম করে। এই "ছাঁটা" ব্যবধান প্রকৃত সংকেতকে শব্দ থেকে ভালোভাবে আলাদা করে, আর তথ্যপূর্ণ অবস্থানগুলোর যৌথ মাস্কিং গণনা সাশ্রয় করে।

ফলাফল: কম পাস — উচ্চতর নির্ভুলতা
লেখকরা তাদের পরীক্ষা MIMIR বেঞ্চমার্কে চালিয়েছেন, যা ছয়টি টেক্সট ডোমেইন কভার করে। পরীক্ষার বিষয় হিসেবে দুটি ওপেন-ওয়েট ডিফিউশন মডেল ব্যবহার করা হয়েছে: LLaDA-8B-Base এবং Dream-v0-Base-7B।
ডোমেইন জুড়ে গড়ে, LLaDA-এর জন্য ROC-AUC মেট্রিক 0.819 থেকে 0.902-এ এবং Dream-এর জন্য 0.851 থেকে 0.942-এ বেড়েছে। এটি অ্যাট্রিবিউশন নির্ভুলতার একটি লক্ষণীয় উন্নতি। এদিকে JUMP প্রতি নমুনায় মাত্র তিনটি মডেল পাস খরচ করে, যেখানে SAMA-এর 32টি প্রয়োজন। অন্য কথায়, পদ্ধতিটি কেবল আরও নির্ভুল নয়, ইনফারেন্সের সংখ্যার দিক থেকে প্রায় এক অর্ডার সস্তাও।

ব্যবহারিক তাৎপর্য
প্রস্তাবিত পদ্ধতিটি দেখায় যে পুনঃপ্রশিক্ষিত ডিফিউশন মডেলের অডিটের জন্য অন্ধ মাস্ক চেষ্টা করার প্রয়োজন নেই। রেফারেন্স-মডেলকে জিজ্ঞাসা করাই যথেষ্ট যে এটি কোথায় আত্মবিশ্বাসের অভাব বোধ করে, এবং পরীক্ষাটি ঠিক সেই অঞ্চলগুলোতে নির্দেশ করা যায়। এটি এমন একটি টুল দেয় যা ওপেন-ওয়েট মডেলের আপডেট প্রকাশের সময় এবং ব্যক্তিগত ডেটার প্রয়োজনীয়তা মেনে চলা যাচাইয়ের জন্য প্রয়োগ করা যেতে পারে।
কাজটি এখনও প্রিপ্রিন্ট অবস্থায় রয়েছে — 22 পৃষ্ঠা, 18 আগস্ট 2026-এর বর্তমান সংস্করণ v2। তবে সমস্যার প্রণয়ন এবং শক্তিশালী ফলাফল ইঙ্গিত দেয় যে পদ্ধতিটির ধারাবাহিকতা থাকবে: অন্যান্য ধরণের ডিফিউশন আর্কিটেকচারে অভিযোজন বা আরও আক্রমণাত্মক পুনঃপ্রশিক্ষণ পরিস্থিতির প্রতি স্থিতিস্থাপকতা।



