কেন স্ট্যান্ডার্ড ডি-আইডেন্টিফায়াররা "স্থানীয়" ডেটা বাদ দেয়
মেডিকেল রেকর্ডের স্বয়ংক্রিয় ডি-আইডেন্টিফিকেশন সিস্টেম সাধারণত সাধারণ ধরনের সুরক্ষিত তথ্য ভালোভাবে পরিচালনা করে: নাম, জন্মতারিখ, বীমা নম্বর। কিন্তু বাস্তব হাসপাতালে এমন ডেটা পাওয়া যায় যা শুধুমাত্র সেই প্রতিষ্ঠানের ভেতরেই সংবেদনশীল। এগুলো হলো ক্লিনিকের সংক্ষিপ্ত নাম, ভবনের নাম, বিভাগের অভ্যন্তরীণ কোড। মানুষের জন্য এই ধরনের স্ট্রিং স্পষ্টভাবে চিকিৎসার স্থান নির্দেশ করে, কিন্তু একটি সার্বজনীন অ্যালগরিদম সব স্থানীয় চিহ্ন জানতে পারে না।
প্রচলিত সমাধানগুলো হয় অভিধানের উপর নির্ভর করে, অথবা নির্দিষ্ট ক্যাটাগরি সহ প্রশিক্ষিত মডেলের উপর। উভয়ই সেগুলো বাদ দেয় যা তাদের রেফারেন্স তালিকায় নেই। গবেষকরা একে "প্রাতিষ্ঠানিকভাবে স্থানীয়কৃত" PHI বলে থাকেন, এবং এখানেই গুরুতর তথ্য ফাঁসের ঝুঁকি তৈরি হয়।
কীভাবে LLM ব্যবধান পূরণ করে
ইন-কনটেক্সট লার্নিং সহ বড় ভাষার মডেলগুলো এই সমস্যা সমাধান করতে সক্ষম কিনা তা যাচাই করতে, পরীক্ষার লেখকরা শিশু অনকোলজির ১০০টি চিহ্নিত নোট নিয়েছিলেন — মোট পাঁচ হাজারেরও বেশি PHI খণ্ড — এবং তারপর আটটি LLM-কে দুটি বিশেষায়িত সিস্টেম (Stanford TiDE এবং OpenMed PII) এবং দুটি প্যাটার্ন-বেসলাইনের সাথে তুলনা করেছিলেন।

ফলাফল LLM-এর পক্ষে গিয়েছিল: সেরা মডেলটি F1 = 0.918 ± 0.001 অর্জন করেছে, যেখানে সেরা বিশেষায়িত সিস্টেম TiDE মাত্র 0.779 দেখিয়েছে। বিশেষ করে প্রসঙ্গ-নির্ভর ক্যাটাগরিগুলোতে — সেই স্থানীয় চিহ্নগুলোতে — সুবিধাটি লক্ষণীয় ছিল, যা সাধারণত অ্যালগরিদমের নজর এড়িয়ে যায়।
প্রম্পটের তিনটি স্তর: HIPAA থেকে সূক্ষ্ম টিউনিং পর্যন্ত
মূল কৌশলটি কেবল একটি অনুরোধ নয়, বরং নির্দিষ্ট প্রতিষ্ঠানের জন্য প্রম্পটের লক্ষ্যবস্তু টিউনিং। পরীক্ষায় তিনটি ভিন্নতা ব্যবহার করা হয়েছিল:
- বেসিক প্রম্পট — HIPAA মান অনুযায়ী সাধারণ নির্দেশনা।
- স্থানীয় ক্যাটাগরি সহ প্রম্পট — প্রাতিষ্ঠানিক ধরনের PHI-এর একটি তালিকা যোগ করা হয় যা মান বিবেচনা করে না।
- অতিরিক্ত এডিটিং থেকে সুরক্ষা সহ প্রম্পট — অপ্রয়োজনীয় ক্লিনিকাল কনটেন্ট কেটে না ফেলার জন্য অতিরিক্ত নির্দেশনা।
বাদ পড়া ক্যাটাগরিগুলো তালিকাভুক্ত করা পূর্বে না পাওয়া ৬১টি খণ্ডের মধ্যে ৭৯% (৪৮টি) পুনরুদ্ধার করেছে। আর অতিরিক্ত এডিটিং বিরুদ্ধে নির্দেশনাটি নির্ভুলতা ফিরিয়ে এনেছে, যা মডেলের "অতিরিক্ত সতর্কতা"র কারণে ক্ষতিগ্রস্ত হয়েছিল।

এজেন্ট এবং এনসেম্বল কোনো লাভ দেয়নি
কেউ অনুমান করতে পারে যে একাধিক মডেল চালানো বা মাল্টি-এজেন্ট স্কিম আরও ভালো ফল দেবে। লেখকরা ১৪টি এই ধরনের কনফিগারেশন পরীক্ষা করেছেন এবং সেরা একক প্রম্পটের সাথে তুলনা করেছেন। দেখা গেছে যে কোনো এজেন্ট আর্কিটেকচারই সাধারণ এক-পাস ক্যালিব্রেটেড প্রম্পটিংকে ছাড়িয়ে যায়নি। এজেন্টদের F1 0.906–0.907 রেঞ্জে ছিল — অর্থাৎ প্রায় একই স্তরে, কিন্তু অতিরিক্ত লাভ ছাড়াই।
LLM অ্যানোটেশন অডিটর হিসেবে
LLM-পদ্ধতির একটি আলাদা মূল্য হলো এটি রেফারেন্স সেটের গুণমান যাচাই করতে সাহায্য করে। মডেলগুলো ৪১৪টি স্থান নির্দেশ করেছে যেখানে মূল অ্যানোটেশন সম্ভবত অসম্পূর্ণ ছিল। ম্যানুয়াল যাচাইয়ের পরে ২২৭টি বাদ পড়া PHI-স্প্যান নিশ্চিত হয়েছে। যখন অ্যানোটেশন সংশোধন করে প্রম্পটিং পুনরায় চালানো হয়েছিল, তখন রিকল 0.981-এ বেড়েছে F1 = 0.907 ± 0.002 সহ। এর অর্থ হলো LLM শুধুমাত্র ডি-আইডেন্টিফিকেশন টুল হিসেবেই নয়, আরও নির্ভুল প্রশিক্ষণ ডেটাসেট তৈরির জন্য অডিটর হিসেবেও কাজ করতে পারে।
উপসংহার
ভালোভাবে টিউন করা প্রম্পট LLM-কে PHI-এর প্রাতিষ্ঠানিক ব্যবধান পূরণ করতে এবং মডেলে একটি একক কলেই নির্ভুলতা ও রিকলের সর্বোত্তম ভারসাম্য খুঁজে পেতে সক্ষম করে। এই পদ্ধতিটি প্রচলিত অভিধান-ভিত্তিক পদ্ধতির চেয়ে বেশি ব্যয়বহুল, তবে এই খরচ আংশিকভাবে রেফারেন্স নিজেই যাচাই ও উন্নত করার সুযোগের মাধ্যমে পুষিয়ে নেওয়া হয়।
লেখকরা LLM-কে বিশেষায়িত ডি-আইডেন্টিফায়ারগুলোর একটি বৈধ অভিযোজনযোগ্য বিকল্প হিসেবে বিবেচনা করেন। বাস্তবায়নের প্রধান কৌশল হলো প্রাতিষ্ঠানিক-নির্দিষ্ট প্রম্পট তৈরি করা যা প্রতিটি ক্লিনিকের স্থানীয় বাস্তবতা বিবেচনা করে।



