এলএলএম-এর পয়েন্টেড প্রম্পটিং কীভাবে লুকানো মেডিকেল ডেটা খুঁজে বের করে যা স্ট্যান্ডার্ড ডি-আইডেন্টিফিকেশন সিস্টেম মিস করে

1 সেপ্টেম্বর 2026৭ প্রদর্শন

নতুন গবেষণায় দেখা গেছে: নির্দিষ্ট ক্লিনিকের জন্য ক্যালিব্রেট করা প্রম্পটসহ বড় ভাষার মডেলগুলো চিকিৎসা তথ্য সুরক্ষার ফাঁকগুলো বন্ধ করে দেয় — অভ্যন্তরীণ কোড এবং ভবনের নামসহ — নির্ভুলতায় বিদ্যমান অ্যালগরিদমকে ছাড়িয়ে যায় এবং পাশাপাশি রেফারেন্স অ্যানোটেশনের ত্রুটিগুলোও চিহ্নিত করে।

এলএলএম-এর পয়েন্টেড প্রম্পটিং কীভাবে লুকানো মেডিকেল ডেটা খুঁজে বের করে যা স্ট্যান্ডার্ড ডি-আইডেন্টিফিকেশন সিস্টেম মিস করে

কেন স্ট্যান্ডার্ড ডি-আইডেন্টিফায়াররা "স্থানীয়" ডেটা বাদ দেয়

মেডিকেল রেকর্ডের স্বয়ংক্রিয় ডি-আইডেন্টিফিকেশন সিস্টেম সাধারণত সাধারণ ধরনের সুরক্ষিত তথ্য ভালোভাবে পরিচালনা করে: নাম, জন্মতারিখ, বীমা নম্বর। কিন্তু বাস্তব হাসপাতালে এমন ডেটা পাওয়া যায় যা শুধুমাত্র সেই প্রতিষ্ঠানের ভেতরেই সংবেদনশীল। এগুলো হলো ক্লিনিকের সংক্ষিপ্ত নাম, ভবনের নাম, বিভাগের অভ্যন্তরীণ কোড। মানুষের জন্য এই ধরনের স্ট্রিং স্পষ্টভাবে চিকিৎসার স্থান নির্দেশ করে, কিন্তু একটি সার্বজনীন অ্যালগরিদম সব স্থানীয় চিহ্ন জানতে পারে না।

প্রচলিত সমাধানগুলো হয় অভিধানের উপর নির্ভর করে, অথবা নির্দিষ্ট ক্যাটাগরি সহ প্রশিক্ষিত মডেলের উপর। উভয়ই সেগুলো বাদ দেয় যা তাদের রেফারেন্স তালিকায় নেই। গবেষকরা একে "প্রাতিষ্ঠানিকভাবে স্থানীয়কৃত" PHI বলে থাকেন, এবং এখানেই গুরুতর তথ্য ফাঁসের ঝুঁকি তৈরি হয়।

কীভাবে LLM ব্যবধান পূরণ করে

ইন-কনটেক্সট লার্নিং সহ বড় ভাষার মডেলগুলো এই সমস্যা সমাধান করতে সক্ষম কিনা তা যাচাই করতে, পরীক্ষার লেখকরা শিশু অনকোলজির ১০০টি চিহ্নিত নোট নিয়েছিলেন — মোট পাঁচ হাজারেরও বেশি PHI খণ্ড — এবং তারপর আটটি LLM-কে দুটি বিশেষায়িত সিস্টেম (Stanford TiDE এবং OpenMed PII) এবং দুটি প্যাটার্ন-বেসলাইনের সাথে তুলনা করেছিলেন।

ফলাফল LLM-এর পক্ষে গিয়েছিল: সেরা মডেলটি F1 = 0.918 ± 0.001 অর্জন করেছে, যেখানে সেরা বিশেষায়িত সিস্টেম TiDE মাত্র 0.779 দেখিয়েছে। বিশেষ করে প্রসঙ্গ-নির্ভর ক্যাটাগরিগুলোতে — সেই স্থানীয় চিহ্নগুলোতে — সুবিধাটি লক্ষণীয় ছিল, যা সাধারণত অ্যালগরিদমের নজর এড়িয়ে যায়।

প্রম্পটের তিনটি স্তর: HIPAA থেকে সূক্ষ্ম টিউনিং পর্যন্ত

মূল কৌশলটি কেবল একটি অনুরোধ নয়, বরং নির্দিষ্ট প্রতিষ্ঠানের জন্য প্রম্পটের লক্ষ্যবস্তু টিউনিং। পরীক্ষায় তিনটি ভিন্নতা ব্যবহার করা হয়েছিল:

  • বেসিক প্রম্পট — HIPAA মান অনুযায়ী সাধারণ নির্দেশনা।
  • স্থানীয় ক্যাটাগরি সহ প্রম্পট — প্রাতিষ্ঠানিক ধরনের PHI-এর একটি তালিকা যোগ করা হয় যা মান বিবেচনা করে না।
  • অতিরিক্ত এডিটিং থেকে সুরক্ষা সহ প্রম্পট — অপ্রয়োজনীয় ক্লিনিকাল কনটেন্ট কেটে না ফেলার জন্য অতিরিক্ত নির্দেশনা।

বাদ পড়া ক্যাটাগরিগুলো তালিকাভুক্ত করা পূর্বে না পাওয়া ৬১টি খণ্ডের মধ্যে ৭৯% (৪৮টি) পুনরুদ্ধার করেছে। আর অতিরিক্ত এডিটিং বিরুদ্ধে নির্দেশনাটি নির্ভুলতা ফিরিয়ে এনেছে, যা মডেলের "অতিরিক্ত সতর্কতা"র কারণে ক্ষতিগ্রস্ত হয়েছিল।

এজেন্ট এবং এনসেম্বল কোনো লাভ দেয়নি

কেউ অনুমান করতে পারে যে একাধিক মডেল চালানো বা মাল্টি-এজেন্ট স্কিম আরও ভালো ফল দেবে। লেখকরা ১৪টি এই ধরনের কনফিগারেশন পরীক্ষা করেছেন এবং সেরা একক প্রম্পটের সাথে তুলনা করেছেন। দেখা গেছে যে কোনো এজেন্ট আর্কিটেকচারই সাধারণ এক-পাস ক্যালিব্রেটেড প্রম্পটিংকে ছাড়িয়ে যায়নি। এজেন্টদের F1 0.906–0.907 রেঞ্জে ছিল — অর্থাৎ প্রায় একই স্তরে, কিন্তু অতিরিক্ত লাভ ছাড়াই।

LLM অ্যানোটেশন অডিটর হিসেবে

LLM-পদ্ধতির একটি আলাদা মূল্য হলো এটি রেফারেন্স সেটের গুণমান যাচাই করতে সাহায্য করে। মডেলগুলো ৪১৪টি স্থান নির্দেশ করেছে যেখানে মূল অ্যানোটেশন সম্ভবত অসম্পূর্ণ ছিল। ম্যানুয়াল যাচাইয়ের পরে ২২৭টি বাদ পড়া PHI-স্প্যান নিশ্চিত হয়েছে। যখন অ্যানোটেশন সংশোধন করে প্রম্পটিং পুনরায় চালানো হয়েছিল, তখন রিকল 0.981-এ বেড়েছে F1 = 0.907 ± 0.002 সহ। এর অর্থ হলো LLM শুধুমাত্র ডি-আইডেন্টিফিকেশন টুল হিসেবেই নয়, আরও নির্ভুল প্রশিক্ষণ ডেটাসেট তৈরির জন্য অডিটর হিসেবেও কাজ করতে পারে।

উপসংহার

ভালোভাবে টিউন করা প্রম্পট LLM-কে PHI-এর প্রাতিষ্ঠানিক ব্যবধান পূরণ করতে এবং মডেলে একটি একক কলেই নির্ভুলতা ও রিকলের সর্বোত্তম ভারসাম্য খুঁজে পেতে সক্ষম করে। এই পদ্ধতিটি প্রচলিত অভিধান-ভিত্তিক পদ্ধতির চেয়ে বেশি ব্যয়বহুল, তবে এই খরচ আংশিকভাবে রেফারেন্স নিজেই যাচাই ও উন্নত করার সুযোগের মাধ্যমে পুষিয়ে নেওয়া হয়।

লেখকরা LLM-কে বিশেষায়িত ডি-আইডেন্টিফায়ারগুলোর একটি বৈধ অভিযোজনযোগ্য বিকল্প হিসেবে বিবেচনা করেন। বাস্তবায়নের প্রধান কৌশল হলো প্রাতিষ্ঠানিক-নির্দিষ্ট প্রম্পট তৈরি করা যা প্রতিটি ক্লিনিকের স্থানীয় বাস্তবতা বিবেচনা করে।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
এলএলএম-এর পয়েন্টেড প্রম্পটিং কীভাবে লুকানো মেডিকেল ডেটা খুঁজে বের করে যা স্ট্যান্ডার্ড ডি-আইডেন্টিফিকেশন সিস্টেম মিস করে