কেন সাধারণ অ্যানোটেশন মেডিকেল এজেন্ট প্রশিক্ষণে বাধা সৃষ্টি করে
চক্ষুবিদ্যাগত ট্রায়াজের জন্য একটি ডায়ালগ এজেন্টকে শুধু শব্দে প্রশিক্ষণ দেওয়া যায় না: সঠিক উত্তরসহ হাজার হাজার কথোপকথনের উদাহরণ দেখাতে হয়। সাধারণ প্রোডাক্টে এই ধরনের অ্যানোটেশন মানুষ-অ্যানোটেটররা করে থাকে। ক্লিনিকে বিষয়টা আরও জটিল: অ্যানোটেশনের জন্য চিকিৎসকদের অংশগ্রহণ প্রয়োজন, এটি ব্যয়বহুল, এবং রোগীদের সাথে কথোপকথনের প্রতিলিপিগুলো চিকিৎসা গোপনীয়তা দ্বারা সুরক্ষিত। সেগুলো বাইরের ঠিকাদারদের কাছে হস্তান্তর করা যায় না, তাই সুপারভিশন স্কেল করা কার্যত অসম্ভব।
সম্প্রতি একটি গবেষণাপত্রের লেখকরা এই মডেল থেকে সরে আসার প্রস্তাব দিয়েছেন। বিশেষজ্ঞ নিয়োগ করে ম্যানুয়ালি প্রতিটি প্রতিক্রিয়া অ্যানোটেট করার পরিবর্তে, তারা ক্লিনিকাল নির্দেশিকাগুলোকে প্রশিক্ষণ সংকেতের উৎস হিসেবে ব্যবহার করেছেন। চক্ষুবিদ্যায় ট্রায়াজের নিয়মগুলো যথেষ্ট কঠোর, যাতে সেগুলোকে আনুষ্ঠানিক অপারেশনে রূপান্তর করা যায় যা স্বয়ংক্রিয়ভাবে ডায়ালগ অ্যানোটেট করতে পারে। এই পদ্ধতি শুধু প্রক্রিয়াটি সস্তাই করে না, বরং সংবেদনশীল ডেটা গবেষণা পরিবেশের বাইরে নিয়ে যাওয়ার প্রয়োজনও দূর করে।

Guideline-as-Oracle পদ্ধতি: নির্দেশিকা 'ওরাকল'-এ পরিণত হয়
গবেষকরা আমেরিকান অ্যাকাডেমি অব অফথালমোলজির নির্দেশিকাগুলো নিয়ে সেগুলোকে ৭০টি সারির একটি অপারেশনাল টেবিলে সংকলন করেছেন। প্রতিটি সারি এমন একটি শর্ত বর্ণনা করে যার ভিত্তিতে একটি ডায়ালগকে প্রাসঙ্গিক ট্রায়াজ শ্রেণিতে শ্রেণীবদ্ধ করা যায়। এই টেবিলটি 'ওরাকল'-এর ভূমিকা পালন করেছে: এটি স্বয়ংক্রিয়ভাবে ৩,০০০টি প্রশিক্ষণ ডায়ালগের জন্য লেবেল নির্ধারণ করেছে। মানুষের অ্যানোটেশন শুধুমাত্র চূড়ান্ত যাচাইয়ের জন্য প্রয়োজন ছিল — এটি ২০১টি ক্লিনিকাল কেসের একটি পৃথক সেটে রেফারেন্স হিসেবে ব্যবহৃত হয়েছে, কিন্তু প্রশিক্ষণ প্রক্রিয়ায় নয়।
ক্লিনিকাল টেক্সটকে ডায়ালগে রূপান্তর করা নিজেই একটি জটিল ইঞ্জিনিয়ারিং কাজ। এটিকে নির্ভরযোগ্য করতে, লেখকরা কর্পাস নির্মাণের আটটি কৌশল বর্ণনা করেছেন। সেগুলোর মধ্যে রয়েছে — নির্দেশিকার প্রাসঙ্গিক সারির ভিত্তিতে স্তর নির্ধারণ, 'একটি তথ্য ভিন্ন' এমন সীমানা জোড়া, শুধুমাত্র মেটাডেটায় ত্রুটি সংশোধন, এবং আলাদাভাবে লেবেল মেরামত। প্রতিটি কৌশলকে তারা প্রমাণ-ভিত্তিক দৃষ্টিকোণ থেকে চিহ্নিত করেছেন: একটি স্বাধীন অ্যানোটেশন প্রক্রিয়া হিসেবে কাজ করে, অন্যটি কোনো প্রভাব ফেলে না, তৃতীয়টি অন্যান্য কারণের প্রভাবের সাথে মিশ্রিত, এবং চতুর্থটি শুধুমাত্র সম্পূর্ণ পাইপলাইনের অংশ হিসেবে যাচাই করা যায়।
এই পদ্ধতি শুধু খরচের সমস্যাই সমাধান করে না, আপডেটের সমস্যাও সমাধান করে: যখন ক্লিনিকাল নির্দেশিকা পরিবর্তিত হয়, তখন হাজার হাজার ডায়ালগ নতুন করে অ্যানোটেট করার পরিবর্তে শুধু নিয়মের টেবিলটি সংশোধন করাই যথেষ্ট।

পরীক্ষা: সামঞ্জস্য বেড়েছে, recall-এ বড় লাফ
পরীক্ষার ভিত্তি ছিল ৯ বিলিয়ন প্যারামিটার বিশিষ্ট একটি মডেল। ৩,০০০টি স্বয়ংক্রিয়ভাবে অ্যানোটেটেড ডায়ালগের কর্পাসে ফাইন-টিউনিংয়ের পর GAO-Triage নামে একটি এজেন্ট তৈরি হয়েছে। ২০১টি কেসের রেফারেন্স সেটে প্রত্যাশিত সিদ্ধান্তের সাথে উত্তরের সামঞ্জস্য ৬১.৭% থেকে বেড়ে ৭৪.১% হয়েছে। পরিবর্তনটি পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ: সঠিক ম্যাকনেমার পরীক্ষায় p = ০.০০৪৬ পাওয়া গেছে।
বিশেষ করে অনির্ধারিত ক্ষেত্রে recall-এর বৃদ্ধি লক্ষণীয়। এমন পরিস্থিতি বোঝানো হয় যা স্ট্যান্ডার্ড প্রোটোকলের সাথে খাপ খায় না — যেমন, যখন রোগী এমন লক্ষণ বর্ণনা করে যার জন্য অ-প্রচলিত প্রতিক্রিয়া প্রয়োজন। এখানেই এজেন্টরা সাধারণত সবচেয়ে বেশি ভুল করে থাকে। GAO-Triage-তে এই সূচকটি ৯.৫% থেকে বেড়ে ৬৯.০% হয়েছে, অর্থাৎ মডেলটি সম্ভাব্য বিপজ্জনক পরিস্থিতি উপেক্ষা করার সম্ভাবনা অনেক কমিয়ে দিয়েছে।
উন্নতিগুলো এলোমেলো ছিল না: ভিন্ন সিড এবং রোগী সিমুলেটরে পুনরায় প্রশিক্ষণ দিলেও সেগুলো বজায় ছিল। GAO-Triage-কে সাতটি সাধারণ-উদ্দেশ্যের ডায়ালগ সিস্টেমের সাথে তুলনা করা হয়েছে। তাদের মধ্যে কোনোটি একই সাথে উভয় সূচকে আধিপত্য বিস্তার করতে পারেনি: কারও সামঞ্জস্য বেশি ছিল, কারও recall — কিন্তু শুধুমাত্র GAO-Triage-তেই দুটোই একসাথে ছিল। এছাড়াও, ইনফারেন্স পর্যায়ে এজেন্টের সবচেয়ে শক্তিশালী frontier-মডেলের প্রয়োজন হয় না এবং এটি 9B প্যারামিটার বিশিষ্ট বেসে লোকালি চলতে পারে।

সাফল্যের রহস্য — টেক্সটে নয়, লেবেল নির্ধারণে
লেখকরা একটি নিয়ন্ত্রণ পরীক্ষা চালিয়েছেন যা ব্যাখ্যা করে কেন পদ্ধতিটি কাজ করে। তারা একই ৩,০০০টি ডায়ালগ নিয়েছেন, কিন্তু নিয়ম দ্বারা নির্ধারিত ডায়ালগ এবং লেবেলের মধ্যে সম্পর্ক এলোমেলো করে দিয়েছেন। এই এলোমেলো করার পর মডেলটি সম্পূর্ণরূপে অবনমিত হয়ে একটি ধ্রুবক রুটিন প্রেডিক্টরে পরিণত হয়েছে: এটি কথোপকথনের বিষয়বস্তু উপেক্ষা করে একই স্ট্যান্ডার্ড উত্তর দিতে শুরু করেছে। এটি একটি গুরুত্বপূর্ণ ফলাফল। এটি দেখায় যে উপকার আসে প্রতিক্রিয়ার ভাসা ভাসা রূপ থেকে নয়, বরং ক্লিনিকাল নিয়ম থেকে উদ্ভূত শ্রেণির সাথে নির্দিষ্ট ডায়ালগের সংযোগ থেকে।
আলাদাভাবে, গবেষকরা label repair কৌশলটি পর্যবেক্ষণ করেছেন — প্রশিক্ষণের পরবর্তী পর্যায়ে লেবেল সংশোধন করা। এর প্রয়োগ নিরাপত্তা অবনতির অদৃশ্য হওয়ার সাথে মিলে গেছে। মনে হচ্ছে, যখন প্রশিক্ষণের শেষের দিকে অ্যানোটেশন সাবধানে পরিষ্কার করা শুরু হয়, তখন মডেলটি অনিরাপদ উত্তরের দিকে বিচ্যুত হওয়া বন্ধ করে দেয়, যা ডেটার প্রাথমিক ত্রুটির কারণে সৃষ্টি হতে পারে।
অনুশীলনের জন্য এর অর্থ কী
কাজের মূল উপসংহার: পরিণত ক্লিনিকাল নির্দেশিকা বিশিষ্ট ক্ষেত্রগুলিতে, প্রায় ম্যানুয়াল অ্যানোটেশন ছাড়াই একটি ডায়ালগ এজেন্টকে প্রশিক্ষণ দেওয়া যায়। নির্দেশিকাগুলোকে একবার এক্সিকিউটেবল নিয়মে রূপান্তর করা যথেষ্ট, তারপর সেগুলোকে সুপারভাইজার হিসেবে ব্যবহার করা। একটি ছোট বিশেষজ্ঞ নমুনা এখনও প্রয়োজন — চূড়ান্ত মান মূল্যায়নের জন্য — তবে এর পরিমাণ প্রশিক্ষণ কর্পাসের সম্পূর্ণ অ্যানোটেশনের সাথে তুলনীয় নয়।
পদ্ধতিটি শুধু চক্ষুবিদ্যার মধ্যে সীমাবদ্ধ নয়। যদি কার্ডিওলজি, জরুরি যত্ন বা টেলিমেডিসিনে অনুরূপ প্রোটোকল বিদ্যমান থাকে, তবে স্কিমাটি সেখানেও অভিযোজিত করা যেতে পারে। প্রধান প্রযুক্তিগত চ্যালেঞ্জ একই রয়ে গেছে: ক্লিনিকাল নির্দেশিকাগুলোকে স্পষ্ট নিয়মে সাবধানে এবং বিষয়বস্তুর গভীর বোঝাপড়ার সাথে রূপান্তর করতে হবে। কিন্তু একবার এটি সম্পন্ন হলে, নিরাপদ মেডিকেল এজেন্টের প্রশিক্ষণ উল্লেখযোগ্যভাবে দ্রুত এবং সস্তা হয়ে যায়, এবং রোগীদের সংবেদনশীল ডেটা ডেভেলপারের নিয়ন্ত্রণে থাকে।



