কীভাবে আল্ট্রাসাউন্ডে ভাষা সেগমেন্টেশন শেখানো যায়, যখন লেবেলযুক্ত ডেটা প্রায় নেই

5 সেপ্টেম্বর 2026১২ প্রদর্শন

গবেষকরা নতুন আল্ট্রাসাউন্ড চিত্রের সেটে মডেল মানিয়ে নেওয়ার একটি পদ্ধতি প্রস্তাব করেছেন, যা মূল ডেটায় প্রবেশাধিকার ছাড়াই কাজ করে: এটি সিউডো-লেবেল পরিমার্জন, কনট্যুর মান নিয়ন্ত্রণ এবং লক্ষ্য ডোমেইনের শৈলীতে সিন্থেটিক চিত্র তৈরি একত্রিত করে। এই পদ্ধতি মাত্র পাঁচটি লেবেলযুক্ত ফ্রেম দিয়ে শুরু করলেও সেগমেন্টেশনের নির্ভুলতা উল্লেখযোগ্যভাবে উন্নত করে।

কীভাবে আল্ট্রাসাউন্ডে ভাষা সেগমেন্টেশন শেখানো যায়, যখন লেবেলযুক্ত ডেটা প্রায় নেই

ক্ষেত্র: content লক্ষ্য ভাষা: বাংলা (bn)

আল্ট্রাসাউন্ড চিত্রে ভাষার সেগমেন্টেশন উচ্চারণ বিশ্লেষণ এবং বাক প্রতিবন্ধকতা নির্ণয়ের জন্য প্রয়োজন, কিন্তু লেবেলযুক্ত ডেটা সংগ্রহ করা কঠিন: বিশেষজ্ঞের প্রয়োজন হয়, এবং চিত্রগুলো যন্ত্র থেকে যন্ত্রে ব্যাপকভাবে ভিন্ন হয়। যখন লেবেলযুক্ত উপাদান প্রায় থাকে না, তখন স্ট্যান্ডার্ড নিউরাল নেটওয়ার্ক প্রশিক্ষণ কাজ করে না: মডেলটি নির্দিষ্ট উৎসের বৈশিষ্ট্যগুলো মুখস্থ করে ফেলে এবং নতুন পরিস্থিতিতে সাধারণীকরণ করতে পারে না।

কেন এটি কঠিন

সমস্যাটি শুধু অ্যানোটেশনের অল্প সংখ্যায় নয়। ভাষার আল্ট্রাসাউন্ড ডেটা বিভিন্ন সেন্সর, বিভিন্ন সেটিংস এবং বিভিন্ন ব্যক্তির কাছ থেকে সংগ্রহ করা হয়, তাই প্রতিটি নতুন ডেটাসেটে চিত্রের বণ্টন আলাদা। একে domain shift বলা হয়। যদি একটি ডেটাসেটে মডেল প্রশিক্ষণ দেওয়া হয় এবং অন্যটিতে প্রয়োগ করা হয়, তাহলে সেগমেন্টেশনের মান তীব্রভাবে কমে যায়। ক্লাসিক্যাল অ্যাডাপ্টেশন পদ্ধতিগুলোর জন্য উৎস ডোমেইনের লেবেলযুক্ত ডেটার অ্যাক্সেস প্রয়োজন, কিন্তু বাস্তব সমস্যায় প্রায়ই শুধুমাত্র একটি প্রাক-প্রশিক্ষিত মডেল এবং নতুন ডোমেইনের লেবেলবিহীন চিত্র থাকে।

ধারণা: source-free অ্যাডাপ্টেশন

সম্প্রতি একটি গবেষণার লেখকরা একটি ফ্রেমওয়ার্ক প্রস্তাব করেন যা কোনো লেবেলযুক্ত ডেটা ছাড়াই এবং উৎস চিত্রগুলিতে অ্যাক্সেস ছাড়াই মডেলটিকে নতুন ডোমেইনে অভিযোজিত করে। ভিত্তি হিসেবে নেওয়া হয় একটি হালকা বэкбон UltraUNet, যা মাত্র পাঁচটি লেবেলযুক্ত চিত্রে প্রাক-প্রশিক্ষিত। এটি ইচ্ছাকৃতভাবে একটি দুর্বল শুরুর বিন্দু — এটি এমন পরিস্থিতি অনুকরণ করে যেখানে ডেটার অভাবে মডেলটি অপর্যাপ্তভাবে প্রশিক্ষিত। এরপর লক্ষ্য ডোমেইনে অভিযোজন ঘটে, যেখানে লেবেলযুক্ত উদাহরণ একেবারেই নেই।

ফিল্টারিং সহ সিউডো-লেবেল

প্রথমে মডেলটি লক্ষ্য চিত্রগুলিতে পূর্বাভাস দেয়। এই মোটামুটি মাস্কগুলোকে সিউডো-লেবেল বলা হয়। তবে সবগুলোকে বিশ্বাস করা যায় না: কিছু কনট্যুর ভুল বা সম্পূর্ণ ভুল হতে পারে। তাই ফ্রেমওয়ার্কটি একটি বিশেষ কনট্যুর কোয়ালিটি কন্ট্রোল মডিউল ব্যবহার করে, যা অবিশ্বস্ত মাস্কগুলো বাদ দেয়। অবশিষ্ট পরিষ্কার সিউডো-লেবেলগুলো প্রশিক্ষণে যায়। প্রক্রিয়াটি পুনরাবৃত্তিমূলকভাবে চলতে থাকে — প্রতিটি চক্রের সাথে লেবেলের মান বৃদ্ধি পায় এবং মডেলটি লক্ষ্য ডোমেইনে আরও ভালোভাবে খাপ খায়।

লক্ষ্য শৈলীতে সিন্থেটিক ডেটা

অতিরিক্তভাবে একটি সেগমেন্টেশন-নিয়ন্ত্রিত কন্ডিশনাল GAN ব্যবহার করা হয়, যা লক্ষ্য ডোমেইনের শৈলীতে সিন্থেটিক «চিত্র-মাস্ক» জোড়া তৈরি করে। এটি অগমেন্টেশনের মতো, তবে ডেটা এলোমেলো রূপান্তরের মাধ্যমে নয়, বরং নতুন ডোমেইনের শৈলীর জন্য বিশেষভাবে তৈরি করা হয়। স্টুডেন্ট মডেলটি তিনটি উৎসের মিশ্রণে প্রশিক্ষিত হয়: পরিষ্কার সিউডো-লেবেলযুক্ত লক্ষ্য চিত্র, কনসিস্টেন্সি রেগুলারাইজেশন সহ নয়জি সিউডো-লেবেল এবং উৎপন্ন সিন্থেটিক নমুনা। এই মিশ্রণ মডেলটিকে ত্রুটির প্রতি স্থিতিশীল করে তোলে এবং শব্দের উপর অতিরিক্ত প্রশিক্ষণ এড়াতে সাহায্য করে।

ফলাফল

পদ্ধতিটি আটটি ভাষার আল্ট্রাসাউন্ড ডেটাসেট থেকে তৈরি ১২টি «উৎস-লক্ষ্য» জোড়ায় পরীক্ষা করা হয়েছিল। সমস্ত পরীক্ষায় প্রস্তাবিত ফ্রেমওয়ার্কটি বেসলাইন পদ্ধতিগুলোকে ছাড়িয়ে গেছে, যার মধ্যে সীমিত ডেটাতে সাধারণ তত্ত্বাবধানে প্রশিক্ষণও রয়েছে। সেগমেন্টেশন ওভারল্যাপ এবং কনট্যুর নির্ভুলতা উভয়ই উন্নত হয়েছে। লেখকরা উপসংহারে পৌঁছেছেন যে সিউডো-লেবেল পরিমার্জন এবং লক্ষ্য ডোমেইন শৈলীতে সিন্থেটিক অগমেন্টেশন — মূল উপাদান, যা প্রায় কোনো লেবেল ছাড়াই অভিযোজন সম্ভব করে।

এই পদ্ধতিটি একটি ব্যবহারিক পথ খুলে দেয়: একটি ছোট ডেটাসেটে মডেলটিকে একবার প্রশিক্ষণ দেওয়া যথেষ্ট, তারপর ধীরে ধীরে এটিকে নতুন পরিস্থিতিতে অভিযোজিত করা যায় — নতুন সেন্সর, সেন্সরের ভিন্ন অবস্থান বা ভিন্ন রোগীর জনসংখ্যা — শ্রমসাধ্য ম্যানুয়াল লেবেলিং ছাড়াই।

সাধারণ প্রশ্নোত্তর

বিভিন্ন উপাদান

সব উপাদান
কীভাবে আল্ট্রাসাউন্ডে ভাষা সেগমেন্টেশন শেখানো যায়, যখন লেবেলযুক্ত ডেটা প্রায় নেই