Как обучить сегментацию языка на УЗИ, когда размеченных данных почти нет

5 сентября 202612 просмотров

Исследователи предложили метод адаптации модели к новому набору УЗИ-снимков без доступа к исходным данным: он сочетает уточнение псевдо-разметки, контроль качества контуров и синтетическую генерацию изображений в стиле целевого домена. Подход заметно повышает точность сегментации даже при старте всего с пяти размеченных кадров.

Как обучить сегментацию языка на УЗИ, когда размеченных данных почти нет

Сегментация языка на ультразвуковых изображениях нужна для анализа артикуляции и диагностики нарушений речи, но собрать и размеченные данные сложно: нужны эксперты, а сами снимки сильно отличаются от аппарата к аппарату. Когда размеченного материала почти нет, стандартное обучение нейросети не работает: модель запоминает особенности конкретного источника и не обобщается на новые условия.

Почему это сложно

Проблема не только в малом количестве аннотаций. Данные УЗИ языка собирают разными датчиками, с разными настройками и у разных людей, поэтому распределение изображений в каждом новом наборе своё. Это называется domain shift. Если обучить модель на одном наборе, а применить к другому, качество сегментации резко падает. Классические методы адаптации требуют доступа к размеченным данным исходного домена, но в реальной задаче часто есть только предобученная модель и неразмеченные снимки нового домена.

Идея: source-free адаптация

Авторы недавнего исследования предлагают фреймворк, который адаптирует модель к новому домену вообще без размеченных данных и без доступа к исходным изображениям. За основу берут лёгкий бэкбон UltraUNet, предобученный всего на пяти размеченных снимках. Это намеренно слабая стартовая точка — она имитирует ситуацию, когда модель недообучена из-за нехватки данных. Дальше происходит адаптация к целевому домену, где размеченных примеров нет совсем.

Псевдо-метки с фильтрацией

Сначала модель делает предсказания на целевых изображениях. Эти грубые маски называют псевдо-метками. Но доверять им всем нельзя: часть контуров будет неточной или вообще ошибочной. Поэтому фреймворк использует специальный контурный модуль контроля качества, который отсеивает ненадёжные маски. Оставшиеся чистые псевдо-метки идут в обучение. Процесс повторяется итеративно — с каждым циклом качество меток растёт, а модель лучше приспосабливается к целевому домену.

Синтетические данные в целевом стиле

Дополнительно используется сегментационно-управляемая условная GAN, которая генерирует синтетические пары «изображение-маска» в стиле целевого домена. Это похоже на аугментацию, только данные создаются не случайными трансформациями, а специально под стиль нового домена. Студенческая модель обучается на смеси трёх источников: чистых псевдо-размеченных целевых изображений, зашумлённых псевдо-меток с регуляризацией согласованности и сгенерированных синтетических образцов. Такой микс делает модель устойчивой к ошибкам и помогает ей не переобучаться на шуме.

Результаты

Метод проверили на 12 парах «источник-цель», составленных из восьми датасетов УЗИ языка. Во всех экспериментах предложенный фреймворк превосходил базовые подходы, включая обычное обучение с учителем на ограниченных данных. Улучшались и перекрытие сегментации (overlap), и точность контура. Авторы делают вывод, что уточнение псевдо-меток и синтетическая аугментация в стиле целевого домена — ключевые компоненты, которые позволяют адаптироваться почти без разметки.

Такой подход открывает практический путь: достаточно один раз обучить модель на маленьком наборе, а затем постепенно адаптировать её к новым условиям — новому датчику, другому положению датчика или иному контингенту пациентов — без трудоёмкой ручной разметки.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Сегментация языка на УЗИ: обучение без размеченных данных