超声图像中的语言分割对于分析发音和诊断言语障碍至关重要,但收集并标注这些数据十分困难:需要专家参与,而且不同设备采集的图像差异很大。当标注数据几乎不存在时,标准神经网络训练无法奏效:模型会记住特定数据源的特征,无法泛化到新场景。

为什么这很困难
问题不仅在于标注数量少。舌部超声数据由不同传感器、以不同设置、在不同人群身上采集,因此每个新数据集的图像分布都各不相同。这被称为域偏移(domain shift)。如果在一个数据集上训练模型,再应用到另一个数据集,分割质量会急剧下降。经典的适配方法需要访问源域的标注数据,但在实际任务中,往往只有预训练模型和新域的未标注图像。
核心思路:无源域适配(source-free adaptation)
近期研究的作者提出了一种框架,能够在完全没有标注数据、也无法访问原始图像的情况下,将模型适配到新域。该框架以轻量级骨干网络 UltraUNet 为基础,该网络仅用五张标注图像进行预训练。这是一个刻意设置的薄弱起点——它模拟了因数据不足而导致模型欠拟合的情况。随后进行目标域适配,而目标域中完全没有标注样本。
带过滤的伪标签
首先,模型对目标图像进行预测。这些粗糙的掩码被称为伪标签。但不能全盘信任它们:部分轮廓可能不准确,甚至完全错误。因此,该框架使用一个专门的轮廓质量控制模块,用于筛除不可靠的掩码。剩余的干净伪标签进入训练流程。这个过程迭代进行——每经过一轮循环,标签质量都会提升,模型也能更好地适应目标域。

目标风格合成数据
此外,框架还使用了一种分割引导的条件生成对抗网络(GAN),用于生成目标域风格的合成“图像-掩码”对。这类似于数据增强,但数据并非通过随机变换生成,而是专门针对新域的风格进行生成。学生模型在三种数据源的混合上进行训练:干净的伪标注目标图像、带一致性正则化的噪声伪标签,以及生成的合成样本。这种混合方式使模型对错误具有鲁棒性,并帮助其避免在噪声上过拟合。
实验结果
该方法在由八个舌部超声数据集组成的12对“源域-目标域”组合上进行了验证。在所有实验中,所提出的框架均优于基线方法,包括在有限数据上进行常规监督学习的方法。分割重叠率(overlap)和轮廓精度均得到提升。作者得出结论:伪标签精炼和目标域风格的合成增强是实现几乎无需标注即可适配的关键组件。
这种方法开辟了一条实用路径:只需在小型数据集上训练一次模型,然后逐步将其适配到新条件——新传感器、不同的传感器位置或不同的患者群体——而无需繁重的人工标注。



