Cómo entrenar la segmentación del lenguaje en ecografías cuando casi no hay datos etiquetados

5 septiembre 202612 vistas

Los investigadores propusieron un método para adaptar el modelo a un nuevo conjunto de imágenes de ultrasonido sin acceso a los datos originales: combina el refinamiento de pseudoetiquetas, el control de calidad de los contornos y la generación sintética de imágenes en el estilo del dominio objetivo. El enfoque mejora notablemente la precisión de la segmentación incluso al comenzar con solo cinco fotogramas etiquetados.

Cómo entrenar la segmentación del lenguaje en ecografías cuando casi no hay datos etiquetados

La segmentación del lenguaje en imágenes de ultrasonido es necesaria para analizar la articulación y diagnosticar trastornos del habla, pero reunir datos etiquetados es difícil: se necesitan expertos, y las propias imágenes varían mucho de un equipo a otro. Cuando hay muy poco material etiquetado, el entrenamiento estándar de una red neuronal no funciona: el modelo memoriza las características de una fuente concreta y no se generaliza a nuevas condiciones.

Por qué es difícil

El problema no es solo la escasez de anotaciones. Los datos de ultrasonido del lenguaje se recopilan con diferentes sensores, con distintos ajustes y en diferentes personas, por lo que la distribución de las imágenes en cada nuevo conjunto es propia. Esto se denomina domain shift. Si se entrena un modelo en un conjunto y se aplica a otro, la calidad de la segmentación cae drásticamente. Los métodos clásicos de adaptación requieren acceso a datos etiquetados del dominio de origen, pero en un problema real a menudo solo se dispone de un modelo preentrenado e imágenes sin etiquetar del nuevo dominio.

Idea: adaptación sin fuente (source-free)

Los autores de una investigación reciente proponen un marco que adapta el modelo a un nuevo dominio sin datos etiquetados y sin acceso a las imágenes originales. Como base se utiliza un backbone ligero, UltraUNet, preentrenado con solo cinco imágenes etiquetadas. Este es un punto de partida deliberadamente débil: simula una situación en la que el modelo está subentrenado por falta de datos. Luego se realiza la adaptación al dominio objetivo, donde no hay ejemplos etiquetados en absoluto.

Pseudoetiquetas con filtrado

Primero, el modelo hace predicciones sobre las imágenes objetivo. Estas máscaras aproximadas se denominan pseudoetiquetas. Pero no se puede confiar en todas: parte de los contornos será imprecisa o incluso errónea. Por eso, el marco utiliza un módulo especial de control de calidad de contornos que descarta las máscaras poco fiables. Las pseudoetiquetas limpias restantes se utilizan para el entrenamiento. El proceso se repite de forma iterativa: con cada ciclo, la calidad de las etiquetas mejora y el modelo se adapta mejor al dominio objetivo.

Datos sintéticos en el estilo objetivo

Además, se utiliza una GAN condicional guiada por segmentación que genera pares sintéticos «imagen-máscara» en el estilo del dominio objetivo. Esto es similar a la aumentación, pero los datos no se crean mediante transformaciones aleatorias, sino específicamente para el estilo del nuevo dominio. El modelo estudiante se entrena con una mezcla de tres fuentes: imágenes objetivo con pseudoetiquetas limpias, pseudoetiquetas ruidosas con regularización de consistencia y muestras sintéticas generadas. Esta mezcla hace que el modelo sea robusto a los errores y ayuda a evitar el sobreajuste al ruido.

Resultados

El método se probó en 12 pares «fuente-objetivo», compuestos a partir de ocho conjuntos de datos de ultrasonido del lenguaje. En todos los experimentos, el marco propuesto superó a los enfoques base, incluido el entrenamiento supervisado convencional con datos limitados. Mejoraron tanto la superposición de la segmentación (overlap) como la precisión del contorno. Los autores concluyen que el refinamiento de las pseudoetiquetas y la aumentación sintética en el estilo del dominio objetivo son componentes clave que permiten la adaptación casi sin etiquetado.

Este enfoque abre un camino práctico: basta con entrenar el modelo una vez en un conjunto pequeño y luego adaptarlo gradualmente a nuevas condiciones —un nuevo sensor, otra posición del sensor o una población de pacientes diferente— sin una tediosa anotación manual.

Preguntas frecuentes

Cómo entrenar la segmentación del lenguaje en ecografías cuando casi no hay datos etiquetados