Sistema de búsqueda profunda agéntica en medicina: ICD-Deepresearch predice futuros códigos CIE

31 agosto 202610 vistas

Un nuevo enfoque combina modelos fundamentales basados en EHR y modelos de lenguaje con búsqueda médica para predecir de antemano los códigos de diagnóstico de la próxima visita. En los conjuntos MIMIC-III y MIMIC-IV, el sistema superó a los comparadores locales, y los médicos evaluaron sus evidencias como notablemente más útiles que los resultados de la búsqueda independiente de GPT-5.

Sistema de búsqueda profunda agéntica en medicina: ICD-Deepresearch predice futuros códigos CIE

Cuando un médico se prepara para una consulta, le resulta útil comprender de antemano con qué probablemente llegará el paciente. Precisamente esa es la tarea que resuelven los sistemas de predicción de diagnósticos: a partir del historial de visitas anteriores, predicen los códigos CIE que podrían aparecer en la historia clínica en la siguiente consulta. Uno de los enfoques más recientes es la búsqueda profunda basada en agentes, donde diferentes modelos trabajan en un único pipeline de investigación.

¿Cuál es la tarea?

Se trata de la predicción prospectiva multietiqueta. El sistema no clasifica una nota ya existente: la futura entrada aún no se ha creado, por lo que el modelo debe basarse únicamente en el historial longitudinal del paciente. Además, puede haber varios códigos correctos, y pueden referirse tanto a enfermedades crónicas como a nuevas afecciones.

Las soluciones clásicas aquí suelen dividirse en dos tipos. Los modelos fundamentales estructurados, entrenados con historias clínicas electrónicas, captan bien la recurrencia de las visitas y la dinámica temporal de las enfermedades. Los modelos de lenguaje, en cambio, son fuertes a la hora de construir hipótesis flexibles, cercanas al razonamiento clínico. Pero por separado pierden parte de la información.

En el preprint de arXiv (2608.17075) se describe el sistema ICD-Deepresearch, que intenta combinar ambos enfoques. Se trata de un flujo de trabajo basado en agentes: los modelos predictivos trabajan junto con la búsqueda médica y los diccionarios de códigos, y la respuesta final se forma teniendo en cuenta las relaciones clínicas externas. La búsqueda profunda aquí no es una lista de enlaces, sino una investigación en varios pasos: el propio sistema decide qué fuentes consultar y cómo relacionarlas con el historial del paciente.

Cómo se realiza la predicción

Ninguna fuente de datos contiene el «conjunto futuro» de códigos, por lo que el sistema trabaja de antemano dentro del presupuesto top-K. Evalúa las posibles transiciones del estado actual del paciente a diagnósticos futuros, utilizando tres fuentes de señal: el propio historial clínico, las asociaciones clínicas externas y la semántica precisa de los códigos CIE.

Generación de candidatos

El primer circuito ejecuta el modelo SparseEHR. Este genera un prior EHR: una distribución de probabilidad sobre los códigos basada en visitas anteriores. Este prior se convierte en el punto de partida para dos rondas limitadas de expansión de investigación: el sistema busca de forma dirigida relaciones clínicas adicionales en fuentes externas, sin convertir la búsqueda en un proceso interminable.

En paralelo funciona una vía independiente: la predicción directa con GPT-5. Esta proporciona su propio conjunto de candidatos, que no depende del modelo sparse. Gracias a ello, los dos métodos compensan las debilidades del otro: uno se apoya en la estadística formalizada, el otro en la comprensión lingüística de los síntomas.

Selección final

Los candidatos recopilados pasan por una validación: el sistema elimina duplicados, verifica la concordancia con el diccionario CIE y clasifica conjuntamente ambas fuentes. Un módulo aparte elabora después justificaciones textuales que explican por qué un código concreto ha entrado en la lista. Es importante señalar que este módulo no influye en las predicciones en sí: solo hace que el resultado sea más transparente para el médico.

Qué mostraron los experimentos

La eficacia se evaluó con los datos de cuidados intensivos MIMIC-III y MIMIC-IV. Dado que puede haber varios códigos correctos, las métricas se calcularon como promedio por paciente: esto se acerca más a la práctica clínica real que el recuento exacto habitual sobre todas las predicciones.

  • En MIMIC-III, la precisión fue del 24.60% y la exhaustividad del 35.09%.
  • En MIMIC-IV, del 25.14% y 48.32%, respectivamente.

La exhaustividad en MIMIC-IV es notablemente mayor: el sistema encuentra con más frecuencia los códigos realmente necesarios, incluso si no evita los superfluos.

Por separado, los médicos evaluaron la utilidad de los documentos que el sistema extrae para confirmar la predicción. Aquí el resultado de ICD-Deepresearch supera claramente a las herramientas independientes: el 51% y el 68% de los documentos resultaron útiles, frente al 22% y el 39% de la búsqueda web autónoma basada en GPT-5 y al 32% y el 41% de Medical Deep Research.

Por qué es importante

La principal conclusión del estudio es que lo productivo no es la competencia, sino la colaboración entre modelos. ICD-Deepresearch demuestra que la estadística médica estructurada y la búsqueda lingüística basada en agentes pueden trabajar en una misma cadena: el diccionario CIE establece el marco, las fuentes externas aportan contexto y las justificaciones ayudan al médico a verificar el razonamiento.

Para la práctica, esto significa una predicción de diagnósticos más temprana y explicable. El sistema no sustituye la decisión clínica, pero reduce el riesgo de pasar por alto una afección importante durante la consulta. Y, por tanto, en el futuro estas herramientas podrían formar parte del asistente digital del médico, desde la planificación de recursos hasta los procesos de seguros.

Preguntas frecuentes

Material similar

Todos los materiales
Sistema de búsqueda profunda agéntica en medicina: ICD-Deepresearch predice futuros códigos CIE