Агентный глубокий поиск в медицине: система ICD-Deepresearch прогнозирует будущие коды МКБ

31 августа 202610 просмотров

Новый подход объединяет фундаментальные модели на базе ЭМК и языковые модели с медицинским поиском, чтобы заранее определять диагностические коды следующего визита. На наборах MIMIC-III и MIMIC-IV система превзошла локальные компараторы, а врачи оценили её доказательства как заметно более полезные, чем результаты самостоятельного поиска GPT-5.

Агентный глубокий поиск в медицине: система ICD-Deepresearch прогнозирует будущие коды МКБ

Когда врач готовится к приёму, ему полезно заранее понимать, с чем, скорее всего, придёт пациент. Именно такую задачу решают системы прогнозирования диагнозов: по истории прошлых обращений они предсказывают коды МКБ, которые могут появиться в карте на следующем визите. Один из свежих подходов — агентный глубокий поиск, где разные модели работают в едином исследовательском конвейере.

Что за задача?

Речь идёт о проспективном мультилейбловом прогнозировании. Система не классифицирует уже существующую заметку: будущая запись ещё не создана, поэтому модель должна опираться только на продольную историю пациента. При этом правильных кодов может быть несколько, и они могут относиться как к хроническим, так и к новым состояниям.

Классические решения здесь обычно делятся на два типа. Структурированные фундаментальные модели, обученные на электронных медкартах, хорошо улавливают повторяемость обращений и временную динамику болезней. Языковые модели, наоборот, сильны в построении гибких гипотез, близких к клиническому рассуждению. Но по отдельности они теряют часть информации.

В препринте на arXiv (2608.17075) описана система ICD-Deepresearch, которая пытается соединить оба подхода. Это агентный воркфлоу: предсказательные модели работают вместе с медицинским поиском и словарями кодов, а итоговый ответ формируется с учётом внешних клинических связей. Глубокий поиск здесь — не выдача ссылок, а многошаговое исследование: система сама решает, какие источники проверить и как сопоставить их с историей пациента.

Как устроен прогноз

Ни один источник данных не содержит «будущего набора» кодов, поэтому система заранее работает в рамках бюджета top-K. Она оценивает возможные переходы от текущего состояния пациента к будущим диагнозам, используя три источника сигнала: саму историю болезни, внешние клинические ассоциации и точную семантику кодов МКБ.

Генерация кандидатов

Первый контур запускает модель SparseEHR. Она формирует EHR-приор — распределение вероятностей по кодам, основанное на прошлых визитах. Этот приор становится отправной точкой для двух ограниченных раундов research expansion: система целенаправленно ищет дополнительные клинические связи во внешних источниках, не превращая поиск в бесконечный перебор.

Параллельно работает независимый путь — прямое прогнозирование с помощью GPT-5. Он даёт собственный набор кандидатов, который не зависит от sparse-модели. За счёт этого два метода компенсируют слабые места друг друга: один опирается на формализованную статистику, другой — на языковое понимание симптомов.

Финальный отбор

Собранные кандидаты проходят валидацию: система удаляет дубликаты, проверяет соответствие словарю ICD и совместно ранжирует оба источника. Отдельный модуль затем составляет текстовые обоснования, объясняющие, почему тот или иной код попал в список. Важно, что этот модуль не влияет на сами предсказания — он лишь делает результат более прозрачным для врача.

Что показали эксперименты

Эффективность оценивали на данных интенсивной терапии MIMIC-III и MIMIC-IV. Так как корректных кодов может быть несколько, метрики считали в среднем по пациентам: это ближе к реальной клинической практике, чем обычный точный подсчёт по всем предсказаниям.

  • На MIMIC-III точность составила 24.60%, полнота — 35.09%.
  • На MIMIC-IV — 25.14% и 48.32% соответственно.

Полнота на MIMIC-IV заметно выше: система чаще находит действительно нужные коды, даже если не избегает лишних.

Отдельно врачи оценивали полезность документов, которые система извлекает для подтверждения прогноза. Здесь результат ICD-Deepresearch заметно опережает самостоятельные инструменты: полезными оказались 51% и 68% документов против 22% и 39% у автономного веб-поиска на базе GPT-5 и 32% и 41% у Medical Deep Research.

Почему это важно

Главный вывод исследования — продуктивна не конкуренция, а сотрудничество моделей. ICD-Deepresearch показывает, что структурированная медицинская статистика и языковой агентный поиск могут работать в одной цепочке: словарь МКБ задаёт рамку, внешние источники добавляют контекст, а обоснования помогают врачу проверить ход рассуждений.

Для практики это означает более раннее и объяснимое предсказание диагнозов. Система не заменяет клиническое решение, но уменьшает риск упустить важное состояние на приёме. А значит, в будущем такие инструменты могут стать частью цифрового помощника врача — от планирования ресурсов до страховых процессов.

Часто задаваемые вопросы

Похожие материалы

Все материалы
ICD-Deepresearch: агентный поиск для прогноза кодов МКБ