যখন একজন চিকিৎসক রোগী দেখার জন্য প্রস্তুত হন, তখন আগে থেকে বোঝা তার জন্য উপকারী যে রোগী সম্ভবত কী নিয়ে আসবেন। রোগ নির্ণয়ের পূর্বাভাস ব্যবস্থা ঠিক এই কাজটিই সমাধান করে: অতীতের ভিজিটের ইতিহাসের ভিত্তিতে তারা ICD কোডগুলির পূর্বাভাস দেয় যা পরবর্তী ভিজিটে কার্ডে আসতে পারে। সাম্প্রতিক পদ্ধতিগুলির মধ্যে একটি হল এজেন্ট-ভিত্তিক ডিপ সার্চ, যেখানে বিভিন্ন মডেল একটি একক গবেষণা পাইপলাইনে একসাথে কাজ করে।
কী কী কাজ?
এখানে речь идет о проспективном мультилейбловом прогнозировании. Система не классифицирует уже существующую заметку: будущая запись ещё не создана, поэтому модель должна опираться только на продольную историю пациента. При этом правильных кодов может быть несколько, и они могут относиться как к хроническим, так и к новым состояниям.
Классические решения здесь обычно делятся на два типа. Структурированные фундаментальные модели, обученные на электронных медкартах, хорошо улавливают повторяемость обращений и временную динамику болезней. Языковые модели, наоборот, сильны в построении гибких гипотез, близких к клиническому рассуждению. Но по отдельности они теряют часть информации.
В препринте на arXiv (2608.17075) описана система ICD-Deepresearch, которая пытается соединить оба подхода. Это агентный воркфлоу: предсказательные модели работают вместе с медицинским поиском и словарями кодов, а итоговый ответ формируется с учётом внешних клинических связей. Глубокий поиск здесь — не выдача ссылок, а многошаговое исследование: система сама решает, какие источники проверить и как сопоставить их с историей пациента.

Как устроен прогноз
Ни один источник данных не содержит «будущего набора» кодов, поэтому система заранее работает в рамках бюджета top-K. Она оценивает возможные переходы от текущего состояния пациента к будущим диагнозам, используя три источника сигнала: саму историю болезни, внешние клинические ассоциации и точную семантику кодов МКБ.
Генерация кандидатов
Первый контур запускает модель SparseEHR. Она формирует EHR-приор — распределение вероятностей по кодам, основанное на прошлых визитах. Этот приор становится отправной точкой для двух ограниченных раундов research expansion: система целенаправленно ищет дополнительные клинические связи во внешних источниках, не превращая поиск в бесконечный перебор.
Параллельно работает независимый путь — прямое прогнозирование с помощью GPT-5. Он даёт собственный набор кандидатов, который не зависит от sparse-модели. За счёт этого два метода компенсируют слабые места друг друга: один опирается на формализованную статистику, другой — на языковое понимание симптомов.
Финальный отбор
Собранные кандидаты проходят валидацию: система удаляет дубликаты, проверяет соответствие словарю ICD и совместно ранжирует оба источника. Отдельный модуль затем составляет текстовые обоснования, объясняющие, почему тот или иной код попал в список. Важно, что этот модуль не влияет на сами предсказания — он лишь делает результат более прозрачным для врача.
Что показали эксперименты
Эффективность оценивали на данных интенсивной терапии MIMIC-III и MIMIC-IV. Так как корректных кодов может быть несколько, метрики считали в среднем по пациентам: это ближе к реальной клинической практике, чем обычный точный подсчёт по всем предсказаниям.
- На MIMIC-III точность составила 24.60%, полнота — 35.09%.
- На MIMIC-IV — 25.14% и 48.32% соответственно.
Полнота на MIMIC-IV заметно выше: система чаще находит действительно нужные коды, даже если не избегает лишних.
Отдельно врачи оценивали полезность документов, которые система извлекает для подтверждения прогноза. Здесь результат ICD-Deepresearch заметно опережает самостоятельные инструменты: полезными оказались 51% и 68% документов против 22% и 39% у автономного веб-поиска на базе GPT-5 и 32% и 41% у Medical Deep Research.

Почему это важно
Главный вывод исследования — продуктивна не конкуренция, а сотрудничество моделей. ICD-Deepresearch показывает, что структурированная медицинская статистика и языковой агентный поиск могут работать в одной цепочке: словарь МКБ задаёт рамку, внешние источники добавляют контекст, а обоснования помогают врачу проверить ход рассуждений.
Для практики это означает более раннее и объяснимое предсказание диагнозов. Система не заменяет клиническое решение, но уменьшает риск упустить важное состояние на приёме. А значит, в будущем такие инструменты могут стать частью цифрового помощника врача — от планирования ресурсов до страховых процессов.




