基于智能体的医学深度研究:ICD-Deepresearch系统预测未来ICD编码

31 八月 202610 视图

一种新方法将基于电子病历的基础模型与医学检索的语言模型相结合,以提前预测下次就诊的诊断代码。在MIMIC-III和MIMIC-IV数据集上,该系统超越了本地对照模型,医生评价其提供的证据明显比GPT-5独立检索的结果更有用。

基于智能体的医学深度研究:ICD-Deepresearch系统预测未来ICD编码

当医生准备接诊时,提前了解患者可能带来什么问题会很有帮助。这正是诊断预测系统要解决的任务:根据既往就诊历史,预测下一次就诊时病历中可能出现的ICD编码。一种较新的方法是智能体深度搜索,其中不同模型在统一的研究流程中协同工作。

这是什么任务?

这里讨论的是前瞻性多标签预测。系统不是对已有记录进行分类:未来的记录尚未生成,因此模型只能依赖患者的纵向病史。同时,正确编码可能有多个,既可能涉及慢性病,也可能涉及新发状况。

经典解决方案通常分为两类。基于结构化电子病历训练的基础模型擅长捕捉就诊的重复性和疾病的时间动态。语言模型则擅长构建灵活的假设,接近临床推理。但单独使用都会丢失部分信息。

arXiv预印本(2608.17075)中描述了一个名为 ICD-Deepresearch 的系统,试图将两种方法结合起来。这是一个智能体工作流:预测模型与医学搜索和编码词典协同工作,最终答案结合外部临床关联生成。这里的深度搜索不是输出链接,而是多步骤研究:系统自行决定检查哪些来源以及如何将其与患者病史匹配。

预测如何运作

没有任何数据源包含“未来的编码集合”,因此系统预先在top-K预算内运作。它评估从患者当前状态到未来诊断的可能转移,使用三个信号来源:病史本身、外部临床关联以及ICD编码的精确语义。

候选生成

第一个环节运行 SparseEHR 模型。它生成EHR先验——基于既往就诊的编码概率分布。该先验成为两轮受限研究扩展的起点:系统有针对性地在外部来源中搜索额外的临床关联,而不会让搜索变成无限遍历。

同时运行一个独立路径——使用 GPT-5 的直接预测。它给出自己的候选集,不依赖稀疏模型。这样两种方法相互弥补弱点:一个依赖形式化统计,另一个依赖对症状的语言理解。

最终筛选

收集到的候选经过验证:系统去除重复项,检查是否符合ICD词典,并对两个来源进行联合排序。随后一个独立模块生成文本理由,解释某个编码为何进入列表。重要的是,该模块不影响预测本身——它只是让结果对医生更透明。

实验显示了什么

评估基于重症监护数据MIMIC-III和MIMIC-IV。由于正确编码可能有多个,指标按患者平均计算:这比对所有预测进行简单精确计数更接近真实临床实践。

  • 在MIMIC-III上,精确率为24.60%,召回率为35.09%。
  • 在MIMIC-IV上,分别为25.14%和48.32%。

MIMIC-IV上的召回率明显更高:系统更常找到真正需要的编码,即使无法避免多余项。

此外,医生单独评估了系统为支持预测而检索的文档的有用性。在此,ICD-Deepresearch 的结果明显优于独立工具:51%和68%的文档被认为有用,而基于GPT-5的自主网络搜索为22%和39%,Medical Deep Research 为32%和41%。

为什么这很重要

研究的主要结论是:模型之间的协作而非竞争才是高效的。ICD-Deepresearch 表明,结构化医学统计和语言智能体搜索可以在同一链条中工作:ICD词典设定框架,外部来源补充上下文,理由帮助医生验证推理过程。

对实践而言,这意味着更早且可解释的诊断预测。系统不替代临床决策,但降低了接诊时遗漏重要状况的风险。因此,未来这类工具可能成为医生数字助手的一部分——从资源规划到保险流程。

常问问题

基于智能体的医学深度研究:ICD-Deepresearch系统预测未来ICD编码