为什么标准去标识符会漏掉“本地”数据
医疗记录自动去标识系统通常能很好地处理典型类型的受保护信息:姓名、出生日期、保险号码。但在真实的医院中,会遇到仅在该机构内部敏感的数据。这些数据包括诊所的缩写名称、楼宇名称、内部科室代码。对人来说,这些字符串明确指向治疗地点,但通用算法无法知晓所有本地标识。
传统解决方案要么依赖词典,要么依赖具有固定类别的训练模型。两者都会漏掉其参考表中未包含的内容。研究人员称之为“机构本地化”的PHI,而正是在这里出现了严重的数据泄露风险。
LLM如何弥合这一差距
为了验证具备上下文学习能力的大语言模型能否解决这一问题,实验作者选取了100条已标注的儿童肿瘤学笔记——共超过五千个PHI片段——然后将八种LLM与两种专用系统(Stanford TiDE和OpenMed PII)以及两种基于模式的基线进行了比较。

结果对LLM有利:最佳模型达到了F1 = 0.918 ± 0.001,而最佳专用系统TiDE仅达到0.779。在依赖上下文的类别上优势尤为明显——正是那些通常超出算法视野的本地标识。
三级提示词:从HIPAA到精细调优
关键技巧不是简单的请求,而是针对特定机构进行有目的的提示词调优。实验中使用了三种变体:
- 基础提示词 — 按HIPAA标准给出通用指令。
- 带本地类别的提示词 — 添加标准未涵盖的机构PHI类型清单。
- 防过度编辑提示词 — 额外指示不要删除多余的临床内容。
列出被遗漏的类别恢复了此前未找到的61个片段中的79%(48个)。而防过度编辑指令则恢复了因模型“过度谨慎”而受损的精确率。

代理和集成未带来增益
可以推测,运行多个模型或多代理方案会产生更好的结果。作者测试了14种此类配置,并将其与最佳单次提示词进行了比较。结果表明,没有任何代理架构能超越简单的单次校准提示。代理的F1保持在0.906–0.907范围内——即几乎处于同一水平,但没有额外增益。
LLM作为标注审计器
LLM方法的另一价值在于它有助于检验参考集本身的质量。模型指出了414处原始标注可能不完整的位置。经人工核查,确认了227个被遗漏的PHI跨度。当标注被修正并重新运行提示后,召回率提升至0.981,F1 = 0.907 ± 0.002。这意味着LLM不仅可以作为去标识工具,还可以作为审计器,用于创建更精确的训练样本。
结论
经过良好调优的提示词使LLM能够弥合机构PHI差距,并在单次模型调用中找到精确率与召回率的最佳平衡。这种方式比传统词典方法成本更高,但这些成本可部分通过验证和改进参考集的能力得到补偿。
作者认为LLM是专用去标识器的合法且可适配的替代方案。主要落地策略是开发机构特定的提示词,充分考虑每家诊所的本地实际情况。



