Почему стандартные деидентификаторы пропускают «местные» данные
Системы автоматической деидентификации медицинских записей обычно хорошо справляются с типовыми типами защищённой информации: имена, даты рождения, номера страховок. Но в реальной больнице встречаются данные, которые чувствительны только внутри этой организации. Это сокращённые названия клиник, имена корпусов, внутренние коды отделений. Для человека такие строки однозначно говорят о месте лечения, но универсальный алгоритм не может знать все локальные обозначения.
Традиционные решения либо опираются на словари, либо на обученные модели с фиксированными категориями. И те и другие пропускают то, что не входит в их справочники. Исследователи называют это «институционально локализованной» PHI, и именно здесь возникают серьёзные риски утечки.
Как LLM удаётся закрыть разрыв
Чтобы проверить, способны ли большие языковые модели с in-context learning решить эту проблему, авторы эксперимента взяли 100 размеченных заметок детской онкологии — всего более пяти тысяч фрагментов PHI, — а затем сравнили восемь LLM с двумя специализированными системами (Stanford TiDE и OpenMed PII) и двумя паттерн-бейзлайнами.

Результат оказался в пользу LLM: лучшая модель достигла F1 = 0,918 ± 0,001, тогда как лучшая специализированная система TiDE показала только 0,779. Особенно заметным было преимущество на контекстуально зависимых категориях — тех самых локальных обозначениях, которые обычно выпадают из поля зрения алгоритмов.
Три уровня промптов: от HIPAA к точной настройке
Ключевой приём — не просто запрос, а целенаправленная настройка промпта под конкретное учреждение. В эксперименте использовали три варианта:
- Базовый промпт — общая инструкция по стандарту HIPAA.
- Промпт с локальными категориями — добавляется перечень институциональных типов PHI, которые стандарт не учитывает.
- Промпт с защитой от избыточного редактирования — дополнительное указание не вырезать лишний клинический контент.
Перечисление пропущенных категорий восстановило 79% из 61 ранее не найденных фрагмента (48 штук). А инструкция против избыточного редактирования вернула точность, которая страдала из-за «перестраховки» модели.

Агенты и ансамбли не дали выигрыша
Можно предположить, что ещё лучший результат даст запуск нескольких моделей или мультиагентная схема. Авторы проверили 14 таких конфигураций и сравнили их с лучшим одиночным промптом. Оказалось, что ни одна агентная архитектура не превзошла просто однопроходный калиброванный промптинг. У агентов F1 держался в диапазоне 0,906–0,907 — то есть практически на том же уровне, но без дополнительного выигрыша.
LLM как аудитор разметки
Отдельная ценность LLM-подхода в том, что он помогает проверить качество самого эталонного набора. Модели указали на 414 мест, где исходная разметка, скорее всего, была неполной. После ручной проверки подтвердились 227 пропущенных PHI-спанов. Когда разметку исправили и перезапустили промптинг, полнота выросла до 0,981 при F1 = 0,907 ± 0,002. Это значит, что LLM может выступать не только как инструмент деидентификации, но и как аудитор для создания более точных обучающих выборок.
Выводы
Хорошо настроенный промпт позволяет LLM закрыть институциональный разрыв PHI и найти оптимальный баланс точности и полноты за один вызов к модели. Такой способ дороже традиционных словарных методов, но эти затраты частично окупаются возможностью проверить и улучшить сам эталон.
Авторы считают LLM легитимной адаптируемой альтернативой специализированным деидентификаторам. Главная стратегия внедрения — разработка институционально-специфичных промптов, учитывающих локальные реалии каждой клиники.



