ClinicalGPT-R1: новая LLM для диагностики обходит GPT-4o на китайских клинических задачах

11 сентября 20262 просмотров

Исследователи представили универсальную медицинскую языковую модель, обученную на 20 000 реальных клинических записей. В бенчмарке MedBench-Hard она показала результаты выше GPT-4o по-китайски и сравнимые с GPT-4 — в англоязычных сценариях.

ClinicalGPT-R1: новая LLM для диагностики обходит GPT-4o на китайских клинических задачах

Что анонсировано

Группа исследователей представила модель ClinicalGPT-R1 — большую языковую модель, которая нацелена не просто на разговор с пациентом, а на полноценную диагностическую рассуждалку. Это попытка сделать универсального «цифрового ассистента врача», способного работать с разными заболеваниями, а не только с одним узким направлением.

Работа появилась на arXiv в апреле 2025 года, и с тех пор авторы выпустили несколько обновлений: актуальной считается третья версия. В статье — восемь страниц и шесть иллюстраций, а материалы и данные выложены в открытый доступ. Для научной ссылки указан DOI, так что работу удобно цитировать.

Чем новая модель отличается от обычных медицинских чат-ботов

В основе ClinicalGPT-R1 лежит обучающий набор из 20 тысяч реальных клинических записей. Это важный нюанс: модель видит не сухие примеры из учебников, а живую картину того, как выглядит настоящий приём — с неполными жалобами, разговорными формулировками и особенностями конкретной клинической практики.

Благодаря этому модель пытается выстраивать цепочку рассуждений: от первичных симптомов к вероятному диагнозу и далее к дифференциальной диагностике. Такой подход ближе к логике врача, чем простое сопоставление текста с готовым ответом.

Разработчики подчёркивают, что ClinicalGPT-R1 — не узкоспециализированный инструмент. Её тренировали как модель общего назначения, чтобы она могла ориентироваться в широком спектре медицинских ситуаций, а не только в одной области.

Как проверяли и с чем сравнивали

Для объективной оценки авторы собрали собственный бенчмарк MedBench-Hard. Он охватывает семь основных медицинских специальностей и репрезентативные заболевания, причём задачи подобраны так, чтобы их нельзя было решить простым запоминанием частых ответов.

Ключевые результаты выглядят обнадёживающе: в китайских диагностических сценариях ClinicalGPT-R1 обходит GPT-4o. На английском языке новинка показывает результат, сопоставимый с GPT-4. Для модели, которая обучалась в первую очередь на данных одного языка и одной клинической культуры, это сильный сигнал: качественно собранный локальный датасет может конкурировать с гигантами индустрии.

Почему это важно за пределами Китая

Для русскоязычного читателя новость интересна скорее как доказательство концепции. Медицинские данные на национальных языках — это ценный и пока не до конца освоенный ресурс. Если подход создателей ClinicalGPT-R1 воспроизводим, аналогичные модели вполне реально развивать и для других языков и систем здравоохранения.

Разумеется, это не значит, что диагностические модели готовы заменить врача. Скорее речь идёт об инструменте поддержки: он помогает не упустить неочевидный диагноз, структурировать рассуждение и быстрее обрабатывать большой объём информации. Но сам факт, что открытая исследовательская модель в состоянии обойти одну из сильнейших коммерческих систем на «домашнем» языке, заставляет внимательнее смотреть на потенциал специализированных моделей.

Часто задаваемые вопросы

Похожие материалы

Все материалы
ClinicalGPT-R1: обзор медицинской LLM для диагностики