Учим модели говорить «не знаю»: метод дообучения, учитывающий уровень знаний LLM

13 сентября 20260 просмотров

Авторы предлагают подход, который при дообучении оценивает глубину знаний модели по каждому примеру и подстраивает обучающий сигнал под эту оценку. В результате модель охотнее и точнее сообщает о нехватке информации, почти не теряя в точности на вопросах, где она компетентна.

Учим модели говорить «не знаю»: метод дообучения, учитывающий уровень знаний LLM

Почему модели уверенно врут

Современные большие языковые модели впечатляют умением отвечать на самые разные вопросы. Но за этой уверенностью часто скрывается серьёзный дефект: модель может выдать красивый и связный ответ на основе выдуманных фактов. Одна из ключевых причин — так называемое рассогласование знаний: на этапе предобучения модель впитывает огромные массивы данных, а на этапе дообучения под конкретные задачи её «прошивают» новыми инструкциями. В результате модель не всегда понимает, где заканчивается то, что она действительно знает, и начинается область незнания.

Исследователи из команды Joosung Lee и коллег предложили подход, который помогает моделям честно говорить «я не знаю», когда ответ действительно выходит за пределы их компетенции. Работа была принята как Findings of EMNLP 2026 и выложена на arXiv.

Оценка знаний на уровне конкретного примера

Главная сложность — понять, знает ли модель ответ на конкретный вопрос, а не на «тему» в целом. Модель может отлично разбираться в одной области и совершенно не ориентироваться в соседней. Поэтому авторы предлагают оценивать знание индивидуально для каждого запроса.

Для этого используется мультисэмплинговый инференс: модель несколько раз запрашивают с одним и тем же вопросом, а затем анализируют, насколько стабильны и согласованы её ответы. Если ответы воспроизводятся с высокой степенью уверенности и совпадают между собой — модель, скорее всего, действительно «знает» тему. Если ответы хаотично меняются или модель даёт разные версии — это сигнал, что знания нет.

Такой подход даёт более надёжный и мелкозернистый показатель, чем обычная уверенность модели в одной генерации. Он становится основой для дальнейшего обучения.

Дообучение с учётом того, что модель уже знает

Полученный показатель знания используется не как внешняя оценка, а как управляющий сигнал для дообучения. Идея в том, что модель нужно учить по-разному на разных примерах:

  • Если модель знает ответ — обучающий сигнал усиливается, чтобы закрепить правильное поведение и не потерять уже имеющиеся навыки.
  • Если модель не знает ответа — сигнал масштабируется иначе, а модель дополнительно поощряют давать явный ответ «я не знаю», вместо того чтобы генерировать случайный или полуправдоподобный текст.

Такой подход помогает избежать ситуации, когда дообучение на новых данных «перетирает» границы знаний модели и заставляет её отвечать на всё подряд, включая то, в чём она не разбирается. Вместо этого модель учится распознавать запросы, которые выходят за область её компетенции, и честно сообщать об этом.

Как измерить, что модель стала честнее

Просто снизить количество галлюцинаций недостаточно — важно, чтобы модель не начала массово отказываться отвечать на вопросы, которые она на самом деле знает. Поэтому исследователи предложили специальные метрики для оценки неопределённости. Они оценивают не только точность на вопросах «из базы знаний», но и способность модели отличать известные примеры от неизвестных.

Ключевой результат experiments: предложенный метод позволяет модели явно выражать неуверенность, когда знаний не хватает, и при этом не терять точность на вопросах, на которые она может ответить. Точное различение известного и неизвестного стабильно улучшает итоговую производительность — то есть модель становится аккуратнее и надёжнее.

Итог

Умение говорить «я не знаю» — это не слабость, а необходимая часть безопасного применения LLM. Метод knowledge-weighted fine-tuning напоминает: чтобы бороться с галлюцинациями, не обязательно «зубрить» ещё больше фактов. Достаточно научить модель честно оценивать собственные границы и не выходить за них. Такой подход делает модели полезнее в реальных сценариях, где лучше получить честный отказ, чем уверенную дезинформацию.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Метод дообучения LLM: как научить модель говорить «не знаю»