FARCA: обучение с подкреплением, где фактам доверяют не одинаково, а по степени надёжности

19 сентября 202616 просмотров

Исследователи из Китая предложили способ борьбы с галлюцинациями при RL-обучении языковых моделей: вместо усреднения сигналов проверки фактов по всему ответу они привязывают их к отдельным токенам и снабжают весами надёжности. Веса вычисляются через контрфактическую атрибуцию — насколько суждение зависит от ключевой подсказки; по данным авторов, такой подход повышает фактичность без потери общих навыков рассуждения.

FARCA: обучение с подкреплением, где фактам доверяют не одинаково, а по степени надёжности

Проверяемая награда и её слепая зона

Обучение с подкреплением на основе проверяемых вознаграждений стало привычным рецептом для языковых моделей: есть задача с однозначно проверяемым ответом — математика, код, вопросы с коротким ответом — и есть сигнал «решил / не решил». Схема работает, но у неё есть известная слабость. Итоговая награда оценивает результат целиком, а не путь к нему. Модель может получить балл за верный вывод, построенный на выдуманных посылках, и точно так же потерять балл за корректное рассуждение с неудачной финальной формулировкой.

Именно здесь и живёт риск галлюцинаций. Если награда зависит только от финального совпадения, у политики нет стимула быть аккуратной по дороге — достаточно угадать ответ. Один из способов это исправить — добавить фактический контроль на уровне процесса: проверять промежуточные утверждения, а не только итог.

Но у process-level подхода обнаруживается собственная проблема. Проверки фактов собираются и усредняются укрупнённо: сигнал приходит пачкой на весь фрагмент, а достоверность самих проверок никто не оценивает. В результате между тем, что реально проверили, и тем, что реально обновили в политике, возникает зазор.

Две неоднозначности вместо одной проблемы

Авторы работы arXiv:2608.24350 (Qiming Xie, Wenjie Zheng, Xiangqing Shen, Rui Xia) дают этому зазору имя — «шумное фактическое присвоение кредита» (noisy factual credit assignment) — и раскладывают его на два независимых аспекта.

  • Неоднозначность локализации кредита. Непонятно, какому именно токену или фрагменту приписывать заслугу или вину. Факт проверили на уровне предложения, а обновление идёт на уровне токена — гранулярности не совпадают, и сигнал размазывается.
  • Неоднозначность достоверности кредита. Непонятно, насколько самой проверке можно верить. Одни фактические суждения надёжны и воспроизводимы, другие — шаткие, зависят от контекста или от конкретной формулировки. Без веса доверия они входят в обучение на равных правах.

Второй аспект — самый недооценённый. Обычные схемы обращения с фактическими сигналами ведут себя так, будто все проверки одинаково качественные. На практике это не так, и слабые проверки начинают портить оптимизацию наравне с сильными.

Как устроен FARCA

FARCA расшифровывается как Fact-Aligned Reliability-Aware Credit Assignment — присвоение кредита с опорой на факты и с учётом их надёжности. Это не новая модель и не датасет, а фреймворк оптимизации политики: он перестраивает то, как фактический контроль превращается в обучающий сигнал.

Согласовать гранулярности

Первый шаг — мелкозернистая локализация кредита. Идея простая по формулировке и нетривиальная по реализации: гранулярность проверки фактов нужно привести в соответствие с гранулярностью обновлений политики. Тогда фактический сигнал приходит не «на весь ответ средним числом», а привязывается к конкретным токенам, которые действительно за это утверждение отвечают. Вместо размытого усреднения политика получает точечные указания.

Оценить, насколько проверке можно верить

Второй шаг — веса достоверности. Для их вычисления авторы вводят контрафактуальную атрибуцию свидетельств (counterfactual evidence attribution): смотрят, насколько фактическое суждение зависит от ключевого фрагмента-свидетельства. Если убрать или заменить это свидетельство и вердикт меняется — значит, проверка действительно на него опирается, и такой сигнал заслуживает большего доверия. Если вердикт остаётся прежним независимо от свидетельства, суждение, скорее всего, не о том, о чём мы думаем, — и его вес падает.

Полученные веса дальше модулируют фактические вознаграждения и локальные преимущества политики. Практический смысл: потенциально недостоверные сигналы получают меньший голос при обновлении, а не блокируются полностью. Это мягкая фильтрация вместо жёсткого отсева — политика не теряет информацию, но перестаёт слепо ей следовать.

Что показывают эксперименты

Авторы проверяли подход на разных моделях и нескольких бенчмарках, оценивающих фактическое рассуждение. Заявленный результат — заметный рост фактичности при сохранении общих способностей к рассуждению. Последняя часть здесь не менее важна первой: улучшения в фактичности часто покупаются ценой деградации других навыков, когда модель становится осторожнее и одновременно слабее. Здесь этого, по данным авторов, не происходит.

Отдельно стоит отметить, что метод остаётся в парадигме RL с проверяемыми наградами — он не требует отказываться от существующего пайплайна и не заменяет его чем-то принципиально другим. Он встраивается как слой между проверкой фактов и обновлением политики.

Что из этого следует

Главная мысль работы шире одной архитектуры. Разговор о фактичности моделей обычно идёт в логике «проверять или не проверять». Но когда проверки уже есть, ключевой вопрос смещается: как именно их результат превращается в обучение. Ошибка на этом стыке не выглядит как ошибка, она выглядит как обычный шум обучения — и потому легко остаётся незамеченной.

Признание того, что источникам доверяют не одинаково, кажется почти тривиальным на уровне здравого смысла. Но в схемах обучения с подкреплением это до сих пор редкость: сигналы складываются в общий котёл, и разница между надёжным свидетельством и случайной догадкой стирается. FARCA — попытка вернуть эту разницу в формулу. Насколько подход окажется переносимым за пределы задач с проверяемым ответом, где факт нельзя так просто подтвердить или опровергнуть, — открытый вопрос, и он же самое интересное направление для следующих работ.

Часто задаваемые вопросы

Похожие материалы

Все материалы
FARCA: обучение с подкреплением и надёжность фактов