Высокое согласие ещё не значит валидность: LLM-судью предлагают проверять на чувствительность к смысловым правкам

17 сентября 202615 просмотров

Исследователи из Гонконгского университета предлагают оценивать LLM-как-судью не только по стабильности вердиктов, но и по тому, замечает ли модель правки, реально меняющие смысл оцениваемого текста. В эксперименте с 7 судьями и 4 доменами вердикты почти не сдвигались от косметических изменений (S = 0.945), однако на смысловые интервенции реагировали слабо (R = 0.319), а часть публичных наборов меток воспроизводилась простыми поверхностными признаками.

Высокое согласие ещё не значит валидность: LLM-судью предлагают проверять на чувствительность к смысловым правкам

Ровно два числа обычно попадают в отчёт о качестве автоматической оценки: насколько вердикты модели совпадают с человеческими и насколько они устойчивы к мелким изменениям вроде перестановки вариантов или переформулировки промпта. Новая работа утверждает, что этого недостаточно — и предлагает смотреть на судью иначе.

Согласие отвечает не на тот вопрос

Согласие и устойчивость к поверхностным возмущениям — это про надёжность (reliability). Надёжный измерительный инструмент выдаёт стабильный результат, но стабильность сама по себе ничего не говорит о том, измеряет ли он нужную величину. Термометр, который всегда показывает 20 градусов, исключительно надёжен и совершенно бесполезен.

Авторы статьи «A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation» (Jianlin Chen, Wenhui Chen, Ziyao Lin, Chi Man Vong; arXiv:2608.24419, cs.AI, подана 25 августа 2026 года; 39 страниц, 10 рисунков, 11 таблиц) переносят разговор в плоскость конструктной валидности: соответствует ли оценка тому понятию, которое она якобы измеряет. Для LLM-судьи это значит простую вещь — судья должен реагировать на смысл, а не на форму.

Профиль из двух измерений

Вместо одной метрики предлагается профиль из двух вероятностей.

S — инвариантность. Как часто вердикт остаётся прежним, если правка сохраняет смысл: переставили абзацы, сменили стиль, убрали воду. Хороший судья здесь не должен дёргаться.

R — конструктная чувствительность. Как часто вердикт меняется, если правка минимальна, но смысл задет: добавили оговорку, ослабили утверждение, сузили область действия. Хороший судья здесь обязан отреагировать.

Ключевое утверждение статьи: S и R независимы, и никакая скалярная сводка не сохраняет все релевантные сравнения. Проще говоря, нельзя усреднить два числа и получить одно честное — судья с высоким S и низким R и судья с низким S и высоким R могут дать одинаковую «среднюю оценку», оставаясь принципиально разными инструментами.

Как это проверяли

Экспериментальная конструкция заметно строже обычной для таких работ.

  • 7 судей и 4 домена — то есть проверяли не одну модель и не на одном типе задач.
  • 7 типов конструкт-изменяющих интервенций против 5 контролей, которые трогают только регистр и смысла не меняют.
  • Направление правки — меняет она конструкт или нет — определяли люди-аннотаторы, а не разметка по умолчанию.
  • Генерация, верификация и судейство были закреплены за непересекающимися семействами моделей. Это важная деталь: судья не оценивает текст, порождённый им же, и не проверяет правки, которые сам придумал.

Последний пункт стоит отдельного внимания. Когда генератор, верификатор и судья — одна и та же модель, высокое согласие может быть артефактом общих смещений, а не признаком качества.

Инвариантность почти идеальна, чувствительность — нет

Здесь начинается самое интересное. При пороге согласованной инвариантности S ≥ 0.90 судьи в среднем показали S = 0.945. Цифра, к которой обычно и стремятся при отчётности.

Чувствительность при этом — R = 0.319. Грубая интерпретация: примерно в двух случаях из трёх судья не заметил правку, которая смысл меняет. Формально безупречный результат по инвариантности сосуществует с очень слабым откликом на содержание.

Масштаб и сила — не одно и то же

Слабая чувствительность распределена неравномерно. Когда правка меняет масштаб утверждения, отклик выше: R_scope = 0.383. Когда она меняет силу — слабее: R_strength = 0.262. Разрыв составляет +0.121, и знак у него одинаков для всех семи судей.

То есть речь не о случайном разбросе между моделями, а о систематической особенности. Судьи лучше считывают расширение и сужение области действия, чем смещение по шкале уверенности — «вероятно» против «точно», «может помочь» против «помогает». Для практики это неприятная новость: именно такие градации чаще всего и нужно различать.

Человеческие метки тоже стоит проверять

Отдельный сюжет — пять публичных наборов меток, которые используются как эталон. Предикторы, опирающиеся исключительно на поверхностные признаки текста, в парном режиме воспроизводят 55–67% меток. В случае MT-Bench поверхностная эвристика совпала с 67.4% человеческих голосов.

Вывод напрашивается неудобный. Если простое правило, ничего не понимающее в содержании, повторяет две трети человеческих решений, то такие метки плохо отделяют смысл от формы — и валидировать нужно не только судью, но и сам набор, на котором его проверяют.

Что с этим делать

Авторы не предлагают заменить LLM-судей чем-то другим — они предлагают изменить отчётность и процедуру проверки.

Совместная отчётность. S и R публикуются рядом, а не сворачиваются в одно число. Читатель отчёта сразу видит, где у судьи провал.

Аудит валидационного набора. Прежде чем доверять согласию с человеческими метками, стоит проверить, насколько эти метки предсказуемы без понимания текста. Если предсказуемы хорошо — доверие к ним завышено.

Разделение ролей. Генерация, верификация и судейство у разных семейств моделей снижают риск, что высокая инвариантность окажется следствием общих слепых зон.

Главная мысль

Высокое согласие — это про стабильность, а не про правильность. Судья, который одинаково уверенно выносит вердикт и до, и после смысловой правки, не «устойчив», а невнимателен. Пока в отчётах есть только одна цифра, различить эти два случая невозможно — и именно поэтому профиль из двух измерений выглядит не усложнением, а минимально необходимой честностью.

Часто задаваемые вопросы

Похожие материалы

Все материалы
LLM-судью проверят на чувствительность к правкам