Ровно два числа обычно попадают в отчёт о качестве автоматической оценки: насколько вердикты модели совпадают с человеческими и насколько они устойчивы к мелким изменениям вроде перестановки вариантов или переформулировки промпта. Новая работа утверждает, что этого недостаточно — и предлагает смотреть на судью иначе.
Согласие отвечает не на тот вопрос
Согласие и устойчивость к поверхностным возмущениям — это про надёжность (reliability). Надёжный измерительный инструмент выдаёт стабильный результат, но стабильность сама по себе ничего не говорит о том, измеряет ли он нужную величину. Термометр, который всегда показывает 20 градусов, исключительно надёжен и совершенно бесполезен.

Авторы статьи «A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation» (Jianlin Chen, Wenhui Chen, Ziyao Lin, Chi Man Vong; arXiv:2608.24419, cs.AI, подана 25 августа 2026 года; 39 страниц, 10 рисунков, 11 таблиц) переносят разговор в плоскость конструктной валидности: соответствует ли оценка тому понятию, которое она якобы измеряет. Для LLM-судьи это значит простую вещь — судья должен реагировать на смысл, а не на форму.
Профиль из двух измерений
Вместо одной метрики предлагается профиль из двух вероятностей.
S — инвариантность. Как часто вердикт остаётся прежним, если правка сохраняет смысл: переставили абзацы, сменили стиль, убрали воду. Хороший судья здесь не должен дёргаться.
R — конструктная чувствительность. Как часто вердикт меняется, если правка минимальна, но смысл задет: добавили оговорку, ослабили утверждение, сузили область действия. Хороший судья здесь обязан отреагировать.
Ключевое утверждение статьи: S и R независимы, и никакая скалярная сводка не сохраняет все релевантные сравнения. Проще говоря, нельзя усреднить два числа и получить одно честное — судья с высоким S и низким R и судья с низким S и высоким R могут дать одинаковую «среднюю оценку», оставаясь принципиально разными инструментами.
Как это проверяли
Экспериментальная конструкция заметно строже обычной для таких работ.
- 7 судей и 4 домена — то есть проверяли не одну модель и не на одном типе задач.
- 7 типов конструкт-изменяющих интервенций против 5 контролей, которые трогают только регистр и смысла не меняют.
- Направление правки — меняет она конструкт или нет — определяли люди-аннотаторы, а не разметка по умолчанию.
- Генерация, верификация и судейство были закреплены за непересекающимися семействами моделей. Это важная деталь: судья не оценивает текст, порождённый им же, и не проверяет правки, которые сам придумал.
Последний пункт стоит отдельного внимания. Когда генератор, верификатор и судья — одна и та же модель, высокое согласие может быть артефактом общих смещений, а не признаком качества.
Инвариантность почти идеальна, чувствительность — нет
Здесь начинается самое интересное. При пороге согласованной инвариантности S ≥ 0.90 судьи в среднем показали S = 0.945. Цифра, к которой обычно и стремятся при отчётности.
Чувствительность при этом — R = 0.319. Грубая интерпретация: примерно в двух случаях из трёх судья не заметил правку, которая смысл меняет. Формально безупречный результат по инвариантности сосуществует с очень слабым откликом на содержание.

Масштаб и сила — не одно и то же
Слабая чувствительность распределена неравномерно. Когда правка меняет масштаб утверждения, отклик выше: R_scope = 0.383. Когда она меняет силу — слабее: R_strength = 0.262. Разрыв составляет +0.121, и знак у него одинаков для всех семи судей.
То есть речь не о случайном разбросе между моделями, а о систематической особенности. Судьи лучше считывают расширение и сужение области действия, чем смещение по шкале уверенности — «вероятно» против «точно», «может помочь» против «помогает». Для практики это неприятная новость: именно такие градации чаще всего и нужно различать.
Человеческие метки тоже стоит проверять
Отдельный сюжет — пять публичных наборов меток, которые используются как эталон. Предикторы, опирающиеся исключительно на поверхностные признаки текста, в парном режиме воспроизводят 55–67% меток. В случае MT-Bench поверхностная эвристика совпала с 67.4% человеческих голосов.
Вывод напрашивается неудобный. Если простое правило, ничего не понимающее в содержании, повторяет две трети человеческих решений, то такие метки плохо отделяют смысл от формы — и валидировать нужно не только судью, но и сам набор, на котором его проверяют.

Что с этим делать
Авторы не предлагают заменить LLM-судей чем-то другим — они предлагают изменить отчётность и процедуру проверки.
Совместная отчётность. S и R публикуются рядом, а не сворачиваются в одно число. Читатель отчёта сразу видит, где у судьи провал.
Аудит валидационного набора. Прежде чем доверять согласию с человеческими метками, стоит проверить, насколько эти метки предсказуемы без понимания текста. Если предсказуемы хорошо — доверие к ним завышено.
Разделение ролей. Генерация, верификация и судейство у разных семейств моделей снижают риск, что высокая инвариантность окажется следствием общих слепых зон.
Главная мысль
Высокое согласие — это про стабильность, а не про правильность. Судья, который одинаково уверенно выносит вердикт и до, и после смысловой правки, не «устойчив», а невнимателен. Пока в отчётах есть только одна цифра, различить эти два случая невозможно — и именно поэтому профиль из двух измерений выглядит не усложнением, а минимально необходимой честностью.



