Пометка «я уверен» в ответе модели — это не измерение, а ещё одно утверждение, которое требует отдельной проверки. Пока такие оценки встраивают в логику агентов, стоит понимать, насколько им можно верить.
Почему к уверенности возникли вопросы
Агентные системы всё чаще устроены так, что следующий шаг выбирается с оглядкой на самооценку модели: если она заявляет высокую уверенность, действие выполняется, если низкую — подключается человек или другой инструмент. Такая схема работает только при одном условии: в момент действия заявленная уверенность должна примерно соответствовать реальной частоте попаданий.
Работа Bhushan Kashinath Joshi (arXiv:2608.24691, подан 25 августа 2026) проверяет именно это допущение — причём в обстановке, где промах виден сразу и не списывается на невезение.
Полигон: шахматы со скрытым королём
Классические шахматы для такой проверки подходят плохо: там всё открыто, и «уверенность» неизбежно смазывается с силой игры. Поэтому взят вариант со скрытой информацией, где королевский статус может тайно и неоднократно переходить от фигуры к фигуре. Игрок не знает, где сейчас находится главная цель, и вынужден действовать на догадках.
Ключевая деталь методики: каждый ход у агента отдельно спрашивали распределение вероятностей по тому, какая фигура соперника скрыто несёт королевский статус. Это запрашивалось независимо от самого хода — чтобы не смешивать «куда я пошёл» и «во что я верю». Истинное положение восстанавливали после партии и сверяли с заявленными числами.

Один правильный ответ из шестидесяти двух
Главный результат выглядит как авария. В двух независимых сериях партий взятия, совершённые при заявленной уверенности не ниже 0,5 в расположении скрытой фигуры, оказались верными в 1 случае из 62. Если перевести в проценты, заявленная вероятность «скорее да, чем нет» обернулась попаданием примерно в полутора процентах ситуаций — расхождение на порядки, а не на проценты.
При этом дефицит калибровки почти целиком сосредоточен именно в этих событиях: 99,3% в исходной серии и 98,7% в повторной. Иными словами, проблема не размазана ровным слоем по всей игре — она сконцентрирована в моментах, когда модель особенно громко заявляет о своей правоте и именно тогда, когда от неё зависит рискованное действие.
Тот же паттерн у других конфигураций
Автор не ограничился одной моделью. Проверка охватила ещё четыре конфигурации, включая второго провайдера. Картина повторяется в более слабой форме и выстраивается в согласованном порядке — но здесь важна аккуратность: сопоставимыми остаются только точечные оценки, а большинство попарных различий при таком размере выборки статистически неразличимы.
Сам автор описывает это как охват находки (scope), а не как доказательство того, что уровень способностей модели предсказывает её калибровку. То есть перед нами не «чем умнее модель, тем лучше она себя оценивает» и не обратное утверждение — просто явление встречается шире, чем одна конкретная система.

Бюджет рассуждений сдвигает метрику сильнее, чем кажется
Отдельный неприятный сюжет — сравнение одной и той же модели при неизменном внешнем рейтинге в таблице лидеров. Меняется только бюджет рассуждений (deliberation budget), то есть сколько «времени на подумать» модель тратит. Так вот, этот сдвиг меняет метрику калибровки почти так же сильно, как большой разрыв между разными моделями.
Практический вывод простой и неудобный: ориентироваться на место в лидерборде при выборе системы для задач с оценкой риска нельзя. Внутри одной и той же модели разброс, вызванный настройкой, сопоставим с тем, что мы привыкли считать серьёзным преимуществом одной модели над другой.
Традиционные метрики умеют показывать обратное
Ещё один результат бьёт по привычным способам замера. На отдельном месте (seat) стандартные оси оценки — легальность ходов, стоимость, задержка, доля доведённых до конца партий — могут полностью расходиться с качеством убеждений модели. Конфигурация, которая выигрывала по всем традиционным показателям сразу, продемонстрировала худшее качество убеждений среди всех протестированных.
Здесь легко ошибиться в интерпретации: речь не о том, что аккуратность и дешевизна вредны сами по себе. Речь о том, что набор метрик, который мы обычно считаем исчерпывающим, просто не измеряет интересующее нас свойство — он про другое.
Почему оценка «по результату» ничего не поймает
Самое неприятное следствие — маскировка. Модель с описанным паттерном всё ещё может выиграть ту самую партию, о которой строила ошибочные убеждения. Итог хороший, а внутренняя картина мира при этом была неверной.
Отсюда следует, что проверка исключительно по результату (outcome-only) такие сбои не обнаруживает в принципе: победа закрывает вопрос, и слабое место остаётся в системе до следующего раза — только уже в задаче, где правильного исхода может не случиться.

Что с этим делать на практике
Несколько рабочих выводов, которые следуют из результатов напрямую.
- Запрашивать у модели её собственное распределение вероятностей по ключевой неизвестной — и хранить его отдельно от выбранного действия. Без разделения этих двух вещей оценивать калибровку не получится.
- Сравнивать заявленную уверенность с фактической частотой попаданий на своих данных, а не доверять цифрам из карточки модели. В игре со скрытой фигурой разрыв оказался огромным, и ничто не гарантирует, что в прикладной задаче он будет меньше.
- Проверять порог, на котором система передаёт решение человеку, отдельно от общей точности. Промахи кучкуются именно в зоне высокой заявленной уверенности.
- Фиксировать бюджет рассуждений при любых сравнениях. Иначе вы измеряете настройку, а не модель.
- Не считать победу или успешный исход доказательством корректности внутренних убеждений системы.
Общий смысл находки не в том, что модели «плохие». Скорее в том, что уверенность и правота — два разных показателя, и первый пока не годится как замена второму. Пока агентные архитектуры строятся вокруг самооценки, эту разницу придётся измерять явно.



