Судья, которому слишком легко верить
Мультимодальные модели всё чаще выступают в роли арбитров: они смотрят на картинку, видео или слушают аудио и выносят вердикт — соответствует ли результат текстовому запросу. Таких «всеядных» судей используют и для оценки генеративных систем, и для автоматической разметки данных, когда живых экспертов на всё не хватает.
Логика понятная: если модель умеет понимать сразу несколько модальностей, почему бы не поручить ей проверку text-to-image, text-to-video и text-to-speech? Но здесь кроется неудобный вопрос. Хорошая итоговая точность такого судьи ещё не значит, что он действительно видит, что оценивает. Существующие наборы тестов и обучающие подборки обычно перекошены в сторону удачных примеров, а разные типы провалов в них свалены в одну кучу.
Результат — искажённая картина. Судья выдаёт приличные цифры, потому что научился говорить «да», а его настоящие слепые зоны остаются незамеченными. Именно эту проблему и разбирает новая работа с arXiv.

Что предлагают авторы: D3-Omni
Исследование вышло под заголовком, который сами авторы построили на контрасте: «OmniJudge or OmniBias?». Вместо очередного рейтинга они собрали диагностический инструмент — D3-Omni, бенчмарк, устроенный так, чтобы не давать судье спрятаться за общую статистику. Название расшифровывается тремя принципами, и каждый из них бьёт по конкретной слабости привычных тестов.
Dual-balanced: перекос в сторону «всё хорошо» убирают
Первый принцип отвечает за баланс. Вместо того чтобы набирать примеры как получится, набор выравнивают: по каждой проверяемой характеристике должно быть сопоставимое число удачных и провальных случаев. Так исчезает ситуация, когда модель набирает очки просто потому, что правильный ответ чаще «да».
Decoupled: одна ошибка — одна причина
Второй принцип — развязка. Каждый дефект в тесте привязан ровно к одной способности. Если судья ошибся, понятно, чего именно ему не хватило: понимания композиции, цвета, синхронизации звука или чего-то ещё. Никаких составных примеров, где непонятно, какое из трёх нарушений сбило модель.
Dynamic: тест подстраивается под прогресс генераторов
Третий принцип — динамика. Конструкция теста направляется туда, где representation примеров пока не хватает, по мере того как генеративные модели осваивают новые области. Цель — держать паритет примерно один к одному по каждой характеристике и равномерное заполнение всех уровней итогового балла.

Как устроен набор данных
Масштаб у D3-Omni приличный: 53 бинарные характеристики, разложенные по трём задачам (17, 22 и 14 на каждую), и 10 671 пример (3 526, 1 998 и 5 147 соответственно). Характеристики подобраны ортогонально — они не дублируют друг друга.
Отдельная инженерная деталь — как получают негативные примеры. Авторы принципиально отказались от повторной генерации выходов: такой путь приводит к утечке информации между характеристиками, и тест перестаёт быть чистым. Вместо этого берут проверенные полностью положительные «семена», а нарушения вносят контролируемо — переписывая промпт и добавляя точечные возмущения, изолирующие одну характеристику.
Что выяснилось: судьи уверенно хвалят и плохо ловят брак
Самое интересное в работе — не устройство бенчмарка, а то, что он показал. Даже сильные мультимодальные судьи спотыкаются на характеристиках, напрямую связанных с модальностью. Проще говоря, им тяжело даётся именно то, ради чего их и берут в оценщики.
Второе наблюдение ещё неприятнее. Модели заметно надёжнее подтверждают выполненные требования, чем обнаруживают нарушенные. Асимметрия устойчивая: сказать «здесь всё соответствует запросу» для судьи куда легче, чем поймать конкретное несоответствие.
Третье — номинально разные атрибуты модель склонна воспринимать как одно целое решение. Различия между свойствами стираются, и судья выносит обобщённый вердикт вместо разбора по пунктам.

Почему агрегированный процент обманывает
Из этих наблюдений складывается главный вывод: итоговая точность может маскировать систематические слепые зоны. Судья, стабильно угадывающий «положительный» ответ, будет выглядеть прилично на перекошенном наборе — и провалится там, где нужно поймать ошибку генератора.
Сбалансированная и развязанная оптика нужна не для красоты метрики, а чтобы эти зоны вообще стало видно. А увидев — можно целенаправленно закрывать: дообучать на проблемных характеристиках, а не гнаться за средним баллом.
Для практики это означает простую вещь. Если вы собираете пайплайн, где модель-судья фильтрует результаты генерации или размечает датасет, проверять её надо на смещённом в сторону негативов наборе, а не на удобной выборке из удачных примеров. Иначе оценщик будет пропускать брак, а вы узнаете об этом от пользователей, а не от метрик.
Коротко
- D3-Omni — бенчмарк для диагностики мультимодальных судей, а не рейтинг моделей.
- Три принципа: баланс положительных и отрицательных примеров, привязка каждой ошибки к одной способности, подстройка теста под развитие генераторов.
- 53 характеристики и почти 11 тысяч примеров по задачам text-to-image, text-to-video и text-to-speech.
- Негативы создают переписыванием промптов и точечными возмущениями, а не повторной генерацией — чтобы не смешивать характеристики.
- Главный вывод: высокий средний результат может скрывать устойчивые слепые зоны, особенно там, где нужно заметить нарушение, а не подтвердить соответствие.



