Судья под микроскопом: тест D3-Omni проверяет, замечают ли мультимодальные модели собственные ошибки

16 сентября 202623 просмотров

Мультимодальные «омни-судьи» оценивают картинки, видео и речь, но привычные бенчмарки перекошены в сторону удачных примеров и потому скрывают провалы. Новый сбалансированный набор D3-Omni разводит типы сбоев по отдельным осям и показывает: модели охотно подтверждают выполненное требование, но куда хуже ловят нарушенное.

Судья под микроскопом: тест D3-Omni проверяет, замечают ли мультимодальные модели собственные ошибки

Судья, которому слишком легко верить

Мультимодальные модели всё чаще выступают в роли арбитров: они смотрят на картинку, видео или слушают аудио и выносят вердикт — соответствует ли результат текстовому запросу. Таких «всеядных» судей используют и для оценки генеративных систем, и для автоматической разметки данных, когда живых экспертов на всё не хватает.

Логика понятная: если модель умеет понимать сразу несколько модальностей, почему бы не поручить ей проверку text-to-image, text-to-video и text-to-speech? Но здесь кроется неудобный вопрос. Хорошая итоговая точность такого судьи ещё не значит, что он действительно видит, что оценивает. Существующие наборы тестов и обучающие подборки обычно перекошены в сторону удачных примеров, а разные типы провалов в них свалены в одну кучу.

Результат — искажённая картина. Судья выдаёт приличные цифры, потому что научился говорить «да», а его настоящие слепые зоны остаются незамеченными. Именно эту проблему и разбирает новая работа с arXiv.

Что предлагают авторы: D3-Omni

Исследование вышло под заголовком, который сами авторы построили на контрасте: «OmniJudge or OmniBias?». Вместо очередного рейтинга они собрали диагностический инструмент — D3-Omni, бенчмарк, устроенный так, чтобы не давать судье спрятаться за общую статистику. Название расшифровывается тремя принципами, и каждый из них бьёт по конкретной слабости привычных тестов.

Dual-balanced: перекос в сторону «всё хорошо» убирают

Первый принцип отвечает за баланс. Вместо того чтобы набирать примеры как получится, набор выравнивают: по каждой проверяемой характеристике должно быть сопоставимое число удачных и провальных случаев. Так исчезает ситуация, когда модель набирает очки просто потому, что правильный ответ чаще «да».

Decoupled: одна ошибка — одна причина

Второй принцип — развязка. Каждый дефект в тесте привязан ровно к одной способности. Если судья ошибся, понятно, чего именно ему не хватило: понимания композиции, цвета, синхронизации звука или чего-то ещё. Никаких составных примеров, где непонятно, какое из трёх нарушений сбило модель.

Dynamic: тест подстраивается под прогресс генераторов

Третий принцип — динамика. Конструкция теста направляется туда, где representation примеров пока не хватает, по мере того как генеративные модели осваивают новые области. Цель — держать паритет примерно один к одному по каждой характеристике и равномерное заполнение всех уровней итогового балла.

Как устроен набор данных

Масштаб у D3-Omni приличный: 53 бинарные характеристики, разложенные по трём задачам (17, 22 и 14 на каждую), и 10 671 пример (3 526, 1 998 и 5 147 соответственно). Характеристики подобраны ортогонально — они не дублируют друг друга.

Отдельная инженерная деталь — как получают негативные примеры. Авторы принципиально отказались от повторной генерации выходов: такой путь приводит к утечке информации между характеристиками, и тест перестаёт быть чистым. Вместо этого берут проверенные полностью положительные «семена», а нарушения вносят контролируемо — переписывая промпт и добавляя точечные возмущения, изолирующие одну характеристику.

Что выяснилось: судьи уверенно хвалят и плохо ловят брак

Самое интересное в работе — не устройство бенчмарка, а то, что он показал. Даже сильные мультимодальные судьи спотыкаются на характеристиках, напрямую связанных с модальностью. Проще говоря, им тяжело даётся именно то, ради чего их и берут в оценщики.

Второе наблюдение ещё неприятнее. Модели заметно надёжнее подтверждают выполненные требования, чем обнаруживают нарушенные. Асимметрия устойчивая: сказать «здесь всё соответствует запросу» для судьи куда легче, чем поймать конкретное несоответствие.

Третье — номинально разные атрибуты модель склонна воспринимать как одно целое решение. Различия между свойствами стираются, и судья выносит обобщённый вердикт вместо разбора по пунктам.

Почему агрегированный процент обманывает

Из этих наблюдений складывается главный вывод: итоговая точность может маскировать систематические слепые зоны. Судья, стабильно угадывающий «положительный» ответ, будет выглядеть прилично на перекошенном наборе — и провалится там, где нужно поймать ошибку генератора.

Сбалансированная и развязанная оптика нужна не для красоты метрики, а чтобы эти зоны вообще стало видно. А увидев — можно целенаправленно закрывать: дообучать на проблемных характеристиках, а не гнаться за средним баллом.

Для практики это означает простую вещь. Если вы собираете пайплайн, где модель-судья фильтрует результаты генерации или размечает датасет, проверять её надо на смещённом в сторону негативов наборе, а не на удобной выборке из удачных примеров. Иначе оценщик будет пропускать брак, а вы узнаете об этом от пользователей, а не от метрик.

Коротко

  • D3-Omni — бенчмарк для диагностики мультимодальных судей, а не рейтинг моделей.
  • Три принципа: баланс положительных и отрицательных примеров, привязка каждой ошибки к одной способности, подстройка теста под развитие генераторов.
  • 53 характеристики и почти 11 тысяч примеров по задачам text-to-image, text-to-video и text-to-speech.
  • Негативы создают переписыванием промптов и точечными возмущениями, а не повторной генерацией — чтобы не смешивать характеристики.
  • Главный вывод: высокий средний результат может скрывать устойчивые слепые зоны, особенно там, где нужно заметить нарушение, а не подтвердить соответствие.

Часто задаваемые вопросы

Похожие материалы

Все материалы
D3-Omni — бенчмарк для мультимодальных судей