Новый бенчмарк SemComp-Bench проверяет, доводят ли видеомодели задачу до результата

3 сентября 202614 просмотров

Исследователи представили датасет и методику оценки генерации видео по семантическому выполнению задач: модель должна не просто создать правдоподобный ролик, а достичь нужного результата и сохранить смысловую связь с эталоном. Первые эксперименты показывают, что это по-прежнему сложная задача для современных видеомоделей.

Новый бенчмарк SemComp-Bench проверяет, доводят ли видеомодели задачу до результата

Семантическое выполнение задачи: новый взгляд на видеогенерацию

Современные модели генерации видео отлично справляются с короткими запросами вроде «кошка играет с клубком» — получается красиво и похоже на правду. Но действительно ли система понимает, какой результат нужен пользователю? Исследователи из Китая предложили бенчмарк SemComp-Bench, который проверяет не просто визуальное качество, а то, выполнена ли задача по смыслу.

Группа авторов во главе с Keyu Tu (всего восемь исследователей) представила на arXiv статью с описанием SemComp-Bench. Работа выложена 18 августа 2026 года, она относится к областям компьютерного зрения и искусственного интеллекта. Вводится новое понятие — Semantic Task Completion Video Generation, то есть генерация видео с семантическим выполнением задачи. Успех здесь определяется не тем, насколько плавно движутся объекты и не совпадением с эталоном кадр-в-кадр, а тем, достигнут ли запрошенный результат и сохраняется ли смысловая связь с образцом.

Ключевая идея — «семантическая привязка» (semantic grounding). Модель должна не просто скопировать картинку, а понять высокоуровневый смысл задания: например, если на эталонном изображении показан сервированный стол, а инструкция просит «добавить чайник», то в итоговом видео чайник должен появиться на столе. При этом не требуется показывать каждый промежуточный шаг или создавать покадровую копию образца — важна только финальная сцена и её соответствие задаче.

Как устроены данные и оценка SemComp-Bench

Для систематической проверки авторы создали датасет SemComp-Data. В него вошли примеры из шести разных областей — таким образом авторы постарались охватить максимально широкий спектр сценариев. Каждый элемент датасета содержит:

  • эталонное изображение (что должно получиться в итоге);
  • подробную инструкцию с деталями;
  • краткую инструкцию — тот вариант, который скорее встретится в реальном запросе;
  • итоговый видеоклип, демонстрирующий ожидаемый результат.

Чтобы подготовить данные, исследователи выстроили конвейер из четырёх этапов. Он превращает сырые видео в стандартизированные экземпляры SemComp-Data. Такая автоматизация позволила масштабировать датасет без ручной разметки каждого ролика.

Оценка в SemComp-Bench построена вокруг vision-language model (VLM). Модель отвечает на структурированные бинарные вопросы — то есть на каждый вопрос есть однозначный ответ «да» или «нет». Это делает проверку прозрачной и воспроизводимой. По результатам считаются два показателя:

  • OA Score (Outcome Achievement) — достигнут ли заданный результат;
  • GR Score (Generation Reliability) — насколько надёжно модель воспроизводит решение, сохраняя связь с эталонным изображением.

По сути, первый показатель отвечает на вопрос «сделано ли то, что просили», а второй — «сделано ли это именно в контексте примера».

Что показали первые тесты

Авторы прогнали через бенчмарк несколько репрезентативных моделей генерации видео. Выяснилось, что задача довести семантику до конца остаётся открытой. Даже современные системы часто выдают ролик, который выглядит качественно, но не соответствует сути запроса: чайник не появляется, объект меняется на похожий, а результат лишь отдалённо напоминает ожидаемый.

Особенно трудно моделям удерживать связь с эталонным изображением, когда инструкция короткая и не содержит всех деталей. OA Score и GR Score оказываются низкими, то есть модель «не понимает» задачу на уровне смысла. Это подтверждает: видеогенерация сегодня — это скорее про «красивую картинку», чем про выполнение поручения.

Появление SemComp-Bench сдвигает акцент в тестировании видеомоделей: вместо оценки правдоподобия кадров — проверка результата, значимого для пользователя. Если раньше бенчмарки спрашивали «похоже ли видео на реальность», то теперь вопрос ставится иначе: «выполнена ли задача». Это шаг к тому, чтобы генеративные видео становились не просто демо, а инструментом решения практических задач.

Авторы опубликовали работу на платформе arXiv под номером 2608.17426, DOI: https://doi.org/10.48550/arXiv.2608.17426. Материалы доступны для изучения, а сам подход к оценке может лечь в основу следующих поколений видеогенераторов.

Часто задаваемые вопросы

Похожие материалы

Все материалы
SemComp-Bench: новый бенчмарк видеомоделей — обзор