SemComp-Bench新基准测试检验视频模型能否完成任务

3 九月 202614 视图

研究人员提出了一个用于评估视频生成任务语义执行能力的数据集和方法:模型不仅要生成看似合理的视频,还要达到预期结果并保持与参考标准的语义关联。初步实验表明,这对当前的视频模型来说仍是一项艰巨挑战。

SemComp-Bench新基准测试检验视频模型能否完成任务

语义任务完成:视频生成的新视角

现代视频生成模型在处理“猫玩毛线球”这类简短提示时表现出色——生成结果美观且逼真。但系统真的理解用户需要什么结果吗?中国的研究人员提出了SemComp-Bench基准测试,它不仅检验视觉质量,更检验任务是否在语义层面得到完成。

以Keyu Tu为首的作者团队(共八位研究者)在arXiv上提交了一篇描述SemComp-Bench的论文。该工作于2026年8月18日发布,属于计算机视觉和人工智能领域。文中引入了一个新概念——Semantic Task Completion Video Generation,即语义任务完成的视频生成。这里的成功标准不取决于物体运动有多流畅,也不取决于与参考帧逐帧匹配的程度,而在于是否达成了所请求的结果,以及是否保持了与样本之间的语义关联。

核心思想是“语义锚定”(semantic grounding)。模型不仅要复制画面,更要理解任务的高层语义:例如,如果参考图像展示了一张摆好的餐桌,而指令要求“添加一个茶壶”,那么最终视频中茶壶必须出现在桌上。同时,不要求展示每一个中间步骤,也不要求逐帧复制样本——重要的是最终场景及其与任务的对应关系。

SemComp-Bench的数据与评估方式

为了进行系统性检验,作者构建了SemComp-Data数据集。其中包含来自六个不同领域的示例——作者以此力求覆盖尽可能广泛的场景类型。数据集中的每个条目包含:

  • 参考图像(最终应达成的结果);
  • 带有细节的详细指令;
  • 简短指令——更接近真实请求中可能出现的版本;
  • 展示预期结果的最终视频片段。

为准备数据,研究人员搭建了一个四阶段流水线。它将原始视频转化为标准化的SemComp-Data实例。这种自动化方式使得数据集无需对每个视频进行人工标注即可扩展。

SemComp-Bench的评估围绕视觉语言模型(VLM)展开。模型回答结构化的二值问题——即每个问题都有明确的“是”或“否”答案。这使得检验透明且可复现。根据结果计算两项指标:

  • OA Score(Outcome Achievement,结果达成度)——是否达成了指定结果;
  • GR Score(Generation Reliability,生成可靠性)——模型在保持与参考图像关联的前提下,复现解决方案的可靠程度。

本质上,第一项指标回答“所要求的事是否完成”,第二项回答“是否正是在示例的语境中完成的”。

初步测试揭示了什么

作者让多个具有代表性的视频生成模型通过了基准测试。结果发现,将语义贯彻到底仍是一个未解决的问题。即使是现代系统,也常常生成看起来质量不错但与请求本质不符的视频:茶壶没有出现,物体被替换成相似物,结果与预期仅勉强沾边。

当指令简短且不包含所有细节时,模型尤其难以保持与参考图像的关联。OA Score和GR Score都很低,说明模型在语义层面“不理解”任务。这证实了:如今的视频生成更多是“漂亮画面”,而非“完成任务”。

SemComp-Bench的出现将视频模型测试的重心从评估帧的逼真度转向检验对用户有意义的结果。过去基准测试问的是“视频是否像现实”,现在问题被重新定义:“任务是否完成”。这是朝着生成式视频不再只是演示、而是解决实际问题的工具迈出的一步。

作者在arXiv平台上发布了该工作,编号为2608.17426,DOI:https://doi.org/10.48550/arXiv.2608.17426。材料可供查阅,而这一评估方法本身也可能成为下一代视频生成器的基础。

常问问题

SemComp-Bench新基准测试检验视频模型能否完成任务