SAGE:AI分镜向导演学习,完善规则并超越专业人士

27 八月 202634 视图

新框架SAGE能够自主从示例中提取导演原则,根据生成结果进行精准优化,并为每个场景仅提供适用的规则。在测试中,该系统获得77.8分,而专业导演为77.1分,并将创作时间缩短了83%以上。

SAGE:AI分镜向导演学习,完善规则并超越专业人士

导演视角:为什么分镜是瓶颈

分镜将剧本转化为一系列视觉计划:摄像机放在哪里,角色在做什么,角度如何变化。在短剧制作中,这一阶段直接决定场景的生动程度。但专业分镜师依赖的是难以用语言传达的经验。这种隐性知识,正是自动化在此停滞不前的主要原因。

乍看之下,似乎可以通过示例教会大语言模型分镜。然而,这条路上面临三个障碍:

  • 知识获取。 导演的技艺并不浮于表面:它隐含在示例中,而手动记录既耗时又昂贵。
  • 知识精炼。 手动创建的规则未经实践检验。当模型生成分镜时,无法判断是哪条规则导致了错误,而不透明的生成过程也无法将反馈关联到具体决策。
  • 知识落地。 即使收集了完整的规则集,它也放不进模型的上下文窗口。而为每个类型或剧情组手动筛选规则,耗时得令人无法接受。

正因如此,分镜仍然是行业中的“瓶颈”:它需要昂贵专家的参与,拖慢了整个流程。如果能让模型学会处理导演规则,短剧制作就能大幅提速——这正是这项新开发所解决的问题。

SAGE:进化的规则

一个由八位作者组成的研究团队在arXiv上发布了框架 SAGE(Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution)。论文发表于2026年8月18日,编号2608.17468,类别cs.AI。核心理念不是让模型死记硬背他人的示例,而是教会它提取并更新导演规则。

首先,SAGE分析“剧本—专家分镜”配对,从中提炼出不绑定具体情节的规则。这就像实习生观察大师的作品并总结原则:“对话中让两位角色都保持在画面内”、“紧张时刻拉近景别”。这些规则可以迁移到不同故事之间,无需从头重新训练模型。

在生成过程中,模型会记住每个叙事组使用了哪些规则。为什么需要这样?如果最终分镜不理想,反馈会精确关联到参与决策的那些规则,而不是整个规则集。这样系统就能知道哪条规则“掉了链子”,并只更新它。这解决了不透明性问题:每个决策都可以归因到具体知识。

进化后的规则被收集到带路由索引的剧本包中。对于每个新情节,系统自动挑选紧凑的规则集,无需专家介入。这就形成了一个闭环:模型学习、归因错误、发展规则、按任务分发。无需针对每个类型手动调参——路由机制决定具体场景需要哪个包。

与简单的示例提示不同,SAGE并不试图把全部导演经验塞进一个请求中。相反,它像知识管理系统一样运作:规则独立存在,随着反馈积累而更新,只在需要时才被调用。这让整个过程更加透明、更具可扩展性。

数字说明一切

为了验证SAGE,研究人员使用了经专家验证的评分标准,并在三个类型的18个测试剧集中将系统与专业导演进行了对比。结果:SAGE得分77.8,人类得分77.1。虽然差距不大,但重要的是AI首次达到了高于普通专业水准的水平。而且SAGE并非简单复制他人作品——它应用的是自己发展出来的规则。

需要强调的是,测试覆盖了不同类型,因此结果不能归因于与某一类剧情的偶然契合。系统在全部三个方向上都表现出了稳定且高质量的水平。

随后,该框架在Virtual Film Studio中部署了14天。在此期间,SAGE为叙事组生成了1,344个输出,其中87.2%无需重大修改即被采纳。这意味着编辑和导演几乎不需要返工生成的计划——只需做细微调整。制作团队表示,每集的作者工作时间减少了83%以上。这不仅是实验室成果,更是实践验证:分镜不再是瓶颈。

开放数据集与前景

与框架一同发布的还有数据集 PROSE——首个公开的、剧本与专业导演分镜配对的集合,包含68个剧集。这对整个社区意义重大:其他团队现在可以在统一材料上比较各自的方法,而不必自创指标。此外,这也是未来模型微调的优质基础——无需从零收集标注数据。

PROSE的发布还促进了研究的可复现性。此前每个团队都使用自己的私有数据,导致结果难以比较。现在社区有了共同的参照点。

当然,分镜只是制作流程中的一个环节。但SAGE基于将反馈归因到具体规则的方法,也可能在其他创意任务中发挥作用——从剪辑到动态分镜。模型越能理解自己为何做出某个决策,就越容易控制和改进。或许下一步,就是将这一原则推广到电影制作中同样充满隐性技艺的其他环节。

论文共11页,包含9张图和4张表。完整版本可在arXiv上通过编号2608.17468查阅。

常问问题

SAGE:AI分镜向导演学习,完善规则并超越专业人士