场景不飘:AI 短剧的场景一致性方案——定场镜头、多角度 set 参考与空间接地
上一篇我写了 AI 短剧怎么让主角不换脸。但一致性其实有两半,另一半更安静、也更容易被忽略:场景会飘。 第一个镜头里客厅的墙是米白的、门在左边、茶几上摆着一只旧座钟;切到下一个镜头,墙成了灰的、门挪到了右边、座钟不见了。观众未必说得出哪里不对,但"这不是同一个房间"的违和感是实打实的——尤其短剧,一集三四十个镜头往往只发生在少数几个 location 里,每个都得让人认得出是同一处。
场景漂移比角色漂移讨论得少,但它同样是"能不能看下去"的门槛。好在解法和角色是同构的——只是有几处关键的镜像和一维额外的东西。这篇把它讲清楚,并附上我这两天把它装进自己产品(magicedit / Magic Canvas)copilot 管线的落地。
同一个范式,镜像的锚点
角色一致性的范式是"先定身份 → 锁参考 → 扇出镜头"。场景完全平移:先定 location → 锁一张场景锚点 → 每个镜头引用它。 场景版的"身份锚点"有个专门的名字——定场镜头(establishing shot):一个 location 的主宽镜头,锚定该场景所有覆盖镜头的样子。
但有一处关键反转,值得单独记住:
- 角色锚点要的是纯中性背景 + 一个清晰主体——背景越干净,越不会把场景烤进身份里。
- 场景锚点恰恰相反——它就是环境,而且必须画面里没有人。一张定场图里若站着个人,这张脸会顺着参考被带进引用这个 location 的每一个镜头。取景也要宽,露出完整空间和定义性建筑,而不是怼着一个角落。
同一个道理(一张可复用的干净锚点),约束却是镜像的。这个反转是场景侧最容易做错的地方——很多人直接拿一张"有人物、有戏剧光、怼脸"的剧照当场景参考,然后奇怪为什么每个镜头的背景都在变。
场景参考图也分层:从定场镜头到多角度 set 参考
和角色一样,场景锚点也不是"一张就够"。业界(invideo 的说法很直接)在做的是"上传多角度参考网格,类似角色设定表"——把一个 set 的宽景、反打、关键细节画在一起,锁住整个空间。层次同样有取舍:
| 场景参考图 | 是什么 | 优 | 缺 | 何时用 |
|---|---|---|---|---|
| 单张定场镜头 | 一张 location 主宽景,无人 | 最便宜,一张干净锚 | 只有一个机位,反打/细节靠瞎编 | 单场 / 背景 location |
| 多角度 set 参考 | 宽 + 反打 + 关键细节角度,同一张画布 | 锁住覆盖需要的角度,正反打空间自洽 | 宽画布摊薄分辨率,结构更难保持一致 | 多镜头覆盖的反复出现 location(默认) |
| 时段变体组 | 同一空间 × 日/暮/夜 | 跨时间跳转仍读作同一间 | 面板更多,光照须同室可信 | 同一场景跨昼夜 |
| 细节/道具锚 | 招牌道具/材质的特写 | 连贯关键物件与质感 | 不管整体空间,需配定场镜头 | 有剧情关键道具或招牌质感的 location |
实操建议和角色那套一样直接,别堆料:单场 location 用一张定场镜头;多镜头覆盖的反复场景上多角度 set 参考;跨昼夜的场景做一组时段变体;有招牌道具的加一张细节锚。 每多一张板都是一次生成、一次花钱,还会让结构更难在面板间保持一致。
场景参考的 4 层提示词公式也和角色平行:主体(建筑/材质/年代/空间布局,具体,且不含人物)+ 视角指令(establishing wide shot, full location visible,多角度再加 wide / reverse / detail)+ 风格光照锁定(每个时段单一光源、统一色调)+ 格式(no people in frame; grid layout)。
场景独有的一维:空间接地
角色一致性讲到这里就差不多了。场景多一维,是角色没有的——空间几何。
一个 location 会被好几个镜头从不同机位覆盖。如果每个镜头都让模型重新想象这个空间的几何关系,正反打就对不上:A 镜头门在左,B 镜头门跑到了右,两个镜头剪在一起观众立刻出戏。2026 年这块的做法叫空间接地(spatial grounding):不用纯描述性语言,而是相对固定锚点描述相机位置——DramaDirector(arXiv:2606.24107)的几何引导把空间布局检索出来和脚本对齐,Digen 的指南干脆建议用 3D 坐标系描述("相机在 45°、距主体 3 米")。
落到管线里,做法很朴素:在场景 breakdown 里就把这个 location 的固定锚点记下来——门、窗、主家具——然后每个镜头的 prompt 对着这些锚点定机位("从门口过肩拍主沙发"、"从窗侧反向拍向门口"),而不是每镜从零编几何。这样同一个 set 的覆盖镜头才空间自洽、剪得到一起。这是场景一致性里最"只有真做过才会强调"的一环。
只锁参考不够:场景也要校验、也要重跑
和角色一模一样,"每个镜头引用同一场景参考"藏着一个假设:参考图本身是对的。 一次生成同样可能跑歪——出错的建筑、漏进画面的人、和故事调性打架的光。
行业的成熟做法同样是"生成后校验 + 重跑",而且有一句很精辟的口诀:"fix the source, not the shot"(修源头,别修镜头)——发现某个 location 的背景不对,就去更新那张场景参考,之后每个引用它的镜头自动继承修正;一次修一张参考,胜过一个镜头一个镜头地救。
校验同样分两层:便宜的一层是九宫格分镜(九格里不光看角色是不是同一个,也看背景是不是同一处);严格的一层是让一个视觉语言模型(VLM)把生成的场景图和 breakdown 逐条比对:建筑、定义性特征、光照色调,并确认画面里没有人,输出 PASS 或"哪里飘了"。
把范式装进管线:no-people 硬约束 + 运行时场景校验门
上面是方法论。我做的是一个会自己在画布上搭节点、生成短片的 copilot,所以要把这套翻译成它能自动执行的规则。这周我把场景侧补齐了(2026-07-24 落地),完全对称于之前的角色侧改动:
- Rule A —— 场景参考硬约束。 之前 copilot 生成场景图只塞 location 描述,不约束成像,经常出一张带人物、怼角落的图。现在固定追加一段约束:establishing 宽景、露出完整空间和定义性建筑、画面无人物、单一光源统一色调、高分辨率,负向词明确堵掉 people / faces / 怼脸 / 混乱光照。同时场景 breakdown 里给每个 location 加一行
Reference note:,记下固定空间锚点(门/窗/主家具),并决定该用单张定场还是多角度 set。 - B1 —— 定场镜头当检查点。 一个新 location 的定场(第一、最宽的那个)镜头,天然是进入该场景其余覆盖前最便宜的 on-location 检查点;九宫格也同时校验 same-location。
- B2 —— 运行时 VLM 场景校验门。 场景图生成完、进镜头之前,copilot 在画布上建一个 VLM 节点,把生成的场景图和它的 breakdown 条目分别接进去(图接
image槽、文本接prompt槽),逐条比对建筑/光照并确认无人,输出 PASS 或 DRIFT,飘了只对漂的那几个节点发重跑卡。两条铁律和角色侧一致:绝不后台读像素(识图必须是画布上、用户点击运行、可见可审计的节点)、绝不自动重生成(重跑花钱,只点亮卡让用户决定)。
局限与没解决的问题
诚实地说,和角色侧一样,这套压住了漂移,没消灭它:
- 空间接地不是真 3D。 "对着门窗定机位"是让文本提示更接地,不是真的三维重建;大跨度的机位变化、复杂遮挡,模型还是会露馅。
- 多角度 set 有分辨率税。 把一个空间从多个角度锁下来,代价是每个角度分到的像素更少,复杂结构在合成时自己就可能不一致。
- VLM 校验会误判。 让视觉模型当场景裁判,它可能把对的判飘、把飘的放过;B2 是 opt-in、受成本上限门控的。
- 时段变体的可信度。 同一个房间日景和夜景要读作同一间,光照逻辑得站得住,这对模型仍是难点。
- 成本是主线约束。 每张多角度板、每次重跑都是真金白银,"别堆料"依然是反复出现的取舍词。
结论
场景一致性是 AI 短剧里更安静的那一半,但它决定观众"这是同一个世界"的信念。范式和角色同构——先定 location、锁定场景锚点、再扇出镜头——但要记住三件场景独有的事:锚点的硬约束和角色正好相反(宽景、无人);location 需要空间接地(对着固定锚点定机位)才能让覆盖镜头剪到一起;校验时别忘了确认"画面里没有人"。
对创作者:把 location 当成和角色一样需要锁定的资产;给反复出现的场景做一张达标的多角度参考,并在参考里记下门窗家具这些固定锚点;"修源头别修镜头"。
对做管线的人:场景侧的工程难点和角色侧几乎一一对应,最大的价值恰恰在这种对称性——同一套"参考硬约束 + 两层校验 + 人类在环的重跑"抽象,角色和场景可以共用,维护成本减半。
参考资料
- invideo — AI Filmmaking in 2026: The Complete Guide to Producing Short Films With AI Agents
- Digen — AI Video Generation Scene Stability: 2026 Evolution Guide
- AI Magicx — AI Multi-Shot Video: Consistent Characters and Scenes Across Clips
- DramaDirector — Geometry-Guided Short Drama Generation(arXiv:2606.24107)
- Genra AI — How to Create AI Short Dramas Solo with Genra: Production & Retention Guide
- 官小西 — 角色不崩:AI 短剧的人物一致性方案
- 官小西 — 九宫格分镜为什么成了 AI 视频的一致性主力