角色不崩:AI 短剧的人物一致性方案——从行业范式到工程落地
用 AI 做多镜头短剧的人都会撞到同一堵墙:第一个镜头里的女主角,发色、外套、脸型都对;切到第 12 个镜头,她换了张脸。角色漂移(character drift)是当前 AI 视频公认最烧钱的问题——短剧尤其吃亏,一集三四十个镜头,主角每一镜都得让观众认得出是同一个人。据 2025–2026 年多篇 AI 短剧产业调研,个人创作者的实测是成片每 1 分钟要磨 20–30 小时,其中大半时间不是在创作,而是在维持一致性、反复调 prompt、把跑歪的镜头重生成一遍。
好消息是:到 2026 年年中,这件事不再是玄学。行业已经收敛出一套相当稳定的范式,我最近把它系统性地装进了自己产品(magicedit / Magic Canvas)的 copilot 管线里。这篇把两件事讲清楚:行业范式长什么样,以及把它变成一条能自动执行的管线时,工程上真正的难点在哪。
范式:先定身份 → 锁参考 → 扇出镜头
一句话概括当前主流做法:一致性在第二步锁死,而不是在每个镜头里反复叮嘱。 它分三段:
- 设计(Design)——先写文本人设,把身份锁下来:脸、身形、年龄、发型、标志性特征。关键是把身份和服装分开——身份是全片不变的,服装是每场可换的。混在一起,角色就没法换衣服而不换脸。
- 参考构建(Reference construction)——把这套身份固化成一张(或一组)参考图,作为这个角色的"数字身份签名",之后每个镜头都复用它。
- 扇出镜头(Shot fan-out)——30+ 个镜头并行生成,每个都引用同一张参考图;prompt 里不再描述长相,只写"怎么动"。
范式里最反直觉、也最值钱的一点是:第二步是大多数创作者直接跳过的一步,而漂移恰恰从这里开始。 参考没锁牢,第三步的每个镜头都在向模型重新想象一遍"她长什么样",模型每次都当场发挥,于是每次都不一样。行业里把破解一致性的技术组合总结成一句话——「角色数字身份绑定 + 多角度预设 + 风格锁定」——三件事全都落在第二步。
参考图不是随便一张:从单图到多视图角色板
常规出图给出的是一张正面半身/全身照。它是最便宜的锚点,但只锁住了一个角度——一旦镜头要转身、给侧脸、露后背,模型就得凭空编,一编就漂。
这里有两层功夫要补。
第一层是参考图的硬约束。 一张角色参考图是身份锚点,不是一个镜头。如果它本身带着场景、戏剧光、夸张姿势,这些污染会顺着参考被带进引用它的每一个镜头。业界对"可复用参考图"的规格相当具体:
- 单人入框,画面里不能有第二张脸;
- 正面或 3/4 角度,人物居中,脸不裁切;
- 均匀柔和的布光,无强烈方向性阴影;
- 纯净中性背景(影棚灰),不是一个环境;
- 分辨率尽量高(短边 ≥1024)。
Scenario 给出的多视图生成指引更细:至少 6 张参考图、覆盖正面与左右 3/4、均匀布光、脸在画面里占 30–50%。这些不是审美偏好,而是让 i2i / i2v 模型能稳定读出身份的工程前提。
第二层是参考图的层次。 除了单图,还有一整套"高级用法"——三视图、四视图、角色设定表、表情板、动作板。它们不是越多越好,每一档都有明确的取舍:
| 参考图 | 是什么 | 优 | 缺 | 何时用 |
|---|---|---|---|---|
| 单图 | 一张正面/3-4 半身或全身 | 最便宜,分辨率全给一张脸 | 只锁一个角度,转身/侧背靠瞎编 | 一次性 / 背景角色 |
| 三视图 turnaround | 前 + 侧 + 背,全身,纯背景 | 锁轮廓+比例+服装全方位,社区标准锚 | 宽画布把分辨率摊薄,脸变小 | 反复出场的主角(默认) |
| 四视图 four-view | 三视图 + 一个 3/4 视角 | 多的 3/4 给 i2v 一个插值支点,转身更顺 | 面板更多,脸更小 | 频繁转身/走位的角色 |
| 角色设定表 model sheet | 三视图 + 头部特写 + 道具/服装标注 | 完整的身份圣经页,锁住细节道具 | 提示词最复杂,最易漂 | 服化复杂的 hero |
| 表情板 expression sheet | 一个头 × 多种情绪 | 锁住台词戏里的脸,防表情崩 | 不管身体/服装,需配三视图 | 台词密集 / 情绪戏 / 口型戏 |
| 动作板 pose sheet | 同一角色 × 几个关键姿势 | 锁住动态身形与剪影 | 脸小,不适合锁细节五官 | 打斗 / 舞蹈 / 运动镜头 |
拆解三视图提示词有个好用的"四层公式":主体描述(具体到发色/五官/服装材质,越具体模型越不乱发挥)+ 视角指令(character sheet, three views, front / side / back view, full body)+ 风格锁定(flat color, clean lines, no shadows,消除干扰)+ 格式排版(white background, grid layout)。核心心法只有一句:描述的特征点越多,模型自由发挥的空间越小。
我的实操建议很直接,别堆料:次要角色用单图;反复出场的主角上三视图;台词主角加一张表情板;只有服化复杂的 hero 才值得做完整角色设定表。 每多一张板,就多一个节点、多一次生成、多一次花钱,还会因为面板变多而让每张脸更小、更易漂。
锁一致性的三条技术路线
参考图定好了,用什么机制把它"焊"进每个镜头?主流有三条路线,各有适用面:
| 路线 | 手段 | 优缺点 | 适用 |
|---|---|---|---|
| 训练式 | 给角色训一个 LoRA / 用 IP-Adapter FaceID 锁脸 | 一致性最强,但要训练成本、要素材 | 主角、反复出场、要求极高一致性 |
| 参考式(i2i) | 单张/一组参考图 + img2img,每个镜头都带上参考 | 零训练、最便宜,但仍带运气成分 | 2026 年主流默认 |
| 多主体模型 | 用原生支持多主体的视频模型 | 单画面锁多人,省事,但受模型能力上限约束 | 多人对手戏 |
参考式是当下的默认,因为它不需要为每个角色训模型——但它的代价是不确定性:img2img 和图生视频两段都带运气,成功往往靠反复重试。多主体模型这一路进展很快,比如 Vidu 的 Q2 模型宣称单画面可同时支持至多 7 个主体,并在动态场景里保持人物、服装、场景的一致(截至 2026 年)。
这三条路线解决的是"怎么把参考焊进镜头"。但它们都有一个共同的盲区,就是下一节。
只锁参考不够:生成后必须校验、可能要重跑
范式的第三步——"每个镜头引用同一参考"——在工程上有个隐蔽的假设:参考图本身是对的。 现实是,一次生成可能跑成功了、却换了个人。参考式尤其如此,img2img 有天然的漂移概率。
所以行业的成熟做法里都藏着一道"生成后校验 + 重跑"的闭环。有一个很朴素的经验数字:约 30% 的角色图/镜头需要重生成一遍,才能把漂移压到可接受范围。把这一步当成流程的一部分(预留 ~30% 重跑预算),而不是当成失败——是专业管线和"碰运气"管线的分水岭。
校验点最好分两层,一层便宜一层严格:
- 便宜的一层是九宫格分镜。 把一个镜头的九个关键帧画在同一张画布上,同一个人天然保持同一副样子——它既是一致性机制,也是进视频前最便宜的人眼检查点。九格里的人还是同一个吗?不是就回上游修,别烧那张贵得多的视频。我之前专门写过这套:九宫格分镜为什么成了 AI 视频的一致性主力。
- 严格的一层是视觉身份校验。 九宫格抓的是单镜构图漂移,抓不了"生成成功但基础参考图就是另一个人"。这需要一个视觉语言模型(VLM)把生成图和身份设定逐条比对:脸、身形、发型、每个标志性特征,一条条过,输出 PASS 或"哪条漂了"。
把范式装进管线:copilot 自动搭图 + 三道门
上面这些是给"手动创作者"总结的方法论。而我做的是一个会自己在画布上搭节点、生成短片的 copilot——所以真正的工作是把这套范式翻译成 copilot 能自动执行的规则。这周我把它合进了 magicedit 的 character / shot 阶段(内部 PR#894,2026-07-24 合入),核心是给管线补上三道防漂移的门:
Rule A —— 参考图硬约束。 之前 copilot 生成角色图,只把身份描述塞进提示词,不约束成像的构图/布光/背景,结果经常出一张带场景的剧照,而不是干净的身份锚点。现在角色图的提示词里固定追加一段约束:单人、纯中性背景、均匀布光、不裁脸、≥1024、明确的负向词(busy background / dramatic lighting / second face / …)。同时角色圣经里给每个角色加一行 Reference note:,让"这个角色该用单图还是多视图板"从设计阶段就带下来,而不是出图时临时拍脑袋。多视图那套(三视图/四视图/角色板/表情板/动作板)单独抽成一个技能叶子,让 copilot 按角色需求挑最轻的一档。
B1 —— 九宫格检查点。 复用已有的九宫格关键帧机制,把它明确成"进视频花钱前的最后一道人眼 on-model 检查":九格里角色若漂了,上游修(重跑角色图 / 重出九宫格),而不是拿一张坏关键帧去生成一整段视频。
B2 —— 运行时 VLM 身份校验门。 这是最花心思、也最能体现工程约束的一道门。角色图生成完、进入镜头阶段之前,copilot 会在画布上建一个 VLM 节点,把生成的角色图和它的圣经条目分别接进去(图接 image 槽、身份文本接 prompt 槽——这个细节在预合并审计里被独立审查者揪出来过:两个不同类型的输入必须显式指定接哪个字段,否则身份文本会被当成第二张图喂进去,整道校验就悄悄失效了),逐条比对后输出 PASS 或 DRIFT。DRIFT 时只对漂了的那几个节点发一张重跑卡。
B2 有两个刻意的、非显而易见的设计决策,值得单独说:
- 绝不在后台读像素——校验必须是画布上的运行时节点。 直觉上,"比对两张图像不像"完全可以在后端悄悄跑一个视觉模型完成。但我们的管线是人类在环、花钱要确认的:识图这件事必须显式落在画布上、由用户点击运行、结果可见可审计。后台偷偷读像素既绕过了成本确认,也让用户看不到"系统凭什么判它漂了"。这条约束优先级高到我把它写进了 copilot 的硬规则里。
- 绝不自动重生成。 重跑要花钱。DRIFT 只是点亮一张重跑卡,让用户决定重跑哪几个——而不是 copilot 自作主张烧一轮 credits。一次漂移是正常的(记得那 ~30% 的经验值),不是流程失败。
三道门叠起来是一套分工明确的防线:Rule A 保证锚点本身干净,B2 保证锚点确实还是同一个人,B1 保证每个镜头的构图没在最后一步跑歪。
局限与没解决的问题
诚实地说,这套方案压住了漂移,但没消灭它:
- 参考式仍带运气。 i2i 的不确定性是模型层面的,管线只能靠"校验+重跑"兜住,兜不住的部分还是要人重试。真正的根治要么等模型更强,要么退回训练式(LoRA),后者对一个"聊两句就出片"的 copilot 太重。
- 多视图有分辨率税。 三视图/四视图把身份锁得更全,代价是每张脸分到的像素更少。角色设定表信息最全,也最容易在合成时自己就漂了。这是个真实的权衡,不是免费午餐。
- VLM 校验自己也会误判。 让一个视觉模型当裁判,它可能把对的判成漂、把漂的放过。B2 现在是 opt-in、受成本上限门控的——它降低漂移逃逸的概率,并不保证零漏判。
- 成本仍然是主线约束。 每加一道校验、每张多视图板、每次重跑,都是真金白银。整套设计里反复出现的取舍词就是"别堆料"——选覆盖需求的最轻一档。
结论
到 2026 年年中,AI 短剧的人物一致性已经从"玄学"变成"工程"。范式收敛得很清楚:先定身份、锁死参考、再扇出镜头,而一致性的成败几乎全押在中间那步——大多数人跳过的"参考构建"。
对创作者,实操结论是三句话:把身份和服装分开;给反复出场的主角做一张规格达标的多视图参考图(但别过度,选最轻的一档);把"~30% 要重跑"当成流程的一部分而不是失败。
对做管线的人,我这次落地最大的体会是:模型能不能生成,已经不是瓶颈了;瓶颈转移到了如何系统性地防漂移、并且便宜地校验。而当你把校验自动化时,最难的部分不是算法,是约束——校验必须人类在环、必须可见可审计、必须不替用户烧钱。这三条约束比任何一个视觉模型都更决定这套东西能不能真正用起来。
参考资料
- Juying AI — How to Make a 90-Second AI Short Drama in 1 Hour: Complete Workflow
- Vidu AI — Consistent Character AI: Workflows & Tips
- Scenario — Generate Character Turnarounds with AI: Consistent Multi-View Design
- Flick — img2img Character Consistency: The 2026 Guide
- DesignHero — 8 Ultimate Character Sheet Prompts for Nano Banana
- 幂简集成 — 2025 AI 短剧全流程指南:剧本生成、视频合成与质量控制的技术实战
- 界面新闻 / JMedia — 2025,AI 短剧的爆发前夜?
- Alignify — 最佳 AI 短剧平台(2026):剧本生成、角色一致、竖屏分发
- 乂媒体 TVtalk — AI 短剧深度调研报告:从技术萌芽到产业重构(2023-2026)
- 官小西 — 九宫格分镜为什么成了 AI 视频的一致性主力