ai官小西

九宫格分镜为什么成了 AI 视频的一致性主力:作用、优缺点与主流用法

用 AI 生成多镜头视频的人都撞过同一堵墙:第一个镜头里的女主角发色、外套、脸型都对,切到下一个镜头,她换了张脸。角色漂移(character drift)是当前 AI 视频公认最烦人的问题之一——每个镜头各自向模型描述一遍"她长什么样",模型每次都重新想象一遍,于是每次都不一样。

九宫格分镜(3×3 nine-panel grid)用一个近乎"作弊"的朴素办法解决了它:把九个关键帧画在同一张画布上。既然九格共处一张图,出图模型天然会让同一个角色保持同一副样子、同一套衣服、同一个场景——一致性不是靠反复叮嘱换来的,而是画布本身逼出来的。

九宫格到底是什么,为什么有效

一张图,横竖各三格,共九格,格与格之间留白色分隔线。九格按"从左到右、从上到下"= 时间顺序排列,每格是一个关键 beat(可标景别)。这张图不是给人看的漫画,而是喂给视频模型的视觉骨架

关键在于视频模型怎么消费它。它不是"平移镜头扫过这张九宫格图",而是把整张图当成两样东西:

  1. 视觉 DNA——角色长相、服装、场景、光线、色调,全部从这张图里锁定;
  2. 分镜脚本——按 1→9 的顺序,把九个静态关键帧插值/演绎成一段连续视频(典型 15 秒)。

一句话概括分工:图负责"长什么样、演什么",Prompt 只负责"怎么动"

九宫格分镜到视频的两步主流工作流

这套之所以在 2026 年上半年火起来,直接原因是视频模型的图生视频(I2V)能力跨过了一道门槛。字节跳动的 Seedance 2.0 于 2026 年 2 月发布(2 月 7 日内测、2 月 10 日即梦上线、2 月 12 日全量),其多模态入参支持同时喂入至多 9 张图、3 段视频、3 段音频加自然语言。给它一张九宫格,它就能自动生出运镜和局部动画——这些活过去要人手剪辑,现在交给了生成模型。

主流用法:两步走的组合拳

当下最流行的组合只有一个模板:出图模型画九宫格 → 视频模型 I2V 演绎

  • 出图:Nano Banana Pro 或 GPT Image 2 是社区首选,因为它们能画出干净的分格、稳定的白色分隔线,并在九格间保持角色一致。
  • 演绎:Seedance 2.0(国内即梦最常用)、Sora 2、Grok 都能吃九宫格。

提示词的分工是这套玩法的精髓——图定好了长相和构图,Prompt 就不该再描述外观,只写运动:

参考 @图片1 的九宫格分镜,按从左到右、从上到下的顺序
演绎成一段 15 秒的视频,保持画面风格一致,
运镜以缓慢推拉为主,转场平滑自然,整体节奏舒缓。

进阶玩法会再叠加空间锚点:先出一张俯视图 + 一张全景图锁住室内空间逻辑,再配九宫格锁角色。社区把这套俯视图称作"室内空间逻辑的定海神针"——因为场景一致性比角色一致性更难,九宫格单独并不能解决换场景后地点走样的问题。

优点与局限:别把它当银弹

九宫格不是所有情况都最优。把它和另外两种常见参考方式摆在一起看,取舍就清楚了:

维度 九宫格(单张多格) 单张参考图 多张独立参考图
跨镜头一致性 (同画布天然锁定) 弱(只锁一个瞬间) 中(每镜头各锁,易漂移)
成本 (1 出图 + 1 视频) 高(6–8 镜头各自多次生成)
迭代效率 (改一张图重出) 低(改动在管线里逐镜头传导)
叙事容量 受限(≤ 9 个 beat) 单镜头 高(不限镜头数)
场景切换 弱(换地点会走样)
适配门槛 内容须能塞进 3×3

我的判断: 对"角色驱动、动作密集、能装进 9 个 beat"的段落,九宫格是当前性价比最高的一致性方案,没有之一。但它有三条硬边界,越界就别用:

  1. 超过 9 个明显 beat 塞不下——硬塞成 12 格,对 15 秒视频又显得赶,节奏崩掉。
  2. 镜头间视觉差异极大时不适用——换天换地换人,九格的"同画布一致性"反而成了枷锁。
  3. 场景一致性仍是未解难题——九宫格锁得住人,锁不住"下一场戏还是同一个房间",得靠俯视图/全景图额外兜底。

三档 look-lock,以及我把 grid 放宽成默认的取舍

在我自己维护的 AI 视频产品管线里,每个镜头有一个 look-lock 档位:none / single / grid,锁定强度从弱到强,恰好映射到视频模型的两个入口(i2v 严格首帧 vs r2v 全能参考)。

三档 look-lock 的决策光谱

最初的引导语把 grid 定位成"只给复杂、自成一体、多步动作弧的镜头"的罕见特例,于是负责生成分镜的 Agent 几乎从不选它——九宫格形同虚设。而联网调研让我意识到:业界主流恰恰把九宫格当默认省钱 + 锁一致性的主力,我们把它的定位反了。

于是我把给 Agent 的引导语放宽了(gridsingle/none 的判据这里只截取核心):

PREFER "grid" as the default whenever the shot features one or more
characters, spans a multi-step action, or needs identity/outfit/scene
held consistent — a 3x3 nine-panel storyboard is composed first and drives
the whole clip. Use "single" for a shot that continues directly from the
previous one but REVEALS parts the previous frame did not show. Use "none"
only for a trivial shot with no character and no continuity concern.
When unsure between grid and none, choose grid.

三档的分工因此变清晰:

  • grid(默认):有角色 / 多 beat 动作 / 需锁一致性——用九宫格接 r2v 全能参考,让整段片子跟着九格走。
  • single:镜头直接续上一镜、但露出了上一帧没展示的部分(拉远、转身、入画)——合成一张静帧当 i2v 严格首帧,专治续接漂移,防模型"发明"没展示的部分。
  • none:无角色、无连续性的琐碎镜头(纯插入、抽象铺垫、标题卡)才用。

这个改动的关键是零回归none 分支的行为逐字未变,三种模式的实现也没动,我只改了"告诉大模型优先选什么"。放宽引导语不改渲染链路,风险面收在 Agent 的选择偏好上——这正是 Prompt 层调优该有的克制。

关于把视频生成交给会写结构化定义的 Agent,我此前写过 HyperFrames 那篇——思路一脉相承:让模型输出它最擅长的结构(HTML 或九宫格),比让它凭空想象最终像素更可控。

结论

九宫格分镜不是什么花哨的新模型,而是一个朴素到近乎取巧的工程约束:用"九格同处一张画布"这个物理事实,把一致性从"反复叮嘱"变成"结构保证"。它对角色驱动、动作密集、能装进 9 个 beat 的段落是当前性价比最高的一致性方案;但它锁得住人锁不住场景,超过 9 个 beat 或镜头差异过大就该换别的方案。

给正在搭 AI 视频管线的人一条实践建议:把九宫格设成默认,而不是特例。让 single 去做它真正擅长的续接补帧,让 none 只留给琐碎镜头。当你在"要不要上九宫格"之间犹豫时,答案通常是——上。

参考资料

  1. 字节跳动 Seed — Seedance 2.0 正式发布(2026-02)
  2. 实在智能 — Seedance 2.0 什么时候发布的?内测到 API 开放时间线全解析
  3. 科技日报 — 字节发布 Seedance 2.0,豆包、即梦官宣接入(2026-02-12)
  4. closerAI(知乎)— NanoBananaPro 九宫格分镜图 + 索拉2 + grok 的视频生成
  5. 知乎 — 爆火全网!Seedance 2.0:九宫格分镜 + Seedance 2.0 视频生成法
  6. 知乎 — 9 宫格分镜转视频的四种高级玩法(附提示词)
  7. bilibili — AI 视频场景一致性完整工作流:俯视图、九宫格、全景图与 GPT-image2 调整方法拆解
  8. Atlas Cloud — The Ultimate Drama Workflow: GPT Image 2 + Seedance 2.0
  9. MindStudio — How to Use Storyboards and Character Sheets to Get Better AI Video Results
  10. SegmentFault — Seedance 2.5 正式发布:30 秒、50 个参考素材、原生 4K(2026-07)