用 AI 做过多镜头视频的人都碰到过同一个瞬间:你在提示词里写了「镜头从低角度绕人物旋转 180 度」,模型给你一个大差不差的旋转——但焦距变了,人物在画面里的比例变了,背景那根柱子转到一半自己消失了。你重抽一次,这回柱子在了,可旋转方向反了。
这不是提示词写得不够好。这是因为语言从来不是描述空间的高带宽通道。一段文字最多能约束「大概怎么动」,约束不了「精确到帧的机位在哪」。
2026 年这件事出现了一个明确的拐点。7 月 31 日字节跳动的 Seedance 2.5 正式上线(6 月 23 日火山引擎 FORCE 原动力大会首次亮相),据即梦内测博主的实测记录,它带来的能力里最反常识的一条不是 30 秒直出、也不是原生 4K,而是支持直接上传 3D 白模文件与相机动画,由官方 Blender 插件导入——把机位、轨道、遮挡关系交给 3D 软件,把材质、光影、细节交给模型。8 月 7 日火山引擎上线了 Seedance 2.5 的 API 服务。
白模这条路本身不新——ComfyUI 圈子里用 Blender 出 Depth/Normal 通道喂 ControlNet 已经玩了两年多。新的是它从民间 hack 变成了产品级一等功能。所以值得把它和其他几种主流技法拉到同一张桌子上,认真比一次。
先定坐标系:凭什么用这几个维度比
市面上的技法横评通常按「哪个更好用」排序,这没意义——它们锁的根本不是同一个东西。我用四个维度,因为这四个才是选型时真正会付账的:
- 它锁住了哪个维度——时间锚点、空间几何、身份外观、还是风格光影。这决定了它能不能解决你手上的问题,别的都是次要的。
- 前期成本——生成之前必须先付出多少人力,以及需不需要你不具备的技能(比如 3D)。
- 迭代成本——改一次要重做多少。这项被严重低估:一个前期贵但改起来便宜的方案,在真实项目里往往完胜前期便宜但每次修改都要重抽的方案。
- 失效模式——崩的时候怎么崩。所有技法都会崩,区别在于崩得可预测还是不可预测。可预测的崩可以在管线里加检查点,不可预测的崩只能靠人肉盯。
第四项是我认为最该被写进选型文档、却几乎没人写的一项。
六种技法逐个拆
1. 纯提示词(T2V):只锁风格
锁住的维度:风格、题材、大致氛围。几何维度一个都不锁。
优点诚实地说只有两个:零前期成本,以及在探索期它是唯一正确的选择——你还不知道要什么的时候,任何精确控制都是浪费。
缺点是它的可复现性接近零。同一段提示词跑两次,你拿到的是两个不同的镜头,而不是同一个镜头的两个版本。这对创作探索无所谓,对交付是致命的——甲方说「第 3 秒那个转场再慢一点」,你没有任何把手可以只动那一处。
失效模式:不可预测。任何一处都可能变。
2. 图生视频(I2V):锁住第一帧
锁住的维度:起始画面的全部信息——构图、角色外观、色调、光位。
这是目前工业界用得最多的技法,原因很简单:出图模型比出视频模型可控得多。你可以在图像阶段反复调到满意(成本是视频的百分之一),再让视频模型只负责「让它动起来」。2026 年主流的关键帧驱动工作流基本都建立在这个事实上。
缺点是控制在第一帧之后迅速衰减。镜头越长,后半段越像自由落体。5 秒内通常还行,10 秒以上你会看到画面慢慢漂离你精心调过的那一帧。
失效模式:可预测——总是从后半段开始崩,所以拆短镜头就能大幅缓解。这是它比纯提示词好带的关键原因。
3. 首尾帧(FLF2V):锁两个时间锚点
锁住的维度:镜头的开始状态和结束状态。中间的路径由模型插值。
Luma Dream Machine 的 keyframes 是较早把这件事产品化的,阿里通义万相在 2025 年 4 月 17 日以 Apache 2.0 开源了 Wan2.1-FLF2V-14B-720P,用两张图生成约 5 秒 720p 的过渡片段,让这条路线彻底平民化。
它真正的价值不在「生成」,在剪辑。首尾帧让你能卡死剪辑点:上一镜的尾帧就是下一镜的首帧,转场天然接得上。这是它在实际管线里不可替代的位置——不是用来做主镜头的,是用来缝镜头的。
缺点是中间过程完全不可控。你给了 A 和 B,模型可能走一条你完全没想到的路径过去。差异越大,路径越离谱:让一个人从站着变成坐着还行,让白天变成黑夜,模型经常给你一段莫名其妙的形变。
失效模式:可预测——首尾越像,中间越稳;首尾差异越大,风险越高。这个规律稳定到可以当作硬规则写进管线。
4. 多参考图 / 元素(R2V):锁身份与外观
锁住的维度:角色长相、服装、道具、场景的视觉 DNA。运动和空间一概不锁。
这是当前解决角色漂移的主力方案。据实测报道,Seedance 2.5 支持最多 50 个多模态参考素材(约 30 张图 + 10 段视频 + 10 段音频)。这个数量级说明了一个趋势:参考不再是「一张图」,而是一套资产库。
我之前专门写过两篇拆这条路线的文章——角色一致性的行业范式与工程落地讲怎么把身份和服装拆开锁,九宫格分镜为什么成了一致性主力讲那个近乎作弊的技巧:把九个关键帧画在同一张画布上,让画布本身逼出一致性。
参考图路线的根本局限在于:它锁的是「长什么样」,不是「在哪里」。角色的脸能一直对,但他在画面里的位置、和背景的遮挡关系、镜头怎么绕他转,参考图一个字都管不了。这恰好是白模负责的那一半。
失效模式:可预测——参考素材覆盖不到的角度(比如只给了正面参考却要拍背影)就是它的失控点。可以在管线里用 VLM 加身份校验闸门自动拦截。
5. Video-to-video 转绘 / 局部重编辑:继承全部运动
锁住的维度:源视频的全部时序信息——运动、时长、节奏、镜头切换。
Runway 在 2025 年 7 月 25 日发布 Aleph 时把这条路线的定位讲得很清楚:in-context video editing,改你要改的,其余原样保留。2026 年 5 月 21 日的 Aleph 2.0 与 Edit Studio 把它推到了 30 秒 1080p,并且能跨多个剪辑点统一施加同一处编辑——不用再逐镜重复操作。开源侧对应的是阿里 VACE(arXiv:2503.07598,ICCV 2025,截至 2026 年 8 月约 3.9k Star),把 R2V、V2V、掩码 V2V 统一在一个框架里,1.3B 和 14B 生产版本在 2025 年 5 月 14 日发布。
V2V 的优势极其突出:时序一致性是白送的,因为运动不是生成的,是继承的。物理合理性也是白送的——真实拍摄的素材自带正确的物理。
代价同样极其突出:你得先有源视频。这不是技术限制,是根本性的前置条件。要么你去实拍(那 AI 只是后期),要么你用 3D 渲染(那你又回到白模),要么你用别的 AI 生成(那源视频的所有毛病都继承下来了)。
在管线里它最合适的位置不是主力生成手段,而是事后修补层:换道具、改天气、统一调色、抹掉穿帮。只动坏掉的那部分,比重抽整镜便宜一个数量级。
失效模式:可预测——源视频里没有的信息,转绘也变不出来。源片里人物背对镜头,你没法转绘出他的正脸。
6. 白模控制:锁空间与相机
锁住的维度:机位、焦距、轨道、时间轴、物体的空间关系与遮挡。材质、光影、细节全部交给模型。
工作流有两条:一条是传统 ComfyUI 路线,Blender 里搭好体块,导出 Depth / Normal / Canny / OpenPose 等控制通道,喂给 ControlNet 或 VACE;另一条是 2026 年 7 月起 Seedance 2.5 走通的产品化路线——通过官方 Blender 插件直接上传 3D 白模与相机动画,模型原生消费。
优点:
- 运镜是真运镜。焦距、轨道、景深、穿越镜头在 3D 里确定,可复现、可微调,改一格参数就是改一格,不是重新抽卡。
- 时序一致性由几何保证。遮挡关系、透视、物体相对尺寸不会帧间漂移。这是纯文生视频最难解的部分,白模用一个"作弊"办法绕过了:不让模型推断空间,直接把空间给它。
- 跨镜头一致性天然成立。同一场景换机位,空间关系自动对得上,比靠参考图对齐可靠得多。我在场景一致性那篇里讨论过用参考图锁场景的种种别扭,白模基本上是那些别扭的根治方案。
- 可审片、可协作。导演能在白模阶段定剪定节奏,签完字再生成。这条在商业项目里的价值可能超过前面所有技术优点之和——它把 AI 视频从"抽到再说"变成了可排期的工序。
缺点,一条条讲清楚:
- 前期成本吃掉了"AI 快"的红利。建模、绑定、K 动画本身就是传统 3D 的全部苦活,白模只省掉了材质、灯光和渲染。团队没有 3D 能力,这条路根本跑不动——这是它最大的准入门槛,不是技术问题是人的问题。
- 约束权重是个真两难。给太满,AI 退化成"贴图机",出来的画面一股 3D 塑料味,观众一眼看出是渲染的;给太松,又回到漂移老问题。这个旋钮没有全局最优值,只能逐镜调。
- 白模不带光影信息。只给 Depth 通道,模型得自己打光,光位常和你在 3D 里设计的冲突。Normal 通道带表面朝向,对光照一致性的帮助比 Depth 大得多——这是实操里最值钱的一条经验,很多人只导 Depth 然后抱怨光在闪。
- 软表面是白模的盲区。头发、布料、水、烟、毛发没有几何支撑(你不会给白模做布料解算),这些地方帧间闪烁最严重,白模一点忙都帮不上。
- 面部表演是最弱环节。白模脸没有微表情。AI 补出来的情绪和口型经常对不上,特写基本救不回来。白模是给中远景和运镜设计的技法,不是给特写的。
- 迭代闭环慢。改一次动画要重渲控制序列 + 重推理,反馈周期比改提示词长一个数量级。
- 工具链绑死。依赖支持多条件控制的模型(Seedance 2.5 / VACE / Runway 控制模式等),换代要重调整套参数和权重。
失效模式:高度可预测,而且崩的位置固定——特写、软表面、光影一致性。可预测到你可以在分镜阶段就决定「这一镜不走白模」。这是白模被低估的最大优点:它的失败是可以提前规划的。
横向对比
| 技法 | 锁住的维度 | 前期成本 | 迭代成本 | 失效模式 | 最适合 |
|---|---|---|---|---|---|
| 纯提示词 T2V | 风格、氛围 | 分钟级 | 极低(但等于重来) | 不可预测,处处可变 | 探索期、氛围片、灵感采样 |
| 图生视频 I2V | 第一帧全部信息 | 十分钟级(调图) | 低(改图重跑) | 可预测:后半段漂 | 短镜头主力、单镜头成片 |
| 首尾帧 FLF2V | 两个时间锚点 | 十分钟级(两张图) | 低 | 可预测:首尾差越大越离谱 | 转场、卡剪辑点、循环动画 |
| 多参考图 R2V | 身份、外观、视觉 DNA | 小时级(做角色板) | 极低(资产可复用) | 可预测:参考未覆盖的角度 | 多镜头短剧、系列内容、IP |
| V2V 转绘 / 重编辑 | 源片全部时序 | 取决于源片获取 | 极低(只动局部) | 可预测:源片没有的变不出来 | 事后修补、换装换景、统一调色 |
| 白模控制 | 相机、空间几何 | 小时级 + 需 3D 技能 | 中高(要重渲重推) | 可预测:特写、软表面、光影 | 复杂运镜、产品/建筑/机械、多机位同场景 |
如果只能选一个:绝大多数人应该选图生视频,因为它的性价比在整张表里最高,而且它是唯一一个"学会了就能用在任何模型上"的技法。白模是给那些已经因为运镜控不住而在返工上烧了大量时间的团队准备的——它解决的是一个具体的痛,不是一个泛泛的"更好"。
它们其实是五层可叠加的约束
上面那张表容易给人一个错觉:这是六选一。实际生产管线里不是。
真实的管线是叠出来的,而且叠的顺序有讲究:先锁不可逆的,再锁可返工的。
- 空间与相机(白模)——改这层最贵,所以第一个定。
- 身份与外观(角色板 / 多参考 / 九宫格)——和空间正交,可以并行准备,资产还能跨集复用。
- 时间锚点(首尾帧)——用来卡剪辑点,让镜头之间接得上。
- 表演与语义(提示词 / 音频驱动口型)——白模最补不上的一层,也是特写最吃的一层。
- 事后修补(V2V 局部重编辑)——最便宜的一层,把能推迟到这里解决的问题全都推迟到这里。
这套顺序背后只有一条成本纪律:把返工尽量留在下层。如果一个问题能靠第 5 层的局部重编辑解决,就绝不要退回第 1 层重搭白模。反过来说,如果一个问题在第 5 层解决不了(比如机位本身就选错了),那它在第 5 层怎么修都是浪费。
顺带说一句,这也解释了为什么 2026 年的开源工具在往「多条件统一框架」收敛——VACE 把 R2V、V2V、掩码 V2V 塞进一个模型,Seedance 2.5 一口气吃 50 个参考素材外加 3D 白模,都是同一个方向:用户不需要六个技法六个工具,需要一个能同时接六种约束的入口。我在开源 AI 视频工具全景评测里也观察到过同样的收敛趋势,只不过那次是在工具层,这次是在模型层。
什么时候值得上白模
给一个能直接用的判断法,按顺序问:
- 这一镜有复杂运镜吗?(环绕、穿越、大幅推拉、多次变焦)——没有,别上白模,I2V 足够。
- 同一个场景要出三个以上机位吗?——要,白模的边际成本开始转正,因为一套白模摊到多个镜头上。
- 主体是硬表面吗?(机械、建筑、汽车、产品、包装)——是,白模的收益最大;如果主体是人物特写或大量软材质,收益迅速衰减。
- 甲方需要在成片前签字吗?——需要,白模阶段可审这一条本身就值回票价。
- 团队里有人会 Blender 吗?——没有,上面四条全部作废。这是硬门槛,不要指望现学。
四条里中两条以上,白模值得上。只中一条,用图生视频加参考图这套更划算。
反过来,明确不值得上白模的场景:单镜头氛围片、大特写情绪戏、需求还在飘的探索期、以及任何"这周就要"的活儿。
结论
白模不是「更好的 AI 视频生成」,它是一次不同的成本分配:把不确定性从生成阶段搬到了制作阶段。你买的是可控性、可复现性和可审片,付的是前期工时和一个 3D 人力的硬门槛。
2026 年真正的变化不是白模这个技法本身——它在 ControlNet 时代就存在了——而是它拿到了产品级的一等公民待遇:官方 Blender 插件、原生 3D 输入通道、和另外五种约束共用同一个模型入口。这意味着白模不再是「另一条技术路线」,而是变成了那五层约束里的第一层。
所以对绝大多数人来说,正确的问题不是「我该用白模还是参考图」,而是「我这条管线的第 1 层锁死了吗,我的返工正在发生在第几层」。如果你的团队每周都在为「镜头运错了」重抽整镜,那你的返工发生在第 1 层,白模就是答案。如果你的返工发生在「角色换脸了」,那第 1 层再完美也救不了你,该去补第 2 层。
技法本身没有优劣,只有它锁不锁得住你当前正在漏的那个维度。
参考资料
- ByteDance / 火山引擎 — Seedance 2.5:2026 年 6 月 23 日火山引擎 FORCE 原动力大会亮相,7 月 31 日正式上线,即梦全球首发;8 月 7 日火山引擎上线 API 服务。Seedance 2.5 内测实操记录(含 3D 白模与 Blender 插件工作流)
- Runway — Introducing Runway Aleph(2025 年 7 月 25 日)
- Runway — Introducing Aleph 2.0 and Edit Studio(2026 年 5 月 21 日,30 秒 1080p、跨镜头统一编辑、单帧编辑锚点)
- Ali-ViLab — VACE: All-in-One Video Creation and Editing(arXiv:2503.07598,ICCV 2025;1.3B / 14B 生产模型 2025 年 5 月 14 日发布;截至 2026 年 8 月约 3.9k Star)
- 阿里通义万相 — Wan2.1-FLF2V-14B-720P(2025 年 4 月 17 日开源,Apache 2.0,首尾帧生成约 5 秒 720p)
- Wan-Video — Wan2.1 开源仓库
- Tesseract Academy — From Blender to AI Video: A Faster Creative Workflow(Blender 白模 + 控制通道工作流)
- ComfyUI — Wan2.1 FLF2V Native Example