传统手绘或实拍音乐视频通常需要较高的制作成本。过去一年,我将相关工作整理为一套半自动影像流程:创意、审美和关键判断由我负责,AI 承担静帧生成、动画生成与部分重复处理。本篇记录这套流程的完整结构,数据来自实际制作,规则则来自多轮返工与验证。
这并不是“一句话生成成片”的方法。AI 降低了绘制与渲染成本,同时提高了筛选和判断的密度:需要持续决定采用何种风格、哪些静帧值得动画化,以及镜头应如何对应音乐节点。工具发生变化,但取舍仍是制作的核心工作。
八阶段制作流程
一首歌曲转化为成品音乐视频,可拆分为八个阶段:
- 歌曲定稿(Suno 生成与筛选);
- 导演脚本(总则、镜头表与 A/B/C 动效分级);
- 静帧生产(niji → GPT,应用四项基础约束);
- 图像筛选(每个关键镜头从 2 至 3 个候选中定稿);
- 动画生成(Seedance,应用六项运动控制原则);
- 两轮复审(使用 filmstrip 联系表逐镜检查);
- 调色交付(依据锚点镜进行仿射匹配);
- 剪辑发布(剪映 → 抖音)。
图像筛选与两轮复审由我直接完成。自动流程可以检查尺寸与循环接缝,但视觉质量与叙事适配仍需人工判断;其余阶段则尽可能标准化和自动化。
提示词分层:图像负责视觉,视频负责运动
这套流程将提示词严格分为两个层级:
- 首帧图提示词只描述视觉结果:风格、光线、构图、胶片质感、hex 色板与人物锚点。所有风格词集中在这一层;
- 视频提示词只描述运动:运动主体、运动方式与镜头运动。此层不重复风格词。
如果在图像提示词中加入运镜要求,模型可能将运动趋势固化进静帧;如果在视频提示词中重复大量风格词,则容易造成画风闪烁和人物面部漂移。将视觉与运动分层,可以减少两个模型阶段之间的职责冲突。
这套图像与视频分层方法,以及后文使用的官方动画语法和受控运镜词表,主要参考 Higgsfield 的公开方法论,再根据项目的暗黑视觉方向进行调整。公开方法构成基础,具体约束来自本项目的实际测试。
静帧生成:四项基础约束
- 将画风标杆置于末位:参考图的最后一张固定为夜景或昼景的风格标准,确保模型优先对齐视觉基准;
- 灰色基调约束:世界以灰色为主,暖色仅存在于灯焰半径内,用于控制全局泛黄;
- 细笔触约束:减少数码噪点与过粗颗粒;
- 面部质感约束:保留红润、细腻与油画式高光,避免生成结果出现过度平滑且缺乏质感的面部。
- hex 色板入词:将定稿的 12 至 15 个 hex 值直接写入提示词,使配色从描述性语言转化为明确约束;
- 风格预设词典:使用“魂系油画·夜”“闪回”“烛光祭坛”等预设组合,再填写主体,避免在单个镜头中临时重写风格;
- 固定风格声明:使用统一的
Style: painterly dark fantasy, oil-painting texture, Rembrandt single-source lighting, chiaroscuro. No game engine, no 3D render look.声明。
- 人物面部与身体比例不通过后期拉伸或换脸修正。此类处理容易引入新的形变,因此不合格结果直接返回生成阶段重新取样。
动画生成:六项控制原则
- 避免“呼吸”“忽明忽暗”等开放式动词,以免模型增加发光环或生物结构等未指定内容;
- 对需要静止的对象使用明确约束,例如“亮度完全恒定”“绝不变大”;
- 每个镜头只保留 1 至 2 个运动源,其余对象逐项指定为静止;
- 需要虚焦的对象应注明“从开始到结束保持虚焦”;
- 循环镜头使用同一张图作为首尾帧,并锁定相机;
- 火焰不作为主要运动源。主体位置的火焰容易在生成过程中持续放大,这项限制来自五次连续失败。
实测中,使用宽松措辞时的一次通过率为 67%;改用明确限制后提高到 88%。涉及火焰的镜头改用雾、雪、发丝或灯芯亮度作为运动源,也可以保留静帧并在剪辑阶段加入镜头运动。
动画提示词使用官方结构化语法,而不使用散文式描述,以便准确对应音乐时间点:
Total: 10s / 2 shots / 16:9
Shot 1: 0–3s: she raises the lantern slowly...
3–5s: fog drifts left, [VFX: embers rising]
Shot 2: @image is the first keyframe and style reference
camera: slow dolly in, sharp focus throughout
需要特别控制两点。第一,使用时间戳规定节拍位置;第二,将负面表述改写为正向目标。例如,不写 no blur,而写 sharp focus throughout。公开示例和实际测试均显示,直接出现某个负面关键词仍可能触发相应内容。
运镜限定为 8 个语义核心:static / pan / tilt / dolly / tracking / crane / push-pull / orbit,再搭配 slow 等速度副词。每个镜头只设置一个主要运镜时,可用率为 79%;在单镜头中组合多个主要运镜时,可用率下降到 34%。
模型分工与任务配置
流程设计的重点,是根据模型能力分配任务,并用固定约束弥补各自的已知偏差。
| 平台/模型 | 强项 | 短板 | 任务 |
|---|---|---|---|
| niji 7 / Midjourney | 审美上限高,人物设定与画风表现较强 | 精确控制与一致性较弱 | 人物设定、画风原点、封面 |
| GPT image2 | 指令执行准确,可差分修改与批量生成 | 审美上限低于 niji,容易全局泛黄 | 场景静帧、人物差分、情感镜头 |
| Seedream | 支持大尺寸,成本较低 | 整体质感一般 | 大图基础与草稿 |
| Seedance 1.5-pro | 首尾帧图生视频和循环较稳定,成本较低 | 火焰容易放大,大幅动作中面部可能漂移 | 动画生成主力 |
| 即梦 Jimeng | 火焰与特效控制较好 | 批量处理与一致性较弱 | 火焰镜头备选 |
| Suno / Whisper | 歌曲生成 / 逐句转写与时间码校准 | — | 音乐与时间轴支持 |
Seedance 另有 2.0 版本,在复杂运镜、打斗与特效方面具有更高质量上限,但成本和余额门槛也更高。当前主力仍使用 1.5-pro;只有关键表演镜头才考虑使用 2.0。两者共用同一套流程约束,因为成片质量不仅取决于模型,也取决于工作流与提示词。更换模型时,不需要更换整套制作结构。
实测成本
| 项目 | 数据 |
|---|---|
| 静帧 | ¥0.5–0.7/张,全片约 70 张,合计约 ¥35–50 |
| 动画生成 | ¥11.3(5s)/ ¥22.5(10s),42 条合计约 ¥475 |
| 一次通过率 | 宽松措辞 67% / 明确限制 88% |
| 完整周期 | 写词 → 发行 → MV 发布,约 4 天/首 |
成本控制主要依靠动效分级。A 级完整动画只用于实际表演镜头,占比不超过 25%;B 级微动循环用于氛围主体;C 级保留静帧,并在剪辑阶段加入镜头运动。26 个镜头全部使用 A 级方案需要 ¥900 以上,分级后约为 ¥475。对于强调凝滞气质的歌曲,B/C 级的慢速微动既能控制成本,也符合整体视觉方向。
调色、剪辑与发布
- 调色:选择全片底色最准确的镜头作为锚点,逐通道进行仿射匹配,混合系数设为 0.6。完全匹配会削弱暖色特写,因此保留部分原始色彩;
- 剪辑:循环片段无缝重复;人物静帧不使用 3D 运镜,以避免 AI 视差扭曲面部,改用慢推与轻微旋转;入梦转场使用模糊闭幕与叠化;
- 导出:分辨率和帧率与原素材保持一致,例如 24fps 素材不导出为 60fps;关闭一键超清与 AI 补帧,避免生成式后处理引入伪影;
- 发布:手动选择同时包含人物面部与有效光源的封面帧,避免默认首帧为黑场而降低信息流中的识别度。
常见问题与对策
| 问题 | 现象 | 对策 |
|---|---|---|
| 视频提示词包含过多风格词 | 画风闪烁、面部漂移 | 风格仅写入首帧图提示词,视频提示词只描述运动 |
| 使用负面禁止式措辞 | no blur 等词反而触发对应现象 |
将限制改写为正向目标 |
| 使用散文式动画提示词 | 镜头无法准确对应音乐节点 | 使用官方语法与时间戳 |
| 单镜头组合多个主要运镜 | 抖动并降低画质 | 每个镜头只保留一个主要运镜 |
| 仅用形容词描述配色 | 跨镜头色调漂移 | 将 hex 色板写入提示词 |
| 将火焰设为运动源 | 火焰持续放大 | 改用雾、雪或发丝作为运动源 |
| 后期修正人物面部 | 拉伸与换脸产生新形变 | 返回生成阶段重新取样 |
| 使用剪辑软件的 AI 后处理 | 面部与油画质感出现伪影 | 关闭相关功能,并保持素材原生帧率 |
结论
这套流程并未减少创作判断,而是重新分配了创作劳动:AI 承担生成与重复处理,人负责风格、镜头、节奏和最终选择。工具与模型会持续更新,但视觉标准、运动约束和审核方法可以作为稳定的制作层保留下来。