多模态参考——把角色脸钉死
角色一致性是漫剧的命门。多模态参考就是官方给的解法。
两套语法,别搞混
Section titled “两套语法,别搞混”同一个功能,网页端和 API 文档用的符号不一样:
| 场景 | 语法 | 例子 |
|---|---|---|
| 即梦网页端(全能参考) | @图片1 |
@图片1 模仿 @视频1 的动作,音色参考 @音频1 |
| 火山引擎 API 文档 | <图片N> |
参考<图片1>中的<主体1>,生成... |
网页端输入框的占位提示写得很清楚,用 @ 触发素材引用。你在即梦里就用 @。 本页引用官方文档原文时保留 <> 写法。
官方推荐句式
Section titled “官方推荐句式”按任务类型分三类(官方原文):
多模态参考——适用于动作迁移、主体复用、氛围借鉴:
- 图片参考:参考
<图片N>中的<主体N>,生成…- 视频参考:参考
<视频N>中的<动作/运镜/风格/音效>,生成…- 音频参考:参考
<音频N>中的音色,生成…
编辑视频——局部替换、主体抹除、属性修改:
- 增加元素:清晰描述
<元素特征>+<出现时机>+<出现位置>- 修改元素:严格编辑
<视频N>,将其中的<原特征>修改为<新特征>- 删除元素:点明需要删除的元素,对于保持不变的元素,在提示词中加以强调,表现更佳
延长视频——续写剧情、延展动作:
- 延长视频:向前/向后延长
<视频N>,生成…- 轨道补全:
<视频1>+<过渡画面描述>+ 接<视频2>+<过渡画面描述>+ 接<视频3>
先定义主体,再反复指代
Section titled “先定义主体,再反复指代”这是官方强调的核心手法:
将
<图片/视频N>中的[主体核心特征]定义为<主体N>
官方示例:
将图片1中穿红色连衣裙、戴草帽的女人定义为主体1将图片1中穿红色连衣裙、戴草帽的女人定义为张红可以直接给角色起名字,后面剧情里就用这个名字指代,模型会自动关联。
官方对特征描述的要求:
使用 2–3 个清晰、稳定的静态特征(如服饰、发型、外观、类别)进行描述,确保唯一可识别性。
使用注意(官方原文):
- 每次涉及主体时需明确指代,避免省略
- 对于未定义主体的简单场景,使用
<主体N>@<图片N>- 对于已提前定义主体的场景,使用同一标签
- 描述尽量简洁,避免冗余和语义冲突
「每次涉及主体时需明确指代,避免省略」这条最容易被忽略——写到第三个镜头你会想偷懒写“他”,模型就开始漂了。
官方把素材分成四种功能角色:
- 角色锚定:锁定角色外观
- 场景定调:锁定环境与风格
- 运镜参考:锁定镜头语言与动作节奏
- 节奏氛围:用音频控制情绪、音色
官方推荐配置(总计 4–5 个素材):
角色图 1–2 张(面部特写 / 全身)+ 场景图 1 张 + 运镜视频 1 段 + 音频 1 段
角色脸不崩的三条官方要求
Section titled “角色脸不崩的三条官方要求”来自官方「人物 ID 漂移」问题的解决方案:
1. 单独准备一张人脸特写图
在原有全身照之外,额外准备一张只包含角色头部的人脸特写图(大头照,仅保留面部,无表情最佳,尽量减少肩颈、背景等干扰元素)。
2. 提示词里分工写清楚
官方给的示例句式:
<主体1>的面部特征参考图片1(大头照),妆造参考图片2(全身照)。
3. 重要素材放前面
越需要精准参考的素材,放在提示词中越靠前的位置。
绝对不要用三视图
Section titled “绝对不要用三视图”这是最反直觉的一条。很多人以为给模型看角色的正面、侧面、背面三视图能提高一致性,官方说恰恰相反:
人物参考使用大头照 + 全身照即可,不建议使用人物多视图。多视图素材包含同一人物的不同角度,模型易将其识别为多个不同主体,反而加剧 ID 漂移问题。
三视图还会引发「双胞胎问题」——同一画面里冒出两个一模一样的人。
官方给的做法是在人名后面标注对应参考图,格式统一:
张三(对应图片 1)将绿色存折扔向站立的李四(对应图片 2)。
再加一条全局约束(官方原文):
视频全程禁止出现外形、着装、配饰完全一致的人物,禁止生成同款分身、双胞胎效果,同一画面中仅保留单个对应人物,不出现人物重复复刻。
人数上限:官方说参考人物超过 4 人时输出稳定性明显下降,建议分组生成——6 个人分成 2 组、每组 3 人分别出图,再用这些图合成最终视频。