Skip to content

多模态参考——把角色脸钉死

角色一致性是漫剧的命门。多模态参考就是官方给的解法。

同一个功能,网页端和 API 文档用的符号不一样

场景 语法 例子
即梦网页端(全能参考) @图片1 @图片1 模仿 @视频1 的动作,音色参考 @音频1
火山引擎 API 文档 <图片N> 参考<图片1>中的<主体1>,生成...

网页端输入框的占位提示写得很清楚,用 @ 触发素材引用。你在即梦里就用 @ 本页引用官方文档原文时保留 <> 写法。

按任务类型分三类(官方原文):

多模态参考——适用于动作迁移、主体复用、氛围借鉴:

  • 图片参考:参考<图片N>中的<主体N>,生成…
  • 视频参考:参考<视频N>中的<动作/运镜/风格/音效>,生成…
  • 音频参考:参考<音频N>中的音色,生成…

编辑视频——局部替换、主体抹除、属性修改:

  • 增加元素:清晰描述<元素特征> + <出现时机> + <出现位置>
  • 修改元素:严格编辑<视频N>,将其中的<原特征>修改为<新特征>
  • 删除元素:点明需要删除的元素,对于保持不变的元素,在提示词中加以强调,表现更佳

延长视频——续写剧情、延展动作:

  • 延长视频:向前/向后延长<视频N>,生成…
  • 轨道补全:<视频1> + <过渡画面描述> + 接 <视频2> + <过渡画面描述> + 接 <视频3>

这是官方强调的核心手法:

<图片/视频N>中的[主体核心特征]定义为<主体N>

官方示例:

将图片1中穿红色连衣裙、戴草帽的女人定义为主体1
将图片1中穿红色连衣裙、戴草帽的女人定义为张红

可以直接给角色起名字,后面剧情里就用这个名字指代,模型会自动关联。

官方对特征描述的要求:

使用 2–3 个清晰、稳定的静态特征(如服饰、发型、外观、类别)进行描述,确保唯一可识别性。

使用注意(官方原文):

  • 每次涉及主体时需明确指代,避免省略
  • 对于未定义主体的简单场景,使用<主体N>@<图片N>
  • 对于已提前定义主体的场景,使用同一标签
  • 描述尽量简洁,避免冗余和语义冲突

「每次涉及主体时需明确指代,避免省略」这条最容易被忽略——写到第三个镜头你会想偷懒写“他”,模型就开始漂了。

官方把素材分成四种功能角色:

  • 角色锚定:锁定角色外观
  • 场景定调:锁定环境与风格
  • 运镜参考:锁定镜头语言与动作节奏
  • 节奏氛围:用音频控制情绪、音色

官方推荐配置(总计 4–5 个素材)

角色图 1–2 张(面部特写 / 全身)+ 场景图 1 张 + 运镜视频 1 段 + 音频 1 段

来自官方「人物 ID 漂移」问题的解决方案:

1. 单独准备一张人脸特写图

在原有全身照之外,额外准备一张只包含角色头部的人脸特写图(大头照,仅保留面部,无表情最佳,尽量减少肩颈、背景等干扰元素)。

2. 提示词里分工写清楚

官方给的示例句式:

<主体1>的面部特征参考图片1(大头照),妆造参考图片2(全身照)。

3. 重要素材放前面

越需要精准参考的素材,放在提示词中越靠前的位置。

这是最反直觉的一条。很多人以为给模型看角色的正面、侧面、背面三视图能提高一致性,官方说恰恰相反

人物参考使用大头照 + 全身照即可,不建议使用人物多视图。多视图素材包含同一人物的不同角度,模型易将其识别为多个不同主体,反而加剧 ID 漂移问题。

三视图还会引发「双胞胎问题」——同一画面里冒出两个一模一样的人。

官方给的做法是在人名后面标注对应参考图,格式统一:

张三(对应图片 1)将绿色存折扔向站立的李四(对应图片 2)。

再加一条全局约束(官方原文):

视频全程禁止出现外形、着装、配饰完全一致的人物,禁止生成同款分身、双胞胎效果,同一画面中仅保留单个对应人物,不出现人物重复复刻。

人数上限:官方说参考人物超过 4 人时输出稳定性明显下降,建议分组生成——6 个人分成 2 组、每组 3 人分别出图,再用这些图合成最终视频。