Skip to content

分镜时序——一条提示词写多个镜头

这是整份指南里最有价值的一条,也是绝大多数教程没讲的。

模型的内部建模是空间和时间解耦的。因此,一个复杂视频的提示词,最理想的形态是时间轴化分镜:把视频拆成几个分镜,按事件发生顺序动态描述每个分镜:谁 + 在哪 + 做什么 + 镜头怎么动。

具体规则(官方原文):

使用镜头1、镜头2、镜头3等标识,按事件发生顺序(先主后次)组织内容。

Seedance 1.0 文档也确认了同样的能力:

支持在同一 prompt 里包含多个切镜,这些切镜会根据提示词的内容,保持主体/风格/场景的延续性。

这意味着你不需要一镜一条提示词。 一条提示词就能出一段带剧情、镜头有变化、角色还不崩的连续片段。

反面案例(官方原文):

男人在街头紧张地奔跑,画面很有电影感。

正面案例(官方原文):

镜头 1:街巷侧拍,男人缓慢起跑,带有急促的呼吸感。
镜头 2:男人撞翻水果摊,镜头快速摇动并给到男人惊恐的特写。
镜头 3:男人翻过矮墙消失,镜头缓慢拉远定格在空荡的街道。

差别一目了然:反面例子只有一个模糊的情绪形容,正面例子把时间顺序、空间位置、动作、运镜全部交代清楚了。

官方给了明确的组织逻辑:

每个镜头推荐按以下逻辑组织:

  • 运镜或镜头切换方式:如“全景缓慢推近”“固定机位”“镜头切至…“等
  • 主体动作与表情:描述核心角色/物体的关键动作、神态变化
  • 位置或空间变化:说明主体所处的场景、位置或空间关系
  • 音频信息:描述对应镜头的音效、人声或背景音乐等

顺序是:怎么拍 → 谁在做什么 → 在哪 → 什么声音。

官方原文:

不强制限制每段时长,优先让模型根据剧情自然生成节奏。

说明:模型对精确时间(如 0–3 秒)的支持不稳定,强行限制时长可能导致生成结果异常。

所以只写“镜头1/镜头2/镜头3”,不要写“镜头1(0-3秒)”。节奏交给模型,你只控制顺序。

官方在「双胞胎问题」那节里明确警告:

请勿直接将完整剧本作为提示词使用,文案内容过度冗余易造成模型理解混乱,需精简无关表述、保证指令清晰聚焦。

一条提示词里三到四个镜头是舒适区,再多就该拆成两条生成了。

官方给了一条判断标准:

情况 做法 官方原文
文戏 用视频延长做连续长镜头 「适用于单一场景内的’文戏’,如长对话、情绪递进、单一路径移动,以实现沉浸式、连贯的一镜到底效果」
武戏 分段生成再剪辑拼接 「适用于剧情转折或复杂、快速的’武戏’,如追逐、打斗、蒙太奇等,可通过独立生成片段再剪辑组合,保证节奏与视觉冲击力」

翻译成漫剧场景:对话戏、情绪戏用一条多分镜搞定;打戏、追逐、快速蒙太奇老老实实分开生成再剪。

一个 15 秒三镜头的完整结构:

【风格前缀】
镜头1:【运镜】,【谁在哪做什么】,【光影】。
镜头2:【镜头切换方式】,【动作/表情变化】,【空间关系】。
镜头3:【运镜】,【高潮动作】,{台词},【落幅画面】。
<音效><音效>(背景音乐)
【约束词】

填好之后大概长这样:

2D日漫风格国漫质感,赛璐璐上色,冷蓝与暖橙对比色调。
镜头1:中景平稳右移,晚高峰地铁车厢内,男人靠在扶手杆旁低头看手机,
周围乘客面无表情,车厢顶灯冷白,窗外隧道灯光拉成流动光带。
镜头2:镜头缓慢推近至面部特写,男人猛然抬头,瞳孔收缩,喉结滚动,
手指攥紧背包带,冷蓝光从侧面打在脸上。
镜头3:镜头切至车厢全景并缓慢环绕,每个乘客头顶悬浮着半透明的橙色数字,
对面座位女孩头顶的数字转为刺目的红,男人压低声音说{那是……倒计时?},
镜头最后定格在闪烁的红色数字上。
<地铁行驶的低频轰鸣><耳鸣般的尖锐嗡声>(低沉悬疑的弦乐,逐渐升调)
人物面部稳定不变形,动作自然流畅,无卡顿无闪烁。
保持无字幕,避免生成任何文字、水印或Logo。

注意每个镜头只用了一种运镜(右移 / 推近 / 环绕),这是官方铁律