AI 视频提示词怎么写?从画面到镜头运动的实用模板

AI 视频总是“能看但不好用”?掌握主体、动作、镜头、场景和节奏五个要素,附可直接套用的提示词模板与避坑方法。

AI 视频提示词怎么写?从画面到镜头运动的实用模板
编辑部 ·

同一句“一个人在海边散步”,AI 可以生成广告大片,也可以生成镜头乱晃、人物变形的素材。差别往往不在于写得多,而在于你有没有把画面里真正需要被控制的信息说清楚。

写 AI 视频提示词,可以把自己当成给摄影师和剪辑师下简短的拍摄单:谁在做什么、在哪里、镜头怎么看、画面是什么感觉、这段动作持续多久。

先用一个五要素公式

主体 + 动作 + 场景 + 镜头 + 风格与节奏

例如:

一位穿深蓝风衣的女性,缓慢走过雨后的上海弄堂;傍晚暖光,地面有倒影;低机位跟拍,中景,镜头平稳向前推进;电影感,安静克制,8 秒。

这句话里每一段都有作用:

  • 主体:谁,外观和数量是否稳定
  • 动作:做一个什么简单、可观察的动作
  • 场景:地点、时间、光线、天气和关键道具
  • 镜头:景别、机位、运动方式和构图
  • 风格与节奏:写实、动画、胶片感,以及快慢和情绪

先把这五项写全,再考虑华丽形容词,成功率会高得多。

最重要的原则:一条镜头只做一件事

视频模型最容易在复杂连续动作中失控。与其写“人物进门、脱外套、倒咖啡、接电话、走向窗边”,不如拆成四个镜头分别生成,再用剪辑拼起来。

每段最好只保留:一个主体、一个核心动作、一个明确镜头运动。这样不仅更稳定,也方便你只重做不满意的一段。

画面怎么描述才有效

主体:用能看见的特征替代抽象评价

“一个很有气质的人”不如“短发、米色针织衫、戴圆框眼镜的年轻女性”。不要堆太多饰品;要保持人物连续时,反复使用同一组核心特征。

动作:说清起点和方向

“在跳舞”范围太大,“从左向右转身,裙摆随着动作扬起,最后面向镜头停下”更容易被执行。动作越违反常识、参与的肢体越多,越容易出错。

场景:优先写光线和空间关系

光线决定画面的一半。可以写“窗边侧逆光”“阴天柔光”“霓虹在湿地面反射”。同时补一个空间关系,例如“桌上只有一只白色陶瓷杯”“背景是虚化的书架”,能减少物体凭空增减。

镜头语言不需要复杂,但要明确

下面这些词足够覆盖大部分需求:

想要的效果可以这样写
交代环境全景、航拍、广角建立镜头
突出人物中景、近景、浅景深
突出细节特写、微距、固定镜头
跟着主体走跟拍、横移、平稳推进
制造情绪手持感、俯拍、低机位、慢动作

一次不要同时要求“航拍、环绕、推进、变焦、跟拍”。先选择一个主运动;镜头越克制,成片越可控。

三个可直接套用的模板

产品展示

[产品] 放在 [材质/颜色] 的桌面上,[光线] 从 [方向] 照入;镜头从 [起点] 缓慢 [运动方式] 到 [重点细节];干净的商业广告风格,画面中不出现文字和品牌标识。

人物氛围短片

[人物核心特征] 在 [地点] 做 [单一动作];[时间/天气/光线],[背景元素];[景别],[镜头运动];[风格与情绪],自然真实的肢体动作。

知识类转场素材

极简的 [主题物体/抽象元素] 从 [状态 A] 平滑变为 [状态 B];纯色背景,固定镜头,干净的 3D 动画风格,节奏均匀,无文字。

生成失败时,别急着整段重写

按这个顺序排查通常最快:

  1. 先删掉冲突要求:同一主体不要又“快速奔跑”又“从容安静”。
  2. 简化动作和角色数量:复杂手部动作、多人互动、频繁换装最容易出问题。
  3. 固定不可变项:保留人物、服装、场景和镜头,只有一个变量改动。
  4. 拆成镜头:长叙事不要一次生成完。
  5. 用首帧或参考图锁定视觉:有图生视频功能时,先把构图和角色确定下来。

AI 视频仍可能出现物理不连贯、遮挡后物体变化等问题,根源可参考什么是世界模型;工具选择可看AI 视频生成工具横评

常见问题

Q:提示词应该用中文还是英文?

多数主流工具都能理解中文。关键不是语言,而是具体、少冲突、结构清晰;如果某工具对英文镜头术语响应更稳定,再保留镜头部分的英文即可。

Q:负面提示词有用吗?

有些工具支持。它更适合排除明显不想要的元素,例如“无字幕、无人群、无快速镜头晃动”,而不是写一长串“不要变形”。先把正面描述写好更重要。

Q:能直接生成可发布的广告吗?

可以把它作为强大的素材生产工具,但人物、文字、产品细节和版权风险都应人工复核;特别是不能暗示真实人物做过其未同意的事。

总结

好视频提示词不是文学比赛,而是一张清楚的拍摄单。抓住主体、单一动作、场景光线、一个主镜头、风格节奏五件事,把复杂叙事拆镜头,把每次修改控制在一个变量,你会比单纯堆形容词稳定得多。