AI 视频提示词怎么写?从画面到镜头运动的实用模板
AI 视频总是“能看但不好用”?掌握主体、动作、镜头、场景和节奏五个要素,附可直接套用的提示词模板与避坑方法。
同一句“一个人在海边散步”,AI 可以生成广告大片,也可以生成镜头乱晃、人物变形的素材。差别往往不在于写得多,而在于你有没有把画面里真正需要被控制的信息说清楚。
写 AI 视频提示词,可以把自己当成给摄影师和剪辑师下简短的拍摄单:谁在做什么、在哪里、镜头怎么看、画面是什么感觉、这段动作持续多久。
先用一个五要素公式
主体 + 动作 + 场景 + 镜头 + 风格与节奏
例如:
一位穿深蓝风衣的女性,缓慢走过雨后的上海弄堂;傍晚暖光,地面有倒影;低机位跟拍,中景,镜头平稳向前推进;电影感,安静克制,8 秒。
这句话里每一段都有作用:
- 主体:谁,外观和数量是否稳定
- 动作:做一个什么简单、可观察的动作
- 场景:地点、时间、光线、天气和关键道具
- 镜头:景别、机位、运动方式和构图
- 风格与节奏:写实、动画、胶片感,以及快慢和情绪
先把这五项写全,再考虑华丽形容词,成功率会高得多。
最重要的原则:一条镜头只做一件事
视频模型最容易在复杂连续动作中失控。与其写“人物进门、脱外套、倒咖啡、接电话、走向窗边”,不如拆成四个镜头分别生成,再用剪辑拼起来。
每段最好只保留:一个主体、一个核心动作、一个明确镜头运动。这样不仅更稳定,也方便你只重做不满意的一段。
画面怎么描述才有效
主体:用能看见的特征替代抽象评价
“一个很有气质的人”不如“短发、米色针织衫、戴圆框眼镜的年轻女性”。不要堆太多饰品;要保持人物连续时,反复使用同一组核心特征。
动作:说清起点和方向
“在跳舞”范围太大,“从左向右转身,裙摆随着动作扬起,最后面向镜头停下”更容易被执行。动作越违反常识、参与的肢体越多,越容易出错。
场景:优先写光线和空间关系
光线决定画面的一半。可以写“窗边侧逆光”“阴天柔光”“霓虹在湿地面反射”。同时补一个空间关系,例如“桌上只有一只白色陶瓷杯”“背景是虚化的书架”,能减少物体凭空增减。
镜头语言不需要复杂,但要明确
下面这些词足够覆盖大部分需求:
| 想要的效果 | 可以这样写 |
|---|---|
| 交代环境 | 全景、航拍、广角建立镜头 |
| 突出人物 | 中景、近景、浅景深 |
| 突出细节 | 特写、微距、固定镜头 |
| 跟着主体走 | 跟拍、横移、平稳推进 |
| 制造情绪 | 手持感、俯拍、低机位、慢动作 |
一次不要同时要求“航拍、环绕、推进、变焦、跟拍”。先选择一个主运动;镜头越克制,成片越可控。
三个可直接套用的模板
产品展示
[产品] 放在 [材质/颜色] 的桌面上,[光线] 从 [方向] 照入;镜头从 [起点] 缓慢 [运动方式] 到 [重点细节];干净的商业广告风格,画面中不出现文字和品牌标识。
人物氛围短片
[人物核心特征] 在 [地点] 做 [单一动作];[时间/天气/光线],[背景元素];[景别],[镜头运动];[风格与情绪],自然真实的肢体动作。
知识类转场素材
极简的 [主题物体/抽象元素] 从 [状态 A] 平滑变为 [状态 B];纯色背景,固定镜头,干净的 3D 动画风格,节奏均匀,无文字。
生成失败时,别急着整段重写
按这个顺序排查通常最快:
- 先删掉冲突要求:同一主体不要又“快速奔跑”又“从容安静”。
- 简化动作和角色数量:复杂手部动作、多人互动、频繁换装最容易出问题。
- 固定不可变项:保留人物、服装、场景和镜头,只有一个变量改动。
- 拆成镜头:长叙事不要一次生成完。
- 用首帧或参考图锁定视觉:有图生视频功能时,先把构图和角色确定下来。
AI 视频仍可能出现物理不连贯、遮挡后物体变化等问题,根源可参考什么是世界模型;工具选择可看AI 视频生成工具横评。
常见问题
Q:提示词应该用中文还是英文?
多数主流工具都能理解中文。关键不是语言,而是具体、少冲突、结构清晰;如果某工具对英文镜头术语响应更稳定,再保留镜头部分的英文即可。
Q:负面提示词有用吗?
有些工具支持。它更适合排除明显不想要的元素,例如“无字幕、无人群、无快速镜头晃动”,而不是写一长串“不要变形”。先把正面描述写好更重要。
Q:能直接生成可发布的广告吗?
可以把它作为强大的素材生产工具,但人物、文字、产品细节和版权风险都应人工复核;特别是不能暗示真实人物做过其未同意的事。
总结
好视频提示词不是文学比赛,而是一张清楚的拍摄单。抓住主体、单一动作、场景光线、一个主镜头、风格节奏五件事,把复杂叙事拆镜头,把每次修改控制在一个变量,你会比单纯堆形容词稳定得多。