ai-video-prompt
AI 视频 Prompt 优化
AI视频场景Prompt优化专家,支持文生视频/图生视频/多图参考/多镜头/视频编辑等全场景,提供正向排除、视觉代偿、三级镜头控制、歧义词替换、结构化叙事、电影级质感描写等专业优化技巧;涉及对话台词时,同步提供AI配音三轴声学控制优化。Use when user asks to write, optimize, or review prompts for AI video generation, "优化视频提示词", "视频prompt", "AI视频", "写分镜", "配音提示词", "短剧提示词", or needs help with dialogue/dubbing in AI video scenes.
AI 视频场景 Prompt 优化
工作流程
- 识别场景类型:判断用户需求属于哪种公式(见下方)
- 套用对应公式:按结构输出优化后的提示词
- 应用高阶技巧:检查并修正常见错误(否定词、抽象动作、歧义词)
- 涉及台词/对话:参考 配音技巧指南 补充声学参数
一、核心提示词公式
文生视频(T2V)
基础公式(新手/灵感启发)
提示词 = 主体 + 场景 + 运动
进阶公式(提升质感)
提示词 = 主体(外观细节)+ 场景(环境细节)+ 运动(幅度/速率/效果)+ 美学控制 + 风格化
美学控制:光源、光线环境、景别、视角、镜头、运镜
电影感叙事公式(短剧/情感场景推荐)
提示词 = 场景氛围 + 主体细节 + 情感/叙事 + 运镜 + 电影美学标签
图生视频(I2V)
首帧图生视频(图片=视频第一帧,极高还原度)
提示词 = 运动描述 + 运镜指令
画幅跟随原图,第一帧与原图几乎一致
多图参考生视频(角色一致性)
提示词(必填)= 场景描述 + @图1 动作/位置 + @图2 动作/位置 + 叙事内容
@图N= 引用第N张参考图的角色/元素- 主体参考:借鉴身份特征,不逐像素复制
- 关键帧参考:近像素级高保真还原(适合分镜串联)
- 示例:
以@图1作为开场,@图1中的人走向@图2中的马,在@图3的雪原背景下策马奔驰
多镜头/分镜
提示词 = 总体描述 + 镜头序号 + 时间戳 + 分镜内容
特殊控制词(支持时填写):生成单镜头 / 无台词 / 无背景音乐
含音频的文生视频
提示词 = 主体 + 场景 + 运动 + 声音描述(人声/音效/BGM)
- 人声 = "台词内容" + 情绪 + 语调 + 语速 + 音色
- 音效 = 音源材质 + 行为 + 环境音
- BGM = 背景音乐 + 风格
视频编辑(V2V)
提示词 = 保留要素描述 + 替换/修改内容 + 目标画面风格
- 示例:
将背景从沙漠替换为蔚蓝大海,保持人物原有姿势和装备,光影调整为清新海滨风格
结构化叙事模板(短剧/情感场景推荐)
【场景】环境 + 光影 + 氛围细节
【主体】角色外貌 + 服装 + 动作状态
【运动】镜头运动 + 主体动作 + 细节捕捉
【音频】[角色,语气/语速] "台词内容"
二、电影级质感词汇速查
写进 prompt 可直接提升画面质感:
| 类别 | 推荐词汇 |
|---|---|
| 画质标签 | cinematic quality / 电影级画质 / 8K超写实 / film grain texture / 35mm film look |
| 光影描述 | golden hour lighting / shallow depth of field(浅景深)/ rim light(轮廓光)/ 散射柔光 / 冷白灯光 / 侧逆光 |
| 色彩风格 | muted vintage color palette / warm color temperature / noir aesthetic / 戏剧张力窒息 |
| 质感细节 | 皮肤毛孔可见 / 发丝细节 / 金属反光 / 烟雾水雾 / 布料褶皱纹理 |
| 运镜词汇 | 镜头推进/拉远 / 低角度平推 / FPV贴地飞行 / 固定镜头 / 景深变换 / 一镜到底 |
| 氛围词 | emotionally charged atmosphere / 戏剧张力窒息 / unspoken tension / 生物荧光流动 |
三、四大高阶优化技巧
技巧1:正向排除法(规避 Prompt 污染)
AI无否定理解能力——"不要戴头盔"会强化"头盔"语义。
规则:删除一切否定表述,只描述你想要的视觉元素,用物理/语义天然排斥替代否定逻辑。
| 错误 | 正确 |
|---|---|
一个宇航员,不要戴头盔 | 一个穿着加压宇航服的宇航员,头盔已卸下放在右侧金属支架上,露出短发和汗湿的额头 |
一位医生,不要穿白大褂 | 一位在生物实验室的女性,身穿深蓝色防静电连体服,胸前印有CRISPR Lab银色徽标 |
技巧2:视觉代偿法(替代抽象动作)
AI无世界模型,无法推理三维朝向;但能稳定渲染高辨识度的具象视觉元素。
规则:放弃动词("背身""望向"),改写「该动作必然携带的3-4个镜头内可见视觉元素」。
| 错误 | 正确 |
|---|---|
宇航员背身对着镜头 | [俯视角拍摄],头盔圆润顶部反光强烈,双肩甲片边缘勾勒V形轮廓,氧气瓶顶部接头六角金属质感 |
她望向远方的山峰 | [正脸微仰],护目镜内侧凝结细微水汽,右眼瞳孔映出远处雪顶高光,面罩呼吸阀轻微雾化 |
技巧3:三级镜头控制
直接写"广角""低机位"等相机术语无效;AI只响应画面最终呈现的视觉结果描述。
三层递进结构:
- 宏观(景别):
特写 / 中景 / 全景 / 大全景 - 中观(角度):拍摄视角动词 + 主体局部名词("俯视角→头盔顶部";"仰视→鞋底磨损纹理")
- 微观(焦点):1-2个高精度渲染细节(缝线/锈迹/反光点/皮肤毛孔)
技巧4:歧义词替换
"八块腹肌""赛博朋克""优雅"等词触发强语义扩散,破坏画面一致性。
规则:用「解剖学描述+光照反应+材质表现」替代风格标签,用「可测量特征」替代主观形容词。
| 错误 | 正确 |
|---|---|
一个帅气的程序员 | 戴无框眼镜的男性,衬衫第三颗纽扣松开,左手腕智能表显示Python代码滚动,咖啡杯沿留有指纹 |
赛博朋克风格 | 霓虹粉蓝光交替投射在潮湿沥青路面,倒影中反射出全息广告碎片 |
四、通用 Prompt 模板
[景别] [主体核心描述],[中观视角锚点],[微观细节1],[微观细节2],[环境氛围],[画质/风格]
口诀:先定景别 → 再锁视角 → 最后钉细节;删掉所有"不""很""超",只留眼睛看得见的东西。
五、涉及台词/对话场景
当视频包含人物对白、旁白或配音时,在声音描述中补充三轴声学参数:
人声 = "台词内容" + [发声方式] + [节奏描述] + [音调变化]
详细情绪配方(害怕/暧昧/娇嗔/愤怒/哭腔/惊喜/口语化)及符号控制体系,参见: → AI视频配音技巧指南
六、精选示例
结构化叙事示例(审讯室):
【场景】冷白灯光打下的审讯室,金属桌面反光,烟灰缸里有未熄的烟。
【主体】左侧老刑警,西装褶皱,眼袋深重,手指慢慢敲着桌面;
右侧嫌疑人,双臂交叉,眼神游移,嘴角带着轻蔑。
【运动】老刑警将一张照片缓缓推过桌面,嫌疑人眼神微微一顿又迅速移开;
镜头低角度平推,捕捉两人手部与表情的细微对峙。
【音频】[老刑警,语速极慢,每个字像钉子]:"你知道我做这行多少年了吗。"
[短暂沉默,烟灰缸上的烟细细飘散]
[嫌疑人,轻飘飘,刻意漫不经心]:"跟我有关系吗。"
[老刑警,不抬头,嘴角微动]:"有。因为我从没输过。"
电影感文生视频示例:
A cinematic scene: golden afternoon light spilling through arched windows of a Parisian
cafe. A man in a tailored navy suit sits across from an elegant woman in crimson dress,
half-empty coffee cups between them. The air is thick with unspoken tension. He leans
forward, voice low: "You knew from the beginning, didn't you?"
Cinematic wide-angle composition, warm golden hour lighting, shallow depth of field,
film grain texture, muted vintage color palette with deep crimson accents,
noir romantic aesthetic, 35mm film look.
多图参考示例(角色一致性):
充满童趣的童话场景。@图1中的小女孩在草地上蹦跳玩耍,@图2中的小熊坐在一棵
苹果树下拨弄吉他,一颗苹果掉到了@图2的头上,@图1开心地指着@图2说:"你要变成音乐家了!"
多镜头示例(情感短剧):
这个故事以第三人称视角,讲述一个关于放弃与重拾希望的短剧。
第1个镜头[0-3秒] [中景] 一个男孩在操场角落独自坐着,低头望着手中信纸,
轻轻叹气,眼神透露迷茫;[自然光,偏暖色温]。
第2个镜头[4-6秒] [特写] 固定机位,聚焦男孩眼睛,泪光闪烁,睫毛微颤,
眼眶下方一滴泪珠悬而未落;[散射柔光]。
第3个镜头[7-10秒] [中景] 场景转至简朴教室,一个女孩走到男孩身边,
面带温和笑容,说:"没事的,我在呢。"语气轻柔,语速稍慢,声音温暖。