Veo 视频提示词生成器:如何撰写高效的 Veo 提示词
本指南将 Google 当前 Veo 提示词方法整理成适用于 Veo 3 与 Veo 3.1 的可复用模板,覆盖构图、运镜、人物细节、地点、动作、光线、对白和声音设计。
无论你是在生成电影感旅行短片、产品广告,还是角色驱动的短剧,核心提示词架构都是通用的。读到最后,你将清楚地知道该如何组织每一条喂给 Veo 的提示词。
Google 官方 Veo 指南建议把具体场景细节与电影制作指令结合起来。可以把提示词理解为对一个镜头的描述:画面里有什么、发生什么、镜头如何构图和运动、场景如何打光,以及应该听到什么。
六大提示词支柱
每条高效的 Veo 提示词都包含以下六个要素中的某种组合:
| 支柱 | 控制内容 | 示例值 |
|---|---|---|
| 主体(Subject) | 视觉焦点是谁或什么 | "一位五十多岁、银发的女性植物学家" |
| 动作 / 运动(Action / Motion) | 正在发生什么,如何运动 | "手中缓缓转动一个玻璃生态箱" |
| 环境(Environment) | 地点、时间、天气 | "黄金时刻阳光充沛的温室里" |
| 镜头(Camera) | 镜头类型、运动、镜头感 | "特写,浅景深,手持缓移" |
| 氛围 / 情绪(Mood / Atmosphere) | 情感基调、色彩 | "温暖琥珀色调,安静而沉静" |
| 声音提示(Audio Cue)(Veo 3+) | 环境音、对白、音乐 | "玻璃上轻柔的雨声,低沉的环境嗡鸣" |
Veo 3 与 Veo 3.1 支持生成音频。当声音属于创意目标时,应写明对白、环境声、音乐或音效;如果镜头刻意保持安静或只关注视觉,则不必强行添加。
Veo 提示词控制项清单
| 控制项 | 需要说明什么 | 示例 |
|---|---|---|
| 镜头构图 | 景别与角度 | 中景,低机位 |
| 镜头运动 | 摄像机如何移动 | 缓慢推进,手持跟拍 |
| 风格 | 视觉媒介或质感 | 黑色电影、定格动画、旧 VHS |
| 光线 | 方向与光质 | 暖色侧光,柔和补光 |
| 人物与地点 | 可见且具体的细节 | 雀斑植物学家,潮湿温室 |
| 动作 | 镜头期间发生什么 | 打开箱子并拿起标本 |
| 对白与声音 | 台词、环境声和音效 | “找到了。”玻璃雨声,低沉室内底噪 |
不是每条提示词都要填满所有控制项。需要控制的地方写具体,允许变化的地方可以给模型留出空间。
你可以直接在 PixMind 的 Veo 提示词库 中浏览现成的模板与社区示例,这是动手自建前非常有用的参考。
目标
生成一个气势恢宏、BBC 风格的自然镜头,具备强烈的尺度感与氛围感。
✅ 示例提示词模板
A lone Arctic fox trots across a vast frozen tundra at blue hour,
its white coat catching the faint violet light of the horizon.
Camera: wide establishing shot slowly pulling back via drone,
revealing endless ice plains stretching to the edge of frame.
Mood: silent, vast, awe-inspiring.
Audio: distant wind howl, soft crunch of snow underfoot.
Cinematic color grade, 24fps film look.
实战案例
一位旅行内容创作者使用这一结构,为纪录片系列生成了一个 10 秒的开场镜头。关键调整在于加入了 "slowly pulling back via drone" —— 若没有明确的镜头运动指令,Veo 会默认使用静态广角镜头,画面显得平淡。加入运动指令后,立刻营造出了场景所需的尺度感。
⚠️ 避坑警告
不要把 "美丽的风景" 作为一个独立的描述词来写。 这种说法过于抽象,Veo 无法据此执行。请用具体的视觉数据替换模糊形容词:光线方向、色温,以及一个具名的镜头运动。"美丽" 毫无意义;"f/2.8 景深下紫色光线映在霜晶上" 才是关键。
目标
生成一支适合社交广告或电商使用的 8–12 秒精修产品主镜头。
✅ 示例提示词模板
A matte black ceramic coffee mug sits on a weathered oak table
in a minimalist Scandinavian kitchen.
Steam rises slowly from the surface.
Camera: tight macro shot, slow push-in, rack focus from table grain
to the mug's rim.
Lighting: soft diffused morning light from a large window camera-left.
Mood: calm, premium, unhurried.
Audio: quiet ambient kitchen sounds, faint birdsong outside.
Color palette: warm neutrals, deep blacks, cream whites.
实战案例
某电商品牌为咖啡订阅服务测试了这一模板。关键细节是 "rack focus from table grain to the mug's rim" —— 这一条镜头指令告诉 Veo 要让焦点动起来,而不是生成一个静态感强的片段。最终成片是一段 9 秒的视频,无需后期处理就达到了可播出的水准。
若想深入了解电商视频用例,PixMind 的 Veo 用例页 提供了按场景分类的示例,值得收藏。
⚠️ 避坑警告
避免在产品镜头中放置两个相互竞争的主体。 如果你写 "桌上一只马克杯、一本书和一根蜡烛",Veo 会试图同时突出这三者,构图会变得杂乱。选择一个主角物体,把其余一切作为支撑性环境来处理。
目标
利用 Veo 3 的原生音频生成能力,生成一段两位角色对话的短场景。
✅ 示例提示词模板
Two young women sit across from each other at a small Paris café table,
afternoon light filtering through lace curtains.
Character A (brunette, 20s, wearing a yellow dress) leans forward and says:
"Do you ever feel like we're living someone else's story?"
Character B (redhead, 20s, green jacket) smiles softly and replies:
"Every single day."
Camera: over-the-shoulder two-shot, then cuts to close-up reaction.
Audio: ambient café noise, soft French accordion in background.
Mood: melancholic but warm, indie film aesthetic.
实战案例
一位短片创作者在实拍前使用这一结构来原型化一段对白场景。最重要的发现是:对白台词必须用引号标注,并明确归属到说话角色。如果没有归属,Veo 有时会把两个声音合成一个,或生成与口型不同步的画面。显式地使用 "Character A says:" 标签解决了这个问题。
⚠️ 避坑警告
每个片段中每个角色的台词控制在 1–2 行短句。 Veo 3 在简短对话上的音频同步表现很强,但在较长独白上会明显下降。若要生成扩展的对白场景,请生成多个短片段,然后在后期剪辑中拼接。
第五部分:场景 — 动作与运动序列
目标
生成一段高能量的动感镜头,比如滑板手、运动员或表演者的运动瞬间。
✅ 示例提示词模板
A young skateboarder in a red hoodie executes a kickflip
on a sun-drenched Los Angeles street court, mid-afternoon.
Camera: low-angle tracking shot following the board,
then a slow-motion freeze-frame at peak trick height.
Motion: fast approach, explosive jump, brief 120fps slow-motion at apex.
Mood: energetic, free, urban summer.
Audio: skateboard wheels on concrete, crowd cheer, hip-hop beat drop.
Color grade: high contrast, saturated warm tones.
实战案例
某运动服饰品牌将这一模板用于 Instagram Reel 广告投放。突破点在于 "brief 120fps slow-motion at apex" 这条指令,它告诉 Veo 在片段中途切换时间节奏,制造出一个戏剧性的停顿,在视觉冲击力最强的瞬间突出了产品(连帽衫)。缺少这条节奏提示时,整段视频以匀速播放,毫无记忆点。
⚠️ 避坑警告
不要在单个片段中要求多个技巧动作。 "滑板手做一个 kickflip,再做一个 heelflip,然后 grind 一段栏杆" 会产出一段混乱的运动序列。每个片段一个动作,干净利落地执行,永远胜过堆砌多个技巧的提示词。
第六部分:场景 — 抽象 / 生成艺术循环
目标
生成一段无缝循环的抽象视觉,非常适合用作背景、音乐可视化或氛围展示。
✅ 示例提示词模板
An infinite fluid simulation of deep indigo and gold ink
slowly blooming and dissolving in water.
No identifiable objects or figures.
Camera: static overhead macro view, perfectly centered.
Motion: slow, continuous, organic expansion and contraction — loop-ready.
Mood: meditative, hypnotic, timeless.
Audio: low drone, 40Hz binaural hum, no music.
Duration cue: designed to loop seamlessly at 8 seconds.
实战案例
一位音乐制作人将其用于 YouTube 氛围音乐频道。关键的补充在于 "No identifiable objects or figures" 和 "loop-ready" —— 缺少这两条,Veo 会在流体镜头中加入一只人手或一个可识别的容器,且片段末尾会出现硬切,破坏循环。负向引导和循环指令两者缺一不可。
⚠️ 避坑警告
抽象提示词恰恰是模糊语言危害更大的地方,而不是更小。 "某种美丽流动的东西" 会在多次生成中产出不一致的结果。请用具体的颜色名、具名的运动类型(流体模拟、粒子漂移、晶体生长)以及明确的镜头位置来锚定你的抽象提示词。
第七部分:场景 — 历史 / 年代剧氛围
目标
以真实的视觉质感与氛围唤起特定的历史时代,无需任何对白。
✅ 示例提示词模板
A Victorian-era London street at dusk, 1880s.
Gas lamps flicker to life along a cobblestone lane
as a horse-drawn carriage passes through light fog.
Camera: medium wide shot, static, slightly elevated angle as if from a second-floor window.
Mood: atmospheric, melancholic, Dickensian.
Lighting: warm amber gas lamp glow against cold blue dusk sky.
Audio: horse hooves on cobblestones, distant church bell, light rain.
Film grain texture, desaturated with amber highlights.
实战案例
一位历史小说作者用这一提示词为书籍制作了氛围预告片。关键镜头指令是 "as if from a second-floor window" —— 它给 Veo 一个明确的观察者位置,让镜头落地,并避免摄像机漂移到街道层面,从而保留了场景所需的电影感距离。
⚠️ 避坑警告
不要混用不同时代的元素。 诸如 "带有霓虹招牌的维多利亚伦敦" 或 "1880 年代街道背景中出现现代汽车" 这类写法会产出年代错乱的结果,且难以在单条提示词中修复。若你确实需要刻意的年代错置,请写明白:"蒸汽朋克架空历史的伦敦,维多利亚式建筑与发光的电气广告牌共存。"
第八部分:通用提示词框架与避坑清单
万能 Veo 提示词公式
将以下结构作为你生成任何 Veo 内容时的默认起点:
[SUBJECT + DEFINING DETAIL]
[ACTION / MOTION DESCRIPTION]
[ENVIRONMENT: location, time of day, weather]
[CAMERA: shot type + movement]
[LIGHTING: source, direction, color temperature]
[MOOD / COLOR PALETTE]
[AUDIO: ambient sound + music + dialogue if any]
[TECHNICAL NOTE: fps, grain, aspect ratio if needed]
并不是每个字段对每个片段都是必填的,但你填得越完整,对输出的掌控就越强。
不同场景应该把细节写在哪里
| 片段类型 | 最高优先级细节 |
|---|---|
| 抽象循环 | 运动规律、镜头行为、视觉质感 |
| 产品主镜头 | 产品外观、动作、光线、构图 |
| 自然或风光 | 地点、天气、镜头路径、环境声 |
| 角色场景 | 外观、动作、构图、声音、对白 |
| 动作或运动 | 明确动作过程、机位、环境运动 |
| 年代剧 | 符合时代的人物、地点、道具、光线与声音 |
提示词长度应服从镜头需要;Google 官方提示指南没有给出通用词数标准。
避坑总清单
在生成前,请用以下清单逐条检查你的提示词:
- [ ] 没有孤立的模糊形容词 —— 用具体的视觉数据替换 "美丽"、"惊艳"、"震撼"
- [ ] 每个片段只有一个主要主体 —— 避免画面中出现相互抢戏的主角
- [ ] 镜头运动是具名的 —— 写 "dolly in"、"arc right"、"static",而不是泛泛的 "moving camera"
- [ ] 声音重要时已明确说明 —— 如果声音属于镜头的一部分,要标明对白归属、环境声或音效
- [ ] 每个片段最多一个动作节拍 —— 多动作提示词会产出混乱的运动
- [ ] 时代或风格引用前后一致 —— 避免意外的年代错置
- [ ] 对白有归属并加引号 —— "Character A says: '此处为台词'"
- [ ] 循环意图明确 —— 若需要无缝循环,请写 "loop-ready" 或 "designed to loop"
- [ ] 所有细节内部一致 —— 删除在动作、镜头方向、时代或基调上相互竞争的指令
何时使用提示词生成工具
每次从零写提示词效率很低。Veo 提示词生成器可以把场景概念整理成结构化初稿。如果你的起点是一段参考视频,可以先用 Video to Prompt 提取镜头,再把选中的镜头按 Veo 需要的构图、动作、对白和声音结构改写。
这在以下场景尤为有用:
- 你刚开始接触 Veo,不确定哪些镜头术语能得到响应
- 你需要快速批量生成多个场景变体
- 你正在把图像提示词改造为视频提示词,需要补充运动、镜头与音频层
PixMind 的 Veo 提示词库 收录了按用例分类的社区精选提示词,是对照优秀示例校准自身提示词风格的捷径。
若想全面了解 Veo 3.1 的能力与生成设置,Veo 3.1 完全指南 涵盖了影响提示词解读方式的模型细节。如果你想在确定工作流之前将 Veo 与其他主流视频模型做对比,Veo 3 视频生成器指南 是一份扎实的技术参考。
第九部分:结语
写好 Veo 提示词不在于写得多,而在于在正确的支柱上写得精准。主体、动作、环境、镜头、氛围、声音:刻意填好这六个字段,保持提示词内部一致,并避开上文提到的常见陷阱。
一段平庸的 AI 视频与一支可播出级片段之间的差距,往往就取决于两三个具体的词:镜头运动名称、光线方向、声音质感。这些细节加上去的成本几乎为零,却会彻底改变输出效果。
从万能公式起步,一次专注测试一个场景,并随着你的提示词词汇库不断扩充,把 PixMind 的 Veo 用例 当作参考资料库。你把想看到的世界描述得越精准,Veo 就能越可靠地把它构建出来。
官方参考



