Wan 3.0 提示词指南:如何充分发挥 Wan 3.0 的最佳效果
我花了一些时间使用 Wan 3.0,我想说,它比前代模型更像是一个由导演主导的模型。它现在支持以文本、图像、音频、视频、文档和网页作为参考输入,生成长达 30 秒的视频,因此提示词编写如今需要更精细的技巧。想知道其中的诀窍吗?继续阅读,我们将说明 Wan 3.0 究竟最适合响应什么内容。
TL;DR
你在提示词开头写下的任何内容,都会是 Wan 3.0 最先锁定的对象,因为它会较早规划构图。在识别主体前先确立镜头和场景,然后描述动作、指定光照与风格,最后添加音频。同时,请明确每个参考素材的作用,以避免出现随机结果。你可以将 Pollo AI 用作使用 Wan 3.0 生成视频的理想工作区。
Wan 3.0 提示词指南:理解关键要素
在介绍如何打造完美的 Wan 3.0 提示词之前,你首先需要了解任何基础提示请求的核心公式,因此让我们快速为你拆解:
要素 | 回答的问题 | 例子 |
|---|---|---|
| 提示词 | 提示词是什么?哪些内容必须保持可识别性? | 一辆饱经风霜的蓝色送货自行车,配有一个柳条篮子。 |
| 场景 | 它在哪里?周围环境如何? | 雨后的法国狭窄街道,瓦片外墙,积水,反光的路面。 |
| 运动 | 哪些物体在移动?以什么顺序移动?以什么速度移动? | 自行车缓缓下坡,轮胎溅起水花。 |
| 相机控制 | 这个镜头应该如何拍摄? | 低角度跟踪拍摄,35mm 镜头,柔和的阴天光线 |
| 风格化 | 该场景遵循怎样的视觉美学? | 色彩柔和的纪录片视频。 |
为什么Wan 3.0需要更细致的提示?
Wan 3.0 的增强功能迫使我采用了与 Wan 2.7 不同的提示方式。其中一个原因是AI 视频的最大时长已延长至每段 30 秒。那么,这为什么重要呢?原因如下……
我对 Wan 3.0 进行了相当深入的测试,未能达到预期的视频与符合预期的视频之间的一个关键区别,是我的提示词中缺乏时间控制。当我只是给出视觉描述,而没有考虑镜头中的每一秒时,结果就失败了。
如果没有清晰的时间线,Wan 3.0 会用随机变化填补空白的秒数。最佳提示词会规划片段全程的关键动作和镜头行为,同时为每个图像、视频、音频文件或链接赋予明确的作用。
我还注意到,Wan 3.0 会较早确立构图,通常会将提示词中的首批细节作为场景基础。顺序很重要,尤其对于图生视频而言,它会保留初始构图和主体身份,却往往无法充分执行大幅变化。
例如,如果我要将照片渲染成视频广告,并请求过于激进的转换,可能就无法获得理想的结果。考虑到所有这些因素,我认为使用 Wan 3.0 需要一种细致入微的方法。那么,让我们来看看如何才能获得最佳的提示词。
在深入了解 Wan 3.0 提示之前,请先阅读我们的Wan 3.0 指南,了解该模型的最新升级。

Wan 3.0 提示:文本转视频与图像转视频
为 T2V 编写 Wan 3.0 提示词的方式会不同于 I2V,因为整个序列取决于是否恰当地定义主体、环境、动作、镜头和视觉风格。
正如我之前提到的,Wan 3.0 会较早规划构图,因此你在提示词开头写下的内容,是模型在处理场景其余部分前最先锁定的内容。例如,如果你的提示词从描述一种氛围开始,那么 Wan 3.0 会围绕该氛围建立锚点,而非围绕主体建立锚点。
因此,你应该在识别主体及希望保留的特征之前,先确立镜头类型。然后,你可以着手定义光线、风格,最后添加对话、音效或音乐。以下是我制作的一个动画短片示例:
提示词 | 输出 |
|---|---|
| 电影级 8K 风格化 3D 长镜头。一位头戴蓝色头巾的年轻男子使用全息智能手表,展开机械臂清洗他沾满泥泞的马自达 RX-7。汽车随即升级,涌动着蓝色电流,由白色变为闪耀着紫色光芒的亮黑色。这辆黑色跑车在雨后霓虹闪烁的赛博朋克夜城中疾驰。挡风玻璃上的抬头显示器启动,汽车腾空而起,在空中变形为一个巨大的双足机甲,驾驶员的身影出现在发光的胸前驾驶舱中。机甲重重地落在街道上,然后启动蓝色喷气推进器飞向高楼,英勇地屹立在摩天大楼的屋顶上。 |
另一方面,如果您打算使用参考图像,则需要采用不同的方法。就我使用经验而言, Wan 3.0 似乎比其他型号更严格地限制了源图像的构图和提示词。
正因如此,使用那些会带来彻底改变或突兀变化的提示可能会相当困难。在大多数情况下, Wan 3.0 效果会不尽如人意,无法达到我对场景的预期,所以我建议使用过渡平滑、连续的提示,例如以下示例:
提示词:
四镜头实拍序列。使用图 1 作为确切的开场画面和视觉锚点。保留雇佣兵公主、粗犷走私犯的面部特征、服装、手枪、宇宙飞船布景、灯光和镜头方向。一部典型的 80 年代太空动作电影:真人演员、实景布景、橡胶外星人服装、全尺寸电子动画机器人、实拍火花/烟雾、克制的激光特效、35 毫米变形镜头。
镜头 1(0-3.2 秒):锁定中距离双枪射击。她向左侧倾斜,靴子抬起,手枪晃动;他坐在右侧。
镜头 2(3.2-6.7 秒):快速倒放。外星人从他身后猛然闪现。她精准地射出一枪,子弹掠过他的肩膀;子弹击中胸口,火花四溅,外星人倒地。管弦乐般的刺耳声,激光爆裂声。
镜头 3(6.7-10.3 秒):低四分之三视角。机器人向右跺脚,举起手臂。她转身,开两枪(先是击中关节,然后是胸部);手臂落下,撞击地面,火花四溅,冒出浓烟。他目瞪口呆;她放下手枪。打击乐响起,铜管乐器奏出华丽的乐章。
镜头 4(10.3-14 秒):双人特写。保持原有的视线。她回到百无聊赖的姿势,手枪晃来晃去,目光呆滞。她依旧轻松自如,镇定自若,一副漠不关心的样子。
输入 | 输出 |
|---|---|
![]() |
Wan 3.0 提示:处理运动
以我的个人经验而言,在 Wan 3.0 中处理运动需要进行相当程度的序列编排。虽然你可以使用“一个男人穿过海滩行走”这样的提示词,但我会说,这种描述只是一项简单的预设动作,时间安排与互动方式并不清楚。
更好的选择是加入一连串可观察到的事件。我会说:“一个男人穿过海滩行走,听到一声响亮的吠叫后停下,转身面向声音传来的方向,低头看到一只金毛寻回犬正向他跑来。”这会产生更真实的逐帧运动效果。
但与此同时,你也不希望用过多编排让片段负担过重。这是我注意到的另一点:Wan 3.0 对此的响应并不理想。当我尝试让角色执行过多精确动作,或与许多物体互动时,输出效果并不那么理想。
因此,尽管 Wan 3.0 现在支持更长的 30 秒片段,我仍建议你让主体承担一个清晰、直接的任务或核心动作,以帮助确保时间稳定性。你可以在下面我生成的这段逼真视频中看到一个很好的例子:
提示词:
@Image 1 是唯一的主角。请始终保持她的面容、发型、身材和服装不变。超写实的 30 年代电影风格画面,定格在阳光明媚的意大利老城街道上(石头建筑、鹅卵石路、咖啡馆、行人、鸽子)。
0-5 秒:她在日常生活中自信地走向镜头(斯坦尼康向后移动)。
5-8 秒:停止,打响指→优雅的无形冲击波冻结一切。
8-20 秒:只有她一动;镜头在她走在冰冻的街道上时旋转,她触摸了一滴悬浮的水滴,然后对着镜头露出半个微笑,再次按下快门。
20-30 秒:第二道冲击波解冻了世界;她保持冷静。
风格:照片级写实,50mm 焦距,浅景深,自然光,细微颗粒感,逼真的物理效果/视觉特效。无变形、无额外元素、无瑕疵。
输入 | 输出 |
|---|---|
![]() |
Wan 3.0 提示:镜头语言
对于镜头语言,我喜欢遵循一个简单的经验法则:按四个部分组织,即景别、角度、运动和镜头。例如:“从高角度的广角建立镜头开始,然后缓慢向前推轨并下降至灯塔;使用 50mm 的电影感透视。”
你可以在所有 Wan 3.0 提示词中使用这一规则,但务必记住避免相互矛盾的表述。例如,你不能说:“一台锁定不动的静态相机快速环绕主体。”这两个指令彼此不兼容,因此不要要求模型让它们同时成立。
如果你想生成类似预告片视频的动态序列,这里有一个通用的摄像机视角指南,您可以在制作场景时反复参考:
意图 | 镜头指令 | 视觉效果 |
|---|---|---|
| 设立地点 | 广角镜头、慢速摇臂或拉远镜头 | 背景和规模 |
| 建立亲密关系 | 中近景,轻轻推入 | 情绪关注 |
| 后续行动 | 侧向移动镜头或前向移动镜头 | 势头和参与 |
| 重视 | 慢速轨道,中心构筑 | 英雄主义或标志性强调 |
| 保留细节 | 固定特写镜头,浅景深 | 聚焦与检查 |
| 制造不稳定 | 可控手持运动 | 紧迫性或文献能量 |
另一项重要的事情是,仅仅写“电影感镜头运动”并不足以用 Wan 3.0 建立恰当的场景。你需要更具体;例如,“狗奔跑时,镜头以步行速度向左跟拍”会产生更有意图的结果。下面是一个很好的示例:
提示词 | 输出 |
|---|---|
| 风格:超写实电影级冬季纪录片,4K HDR,自然光,浅景深,流畅的镜头运动,柔和的色彩调校,营造宁静的氛围。场景 1(0-3 秒):无人机航拍镜头,一座小木屋隐匿在白雪皑皑的松林深处。大雪轻柔飘落,温暖的金光从窗户透出。随着镜头缓缓下降,烟囱里升起缕缕炊烟。场景 2(3-6 秒):木屋内,同一位女子裹着柔软的羊毛毯,坐在噼啪作响的石砌壁炉旁,正在读书。场景 3(6-10 秒):她打开木质前门,踏上积雪覆盖的门廊。雪花轻柔地落在她的毛衣和头发上。她微笑着,缓缓深吸一口气,眺望着寂静的森林,镜头在她周围轻轻环绕。场景 4(10-13 秒)特写镜头:靴子在未踏过的雪地上留下新鲜的脚印,她戴着手套的手拂去松枝上的积雪,雪花落在温暖的小屋窗户上,烟雾飘散到清冷的冬日空气中。场景 5(13-15 秒)黄昏时分,镜头从小屋拉远。雪继续飘落,小屋在广袤的白色森林中渐渐缩小。 |
除了学习如何制作 Wan 3.0 提示之外,还可以阅读我们的Wan 3.0 使用指南,以生成更好的 AI 视频。
Wan 3.0 提示:音频/对话场景
我们知道 Wan 3.0 支持原生音频生成,但很容易忘记,音频同样需要像视觉内容一样经过有意识的描述。对于对白,我在生成日常 vlog、教程、短片等内容后总结出的经验是:要尽量保持台词简短。
遗憾的是,口型同步并不总是稳定可靠,因此应将对白视作简短的表演提示,而不是冗长的剧本叙事。根据我的观察,这正是 Wan 3.0 最适合的方式。你可以在下面看到,这如何帮助生成出色的视听效果:
提示词:
保留@image 1 中人物的面部、发型、身份、肤色和体型。一位地道的印尼女性,身穿宽松的赤陶色亚麻衬衫、灰褐色阔腿裤、棕色皮凉鞋、小巧的金色耳环,一头蓬松的波浪卷发。
2000 年代末期翻盖相机拍摄的原始 vlog:画面抖动严重,对焦不准,曝光偏移,色调偏暖偏暗,有数码噪点。没有摆拍,也没有现代调色。
00:00–00:04 漫步热带村庄,面带微笑:“今天我们要去寻找新鲜的椰子!”
00:04–00:08 看着小贩切椰子,很兴奋。
00:08–00:12 啜饮椰子水,微笑着说:“这太清爽了!”
00:12–00:16 与村民们聊天/大笑,手里拿着椰子。
00:16–00:20 尝试打开椰子,费了好大劲,笑了;当地人欢呼。
00:20–00:24 舀起肉,尝一尝,竖起大拇指。
00:24–00:27 边走边向当地人挥手。
00:27–00:30 微笑挥手:“下次冒险再见!拜拜!”
输入 | 输出 |
![]() |
我还注意到,如果是多角色场景,一定要使用标签。例如,“[莎拉,沙哑的声音]说:‘我们六点出发。’”“[乔恩,轻柔而犹豫的声音]回头看着她,说:‘好的。我们开始收拾行李吧。’”
想了解更多 Wan 3.0 的应用案例吗?请查看这篇关于Wan 3.0 最佳应用案例的文章。
想用 Wan 3.0 生成精彩视频?立即前往Pollo AI!
现在你已经清楚了解如何编写扎实的 Wan 3.0 提示词,可能想要立刻开始用它生成视频。如果是这样,我建议你前往 Pollo AI。为什么?因为它是功能强大的 AI 创意套件,汇集了所有顶尖的 AI 视频模型。
在这里,您可以访问Wan 3.0、 Seedance 2.5、 Kling 3.0和Veo 3.1等数十种模型,方便您比较不同的输出效果,从而获得最佳结果。不仅如此,您还可以将所有素材上传到这个平台,并将所有项目托管在这个平台上。

本质上,我认为它是一个理想的工作空间,能够配合你使用 Wan 3.0 的任何计划。最棒的是,它提供了Pollo 智能体,一个用于视频、故事、广告和创意设计的AI 智能体,它可以自动完成从结构和节奏到视觉效果的一切工作,这意味着它还可以指导你创作完美的提示词。

只需几分钟,它就能将你的任何粗略想法变成可用于制作的成果。此外,Pollo AI 还提供数十种可用于后期制作的工具,例如AI 视频扩展器,确保你拥有完成工作所需的一切。
只需前往 Pollo AI 并注册一个账号即可。您可以通过免费试用版开始使用 Wan 3.0 生成视频。我保证,只需几个小时,您就会发现它就像您自己的私人视频制作助手一样得心应手。
关于 Wan 3.0 提示词指南的常见问题解答
Wan 3.0 可以生成多长的视频?
Wan 3.0 允许您一次性生成最长 30 秒的带原生音频的视频。为了获得最佳效果,请确保您的提示词信息涵盖镜头的每一秒。否则,它可能会根据自身判断以意想不到的方式填充空白。
Wan 3.0 支持多少个参考素材?
您最多可以上传 10 张参考图片、5 个视频和 5 个音频文件,每次生成支持添加文档和网页链接。请务必标记每个参考文件的作用;否则,它们可能会随机影响最终输出结果。
如何改进过长的 Wan 3.0 提示词?
重点在于为 Wan 3.0 提供分层指令。例如:“一片寂静的森林。突然,地面震动并裂开。丧尸从裂缝中爬出。” 将所有关键状态分开,并将它们视为独立的时间节点。对于 30 秒的场景,为每个结束状态使用时间戳。
我应该如何为图生视频编写提示词?
Wan 3.0 的参考锚定能力非常强,因此它倾向于对源图像进行渐进式的演变,而不是剧烈的改变。重点在于精心设计提示,通过指定摄像机或拍摄对象在场景中的移动方式,来展现场景的自然发展过程。
如何提高 Wan 3.0 的角色一致性?
你可以使用角色的参考图片/视频,然后定义你希望 Wan 3.0 保持稳定的属性。例如,“在整个场景中保持女性的金色长发和面部特征不变。” 尽量减少角色数量、动作和地点变化。
使用 Wan 3.0 时如何控制音频?
编写提示词时,应将音频单独归类,并分别描述每种音频的来源/表现形式。例如:“温柔的女声响起。雨滴敲打着玻璃。钢琴曲在对话中缓缓响起。” 这样就涵盖了人声、音效和背景音乐,确保生成的场景中每个部分都得到了体现。






