首页/博客/AI 模型洞察/Wan 3.0 提示词指南:如何充分发挥 Wan 3.0 的最佳效果

Wan 3.0 提示词指南:如何充分发挥 Wan 3.0 的最佳效果

我花了一些时间使用 Wan 3.0,我想说,它比前代模型更像是一个由导演主导的模型。它现在支持以文本、图像、音频、视频、文档和网页作为参考输入,生成长达 30 秒的视频,因此提示词编写如今需要更精细的技巧。想知道其中的诀窍吗?继续阅读,我们将说明 Wan 3.0 究竟最适合响应什么内容。

TL;DR

你在提示词开头写下的任何内容,都会是 Wan 3.0 最先锁定的对象,因为它会较早规划构图。在识别主体前先确立镜头和场景,然后描述动作、指定光照与风格,最后添加音频。同时,请明确每个参考素材的作用,以避免出现随机结果。你可以将 Pollo AI 用作使用 Wan 3.0 生成视频的理想工作区。

Wan 3.0 提示词指南:理解关键要素

在介绍如何打造完美的 Wan 3.0 提示词之前,你首先需要了解任何基础提示请求的核心公式,因此让我们快速为你拆解:

要素

回答的问题

例子

提示词提示词是什么?哪些内容必须保持可识别性?一辆饱经风霜的蓝色送货自行车,配有一个柳条篮子。
场景它在哪里?周围环境如何?雨后的法国狭窄街道,瓦片外墙,积水,反光的路面。
运动哪些物体在移动?以什么顺序移动?以什么速度移动?自行车缓缓下坡,轮胎溅起水花。
相机控制这个镜头应该如何拍摄?低角度跟踪拍摄,35mm 镜头,柔和的阴天光线
风格化该场景遵循怎样的视觉美学?色彩柔和的纪录片视频。

为什么Wan 3.0需要更细致的提示?

Wan 3.0 的增强功能迫使我采用了与 Wan 2.7 不同的提示方式。其中一个原因是AI 视频的最大时长已延长至每段 30 秒。那么,这为什么重要呢?原因如下……

我对 Wan 3.0 进行了相当深入的测试,未能达到预期的视频与符合预期的视频之间的一个关键区别,是我的提示词中缺乏时间控制。当我只是给出视觉描述,而没有考虑镜头中的每一秒时,结果就失败了。

如果没有清晰的时间线,Wan 3.0 会用随机变化填补空白的秒数。最佳提示词会规划片段全程的关键动作和镜头行为,同时为每个图像、视频、音频文件或链接赋予明确的作用。

我还注意到,Wan 3.0 会较早确立构图,通常会将提示词中的首批细节作为场景基础。顺序很重要,尤其对于图生视频而言,它会保留初始构图和主体身份,却往往无法充分执行大幅变化

例如,如果我要将照片渲染成视频广告,并请求过于激进的转换,可能就无法获得理想的结果。考虑到所有这些因素,我认为使用 Wan 3.0 需要一种细致入微的方法。那么,让我们来看看如何才能获得最佳的提示词。

在深入了解 Wan 3.0 提示之前,请先阅读我们的Wan 3.0 指南,了解该模型的最新升级。

立即在 Pollo AI 免费试用 Wan 3.0

输入您的创意提示,使用 Pollo AI 的 Wan 3.0 制作精彩视频。

开始免费创作
开始免费创作

Wan 3.0 提示:文本转视频与图像转视频

为 T2V 编写 Wan 3.0 提示词的方式会不同于 I2V,因为整个序列取决于是否恰当地定义主体、环境、动作、镜头和视觉风格。

正如我之前提到的,Wan 3.0 会较早规划构图,因此你在提示词开头写下的内容,是模型在处理场景其余部分前最先锁定的内容。例如,如果你的提示词从描述一种氛围开始,那么 Wan 3.0 会围绕该氛围建立锚点,而非围绕主体建立锚点。

因此,你应该在识别主体及希望保留的特征之前,先确立镜头类型。
然后,你可以着手定义光线、风格,最后添加对话、音效或音乐。以下是我制作的一个动画短片示例:

提示词

输出

电影级 8K 风格化 3D 长镜头。一位头戴蓝色头巾的年轻男子使用全息智能手表,展开机械臂清洗他沾满泥泞的马自达 RX-7。汽车随即升级,涌动着蓝色电流,由白色变为闪耀着紫色光芒的亮黑色。这辆黑色跑车在雨后霓虹闪烁的赛博朋克夜城中疾驰。挡风玻璃上的抬头显示器启动,汽车腾空而起,在空中变形为一个巨大的双足机甲,驾驶员的身影出现在发光的胸前驾驶舱中。机甲重重地落在街道上,然后启动蓝色喷气推进器飞向高楼,英勇地屹立在摩天大楼的屋顶上。

另一方面,如果您打算使用参考图像,则需要采用不同的方法。就我使用经验而言, Wan 3.0 似乎比其他型号更严格地限制了源图像的构图和提示词。

正因如此,使用那些会带来彻底改变或突兀变化的提示可能会相当困难。在大多数情况下, Wan 3.0 效果会不尽如人意,无法达到我对场景的预期,所以我建议使用过渡平滑、连续的提示,例如以下示例:

提示词:

四镜头实拍序列。使用图 1 作为确切的开场画面和视觉锚点。保留雇佣兵公主、粗犷走私犯的面部特征、服装、手枪、宇宙飞船布景、灯光和镜头方向。一部典型的 80 年代太空动作电影:真人演员、实景布景、橡胶外星人服装、全尺寸电子动画机器人、实拍火花/烟雾、克制的激光特效、35 毫米变形镜头。

镜头 1(0-3.2 秒):锁定中距离双枪射击。她向左侧倾斜,靴子抬起,手枪晃动;他坐在右侧。

镜头 2(3.2-6.7 秒):快速倒放。外星人从他身后猛然闪现。她精准地射出一枪,子弹掠过他的肩膀;子弹击中胸口,火花四溅,外星人倒地。管弦乐般的刺耳声,激光爆裂声。

镜头 3(6.7-10.3 秒):低四分之三视角。机器人向右跺脚,举起手臂。她转身,开两枪(先是击中关节,然后是胸部);手臂落下,撞击地面,火花四溅,冒出浓烟。他目瞪口呆;她放下手枪。打击乐响起,铜管乐器奏出华丽的乐章。

镜头 4(10.3-14 秒):双人特写。保持原有的视线。她回到百无聊赖的姿势,手枪晃来晃去,目光呆滞。她依旧轻松自如,镇定自若,一副漠不关心的样子。

输入

输出

1787800046944-64220116-6849-48a5-b8cd-426e0ca3c699.webp

Wan 3.0 提示:处理运动

以我的个人经验而言,在 Wan 3.0 中处理运动需要进行相当程度的序列编排。虽然你可以使用“一个男人穿过海滩行走”这样的提示词,但我会说,这种描述只是一项简单的预设动作,时间安排与互动方式并不清楚。

更好的选择是加入一连串可观察到的事件。我会说:“一个男人穿过海滩行走,听到一声响亮的吠叫后停下,转身面向声音传来的方向,低头看到一只金毛寻回犬正向他跑来。”这会产生更真实的逐帧运动效果。

在Pollo AI免费试用Wan 3.0 💳 一次订阅,畅享所有模型 • 🌟 无需注册

但与此同时,你也不希望用过多编排让片段负担过重。这是我注意到的另一点:Wan 3.0 对此的响应并不理想。当我尝试让角色执行过多精确动作,或与许多物体互动时,输出效果并不那么理想。

因此,尽管 Wan 3.0 现在支持更长的 30 秒片段,我仍建议你让主体承担一个清晰、直接的任务或核心动作,以帮助确保时间稳定性。你可以在下面我生成的这段逼真视频中看到一个很好的例子:

提示词:

@Image 1 是唯一的主角。请始终保持她的面容、发型、身材和服装不变。超写实的 30 年代电影风格画面,定格在阳光明媚的意大利老城街道上(石头建筑、鹅卵石路、咖啡馆、行人、鸽子)。

0-5 秒:她在日常生活中自信地走向镜头(斯坦尼康向后移动)。

5-8 秒:停止,打响指→优雅的无形冲击波冻结一切。

8-20 秒:只有她一动;镜头在她走在冰冻的街道上时旋转,她触摸了一滴悬浮的水滴,然后对着镜头露出半个微笑,再次按下快门。

20-30 秒:第二道冲击波解冻了世界;她保持冷静。

风格:照片级写实,50mm 焦距,浅景深,自然光,细微颗粒感,逼真的物理效果/视觉特效。无变形、无额外元素、无瑕疵。

输入

输出

根据这张图片里的女人形象,生成一张她穿T恤的平面模型照片.webp

Wan 3.0 提示:镜头语言

对于镜头语言,我喜欢遵循一个简单的经验法则:按四个部分组织,即景别、角度、运动和镜头。例如:“从高角度的广角建立镜头开始,然后缓慢向前推轨并下降至灯塔;使用 50mm 的电影感透视。”

你可以在所有 Wan 3.0 提示词中使用这一规则,但务必记住避免相互矛盾的表述。例如,你不能说:“一台锁定不动的静态相机快速环绕主体。”这两个指令彼此不兼容,因此不要要求模型让它们同时成立。

如果你想生成类似预告片视频的动态序列,这里有一个通用的摄像机视角指南,您可以在制作场景时反复参考:

意图

镜头指令

视觉效果

设立地点广角镜头、慢速摇臂或拉远镜头背景和规模
建立亲密关系中近景,轻轻推入情绪关注
后续行动侧向移动镜头或前向移动镜头势头和参与
重视慢速轨道,中心构筑英雄主义或标志性强调
保留细节固定特写镜头,浅景深聚焦与检查
制造不稳定可控手持运动紧迫性或文献能量

另一项重要的事情是,仅仅写“电影感镜头运动”并不足以用 Wan 3.0 建立恰当的场景。你需要更具体;例如,“狗奔跑时,镜头以步行速度向左跟拍”会产生更有意图的结果。下面是一个很好的示例

提示词

输出

风格:超写实电影级冬季纪录片,4K HDR,自然光,浅景深,流畅的镜头运动,柔和的色彩调校,营造宁静的氛围。场景 1(0-3 秒):无人机航拍镜头,一座小木屋隐匿在白雪皑皑的松林深处。大雪轻柔飘落,温暖的金光从窗户透出。随着镜头缓缓下降,烟囱里升起缕缕炊烟。场景 2(3-6 秒):木屋内,同一位女子裹着柔软的羊毛毯,坐在噼啪作响的石砌壁炉旁,正在读书。场景 3(6-10 秒):她打开木质前门,踏上积雪覆盖的门廊。雪花轻柔地落在她的毛衣和头发上。她微笑着,缓缓深吸一口气,眺望着寂静的森林,镜头在她周围轻轻环绕。场景 4(10-13 秒)特写镜头:靴子在未踏过的雪地上留下新鲜的脚印,她戴着手套的手拂去松枝上的积雪,雪花落在温暖的小屋窗户上,烟雾飘散到清冷的冬日空气中。场景 5(13-15 秒)黄昏时分,镜头从小屋拉远。雪继续飘落,小屋在广袤的白色森林中渐渐缩小。

除了学习如何制作 Wan 3.0 提示之外,还可以阅读我们的Wan 3.0 使用指南,以生成更好的 AI 视频。

Wan 3.0 提示:音频/对话场景

我们知道 Wan 3.0 支持原生音频生成,但很容易忘记,音频同样需要像视觉内容一样经过有意识的描述。对于对白,我在生成日常 vlog教程、短片等内容后总结出的经验是:要尽量保持台词简短。

遗憾的是,口型同步并不总是稳定可靠,因此应将对白视作简短的表演提示,而不是冗长的剧本叙事。根据我的观察,这正是 Wan 3.0 最适合的方式。你可以在下面看到,这如何帮助生成出色的视听效果:

提示词:

保留@image 1 中人物的面部、发型、身份、肤色和体型。一位地道的印尼女性,身穿宽松的赤陶色亚麻衬衫、灰褐色阔腿裤、棕色皮凉鞋、小巧的金色耳环,一头蓬松的波浪卷发。

2000 年代末期翻盖相机拍摄的原始 vlog:画面抖动严重,对焦不准,曝光偏移,色调偏暖偏暗,有数码噪点。没有摆拍,也没有现代调色。

00:00–00:04 漫步热带村庄,面带微笑:“今天我们要去寻找新鲜的椰子!”

00:04–00:08 看着小贩切椰子,很兴奋。

00:08–00:12 啜饮椰子水,微笑着说:“这太清爽了!”

00:12–00:16 与村民们聊天/大笑,手里拿着椰子。

00:16–00:20 尝试打开椰子,费了好大劲,笑了;当地人欢呼。

00:20–00:24 舀起肉,尝一尝,竖起大拇指。

00:24–00:27 边走边向当地人挥手。

00:27–00:30 微笑挥手:“下次冒险再见!拜拜!”

输入

输出

根据这张图片里的女人形象,生成一张她的正面生活照片,形象,发型,严肃,肤色等等都要一样.webp

我还注意到,如果是多角色场景,一定要使用标签。例如,“[莎拉,沙哑的声音]说:‘我们六点出发。’”“[乔恩,轻柔而犹豫的声音]回头看着她,说:‘好的。我们开始收拾行李吧。’”

想了解更多 Wan 3.0 的应用案例吗?请查看这篇关于Wan 3.0 最佳应用案例的文章。

想用 Wan 3.0 生成精彩视频?立即前往Pollo AI

现在你已经清楚了解如何编写扎实的 Wan 3.0 提示词,可能想要立刻开始用它生成视频。如果是这样,我建议你前往 Pollo AI。为什么?因为它是功能强大的 AI 创意套件,汇集了所有顶尖的 AI 视频模型。

在这里,您可以访问Wan 3.0Seedance 2.5Kling 3.0Veo 3.1等数十种模型,方便您比较不同的输出效果,从而获得最佳结果。不仅如此,您还可以将所有素材上传到这个平台,并将所有项目托管在这个平台上。

Pollo.ai营销工作室的界面,用于创建视觉内容。

本质上,我认为它是一个理想的工作空间,能够配合你使用 Wan 3.0 的任何计划。最棒的是,它提供了Pollo 智能体,一个用于视频故事广告创意设计AI 智能体,它可以自动完成从结构和节奏到视觉效果的一切工作,这意味着它还可以指导你创作完美的提示词。

立即在 Pollo AI 免费试用 Wan 3.0

使用 Wan 3.0 将您最大胆的想法变为现实,并在 Pollo AI 上将其转换为可发布的视频。

开始免费创作
开始免费创作

只需几分钟,它就能将你的任何粗略想法变成可用于制作的成果。此外,Pollo AI 还提供数十种可用于后期制作的工具,例AI 视频扩展器,确保你拥有完成工作所需的一切。

只需前往 Pollo AI 并注册一个账号即可。您可以通过免费试用版开始使用 Wan 3.0 生成视频。我保证,只需几个小时,您就会发现它就像您自己的私人视频制作助手一样得心应手。

关于 Wan 3.0 提示词指南的常见问题解答

Wan 3.0 可以生成多长的视频?

Wan 3.0 允许您一次性生成最长 30 秒的带原生音频的视频。为了获得最佳效果,请确保您的提示词信息涵盖镜头的每一秒。否则,它可能会根据自身判断以意想不到的方式填充空白。

Wan 3.0 支持多少个参考素材?

您最多可以上传 10 张参考图片、5 个视频和 5 个音频文件,每次生成支持添加文档和网页链接。请务必标记每个参考文件的作用;否则,它们可能会随机影响最终输出结果。

如何改进过长的 Wan 3.0 提示词?

重点在于为 Wan 3.0 提供分层指令。例如:“一片寂静的森林。突然,地面震动并裂开。丧尸从裂缝中爬出。” 将所有关键状态分开,并将它们视为独立的时间节点。对于 30 秒的场景,为每个结束状态使用时间戳。

我应该如何为图生视频编写提示词?

Wan 3.0 的参考锚定能力非常强,因此它倾向于对源图像进行渐进式的演变,而不是剧烈的改变。重点在于精心设计提示,通过指定摄像机或拍摄对象在场景中的移动方式,来展现场景的自然发展过程。

如何提高 Wan 3.0 的角色一致性?

你可以使用角色的参考图片/视频,然后定义你希望 Wan 3.0 保持稳定的属性。例如,“在整个场景中保持女性的金色长发和面部特征不变。” 尽量减少角色数量、动作和地点变化。

使用 Wan 3.0 时如何控制音频?

编写提示词时,应将音频单独归类,并分别描述每种音频的来源/表现形式。例如:“温柔的女声响起。雨滴敲打着玻璃。钢琴曲在对话中缓缓响起。” 这样就涵盖了人声、音效和背景音乐,确保生成的场景中每个部分都得到了体现。

您可能也喜欢

查看更多

Wan 3.0 评测:我实测了 10 天,这是我的发现

这篇 Wan 3.0 评测分享了我在真实视频项目中测试这个模型后的发现。了解它的表现,以及为什么我推荐在 Pollo AI 上使用 Wan 3.0。

Wan 3.0 vs Seedance 2.5:该选择哪款 AI 视频生成器?

在这里了解更多关于 Wan 3.0 与 Seedance 2.5 的信息!阅读我们对 Wan 3.0 和 Seedance 2.5 的详细对比指南,了解如今哪款 AI 视频生成器最适合你!

Seedance 2.5 提示词指南:停止猜测,开始像导演一样创作

别再写华而不实的提示词了!掌握 Seedance 2.5 最实用的提示词公式,轻松生成惊艳的文本、图片和视频内容。

Gemini Omni (Veo 4)对比Seedance 2.0:哪款AI视频生成器更适合你?

对比Gemini Omni (Veo 4)和 Seedance 2.0的主要功能。看看哪款 AI 视频生成器更适合你的需求,并来Pollo AI免费试用 Gemini Omni和Seedance 2.0!