Explore Other Wan AI Models
核心功能
- 更强的时间连贯性:在更长的视频序列中,保持角色、物体和视觉细节的稳定一致。
- 更真实的物理模拟:以更可信的物理效果呈现流体、布料、碰撞以及多物体运动。
- 原生 1080P 视频生成:原生生成更清晰的 1080P 视频,并支持实验性的 4K 输出。
- 更快的视频生成速度:在相同硬件条件下,视频生成速度可提升约 40%。
- 灵活的多模态生成:支持基于文本、图像、音频或视频进行生成,并提供灵活的序列控制。
- 音频驱动的动作与唇形同步:可根据指定音轨同步角色动作和唇部运动。
更强的时间连贯性
Wan 3.0 能够让角色、物体和视觉细节在更长的镜头序列中保持更稳定,减少画面扭曲、漂移或帧间模糊。您可以构建连续的角色场景、动态产品镜头和更长的匀净片段,而不会出现画面中途崩坏的情况。
| 提示词 | 输出视频 |
| 一个持续 8 秒的连续跟踪镜头,跟随一位身穿红色皮夹克的年轻女子穿过熙熙攘攘的夜市,她手里拿着一杯透明的冰咖啡。镜头向后移动,她瞥了一眼摊位,啜饮了一口,然后继续前行。保持她的面部表情、服装、杯子、人群、光线和动作始终保持一致。 |
更真实的物理模拟
Wan 3.0 让液体流动更自然,布料反应更真实,多个物体在 AI 视频中的互动更清晰地展现重量感和动量互动。创作出动作序列、时尚视觉效果、飞溅特效和复杂运动,让画面真实自然,而非生硬做作。
| 提示词 | 输入图像 | 输出视频 |
| 15 秒;16:9。一个孤独的卷发男孩在学校遭遇排斥,然后在宿舍里打开了一双粉色的耐克球鞋。他下定决心,在日落时分的比赛中大放异彩,凭借快速的运球、传球和与队友的击掌庆祝。画面最后定格在他自信的笑容和耐克标志上。旁白:“献给永远准备好的人。”屏幕文字:“Just do it(只管去做)。” | ![]() ![]() |
原生 1080P 视频生成
Wan 3.0 原生支持 1080P 分辨率,相比 Wan 2.6 的 720P 输出,带来更清晰的纹理、更锐利的边缘和更丰富的细节,同时还提供实验性的 4K 生成。您可以制作出更精美的广告、产品展示、电影短片和大屏幕内容,而无需过多依赖后期升频技术。
| 提示词 | 输出视频 |
| 一段 8 秒的影棚产品宣传片,展示一款置于哑光炭灰色石质底座上的奢华腕表。影片以微距镜头呈现腕表的精细之处,包括拉丝钢表壳、滚花表冠、镌刻表圈、时标以及缝线皮革表带。腕表保持静止,镜头左右滑动,依次聚焦于表冠、表盘和表带,最终定格在一张清晰的四分之三侧面特写上,呈现出逼真的反射效果。 |
更快的视频生成速度
注意力优化使 Wan 3.0 在同等硬件配置下速度提升约 40%,帮助用户减少等待时间,更快地从提示词跳转到结果。尝试更多创意方向,更快地完善场景,并保持高容量内容工作流程的顺畅运行。
| 提示词 | 输入图像 | 输出视频 |
| 15 秒竖屏 9:16 UGC 护肤视频,在家中真实环境下拍摄,使用智能手机拍摄,轻微手持抖动,自然光。突出使用前后的强烈对比:暗沉、油腻、肤色不均的肌肤变得清透、明亮、光滑、水润。请完全匹配@image2并正确使用。视频包含使用特写,无文字、logo、音乐或水印,仅包含室内环境光。 | ![]() ![]() |
灵活的多模态生成
Wan 3.0 支持文本、图像、音频和视频输入,可用于首帧动画、起始帧和结束帧生成以及视频连续播放。它可以将静态图像转换为动态图像,引导两个关键时刻之间的过渡,或将现有片段扩展成更完整的序列。
| 提示词 | 输入图像和视频 | 输出视频 |
| 仅使用@video1的调色和镜头节奏。9:16,24 帧/秒,15 秒。一辆复古敞篷车在法国里维埃拉疾驰,一位围着围巾的女士坐在旁边,旁边放着一只迪奥 Book Tote 手提包。镜头切换到海边别墅,冰镇柠檬水,日落露台,以及居中的迪奥标志。避免模糊、水印和杂乱的文字。 | ![]() |
音频驱动的动作和唇形同步
Wan 3.0 使用指定的音轨来引导角色动作,并将唇部动作与声音同步。您可以创建对话片段、音乐表演、舞蹈视频和其他以音频为主导的场景,并实现更精准的时序控制。
| 提示词 | 输入图像 | 输出视频 |
| 12 秒真实浴室 UGC 视频,柔和的窗光和手持智能手机拍摄;全程不展示手机或拍摄设备。特写镜头:“等等——”展示产品:“我最近一直在用这款防晒霜。”涂抹过程:“它涂起来超级轻薄……不会泛白。”露出肌肤:“而且它涂在皮肤上感觉很舒服。”最后摆个姿势:“嗯……我真的很喜欢这款。”全程仅使用自然光。 | ![]() ![]() |
WAN 3.0 的实际应用案例
- 短片和人物故事:在对话场景、行走镜头和较长的叙事序列中保持同一角色的可辨识性,而无需明显的面部或服装变化。
- 时尚与饮品广告宣传:通过更具说服力的动态效果,打造飘逸的裙摆、飘动的面料、倾倒的饮品、飞溅的水花以及产品互动,为广告和社交宣传活动增添活力。
- 产品发布视频:生成清晰的 1080P 特写镜头、360° 产品展示视频、包装揭晓视频以及用于电子商务页面、演示文稿和发布活动的电影级品牌视觉效果。
- 社交广告迭代:在测试 YouTube、Instagram 或 TikTok 短视频广告时,更快产出并比较不同开场、镜头运动和场景变体。
- 照片动画和视频延展:为肖像或产品图像添加动画,连接两个计划的关键帧,或扩展现有片段以用于预告片、转场和营销活动编辑。
功能对比:Wan 3.0 vs Kling 3.0 vs Sora 2
| 功能 | Wan 3.0 | Kling 3.0 | Sora 2 |
| 支持的输入方式 | 文本、图像、音频和视频 | 文本、图像、起始/结束帧以及图像或视频参考 | 文本和图像输入 |
| 输出质量 | 原生 1080P,支持实验性 4K | 原生 4K | 720P |
| 时间一致性 | 在更长序列中保持角色和物体稳定 | 在多个镜头间保持较合理一致性 | 支持连贯的多场景生成 |
| 物理模拟 | 提升了液体、布料运动和多物体互动表现 | 处理常见的运动和场景交互 | 旨在模拟逼真的运动和环境 |
| 生成控制 | 首帧动画、起始/结束帧控制和视频连续播放 | 自动或自定义多镜头分镜,并支持元素参考 | 多镜头提示、角色参考、视频编辑与延展 |

如何在 Pollo AI 上使用 Wan 3.0
选择 Wan 3.0
打开 AI 视频生成器并选择 Wan 3.0 模型(即将推出)。
添加您的输入内容
输入提示词或上传图片或 MP4 音频/视频文件。
生成您的视频
选择您的设置,然后单击“生成”以创建您的 Wan 3.0 视频。
常见问题解答
什么是 WAN 3.0?
Wan 3.0 是一款多模态 AI 视频模型,能够根据文本、图像、音频或现有素材生成视频。它专注于更强的时间连贯性、更逼真的物理效果、原生 1080P 输出以及更灵活的视频控制。
Wan 3.0 可以生成哪些类型的视频?
Wan 3.0 可以创作人物故事、产品视频、时尚宣传片、动作场景、对话视频和电影级社交内容。其多模态输入方式也使其既适用于新一代用户,也适用于现有的素材工作流程。
Wan 3.0 能否在较长的视频中保持角色形象的一致性?
Wan 3.0 旨在更可靠地在较长的镜头序列中保持角色和物体的一致性。这有助于减少面部漂移、服装细节变化以及拍摄过程中人物变形等问题。
如何提高 Wan 3.0 视频中人物角色的一致性?
使用清晰的参考图片,避免在提示之间更改角色描述,并保持服装、发型和镜头方向的一致性。更简洁的场景过渡也有助于减少角色身份的混淆。
Wan 3.0 能否延长现有视频?
是的。它的视频续播功能可以在保持原有主题、场景和运动方向的同时延长现有素材,使其适用于更长的剪辑、转场和营销活动系列变体。
我可以在 Pollo AI 上免费使用 Wan 3.0 吗?
是的。您可以先使用 Pollo AI 的免费额度试用 Wan 3.0 AI 视频生成器。如果需要更高使用量、更快的处理速度或无水印效果,则可能需要付费套餐。

准备好迎接 Wan 3.0,今天来体验 Wan 2.6 吧!
使用 Wan 3.0 生成具有逼真物理效果、多模态输入和音频同步运动的连贯 1080P 视频。










