ホームページ/記事一覧/AIモデルに関する考察/Wan 3.0 プロンプトガイド:Wan 3.0を最大限に活用する方法

Wan 3.0 プロンプトガイド:Wan 3.0を最大限に活用する方法

Wan 3.0をしばらく使ってみた感想ですが、以前のバージョンよりもディレクター主導型のモデルになっていると言えるでしょう。テキスト、画像、音声、動画、ドキュメント、ウェブページをリファレンス入力として30秒の映像生成に対応しているため、プロンプトの出し方には以前よりも繊細な操作が求められます。そのコツを知りたいですか? Wan 3.0がどのような入力に最も適しているかを解説しますので、ぜひ読み進めてください。

要約

Wan 3.0 は構図を早期にマッピングするため、プロンプトの冒頭に入力した内容を最初に確定します。被写体を特定する前にショットとシーンを設定し、次にアクションを説明し、照明とスタイルを指定し、最後に音声を追加します。また、ランダムな結果を避けるために、各参照の役割を指定してください。Pollo Pollo AI は、 Wan 3.0でビデオを生成するための最適なワークスペースとして使用できます。

Wan 3.0プロンプトガイド:重要なポイントを理解する

完璧なWan 3.0プロンプトの作成方法に入る前に、まず基本的なプロンプトリクエストの基本となる公式を理解する必要があります。それでは、簡単に説明しましょう。

側面

答えるべき質問

主題主題は何であり、何が認識可能なまま残されなければならないのか?使い込まれた青い配達用自転車に、籐製のカゴが付いている。
シーンそれはどこにあるのか、そして周囲には何があるのか​​?雨上がりのフランスの狭い通り、タイル張りのファサード、水たまり、反射する舗装路
モーション何が、どのような順序で、どのくらいの速度で動くのか?自転車はゆっくりと坂を下っていく。タイヤからは水滴が飛び散る。
カメラ制御そのシーンはどのように撮影すべきでしょうか?ローアングルからのトラッキングショット、35mmレンズ、柔らかな曇り空
様式化この場面を支配する視覚的美学とは何か?色調を抑えたドキュメンタリー映像

なぜWan 3.0はより繊細なプロンプト表示を必要とするのか?

Wan 3.0の機能向上により、Wan 2.7で頻繁に使用していたプロンプトのスタイルを変更せざるを得なくなりました。その理由の一つは、 AI動画の最大再生時間が1クリップあたり30秒に延長されたことです。では、なぜこれが重要なのでしょうか?その理由は次のとおりです…

Wan 3.0をかなり徹底的にテストしてみたところ、期待外れだった動画と期待通りだった動画の決定的な違いは、プロンプトにおける時間制御の欠如でした。ショットのすべての秒数を考慮せずに単に視覚的な説明を与えただけでは、うまくいきませんでした。

明確なタイムラインがなければ、 Wan 3.0は空白の時間をランダムな変更で埋めてしまうでしょう。最適なプロンプトは、クリップ全体を通して主要なアクションとカメラの動作を明確に示し、すべての画像、ビデオ、オーディオファイル、またはリンクに明確な役割を与えます。

また、 Wan 3.0は構図を早い段階で確立し、多くの場合、最初のプロンプトの詳細をシーンの基盤として使用していることに気づきました。特に画像から動画への変換においては、順序が重要であり、初期の構図と被写体のアイデンティティは維持されるものの、大幅な変更には対応しにくい傾向があります。

例えば、写真から動画広告を作成する際に、過度に極端な変換を要求すると、満足のいく結果が得られない可能性があります。こうした点を考慮すると、 Wan 3.0 を使用するには、繊細なアプローチが必要だと言えるでしょう。それでは、最適なプロンプトを得る方法を見ていきましょう。

Wan 3.0のプロンプトについて詳しく説明する前に、 Wan 3.0とは何かについてのガイドで、このモデルの最新のアップグレードについて確認してください。

Pollo AIでWan 3.0を無料でお試しください。

Pollo AIのWan 3.0を使って、あなたの創造的なアイデアを入力して、素晴らしい動画を作りましょう。

無料で作成を開始
無料で作成を開始

Wan 3.0プロンプト:テキストからビデオへの変換 vs 画像からビデオへの変換

T2V用のWan 3.0プロンプトの作成方法はI2Vとは異なります。なぜなら、シーケンス全体は被写体、環境、アクション、カメラ、およびビジュアルスタイルを適切に定義することにかかっているからです。

先ほども述べたように、 Wan 3.0は構図を早い段階でマッピングするため、プロンプトの冒頭に入力した内容が、シーンの残りの部分よりも先にモデルによって最初に固定されます。例えば、プロンプトが雰囲気の説明から始まる場合、 Wan 3.0は被写体ではなく、その雰囲気を中心に構図を構築します。

そのため、被写体と残したい特徴を特定する前に、カメラの撮影タイプを確立する必要があります。その後、照明やスタイルを定義し、最後にセリフ、効果音、音楽などを追加できます。例として、私が作成したアニメーション映画を以下に示します。

プロンプト

出力

映画のような8Kスタイルの3D連続ショット。青いバンダナを巻いた若い男がホログラフィックスマートウォッチを使って、泥だらけのマツダRX-7を洗う機械アームを展開する。車はアップグレードされ、青い電気がほとばしり、白から光沢のある黒へと変化し、紫色のエネルギーが光る。黒い車は、雨で濡れたネオンのサイバーパンク都市を夜通し疾走する。フロントガラスのHUDが起動し、車はジャンプし、空中で巨大な二足歩行メカに変形する。ドライバーは光る胸のコックピットから見える。メカは道路に激しく着地し、青いジェットスラスターを使って飛び上がり、高層ビルの屋上に堂々と立つ。

一方、参照画像を使用する場合は、別のアプローチが必要になります。私が使用した限りでは、 Wan 3.0は他のモデルよりもソース画像の構図と被写体の特定をはるかに厳密に制限しているようです。

そのため、劇的な変化をもたらしたり、急激な変化を引き起こしたりするプロンプトを使用するのは非常に難しい場合があります。ほとんどの場合、 Wan 3.0 は期待どおりに動作せず、シーンに対する私のビジョンに及ばないため、以下のような滑らかで連続的な遷移を持つプロンプトを使用することをお勧めします。

プロンプト:

4ショットの実写シーケンス。画像1を正確なオープニングフレームおよび視覚的アンカーとして使用します。傭兵の王女、屈強な密輸業者、顔、衣装、ピストル、宇宙船セット、照明、画面方向はすべて同一にしてください。1980年代の実写SFアクション映画:実写俳優、実物のセット、ゴム製のエイリアンスーツ、実物大のアニマトロニクスロボット、実写の火花/煙、抑制された光学レーザー、35mmアナモルフィック。

ショット1(0~3.2秒):ロックオンされた中距離ツーショット。彼女は左に寝そべり、ブーツを上げ、ピストルをぶら下げている。彼は右側に座っている。

ショット2(3.2~6.7秒):高速逆再生。エイリアンが彼の左後方に飛び出す。彼女は彼の肩をかすめるように正確な一発を発射する。弾丸が胸に命中し、火花が散り、エイリアンは倒れる。オーケストラの突き刺すような音、レーザーの閃光。

ショット3(6.7~10.3秒):低い3/4アングル。ロボットは右に踏み込み、腕を上げる。旋回して2発発射(関節、次に胸部)。腕が下がり、火花と煙を上げて倒れる。ロボットは畏敬の念で見つめる。ロボットはピストルを下ろす。打楽器が鳴り、金管楽器が華やかに鳴り響く。

ショット4(10.3~14秒):タイトなツーショット。元の視線。彼女は退屈そうなポーズに戻り、ピストルをぶら下げ、じっと見つめる。彼女は依然として、何事にも動じず、冷静で、無関心な様子だ。

入力

出力

1787800046944-64220116-6849-48a5-b8cd-426e0ca3c699.webp

Wan 3.0プロンプティング: モーションの処理

個人的な経験から言うと、 Wan 3.0でモーションを処理するには、かなりのシーケンス処理が必要です。「男性がビーチを歩く」といったプロンプトを使うこともできますが、これは単なる単純なプリセットアクションに過ぎず、タイミングやインタラクションが不明瞭なままです。

より良い方法は、一連の観察可能な出来事を追加することです。例えば、「男性がビーチを歩いていると、大きな吠え声が聞こえて立ち止まり、音のする方へ振り返ると、ゴールデンレトリバーが自分に向かって走ってくるのが見えた」といった具合です。こうすることで、よりリアルなコマ送りの動きが表現できます。

Pollo AIでWan 3.0を無料でお試しください💳 1つのサブスクリプションで全モデル利用可能 • 🌟 サインアップ不要

しかし同時に、クリップに過剰な振り付けを詰め込みすぎるのも避けたいところです。これは、 Wan 3.0 があまりうまく対応できない点の一つです。キャラクターにあまりにも多くの精密な動作をさせたり、多くのオブジェクトとインタラクトさせようとすると、出力結果はあまり理想的ではありませんでした。

Wan 3.0では30秒の長めのクリップもサポートされるようになりましたが、時間的な安定性を確保するために、被写体に明確で分かりやすい役割や中心的な動作を与えることをお勧めします。以下に作成したリアルな動画で、その良い例をご覧いただけます。

プロンプト:

@Image1 は唯一の主人公です。彼女の顔、髪型、体型、服装は、作品全体を通して正確に維持してください。陽光が降り注ぐイタリアの旧市街の通り(石造りの建物、石畳、カフェ、歩行者、鳩)を舞台に、1930年代の映画のような超リアルな時間停止シーンを再現してください。

0~5秒:彼女は日常生活の中で自信に満ちた足取りでカメラに向かって歩いてくる(ステディカムは後退する)。

5〜8秒:停止し、指を鳴らす→優雅で目に見えない衝撃波がすべてを凍らせる。

8~20秒:彼女だけが動く。カメラは彼女が凍った通りを歩き、宙に浮いた水滴に触れ、それからカメラに向かって半笑いを浮かべ、再びシャッターを切る様子を捉える。

20~30秒:2度目の衝撃波が世界を解凍する。彼女は冷静さを保つ。

スタイル:フォトリアリスティック、50mmレンズ、浅い被写界深度、自然光、繊細な粒子感、リアルな物理演算/VFX。モーフィング、特殊効果、アーティファクトは一切使用していません。

入力

出力

この写真の女の子の人形に基づいて、シャツを着た平面モデル写真.webpを生成します。

Wan 3.0プロンプト: カメラ言語

カメラワークに関しては、私がよく従う簡単な経験則として、ショットサイズ、アングル、動き、レンズの4つの要素で構成することを推奨しています。例えば、「高いアングルから広角で全体像を捉え、その後、灯台に向かってゆっくりとドリーで移動します。50mmの映画的な視点を使用します。」といった具合です。

このルールはすべてのWan 3.0プロンプトで使用できますが、矛盾する表現は避けるようにしてください。たとえば、「固定されたカメラが被写体を高速で旋回する」という表現は使えません。この2つの指示は互換性がないため、モデルにそのように動作するように指示しないでください。

例えば予告編動画のようなダイナミックなシーケンスを作成したい場合、シーンを作成する際に繰り返し参照できる一般的なカメラ視点ガイドを以下に示します。

意図

カメラの向き

視覚効果

場所を確立するワイドショット、スロークレーン、またはプルアウト文脈と規模
親密さを築く中程度のクローズアップ、軽く押し込む感情的な注意
アクションをフォローする横方向のトラッキングショットまたは前方ドリー勢いと参加
重要性を示す低速軌道、中心構図英雄的または象徴的な強調
細部を保持する固定クローズアップ、浅い被写界深度焦点と検査
不安定な状態を作り出す手持ちで制御された動き切迫感かドキュメンタリー的なエネルギーか

もう一つ重要な点は、「映画のようなカメラワーク」とだけ言うだけでは、 Wan 3.0で適切なシーンを設定するには不十分だということです。もっと具体的に記述する必要があります。例えば、「犬が走るのに合わせて、カメラは歩行速度で左に追従する」とすれば、より意図的な結果が得られます。良い例を挙げましょう。

プロンプト

出力

スタイル: 超リアルな映画のような冬のドキュメンタリー、4K HDR、自然光、浅い被写界深度、滑らかなカメラの動き、ソフトなカラーグレーディング、平和な雰囲気。シーン 1 (0~3 秒) 雪に覆われた松林の奥深くに隠れた小さな木造小屋をドローンで空撮。大雪が静かに降り、窓からは温かい金色の光が輝いている。煙突から薄い煙が立ち上り、カメラは小屋に向かってゆっくりと降りていく。シーン 2 (3~6 秒) 小屋の中では、同じ女性が柔らかいウールの毛布にくるまり、パチパチと音を立てる石造りの暖炉のそばに座って本を読んでいる。シーン 3 (6~10 秒) 彼女は木製の玄関ドアを開け、雪の積もったポーチに足を踏み入れる。雪の結晶が彼女のセーターと髪に静かに降り注ぐ。彼女は微笑み、ゆっくりと深呼吸をし、静かな森を見渡す。カメラは彼女の周りをゆっくりと旋回する。シーン4(10~13秒)クローズアップの映画のようなショット:ブーツが手つかずの雪の上に新しい足跡を残し、手袋をした手が松の枝から雪を払い、雪の結晶が暖かい小屋の窓に積もり、煙が澄んだ冬の空気に漂う。シーン5(13~15秒)夕暮れ時の小屋からのワイドな映画のような引きのショット。雪が降り続き、光り輝く小屋は広大な白い森の中で小さくなっていく。

Wan 3.0のプロンプトの作成方法を学ぶだけでなく、 Wan 3.0の使い方ガイドを読んで、さらに優れたAI動画を作成しましょう。

Wan 3.0プロンプト:音声/対話シーン

Wan 3.0がネイティブ音声生成をサポートしていることは周知の事実ですが、音声も映像と同様に意図的に記述する必要があることを忘れがちです。日々のVlogチュートリアル、短編映画などをWan 3.0で生成してみて私が学んだのは、セリフは短く保つべきだということです。

残念ながら、リップシンクは常に安定して機能するとは限らないため、セリフは長々とした脚本ではなく、短い演技の合図として捉えてください。私がこれまで見てきた限りでは、これがWan 3.0で最も効果的な方法です。以下に、この方法が優れたオーディオビジュアル効果を生み出すのにどのように役立ったかを示します。

プロンプト:

@image1 から顔、髪型、身元、肌の色、体型を正確に再現。オーバーサイズのテラコッタ色のリネンシャツ、くすんだバーガンディ色のワイドレッグパンツ、茶色の革サンダル、小さな金のフープピアス、ゆるやかなウェーブヘアの、本物のインドネシア人女性。

2000年代後半のフリップカメラで撮影した、ありのままのVlog:激しい手ブレ、ピント合わせの迷い、露出のずれ、暖色系の色褪せた色合い、デジタルノイズ。ポーズや現代的なカラーグレーディングは一切なし。

00:00–00:04 熱帯の村を笑顔で歩きながら「今日は新鮮なココナッツを探しに行くんだ!」

00:04–00:08 興奮しながら、屋台の店主がココナッツを切る様子を見ている。

00:08–00:12 ココナッツウォーターを一口飲み、微笑む:「これは本当に爽やか!」

00:12–00:16 ココナッツを持った村人たちと談笑する。

00:16–00:20 ココナッツを開けようと試みるが、苦戦し、笑い声を上げる。地元の人々は歓声を上げる。

00:20–00:24 肉をすくい、味見をし、親指を立てる。

00:24–00:27 地元の人々に手を振りながら歩く。

00:27–00:30 笑顔で手を振る:「次の冒険で会いましょう。さようなら!」

入力

出力

この圖片里の女人形に基づいて她正面生活写真、形象、発信型、脸部、肤色等等都要一样.webpを生成する

もう一つ気づいたのは、複数の登場人物が登場するシーンでは、必ずラベルを使うべきだということです。例えば、「[サラ、かすれた声]は『6時に出発しなくちゃ』と言う。[ジョン、柔らかくためらいがちな声]は彼女を振り返って『それでいいよ。荷造りを始めよう』と言う。」のようにです。

Wan 3.0で何ができるのか、もっと多くの例を見たいですか?Wan 3.0の最適な活用事例を紹介したこちらの記事をご覧ください。

Wan 3.0で動画を生成したいですか? Pollo AIへアクセスしてください。

これで、しっかりとしたWan 3.0プロンプトの作成方法が明確になったので、おそらくそれを使って動画を作成し始めたくなるでしょう。もしそうなら、 Pollo AIを利用することをお勧めします。なぜなら、Pollo AIは最高のAI動画モデルをすべて一箇所に集めた、究極のAIクリエイティブスイートだからです。

ここでは、 Wan 3.0Seedance 2.5Kling 3.0Veo 3.1をはじめとする数十種類のソフトウェアにアクセスでき、さまざまな出力形式を簡単に比較して最適な結果を得ることができます。それだけでなく、すべてのアセットをアップロードし、すべてのプロジェクトをこの単一プラットフォームでホストすることも可能です。

Pollo.aiのマーケティングスタジオのインターフェース。ビジュアルコンテンツの作成に使用します。

要するに、これはWan 3.0で何をするにしても、それを補完する完璧なワークスペースだと私は考えています。そして何より素晴らしいのは、動画ストーリー広告クリエイティブデザインのためのAI AgentであるPollo Agentが搭載されていることです。これは構成やペース配分からビジュアルまで全てを自動化してくれるので、完璧なプロンプトを作成する際にも役立ちます。

Pollo AIでWan 3.0を無料でお試しください。

Wan 3.0 を使ってあなたの最も大胆なアイデアを実現し、 Pollo AIで公開可能なビデオに変換しましょう。

無料で作成を開始
無料で作成を開始

ほんの数分で、どんな漠然としたアイデアもすぐに制作可能な成果物へと仕上げることができます。さらに、 Pollo AIにはAIビデオエクステンダーなど、ポストプロダクションで使用できるツールが多数搭載されているため、作業に必要なすべてが揃っています。

Pollo AIにアクセスしてアカウントを作成するだけで、無料トライアルを通じてWan 3.0で動画制作をすぐに始めることができます。このプラットフォームを数時間使ってみれば、きっとあなた専用の動画制作アシスタントとして活用したくなるはずです。

Wan 3.0プロンプトガイドに関するよくある質問

Wan 3.0生成はどのくらいの期間続く可能性があるか?

Wan 3.0、ネイティブオーディオ付きの動画を最大30秒まで一度に生成できます。最高の結果を得るには、プロンプトが撮影した映像のすべての秒数に対応していることを確認してください。そうでない場合、予期せぬ方法で独自の判断で空白部分を補完してしまう可能性があります。

Wan 3.0はいくつの参照をサポートしていますか?

最大10枚の参照画像、5本の動画、5本の音声ファイルをアップロードできます。各生成ごとにドキュメントやウェブページのリンクを含めることも可能です。これらの参照がそれぞれどのような役割を果たすのかを必ず明記してください。そうしないと、最終出力に意図しない影響を与えてしまう可能性があります。

長いWan 3.0プロンプトを改善するにはどうすればよいですか?

Wan 3.0 に階層的な指示を与えることに重点を置いてください。例えば、「静かな森。突然、地面が揺れ、裂ける。ゾンビが亀裂から這い出てくる。」といった具合です。すべての重要な状態を分離し、それぞれを独立した時系列上のビートとして扱います。30秒のシーンの場合は、各終了状態にタイムスタンプを使用してください。

画像から動画への変換を促すにはどうすればよいでしょうか?

Wan 3.0は参照アンカー機能が非常に優れているため、ソース画像に劇的な変化を加えるよりも、段階的な変化を好む傾向があります。カメラや被写体がシーン内でどのように動くべきかを指定することで、シーンの自然な流れを示すプロンプトを作成することに重点を置きましょう。

Wan 3.0でキャラクターの一貫性を向上させるにはどうすればよいですか?

キャラクターの参考画像や動画を用意し、 Wan 3.0で維持したい属性を定義します。例えば、「シーン全体を通して、女性の長いブロンドの髪と顔の特徴を維持する」といった具合です。キャラクター、動作、場所の変更を最小限に抑えるだけで済みます。

Wan 3.0を使用する際に、音声を制御するにはどうすればよいですか?

プロンプトを作成する際は、音声を独立したカテゴリに分類し、それぞれの音源や動作を個別に記述してください。例えば、「優しい女性の声が聞こえる。雨がガラスを叩く。会話の背後でピアノの音楽が流れる。」のように記述します。こうすることで、音声、効果音、BGMが網羅され、生成されるシーンにそれぞれの要素が確実に反映されます。

こちらもおすすめ

詳しく見る

Wan 3.0レビュー:10日間試してわかったこと

このWan 3.0レビューでは、実際の動画制作でモデルを試してわかった特徴や性能を詳しく紹介します。実際のパフォーマンスや使い勝手を検証し、Pollo AIでWan 3.0を使うメリットについても解説します。

Wan 3.0 vs Seedance 2.5:どのAI動画生成ツールを使うべき?

Wan 3.0 と Seedance 2.5 の詳細はこちらでチェック!Wan 3.0 と Seedance 2.5 の詳しい比較ガイドを読んで、今すぐ使うのに最適なAI動画生成ツールがどちらかを見つけよう!

Seedance 2.5 プロンプトガイド:推測はやめて、指示を出そう

Seedance 2.5は、詩作をやめて監督業に転身するよう促します! Seedance 2.5の最高の機能を活用して、魅力的なテキスト、画像、動画を出力しましょう。

Gemini Omni (Veo 4) vs. Seedance 2.0:あなたに最適なAI動画生成ツールは?

Gemini Omni(Veo 4)とSeedance 2.0の機能、動画品質、生成精度、モーション表現、使いやすさを比較します。用途別の違いや特徴を確認し、自分に合ったAI動画生成モデルを見つけましょう。Pollo AIなら両モデルを無料で試せます。