Przewodnik po promptach Wan 3.0: jak wyciągnąć maksimum z Wan 3.0
Spędziłem trochę czasu korzystając z Wan 3.0 i muszę przyznać, że jest to model bardziej sterowany przez reżysera niż jego poprzednicy. Obsługuje teraz 30-sekundowe generacje z tekstem, obrazami, dźwiękiem, wideo, dokumentami i stronami internetowymi jako danymi referencyjnymi, więc podpowiedzi wymagają teraz nieco więcej finezji. Chcesz poznać sztuczkę? Czytaj dalej, a wyjaśnimy, na co dokładnie Wan 3.0 reaguje najlepiej.
Krótko mówiąc
Cokolwiek napiszesz na początku swojego polecenia, Wan 3.0 zablokuje je w pierwszej kolejności, ponieważ już na wczesnym etapie ustala kompozycję. Najpierw ustal ujęcie i scenę, a następnie opisz akcję, określ oświetlenie i styl, a następnie dodaj dźwięk. Określ również rolę każdego odniesienia, aby uniknąć przypadkowych rezultatów. Pollo AI może być idealnym środowiskiem roboczym do generowania filmów za pomocą Wan 3.0.
Przewodnik po Wan 3.0 : Zrozumienie kluczowych aspektów
Zanim przejdziemy do tego, jak utworzyć idealny monit Wan 3.0 , najpierw musisz zrozumieć podstawową formułę dowolnego podstawowego żądania monitu, więc pokrótce ją dla Ciebie omówimy:
Aspekt | Pytanie do odpowiedzi | Przykład |
|---|---|---|
| Temat | Co jest tematem i co musi pozostać rozpoznawalne? | Zniszczony niebieski rower dostawczy z wiklinowym koszykiem. |
| Scena | Gdzie się znajduje i co go otacza? | Wąska francuska ulica po deszczu, kafelkowe fasady, kałuże wody, odblaskowa nawierzchnia |
| Ruch | Co się porusza, w jakiej kolejności i z jaką prędkością? | Rower powoli stacza się w dół, woda spływa z opon |
| Sterowanie kamerą | Jak powinno być sfilmowane ujęcie? | Ujęcie z niskiego kąta, obiektyw 35 mm, miękkie, pochmurne światło |
| Stylizacja | Jaka estetyka wizualna dominuje na tej scenie? | Film dokumentalny z stonowanymi kolorami |
Dlaczego Wan 3.0 wymaga bardziej zniuansowanych komunikatów?
Ulepszone możliwości Wan 3.0 zmusiły mnie do przyjęcia innego stylu podpowiedzi niż ten, na którym często polegałem w WAN 2.7. Jednym z powodów jest wydłużenie maksymalnego czasu trwania filmów AI do 30 sekund na klip. Dlaczego to takie ważne? Oto dlaczego…
Przetestowałem Wan 3.0 dość dokładnie i kluczową różnicą między filmami, które nie spełniły moich oczekiwań, a tymi, które nie spełniały, był brak kontroli czasu w moich podpowiedziach. Kiedy po prostu podawałem wizualne opisy, nie uwzględniając każdej sekundy ujęcia, efekt był porażką.
Bez wyraźnej osi czasu, Wan 3.0 wypełniałby puste sekundy losowymi zmianami. Najlepsze komunikaty wskazują kluczowe działania i zachowanie kamery w całym klipie, jednocześnie nadając każdemu obrazowi, filmowi, plikowi audio lub linkowi jasną rolę.
Zauważyłem również, że Wan 3.0 ustala kompozycję na wczesnym etapie, często wykorzystując pierwsze szczegóły jako podstawę sceny. Kolejność ma znaczenie, szczególnie w przypadku konwersji obrazu na wideo, gdzie zachowuje początkową kompozycję i tożsamość obiektu, ale ma tendencję do niedoceniania drastycznych zmian.
Na przykład, jeśli renderuję reklamę ze zdjęciami i żądam zbyt radykalnej transformacji, mogę nie uzyskać satysfakcjonującego rezultatu. Biorąc pod uwagę wszystkie te rozważania, myślę, że można śmiało powiedzieć, że korzystanie z Wan 3.0 wymaga niuansowego podejścia. Przyjrzyjmy się zatem, jak uzyskać najlepsze możliwe komunikaty.
Zanim zagłębisz się w temat Wan 3.0 , zapoznaj się z najnowszymi ulepszeniami tego modelu w naszym poradniku na temat technologii Wan 3.0 .
Wypróbuj Wan 3.0 za darmo na Pollo AI już teraz
Wprowadź swoje kreatywne pomysły, aby tworzyć zachwycające filmy za pomocą Wan 3.0 na Pollo AI.
Zacznij tworzyć za darmo
Monity Wan 3.0 : zamiana tekstu na wideo a zamiana obrazu na wideo
Sposób tworzenia komunikatów Wan 3.0 dla T2V będzie się różnić od sposobu tworzenia komunikatów I2V, ponieważ cała sekwencja opiera się na prawidłowym zdefiniowaniu tematu, otoczenia, akcji, kamery i stylu wizualnego.
Jak wspomniałem wcześniej, Wan 3.0 już na wczesnym etapie tworzy kompozycję, więc to, od czego zaczynasz swoją wskazówkę, jest tym, co model blokuje jako pierwsze przed resztą sceny. Na przykład, jeśli Twoja wskazówka zaczyna się od opisu nastroju, Wan 3.0 będzie się skupiał na tym nastroju, a nie na tematach.
Z tego powodu, przed określeniem obiektu i cech, które chcesz zachować, powinieneś określić typ ujęcia. Następnie możesz przejść do zdefiniowania oświetlenia, stylu, a na koniec dodać dialogi, efekty dźwiękowe lub muzykę. Oto przykładowy film animowany , który wygenerowałem:
Podpowiedź | Wyjście |
|---|---|
| Kinowy, stylizowany, ciągły obraz 3D w rozdzielczości 8K. Młody mężczyzna w niebieskiej bandanie używa holograficznego smartwatcha do rozkładania mechanicznych ramion, które myją jego zabłoconą Mazdę RX-7. Samochód ulepsza się, napełniając się niebieską elektrycznością i zmieniając kolor z białego na lśniąco czarny, z jaskrawą, fioletową energią. Czarny samochód mknie nocą przez deszczowe, neonowe, cyberpunkowe miasto. Aktywuje się wyświetlacz HUD na przedniej szybie, a samochód skacze, przemieniając się w powietrzu w gigantycznego, dwunożnego mecha z kierowcą widocznym w świecącej kokpicie na klatce piersiowej. Mech ląduje ciężko na ulicy, a następnie używa niebieskich silników odrzutowych, by wzbić się w powietrze i bohatersko stanąć na dachu wieżowca. |
Z drugiej strony, jeśli zamierzasz używać obrazów referencyjnych, wymaga to innego podejścia. Z tego, co zaobserwowałem podczas korzystania z niego, Wan 3.0 wydaje się znacznie ściślej niż inne modele blokować kompozycję i tożsamość tematu obrazu źródłowego.
Z tego powodu korzystanie z podpowiedzi, które radykalnie transformują lub powodują nagłe zmiany, może być dość trudne. W większości takich przypadków Wan 3.0 nie spełniałby oczekiwań i nie odzwierciedlał mojej wizji sceny, dlatego zalecam korzystanie z podpowiedzi z płynnymi, ciągłymi przejściami, takimi jak poniżej:
Podpowiedź:
Czteroujęciowa sekwencja aktorska. Użyj obrazu 1 jako dokładnego punktu wyjścia i wizualnego punktu odniesienia. Zachowaj identyczną księżniczkę najemniczkę, krzepkiego przemytnika, twarze, kostiumy, pistolet, scenografię statku kosmicznego, oświetlenie i reżyserię. Prawdziwy film akcji kosmicznej z lat 80.: prawdziwi aktorzy, scenografia, gumowy kostium kosmity, pełnowymiarowy animatronik, praktyczne iskry/dym, ograniczone lasery optyczne, anamorficzny obraz 35 mm.
STRZAŁ 1 (0–3,2 s): Zablokowany, średni, dwustrzałowy. Ona odchyla się w lewo, but w górze, pistolet zwisa; on siedzi po prawej.
STRZAŁ 2 (3,2–6,7 s): Szybki powrót. Obcy wybucha za nim. Oddaje jeden celny strzał obok jego ramienia; bełt trafia w pierś, iskra, spada. Orkiestrowe pchnięcie, trzask lasera.
STRZAŁ 3 (6,7–10,3 s): Niskie trzy czwarte. Robot tupie w prawo, unosi ramię. Obraca się, oddaje dwa strzały (w staw, a potem w klatkę piersiową); ramię opada, rozbija się z iskrami/dymem. On patrzy z podziwem; ona opuszcza pistolet. Słychać kapiszon, blaszane frędzle.
UJĘCIE 4 (10,3–14 s): Mocne ujęcie z dwóch ujęć. Oryginalna linia wzroku. Wraca do znudzonej pozy, zwisa z pistoletu i wpatruje się w nią. Pozostaje nieskrępowana, opanowana i niewzruszona.
Wejście | Wyjście |
|---|---|
![]() |
Monitowanie Wan 3.0 : obsługa ruchu
Z własnego doświadczenia wiem, że obsługa ruchu za pomocą Wan 3.0 wymaga sporej ilości sekwencji. Można użyć komunikatu typu „mężczyzna idzie po plaży”, ale powiedziałbym, że ten opis to po prostu prosta, predefiniowana akcja, która pozostawia niejasne kwestie czasu i interakcji.
Lepszym rozwiązaniem jest dodanie ciągu obserwowalnych zdarzeń. Powiedziałbym: „Mężczyzna idzie po plaży, zatrzymuje się, gdy słyszy głośne szczekanie, odwraca się w kierunku dźwięku i spogląda w dół, aby zobaczyć biegnącego w jego kierunku golden retrievera”. To tworzy bardziej realistyczny ruch klatka po klatce.
Jednocześnie jednak nie należy przeciążać klipu nadmierną choreografią. To kolejna rzecz, na którą zauważyłem, że Wan 3.0 nie reaguje dobrze. Kiedy próbowałem zmusić postać do wykonania zbyt wielu precyzyjnych akcji lub interakcji z wieloma obiektami, efekt końcowy nie był idealny.
Chociaż Wan 3.0 obsługuje teraz dłuższe, 30-sekundowe klipy, sugeruję skupienie się na nadaniu obiektowi jasnego, prostego zadania/głównej czynności, aby zapewnić stabilność czasową. Dobry przykład tego można zobaczyć na realistycznym filmie , który wygenerowałem poniżej:
Podpowiedź:
@Image1 jest jedyną główną bohaterką. Zachowaj jej twarz, fryzurę, ciało i ubranie w całej okazałości. Ultrarealistyczny filmowy stop-klatka z lat 30. na rozświetlonej słońcem włoskiej uliczce starego miasta (kamienne budynki, bruk, kawiarnie, piesi, gołębie).
0–5s: Pewnie idzie w stronę kamery (Steadicam śledzi ruch kamery) pośród normalnych chwil.
5–8 s: Zatrzymanie, pstryknięcie palcami → elegancka, niewidzialna fala uderzeniowa zamraża wszystko.
8–20 s: Porusza się tylko ona; kamera krąży, gdy idzie po zamarzniętej ulicy, dotyka zawieszonej w powietrzu kropli, po czym zwraca się w stronę kamery z półuśmiechem i znów robi zdjęcia.
Lata 20–30: Druga fala uderzeniowa odmraża świat; ona zachowuje spokój.
Styl: fotorealistyczny, 50 mm, mała głębia ostrości, naturalne światło, subtelne ziarno, realistyczna fizyka/efekty wizualne. Bez morfingu, dodatków i artefaktów.
Wejście | Wyjście |
|---|---|
![]() |
Monit Wan 3.0 : Język aparatu
Jeśli chodzi o język filmowy, prostą zasadą, którą lubię się kierować, jest podzielenie go na cztery części: rozmiar ujęcia, kąt, ruch i obiektyw. Na przykład: „szerokie ujęcie wprowadzające z góry, a następnie powolny zjazd do przodu w stronę latarni morskiej; użyj kinowej perspektywy 50 mm”.
Możesz używać tej reguły we wszystkich komunikatach Wan 3.0 , ale zawsze pamiętaj, aby unikać sprzeczności. Na przykład, nie możesz powiedzieć: „Zablokowana, statyczna kamera szybko okrąża obiekt”. Te dwa oddzielne polecenia są niekompatybilne, więc nie proś modela, aby je uruchomił.
Jeśli kiedykolwiek zechcesz wygenerować dynamiczną sekwencję, taką jak na przykład zwiastun wideo , oto ogólny przewodnik po perspektywie kamery, do którego możesz wielokrotnie sięgać podczas tworzenia sceny:
Zamiar | Kierunek kamery | Efekt wizualny |
|---|---|---|
| Ustal miejsce | Szerokie ujęcie, powolne ujęcie dźwigiem lub wysuwanie | Kontekst i skala |
| Zbuduj intymność | Średnie zbliżenie, delikatne wciśnięcie | Uwaga emocjonalna |
| Śledź akcję | Ujęcie z boku lub z przodu wózka | Pęd i uczestnictwo |
| Pokaż ważność | Powolna orbita, wyśrodkowana kompozycja | Podkreślenie bohaterskie lub ikoniczne |
| Zachowaj szczegóły | Stałe zbliżenie, mała głębia ostrości | Skupienie i kontrola |
| Stwórz niestabilność | Kontrolowany ruch ręczny | Pilność lub energia dokumentalna |
Kolejną ważną kwestią jest to, że samo stwierdzenie „ruch kamery filmowej” nie wystarczy, aby stworzyć odpowiednią scenę w Wan 3.0. Trzeba być bardziej precyzyjnym; na przykład „kamera porusza się w lewo z prędkością spaceru, podczas gdy pies biegnie” przyniesie bardziej zamierzone rezultaty. Oto dobry przykład:
Podpowiedź | Wyjście |
|---|---|
| Styl: Ultrarealistyczny, kinowy zimowy dokument, 4K HDR, naturalne oświetlenie, mała głębia ostrości, płynny ruch kamery, miękka gradacja kolorów, spokojna atmosfera. Scena 1 (0–3 s) Ujęcie z drona małej drewnianej chatki ukrytej głęboko w ośnieżonym lesie sosnowym. Ciężki śnieg pada delikatnie, a ciepłe, złote światła świecą z okien. Cienki dym unosi się z komina, gdy kamera powoli opada w kierunku chatki. Scena 2 (3–6 s) Wewnątrz chatki ta sama kobieta siedzi przy trzaskającym kamiennym kominku, owinięta miękkim wełnianym kocem, czytając książkę. Scena 3 (6–10 s) Otwiera drewniane drzwi wejściowe i wychodzi na ośnieżony ganek. Płatki śniegu delikatnie lądują na jej swetrze i włosach. Uśmiecha się, bierze powolny, głęboki oddech i patrzy na cichy las, podczas gdy kamera delikatnie krąży wokół niej. Scena 4 (10–13 s) Ujęcia filmowe z bliska: buty zostawiają świeże ślady na nietkniętym śniegu, jej dłoń w rękawiczce strzepuje śnieg z gałęzi sosen, płatki śniegu osiadają na ciepłym oknie chaty, a dym unosi się w rześkim zimowym powietrzu. Scena 5 (13–15 s) Szerokie ujęcie filmowe z chaty o zmierzchu. Śnieg pada nadal, a rozświetlona chata staje się coraz mniejsza wśród rozległego białego lasu. |
Oprócz tego, że dowiesz się, jak tworzyć monity Wan 3.0 , przeczytaj nasz poradnik, jak używać Wan 3.0, aby tworzyć jeszcze lepsze filmy o sztucznej inteligencji.
Podpowiedzi Wan 3.0 : Sceny audio/dialogowe
Wiemy, że Wan 3.0 obsługuje natywne generowanie dźwięku, ale łatwo zapomnieć, że dźwięk również musi być opisany tak samo szczegółowo, jak elementy wizualne. Jeśli chodzi o dialogi, to z tego, co nauczyłem się o Wan 3.0 po generowaniu codziennych vlogów , samouczków , krótkich filmów itp., wynika, że linie dialogowe powinny być krótkie.
Niestety, synchronizacja ruchu ust nie zawsze jest wiarygodna, więc potraktuj dialogi jako krótkie wskazówki do występu, a nie długą narrację scenariusza. Z moich obserwacji wynika, że to działa najlepiej w Wan 3.0. Poniżej możesz zobaczyć, jak pomogło to uzyskać świetny efekt audiowizualny:
Podpowiedź:
Zachowaj dokładny wygląd twarzy, fryzury, tożsamości, koloru skóry i sylwetki od @image1. Autentyczna indonezyjska kobieta w obszernej terakotowej lnianej koszuli, szerokich spodniach w kolorze brudnego burgundu, brązowych skórzanych sandałach, małych złotych kolczykach-kółkach i luźnych, falowanych włosach.
Surowy vlog z kamery flip z końca lat 2000.: silne drgania, szukanie ostrości, zmiany ekspozycji, ciepłe, wyblakłe kolory, szum cyfrowy. Bez pozowania i nowoczesnej gradacji.
00:00–00:04 Spacer po tropikalnej wiosce z uśmiechem: „Dziś polujemy na świeże kokosy!”
00:04–00:08 Obserwuje sprzedawcę siekającego kokosy, podekscytowany.
00:08–00:12 Pije wodę kokosową, uśmiecha się: „To takie orzeźwiające!”
00:12–00:16 Pogawędki/śmiechy z mieszkańcami wioski trzymającymi kokosy.
00:16–00:20 Próbuje otworzyć kokosa, zmaga się, śmieje; miejscowi wiwatują.
00:20–00:24 Nabiera miąższ, próbuje, pokazuje kciuk w górę.
00:24–00:27 Spacerując i machając do miejscowych.
00:27–00:30 Uśmiechy, machnięcia: „Do zobaczenia w mojej kolejnej przygodzie. Pa!”
Wejście | Wyjście |
![]() |
Zauważyłem też, że w scenach z wieloma postaciami należy używać etykiet. Na przykład: „[Sarah, ochrypłym głosem] mówi: 'Musimy wyjść o szóstej'. [Jon, cichym, niepewnym głosem] odwraca się do niej i mówi: 'W porządku. Zaczynajmy się pakować'”.
Chcesz zobaczyć więcej przykładów możliwości Wan 3.0 ? Sprawdź ten artykuł o najlepszych zastosowaniach Wan 3.0 .
Chcesz generować filmy za pomocą Wan 3.0? Przejdź do Pollo AI
Skoro już wiesz, jak stworzyć solidny komunikat Wan 3.0 , prawdopodobnie zechcesz zacząć generować filmy za jego pomocą. Jeśli tak, polecam Pollo AI. Dlaczego? Ponieważ to najlepszy zestaw narzędzi kreatywnych opartych na sztucznej inteligencji , który gromadzi wszystkie najlepsze modele wideo oparte na sztucznej inteligencji w jednym miejscu.
Tutaj masz dostęp do Wan 3.0 , Seedance 2.5 , Kling 3.0 i Veo 3.1 oraz dziesiątek innych opcji, co ułatwia porównywanie różnych wyników w celu uzyskania jak najlepszego rezultatu. Co więcej, możesz również przesłać wszystkie swoje zasoby i hostować wszystkie swoje projekty na tej jednej platformie.

W gruncie rzeczy uważam, że jest to idealne miejsce pracy, które uzupełni wszystko, co zamierzasz zrobić z Wan 3.0. A co najlepsze? Oferuje Pollo Agent , AI Agent do filmów , historii , reklam i projektów kreatywnych , który automatyzuje wszystko, od struktury i tempa po elementy wizualne, co oznacza, że może również pomóc Ci w stworzeniu idealnego komunikatu.
Wypróbuj Wan 3.0 za darmo na Pollo AI już teraz
Wciel swoje najśmielsze pomysły w życie dzięki Wan 3.0 i zmień je w gotowe do publikacji filmy w Pollo AI.
Zacznij tworzyć za darmo
Wystarczy kilka minut, aby przekształcić każdy Twój pomysł w gotowy do produkcji produkt. Co więcej, Pollo AI oferuje dziesiątki narzędzi do postprodukcji, takich jak AI Video Extender , dzięki czemu masz wszystko, czego potrzebujesz do wykonania zadania.
Wystarczy przejść do Pollo AI i założyć konto. Możesz zacząć generować filmy za pomocą Wan 3.0 bezpłatnie, korzystając z bezpłatnego okresu próbnego . Gwarantuję, że po kilku godzinach korzystania z tej platformy zaczniesz postrzegać ją jako swojego osobistego asystenta produkcji wideo.
Najczęściej zadawane pytania dotyczące przewodnika Wan 3.0 Prompt Guide
Jak długa może być generacja Wan 3.0 ?
Wan 3.0 pozwala generować filmy z natywnym dźwiękiem o długości do 30 sekund w jednym przejściu. Upewnij się tylko, że w monicie uwzględniona jest każda sekunda ujęcia, jeśli chcesz uzyskać jak najlepszy rezultat. W przeciwnym razie monito może uzupełnić luki, kierując się własnym osądem, w nieoczekiwany sposób.
Ile referencji obsługuje Wan 3.0 ?
Możesz przesłać maksymalnie 10 obrazów referencyjnych, 5 filmów i 5 plików audio, z obsługą linków do dokumentów i stron internetowych w każdej generacji. Zawsze pamiętaj o opisaniu funkcji każdego z tych odnośników; w przeciwnym razie mogą one losowo wpływać na ostateczny wynik.
Jak mogę poprawić długi monit Wan 3.0 ?
Skoncentruj się na nadawaniu warstwowych dyrektyw Wan 3.0 . Na przykład: „Cichy las. Nagle ziemia drży i rozstępuje się. Zombie wyłaniają się ze szczelin”. Oddziel wszystkie kluczowe stany i potraktuj je jako niezależne, chronologiczne momenty. W scenach 30-sekundowych użyj znaczników czasu dla każdego stanu końcowego.
W jaki sposób mam wywołać generowanie obrazu do postaci wideo?
Możliwości Wan 3.0 w zakresie zakotwiczania odniesienia są dość rozbudowane, dlatego preferuje on stopniową ewolucję zamiast drastycznych zmian w obrazie źródłowym. Skoncentruj się na tworzeniu podpowiedzi, które odzwierciedlają naturalny rozwój sceny, określając, jak kamera lub obiekt powinien się w niej poruszać.
Jak mogę poprawić spójność znaków w Wan 3.0?
Możesz użyć obrazu/filmu referencyjnego postaci, a następnie zdefiniować atrybuty, które Wan 3.0 ma zachować na stabilnym poziomie. Na przykład: „Zachowaj długie blond włosy i rysy twarzy kobiety w całej scenie”. Wystarczy zminimalizować liczbę postaci, akcji i zmian lokalizacji.
Jak sterować dźwiękiem korzystając z Wan 3.0?
Pisząc polecenie, należy umieścić dźwięk w osobnej kategorii i osobno opisać źródło/zachowanie każdego z nich. Na przykład: „Mówi delikatny kobiecy głos. Deszcz stuka w szybę. Muzyka fortepianowa gra pod dialogiem”. Dotyczy to głosu, efektów dźwiękowych i muzyki w tle, upewniając się, że każda część zostanie uchwycona w wygenerowanej scenie.






