Casa/Blog/Approfondimenti sui modelli di intelligenza artificiale/Guida ai prompt di Wan 3.0: come ottenere il massimo da Wan 3.0

Guida ai prompt di Wan 3.0: come ottenere il massimo da Wan 3.0

Ho utilizzato Wan 3.0 per un po' di tempo e devo dire che, rispetto alle versioni precedenti, si basa maggiormente su un modello guidato dal regista. Ora supporta la generazione di messaggi di 30 secondi con testo, immagini, audio, video, documenti e pagine web come input di riferimento, quindi l'inserimento dei messaggi richiede un po' più di precisione. Volete sapere qual è il trucco? Continuate a leggere per scoprire a cosa Wan 3.0 risponde meglio.

In breve

Qualunque cosa scrivi all'inizio del tuo prompt , Wan 3.0 la consoliderà per prima, perché definisce la composizione fin dalle prime fasi. Stabilisci l'inquadratura e la scena prima di identificare il soggetto, poi descrivi l'azione, specifica l'illuminazione e lo stile, e infine aggiungi l'audio. Inoltre, specifica il ruolo di ogni riferimento per evitare risultati casuali. Puoi utilizzare Pollo AI come ambiente di lavoro ideale per generare video con Wan 3.0 .

Guida prompt Wan 3.0 : comprensione degli aspetti chiave

Prima di addentrarci nel come creare il prompt perfetto Wan 3.0 , è necessario comprendere la formula di base per qualsiasi prompt prompt , quindi analizziamola brevemente:

Aspetto

Domanda a cui rispondere

Esempio

Soggetto Qual è il soggetto e cosa deve rimanere riconoscibile? Una bicicletta da consegna blu, consumata dal tempo, con un cestino di vimini.
Scena Dove si trova e cosa lo circonda? Una stretta via francese dopo la pioggia, facciate piastrellate, pozzanghere d'acqua, pavimentazione riflettente
Movimento Cosa si muove, in quale ordine e a quale velocità? La bicicletta rotola lentamente giù per la collina; l'acqua schizza dalle gomme
Controllo della telecamera Come si dovrebbe filmare la scena? Ripresa in movimento dal basso, obiettivo da 35 mm, luce soffusa dovuta al cielo coperto.
Stilizzazione Quale estetica visiva domina la scena? Video documentario dai colori tenui

Perché Wan 3.0 richiede un sistema di prompting più dettagliato?

Le funzionalità migliorate di Wan 3.0 mi hanno costretto ad adottare uno stile di prompting diverso da quello che utilizzavo spesso con Wan 2.7. Uno dei motivi è che la durata massima dei video AI è stata estesa a 30 secondi per clip. Ora, perché è importante? Ecco perché…

Ho testato Wan 3.0 in modo piuttosto approfondito e una differenza fondamentale tra i video che non hanno soddisfatto le mie aspettative e quelli che le hanno ottenute è stata la mancanza di controllo temporale nelle mie istruzioni. Quando mi limitavo a fornire descrizioni visive senza specificare ogni singolo secondo dell'inquadratura, il risultato era un fallimento.

Senza una chiara sequenza temporale, Wan 3.0 riempirebbe i secondi vuoti con modifiche casuali. I suggerimenti migliori delineano le azioni chiave e il comportamento della telecamera durante la clip, assegnando a ogni immagine, video, file audio o collegamento un ruolo ben definito.

Ho anche notato che Wan 3.0 definisce la composizione fin dalle prime fasi, spesso utilizzando i primi dettagli prompt come base della scena. L'ordine è importante, soprattutto nella conversione da immagine a video, dove preserva la composizione iniziale e l'identità del soggetto, ma tende a non dare sufficiente enfasi a cambiamenti drastici.

Ad esempio, se sto convertendo una foto in un annuncio video e richiedo una trasformazione eccessivamente radicale, potrei non ottenere un risultato soddisfacente. Date tutte queste considerazioni, credo sia giusto affermare che l'utilizzo Wan 3.0 richiede un approccio mirato. Vediamo quindi come ottenere i prompt migliori.

Prima di approfondire le funzionalità di Wan 3.0 , scopri gli ultimi aggiornamenti del modello nella nostra guida su cos'è Wan 3.0 .

Prova Wan 3.0 gratuitamente su Pollo AI ora

Inserisci le tue idee creative per realizzare video straordinari con Wan 3.0 su Pollo AI.

Inizia a creare gratuitamente
Inizia a creare gratuitamente

Suggerimenti Wan 3.0 : da testo a video vs. da immagine a video

Il modo in cui si creano i prompt Wan 3.0 per T2V sarà diverso da I2V perché l'intera sequenza si basa sulla corretta definizione del soggetto, dell'ambiente, dell'azione, della telecamera e dello stile visivo.

Come accennato in precedenza, Wan 3.0 definisce la composizione fin dalle prime fasi, quindi ciò con cui inizi il tuo prompt è ciò che il modello blocca per primo, prima del resto della scena. Ad esempio, se il tuo prompt inizia descrivendo un'atmosfera, Wan 3.0 si baserà su quell'atmosfera piuttosto che sui soggetti.

Per questo motivo, prima di identificare il soggetto e le caratteristiche che si desidera preservare, è consigliabile definire il tipo di inquadratura. Successivamente, si può procedere alla definizione dell'illuminazione, dello stile e, per finire, aggiungere dialoghi, effetti sonori o musica. Ecco un esempio di filmato animato che ho realizzato:

Prompt

Produzione

Ripresa continua in 3D stilizzato 8K, in stile cinematografico. Un giovane con una bandana blu usa uno smartwatch olografico per attivare dei bracci meccanici che lavano la sua Mazda RX-7 infangata. L'auto si trasforma, pervasa da un'elettricità blu e passando dal bianco al nero lucido, con un'energia viola brillante. L'auto nera sfreccia attraverso una città cyberpunk notturna, bagnata dalla pioggia e illuminata da luci al neon. Un display sul parabrezza si attiva e l'auto spicca un salto, trasformandosi a mezz'aria in un gigantesco mech bipede con il pilota visibile nell'abitacolo luminoso sul petto. Il mech atterra pesantemente sulla strada, poi usa dei propulsori a reazione blu per volare in alto e posizionarsi eroicamente sul tetto di un grattacielo.

D'altra parte, se si intende utilizzare immagini di riferimento, è necessario un approccio diverso. Da quello che ho potuto constatare, Wan 3.0 sembra vincolare la composizione e l'identità del soggetto dell'immagine sorgente in modo molto più rigoroso rispetto ad altri modelli.

Per questo motivo, può essere piuttosto difficile utilizzare prompt che siano radicalmente trasformativi o che causino cambiamenti bruschi. Nella maggior parte di questi casi, Wan 3.0 non sarebbe all'altezza e non corrisponderebbe alla mia visione della scena, quindi consiglio di utilizzare prompt con transizioni fluide e continue come quelle riportate di seguito:

Prompt:

Sequenza live-action composta da quattro inquadrature. Utilizzare l'Immagine 1 come fotogramma di apertura esatto e punto di riferimento visivo. Mantenere identici la principessa mercenaria, il contrabbandiere rude, i volti, i costumi, la pistola, il set dell'astronave, l'illuminazione e la direzione dello schermo. Film d'azione spaziale pratico degli anni '80: attori reali, set fisici, tuta aliena in gomma, robot animatronico a grandezza naturale, scintille/fumo reali, laser ottici moderati, pellicola anamorfica 35 mm.

INQUADRATURA 1 (0–3,2s): Inquadratura media a due personaggi. Lei è sdraiata a sinistra, con lo stivale alzato e la pistola penzolante; lui è seduto a destra.

SCENA 2 (3,2–6,7s): Inversione rapida. L'alieno esplode a sinistra dietro di lui. Spara un colpo preciso oltre la sua spalla; il dardo colpisce il petto, scintilla, cade. Pugnalata orchestrale, crepitio laser.

INQUADRATURA 3 (6,7–10,3s): Tre quarti dal basso. Il robot batte il piede a destra, alza il braccio. Ruota su se stesso, spara due colpi (articolazione e poi petto); il braccio cade, si schianta con scintille/fumo. Lui la fissa sbalordito; lei abbassa la pistola. Colpi di percussione, squillo di ottoni.

INQUADRATURA 4 (10.3–14s): Inquadratura ravvicinata a due. Linea dello sguardo originale. Ritorna alla posa annoiata, con la pistola penzolante, fissa lo sguardo. Rimane disinvolta, controllata e impassibile.

Ingresso

Produzione

1787800046944-64220116-6849-48a5-b8cd-426e0ca3c699.webp

Richiesta Wan 3.0 : Gestione del movimento

Per esperienza personale, gestire il movimento con Wan 3.0 richiede una discreta quantità di sequenziamento. Sebbene si possa usare un prompt come "un uomo cammina su una spiaggia", direi che questa descrizione è solo una semplice azione preimpostata, che lascia poco chiari i tempi e l'interazione.

Un'opzione migliore è aggiungere una sequenza di eventi osservabili. Ad esempio, potrei dire: "Un uomo cammina su una spiaggia, si ferma quando sente un forte abbaio, si gira verso la fonte del suono e guarda in basso per vedere un golden retriever che gli corre incontro". Questo crea un movimento più realistico, fotogramma per fotogramma.

Prova Wan 3.0 su Pollo AI gratuitamente 💳 Un solo abbonamento, tutti i modelli • 🌟 Nessuna registrazione prompt

Ma allo stesso tempo, non bisogna sovraccaricare la clip con una coreografia eccessiva. Questo è un altro aspetto che ho notato essere un problema di Wan 3.0 . Quando ho provato a far eseguire a un personaggio troppe azioni precise o a farlo interagire con molti oggetti, il risultato non era ottimale.

Pertanto, sebbene Wan 3.0 ora supporti clip più lunghe di 30 secondi, suggerisco di concentrarsi sull'attribuire al soggetto un ruolo/un'azione centrale chiara e diretta per garantire la stabilità temporale. Un buon esempio di ciò si può trovare nel video realistico che ho generato qui sotto:

Prompt:

@Image1 è l'unico personaggio principale. Mantieni il suo viso, la sua acconciatura, il suo corpo e i suoi vestiti esatti per tutta la durata dell'immagine. Un fermo immagine ultra-realistico in stile cinematografico anni '30, ambientato in una strada soleggiata di un centro storico italiano (edifici in pietra, ciottoli, caffè, pedoni, piccioni).

0–5s: Cammina con sicurezza verso la telecamera (la Steadicam indietreggia) in una scena di vita quotidiana.

5–8 secondi: si ferma, schiocca le dita → un'elegante onda d'urto invisibile congela tutto.

8–20s: Solo lei si muove; la telecamera le gira intorno mentre cammina sulla strada ghiacciata, tocca una goccia sospesa, poi si gira verso la telecamera con un mezzo sorriso e scatta di nuovo.

20-30 secondi: la seconda ondata di shock scongela il mondo; lei rimane calma.

Stile: fotorealistico, 50 mm, profondità di campo ridotta, luce naturale, grana tenue, fisica/effetti speciali realistici. Nessun morphing, elementi aggiuntivi o artefatti.

Ingresso

Produzione

根据这张图片里的女人形象,生成一张她穿t-shirt的平面模特照foto.webp

Richiesta Wan 3.0 : Linguaggio della fotocamera

Per quanto riguarda il linguaggio della macchina da presa, una semplice regola empirica che mi piace seguire è quella di strutturarlo in quattro parti: inquadratura, angolazione, movimento e obiettivo. Ad esempio, "un'ampia inquadratura di apertura dall'alto, poi una lenta discesa con carrello in avanti verso il faro; utilizzare una prospettiva cinematografica da 50 mm".

Puoi usare questa regola in tutti i tuoi prompt Wan 3.0 , ma ricorda sempre di evitare un linguaggio contraddittorio. Ad esempio, non puoi dire: "Una telecamera fissa ruota rapidamente attorno al soggetto". Queste due istruzioni separate sono incompatibili, quindi non chiedere al modello di farle funzionare.

Se desideri creare una sequenza dinamica come, ad esempio, un trailer , ecco una guida generale sulla prospettiva della telecamera a cui puoi fare riferimento ripetutamente durante la realizzazione della scena:

Intento

Direzione della telecamera

Effetto visivo

Stabilire il luogo Inquadratura ampia, gru lenta o carrellata. Complesso e scala
Costruire intimità Primo piano medio, leggera spinta in avanti Attenzione emotiva
Segui l'azione Ripresa laterale o carrello in avanti Slancio e partecipazione
Mostrare l'importanza Orbita lenta, composizione centrata Enfasi eroica o iconica
Conservare i dettagli Primo piano fisso, profondità di campo ridotta Messa a fuoco e ispezione
Creare instabilità Movimento manuale controllato Urgenza o energia documentaria

Un altro aspetto importante è che affermare semplicemente "movimento di macchina cinematografico" non è sufficiente per impostare correttamente una scena con Wan 3.0. È necessario essere più specifici; ad esempio, "la telecamera si sposta a sinistra a velocità di camminata mentre il cane corre" produrrà risultati più intenzionali. Ecco un buon esempio:

Prompt

Produzione

Stile: Documentario invernale ultra-realistico e cinematografico, 4K HDR, illuminazione naturale, profondità di campo ridotta, movimenti di macchina fluidi, gradazione di colore delicata, atmosfera pacifica. Scena 1 (0-3 s) Ripresa aerea con drone di una piccola baita di legno nascosta nel profondo di una pineta innevata. Una fitta nevicata cade dolcemente mentre calde luci dorate brillano dalle finestre. Un sottile fumo sale dal camino mentre la telecamera scende lentamente verso la baita. Scena 2 (3-6 s) All'interno della baita, la stessa donna siede accanto a un camino di pietra scoppiettante avvolta in una morbida coperta di lana, leggendo un libro. Scena 3 (6-10 s) Apre la porta d'ingresso in legno ed esce sulla veranda innevata. I fiocchi di neve le cadono dolcemente sul maglione e sui capelli. Sorride, fa un respiro lento e profondo e guarda attraverso la foresta silenziosa mentre la telecamera le gira delicatamente intorno. Scena 4 (10-13 s) Inquadrature cinematografiche ravvicinate: stivali che lasciano impronte fresche nella neve immacolata, la sua mano guantata che spazza via la neve dai rami di pino, fiocchi di neve che si posano sulla calda finestra della baita e fumo che si disperde nell'aria frizzante dell'inverno. Scena 5 (13-15 s) Ampia inquadratura cinematografica che si allontana dalla baita al crepuscolo. La neve continua a cadere mentre la baita illuminata si rimpicciolisce nell'immensa foresta bianca.

Oltre a imparare come creare prompt per Wan 3.0 , leggi la nostra guida su come usare Wan 3.0 per creare video con intelligenza artificiale ancora migliori.

Suggerimenti Wan 3.0 : Scene audio/dialoghi

Sappiamo che Wan 3.0 supporta la generazione audio nativa, ma è facile dimenticare che anche l'audio deve essere descritto con la stessa cura riservata alle immagini. Per quanto riguarda i dialoghi, ciò che ho imparato su Wan 3.0 dopo aver generato vlog quotidiani , tutorial , cortometraggi ecc., è di mantenere le battute brevi.

Purtroppo, la sincronizzazione labiale non è sempre affidabile, quindi è meglio considerare i dialoghi come brevi indicazioni di interpretazione, non come una lunga sceneggiatura. Da quello che ho visto, questo è il metodo che funziona meglio con Wan 3.0. Di seguito potete vedere come questo abbia contribuito a produrre un ottimo risultato audiovisivo:

Prompt:

Preservare con precisione viso, acconciatura, identità, tonalità della pelle e corporatura dall'immagine @image1. Autentica donna indonesiana con camicia oversize in lino color terracotta, pantaloni a gamba larga color bordeaux polveroso, sandali in pelle marrone, piccoli orecchini a cerchio dorati e capelli mossi sciolti.

Vlog amatoriale di fine anni 2000 girato con una videocamera a conchiglia: forti vibrazioni, messa a fuoco instabile, variazioni di esposizione, colori caldi e sbiaditi, rumore digitale. Nessuna posa o color correction moderna.

00:00–00:04 Passeggiata in un villaggio tropicale con un sorriso: "Oggi andiamo a caccia di noci di cocco fresche!"

00:04–00:08 Guarda il venditore tagliare una noce di cocco, emozionato.

00:08–00:12 Sorseggia acqua di cocco e sorride: "È così rinfrescante!"

00:12–00:16 Chiacchiere/risate con gli abitanti del villaggio che tengono in mano una noce di cocco.

00:16–00:20 Prova ad aprire una noce di cocco, fa fatica, ride; la gente del posto fa il tifo.

00:20–00:24 Prende la polpa, assaggia, pollice in su.

00:24–00:27 Cammina salutando la gente del posto.

00:27–00:30 Sorrisi, saluti: "Ci vediamo nella mia prossima avventura. Ciao!"

Ingresso

Produzione

根据这张图片里的女人形象,生成一张她正面生活照,形象,发型,脸部,肤色等等都要一样.webp

Un'altra cosa che ho notato è che, se si tratta di una scena con più personaggi, è importante usare delle etichette. Ad esempio: "[Sarah, con voce roca] dice: 'Dobbiamo partire alle sei'. "[Jon, con voce dolce ed esitante] la guarda e dice: 'Va bene. Iniziamo a fare le valigie'."

Vuoi vedere altri esempi di cosa si può realizzare con Wan 3.0 ? Dai un'occhiata a questo articolo sui migliori casi d'uso di Wan 3.0 .

Vuoi generare video con Wan 3.0? Visita Pollo AI

Ora che hai ben chiaro come creare un prompt Wan 3.0 efficace, probabilmente vorrai iniziare a generare video. In tal caso, ti consiglio di dare un'occhiata a Pollo AI. Perché? Perché è la suite creativa AI definitiva che riunisce tutti i migliori modelli video basati sull'IA in un unico posto.

Qui puoi accedere a Wan 3.0 , Seedance 2.5 , Kling 3.0 e Veo 3.1 , oltre a decine di altre opzioni, che ti permettono di confrontare facilmente diversi output per ottenere il risultato migliore. E non solo: puoi anche caricare tutte le tue risorse e ospitare tutti i tuoi progetti in un'unica piattaforma.

Interfaccia di Marketing Studio di Pollo.ai per la creazione di contenuti visivi.

In sostanza, lo considero lo spazio di lavoro perfetto che completerà qualsiasi cosa tu voglia fare con Wan 3.0. Il meglio? Offre Pollo Agent , un AI Agent per video , storie , annunci e design creativo , che automatizza tutto, dalla struttura e dal ritmo agli elementi visivi, il che significa che può anche guidarti nella creazione del prompt perfetto.

Prova Wan 3.0 gratuitamente su Pollo AI ora

Dai vita alle tue idee più audaci con Wan 3.0 e trasformale in video pronti per la pubblicazione su Pollo AI.

Inizia a creare gratuitamente
Inizia a creare gratuitamente

Bastano pochi minuti e trasformerà qualsiasi idea, anche la più abbozzata, in un risultato pronto per la produzione. Inoltre, Pollo AI include decine di strumenti utilizzabili in post-produzione, come l' estensione video basata sull'IA , garantendoti tutto il necessario per portare a termine il lavoro.

Visita semplicemente Pollo AI e registrati per creare un account. Puoi iniziare a generare video con Wan 3.0 senza alcun costo grazie alla prova gratuita . Ti garantisco che dopo poche ore su questa piattaforma, inizierai a considerarla il tuo assistente personale per la produzione video.

Domande frequenti sulla guida prompt Wan 3.0

Quanto può essere lunga una generazione Wan 3.0 ?

Wan 3.0 consente di generare video con audio nativo della durata massima di 30 secondi in un'unica passata. Assicurati che il tuo prompt tenga conto di ogni secondo della ripresa per ottenere il miglior risultato possibile. In caso contrario, potrebbe riempire gli spazi vuoti in modo inaspettato, basandosi su un proprio giudizio.

Quanti riferimenti supporta Wan 3.0 ?

È possibile caricare fino a 10 immagini di riferimento, 5 video e 5 file audio, con supporto per link a documenti e pagine web inclusi per ogni generazione. Ricorda sempre di specificare la funzione di ciascun riferimento; in caso contrario, potrebbero influenzare in modo casuale il risultato finale.

Come posso migliorare un prompt Wan 3.0 troppo lungo?

Concentrati sull'imporre direttive a più livelli a Wan 3.0 . Ad esempio: "Una foresta tranquilla. Improvvisamente, il terreno trema e si spacca. Degli zombi escono dalle crepe." Separa tutti gli stati chiave e trattali come sequenze cronologiche indipendenti. Per le scene di 30 secondi, usa i timestamp per ogni stato finale.

Come posso prompt la generazione di un video da un'immagine?

La capacità di ancoraggio di riferimento di Wan 3.0 è piuttosto forte, quindi tende a preferire un'evoluzione graduale a cambiamenti drastici all'immagine sorgente. Concentrati sulla creazione di prompt che mostrino una progressione naturale della scena, specificando come la telecamera o il soggetto dovrebbero muoversi al suo interno.

Come posso migliorare la coerenza dei caratteri con Wan 3.0?

È possibile utilizzare un'immagine/video di riferimento del personaggio, quindi definire gli attributi che si desidera che Wan 3.0 mantenga stabili. Ad esempio, "Mantenere i lunghi capelli biondi e i tratti del viso della donna per tutta la scena". Basta ridurre al minimo il numero di personaggi, azioni e cambi di location.

Come posso controllare l'audio quando utilizzo Wan 3.0?

Quando scrivi la prompt, dovresti inserire l'audio in una categoria a sé stante e descrivere separatamente la fonte/il comportamento di ciascun elemento. Ad esempio: "Una dolce voce femminile parla. La pioggia tamburella sul vetro. In sottofondo si sente una musica di pianoforte." Questo include voce, effetti sonori e musica di sottofondo, assicurando che ogni elemento sia catturato nella scena generata.

Potrebbero interessarti anche

Vedi altro

Recensione di Wan 3.0: l’ho testato per 10 giorni ed ecco cosa ho scoperto

Questa recensione di Wan 3.0 condivide ciò che ho scoperto dopo aver testato questo modello su progetti video reali. Scopri come si è comportato e perché consiglio di usare Wan 3.0 su Pollo AI.

Wan 3.0 vs Seedance 2.5: quale generatore video AI dovresti usare?

Scopri di più su Wan 3.0 vs Seedance 2.5 qui! Leggi la nostra guida comparativa dettagliata tra Wan 3.0 e Seedance 2.5 per scoprire quale generatore video AI è il migliore da usare oggi per te!

Guida ai prompt Seedance 2.5: smetti di tirare a indovinare, inizia a dirigere

Seedance 2.5 ti invita a smettere di scrivere poesie e a iniziare a dirigere! Scopri le migliori formule Seedance 2.5 per ottenere risultati straordinari con testi, immagini e video.

Gemini Omni (Veo 4) vs. Seedance 2.0: Qual è il miglior generatore di video AI per te?

Confronta Gemini Omni (Veo 4) e Seedance 2.0 in base alle loro caratteristiche chiave. Scopri quale generatore di video AI si adatta alle tue esigenze e prova Gemini Omni e Seedance 2.0 su Pollo AI gratuitamente!