Guia de Prompts do Wan 3.0: Como Tirar o Máximo do Wan 3.0
Passei algum tempo usando o Wan 3.0 e posso afirmar que ele é um modelo mais orientado pelo diretor do que seus antecessores. Agora, ele suporta gerações de 30 segundos com texto, imagem, áudio, vídeo, documentos e páginas da web como entradas de referência, então o recurso de prompts exige um pouco mais de sutileza. Quer saber o segredo? Continue lendo, pois explicaremos exatamente a que o Wan 3.0 responde melhor.
Resumindo:
Tudo o que você escrever no início do seu prompt será o que o Wan 3.0 irá priorizar, pois ele define a composição desde o início. Estabeleça o enquadramento e a cena antes de identificar o sujeito, depois descreva a ação, especifique a iluminação e o estilo e, por fim, adicione o áudio. Além disso, especifique a função de cada referência para evitar resultados aleatórios. Você pode usar o Pollo AI como o ambiente de trabalho perfeito para gerar vídeos com o Wan 3.0.
Guia de instruções do Wan 3.0 : Compreendendo os principais aspectos
Antes de abordarmos como criar a mensagem perfeita para o Wan 3.0 , você precisa entender a fórmula básica para qualquer solicitação de mensagem. Vamos então explicá-la rapidamente:
Aspecto | Pergunta a responder | Exemplo |
|---|---|---|
| Assunto | Qual é o assunto e o que deve permanecer reconhecível? | Uma bicicleta de entregas azul desgastada com uma cesta de vime. |
| Cena | Onde fica e o que o rodeia? | Uma rua estreita francesa depois da chuva, fachadas revestidas de azulejos, poças d'água, calçada refletora. |
| Movimento | O que se move, em que ordem e a que velocidade? | A bicicleta desce a ladeira lentamente; a água espirra dos pneus. |
| Controle da câmera | Como a cena deve ser filmada? | Plano de acompanhamento em ângulo baixo, lente de 35 mm, luz suave e nublada. |
| Estilização | Que estética visual rege a cena? | Vídeo documentário com cores suaves. |
Por que a Wan 3.0 exige instruções mais sutis?
As funcionalidades aprimoradas do Wan 3.0 me obrigaram a adotar um estilo de interação diferente daquele que eu usava frequentemente no Wan 2.7. Um dos motivos é que a duração máxima dos vídeos de IA foi estendida para 30 segundos por clipe. Mas por que isso importa? Eis o motivo…
Testei o Wan 3.0 exaustivamente e uma diferença crucial entre os vídeos que não atingiram as expectativas e aqueles que corresponderam foi a falta de controle de tempo nas minhas instruções. Quando simplesmente forneci descrições visuais sem levar em conta cada segundo da cena, o resultado foi desastroso.
Sem uma linha do tempo clara, o Wan 3.0 preencheria segundos vazios com mudanças aleatórias. As melhores instruções mapeiam as ações principais e o comportamento da câmera ao longo do clipe, atribuindo a cada imagem, vídeo, arquivo de áudio ou link uma função clara.
Notei também que o Wan 3.0 estabelece a composição logo no início, muitas vezes usando os primeiros detalhes da cena como base. A ordem importa, especialmente na conversão de imagem em vídeo, onde preserva a composição inicial e a identidade do sujeito, mas tende a subestimar mudanças drásticas.
Por exemplo, se eu estiver renderizando um anúncio em vídeo a partir de uma foto e solicitar uma transformação muito radical, posso não obter um resultado satisfatório. Levando tudo isso em consideração, acho justo dizer que é preciso uma abordagem cuidadosa para usar o Wan 3.0. Então, vamos ver como você pode obter as melhores sugestões possíveis.
Antes de mergulhar nos recursos do Wan 3.0 , explore as atualizações mais recentes do modelo em nosso guia sobre o que é o Wan 3.0 .
Experimente o Wan 3.0 gratuitamente no Pollo AI agora mesmo.
Insira suas ideias criativas para fazer vídeos incríveis com o Wan 3.0 no Pollo AI.
Comece a criar conteúdo gratuitamente
Solicitação de texto para vídeo no Wan 3.0 : conversão de texto em vídeo versus conversão de imagem em vídeo
A forma como você cria prompts Wan 3.0 para T2V será diferente da forma como você cria prompts para I2V, porque toda a sequência depende da definição correta do assunto, ambiente, ação, câmera e estilo visual.
Como mencionei anteriormente, o Wan 3.0 define a composição antecipadamente, então o que você usa como ponto de partida é o que o modelo prioriza antes do restante da cena. Por exemplo, se o seu ponto de partida descreve um estado de espírito, o Wan 3.0 se baseará nesse estado de espírito em vez dos sujeitos.
Por isso, você deve definir o tipo de enquadramento antes de identificar o assunto e as características que deseja preservar. Em seguida, você pode definir a iluminação, o estilo e finalizar com diálogos, efeitos sonoros ou música. Aqui está um filme de animação que eu criei como exemplo:
Incitar | Saída |
|---|---|
| Plano-sequência estilizado em 3D 8K cinematográfico. Um jovem com uma bandana azul usa um smartwatch holográfico para ativar braços mecânicos que lavam seu Mazda RX-7 enlameado. O carro se transforma, pulsando com eletricidade azul e mudando de branco para um preto brilhante com energia roxa radiante. O carro preto acelera por uma cidade cyberpunk neon, coberta de chuva, à noite. Um HUD no para-brisa se ativa e o carro salta, transformando-se no ar em um robô gigante bípede com o piloto visível na cabine brilhante em forma de peito. O robô aterrissa pesadamente na rua e, em seguida, usa propulsores a jato azuis para voar e ficar heroicamente em cima do telhado de um arranha-céu. |
Por outro lado, se você pretende usar imagens de referência, isso exige uma abordagem diferente. Pelo que observei ao utilizá-lo, o Wan 3.0 parece restringir a composição e a identidade do assunto da imagem de origem de forma muito mais rigorosa do que outros modelos.
Por isso, pode ser bastante difícil usar comandos que sejam radicalmente transformadores ou que causem mudanças abruptas. Na maioria desses casos, o Wan 3.0 não conseguiria executar o que eu esperava e não atingiria a minha visão para a cena, então recomendo usar comandos com transições suaves e contínuas, como as abaixo:
Incitar:
Sequência de quatro planos com atores reais. Use a Imagem 1 como fotograma de abertura exato e referência visual. Mantenha idênticos a princesa mercenária, o contrabandista robusto, os rostos, os figurinos, a pistola, o cenário da nave espacial, a iluminação e a direção de cena. Filme de ação espacial prático dos anos 80: atores reais, cenários físicos, traje alienígena de borracha, robô animatrônico em tamanho real, faíscas/fumaça reais, lasers ópticos controlados, anamórfico 35mm.
CENA 1 (0–3,2s): Plano médio fixo de dois planos. Ela reclina-se para a esquerda, bota levantada, pistola pendurada; ele senta-se à direita.
CENA 2 (3,2–6,7s): Reverso rápido. Alienígena surge à esquerda dele. Ela dispara um tiro preciso que passa raspando pelo ombro dele; o raio atinge o peito, faísca, ele cai. Golpe orquestral, estalo de laser.
CENA 3 (6,7–10,3s): Plano baixo três quartos. O robô pisa forte para a direita, levanta o braço. Ela gira, dispara dois tiros (na articulação e depois no peito); o braço cai, estilhaçando-se com faíscas e fumaça. Ele a observa, maravilhado; ela abaixa a pistola. A percussão ressoa, os metais criam um floreio.
CENA 4 (10,3–14s): Plano fechado com duas pessoas. Direção de olhar original. Ela retorna à pose entediada, pistola pendurada, olhar fixo. Ela permanece impassível, controlada e indiferente.
Entrada | Saída |
|---|---|
![]() |
Aviso Wan 3.0 : Manipulação de Movimento
Falando por experiência própria, lidar com movimento no Wan 3.0 exige um bom planejamento de sequências. Embora seja possível usar um comando como "um homem caminha pela praia", eu diria que essa descrição é apenas uma ação predefinida simples, o que deixa o tempo e a interação pouco claros.
Uma opção melhor seria adicionar uma sequência de eventos observáveis. Eu diria: "Um homem caminha pela praia, para ao ouvir um latido alto, vira-se na direção do som e olha para baixo para ver um golden retriever correndo em sua direção". Isso cria uma movimentação mais realista, quadro a quadro.
Mas, ao mesmo tempo, você não quer sobrecarregar o clipe com coreografias excessivas. Isso é outra coisa que notei que o Wan 3.0 não lida bem. Quando tentei fazer um personagem executar muitas ações precisas ou interagir com muitos objetos, o resultado não foi ideal.
Portanto, embora o Wan 3.0 agora suporte clipes mais longos de 30 segundos, sugiro que você se concentre em atribuir ao sujeito uma função/ação central clara e direta para ajudar a garantir a estabilidade temporal. Você pode ver um bom exemplo disso no vídeo realista que gerei abaixo:
Incitar:
@Image1 é a única personagem principal. Preserve seu rosto, penteado, corpo e roupas com exatidão do início ao fim. Cronometrado de forma ultrarrealista, como se estivesse congelado no tempo em uma rua ensolarada de uma cidade velha italiana (prédios de pedra, paralelepípedos, cafés, pedestres, pombos).
0–5s: Ela caminha com confiança em direção à câmera (a Steadicam recua) em meio à vida normal.
5–8s: Para, estala os dedos → uma elegante onda de choque invisível congela tudo.
8–20s: Apenas ela se move; a câmera gira enquanto ela caminha pela rua congelada, toca uma gota suspensa, depois encara a câmera com um meio sorriso e dispara novamente.
20-30 segundos: A segunda onda de choque descongela o mundo; ela mantém a calma.
Estilo: fotorrealista, 50mm, profundidade de campo reduzida, luz natural, granulação sutil, física/efeitos visuais realistas. Sem morphing, elementos extras ou artefatos.
Entrada | Saída |
|---|---|
![]() |
Solicitação Wan 3.0 : Linguagem da Câmera
Para a linguagem de câmera, uma regra prática simples que gosto de seguir é estruturá-la em quatro partes: tamanho do plano, ângulo, movimento e lente. Por exemplo: “um plano geral de estabelecimento a partir de um ângulo alto, seguido de um travelling lento para frente em direção ao farol; use uma perspectiva cinematográfica de 50mm”.
Você pode usar essa regra em todos os seus comandos Wan 3.0 , mas lembre-se sempre de evitar linguagem contraditória. Por exemplo, você não pode dizer: "Uma câmera estática travada circula rapidamente o objeto". Essas duas instruções separadas são incompatíveis, então não peça ao modelo para fazê-las funcionar.
Se você precisar criar uma sequência dinâmica, como um trailer , por exemplo, aqui está um guia geral de perspectiva de câmera que você pode consultar repetidamente ao criar a cena:
Intenção | Direção da câmera | Efeito visual |
|---|---|---|
| Estabelecer local | Plano geral, movimento lento de grua ou afastamento gradual | Contexto e escala |
| Construir intimidade | Plano médio fechado, leve aproximação. | Atenção emocional |
| Ação de acompanhamento | Plano de travelling lateral ou travelling para a frente | Impulso e participação |
| Mostrar importância | Órbita lenta, composição centrada | Ênfase heroica ou icônica |
| Preserve os detalhes | Plano fechado fixo, profundidade de campo reduzida. | Foco e inspeção |
| Criar instabilidade | movimento manual controlado | Urgência ou energia documental |
Outro ponto importante é que simplesmente afirmar “movimento de câmera cinematográfico” não é suficiente para criar uma cena adequada com o Wan 3.0. É preciso ser mais específico; por exemplo, “a câmera acompanha o cachorro para a esquerda na velocidade de caminhada enquanto ele corre” produzirá resultados mais intencionais. Aqui está um bom exemplo:
Incitar | Saída |
|---|---|
| Estilo: Documentário de inverno ultrarrealista e cinematográfico, 4K HDR, iluminação natural, pouca profundidade de campo, movimento de câmera suave, gradação de cores suave, atmosfera tranquila. Cena 1 (0–3s): Tomada aérea com drone de uma pequena cabana de madeira escondida no meio de uma floresta de pinheiros coberta de neve. A neve cai suavemente enquanto luzes douradas e quentes brilham pelas janelas. Uma fina fumaça sobe da chaminé enquanto a câmera desce lentamente em direção à cabana. Cena 2 (3–6s): Dentro da cabana, a mesma mulher senta-se ao lado de uma lareira de pedra crepitante, envolta em um cobertor de lã macio, lendo um livro. Cena 3 (6–10s): Ela abre a porta de madeira da frente e sai para a varanda nevada. Flocos de neve pousam suavemente em seu suéter e cabelo. Ela sorri, respira fundo e contempla a floresta silenciosa enquanto a câmera circula suavemente ao seu redor. Cena 4 (10–13 s) Planos cinematográficos em close-up: botas deixando pegadas frescas na neve intocada, sua mão enluvada limpando a neve dos galhos de pinheiro, flocos de neve se depositando na janela aquecida da cabana e fumaça se espalhando no ar fresco do inverno. Cena 5 (13–15 s) Plano cinematográfico amplo da cabana ao entardecer. A neve continua caindo enquanto a cabana iluminada se torna cada vez menor em meio à vasta floresta branca. |
Além de aprender a criar prompts para o Wan 3.0 , leia nosso guia sobre como usar o Wan 3.0 para criar vídeos de IA ainda melhores.
Wan 3.0 Prompting: Cenas de áudio/diálogo
Sabemos que o Wan 3.0 suporta geração de áudio nativa, mas é fácil esquecer que o áudio também precisa ser descrito com a mesma precisão que os elementos visuais. No que diz respeito aos diálogos, o que aprendi sobre o Wan 3.0 depois de gerar vlogs diários , tutoriais , curtas-metragens, etc., é que as falas devem ser curtas.
Infelizmente, a sincronização labial nem sempre é confiável, então considere o diálogo como breves dicas de atuação, e não como uma longa narrativa de roteiro. Pelo que observei, essa é a melhor abordagem com o Wan 3.0. Você pode ver como isso contribuiu para um excelente resultado audiovisual abaixo:
Incitar:
Preservação exata do rosto, penteado, identidade, tom de pele e corpo da @image1. Mulher indonésia autêntica com camisa de linho terracota oversized, calças largas em tom bordô, sandálias de couro marrom, brincos de argola pequenos dourados e cabelos soltos e ondulados.
Vlog bruto gravado com câmera flip no final dos anos 2000: muita trepidação, foco instável, variações de exposição, cores quentes e desbotadas, ruído digital. Sem poses ou edição moderna.
00:00–00:04 Caminha por uma aldeia tropical sorrindo: “Hoje vamos à caça de cocos frescos!”
00:04–00:08 Observa o vendedor cortar coco, animado.
00:08–00:12 Toma um gole de água de coco e sorri: “Isto é tão refrescante!”
00:12–00:16 Conversas/risos com moradores locais segurando um coco.
00:16–00:20 Tenta abrir um coco, tem dificuldades, ri; os moradores locais aplaudem.
00:20–00:24 Pega a polpa, prova e aprova com o polegar.
00:24–00:27 Caminha acenando para os moradores locais.
00:27–00:30 Sorrisos, acenos: “Até a minha próxima aventura. Tchau!”
Entrada | Saída |
![]() |
Outra coisa que notei é que, se for uma cena com vários personagens, certifique-se de usar legendas. Por exemplo: “[Sarah, com voz rouca] diz: 'Precisamos sair às seis.' [Jon, com voz suave e hesitante] olha para ela e diz: 'Tudo bem. Vamos começar a arrumar as malas.'”
Quer ver mais exemplos do que a Wan 3.0 pode criar? Confira este artigo sobre os melhores casos de uso da Wan 3.0 .
Quer gerar vídeos com a Wan 3.0? Acesse o Pollo AI.
Agora que você entende bem como criar um prompt sólido para a Wan 3.0 , provavelmente quer começar a gerar vídeos com ele. Nesse caso, recomendo o Pollo AI. Por quê? Porque é o pacote completo de IA para criação de conteúdo , reunindo todos os principais modelos de IA para vídeo em um só lugar.
Aqui, você pode acessar o Wan 3.0 , o Seedance 2.5 , o Kling 3.0 e o Veo 3.1 , além de dezenas de outras opções, facilitando a comparação de diferentes saídas para obter o melhor resultado possível. E não só isso, você também pode fazer o upload de todos os seus arquivos e hospedar todos os seus projetos nesta única plataforma.

Em resumo, considero-o o espaço de trabalho perfeito que complementará qualquer projeto que você pretenda realizar com o Wan 3.0. E o melhor de tudo? Ele oferece o Pollo Agente , um AI Agent para vídeos , histórias , anúncios e design criativo , que automatiza tudo, da estrutura e ritmo aos elementos visuais, o que significa que ele também pode orientá-lo na criação do texto perfeito.
Experimente o Wan 3.0 gratuitamente no Pollo AI agora mesmo.
Dê vida às suas ideias mais ousadas com o Wan 3.0 e transforme-as em vídeos prontos para publicação no Pollo AI.
Comece a criar conteúdo gratuitamente
Em poucos minutos, qualquer ideia inicial se transforma em um resultado pronto para produção. Além disso, o Pollo AI oferece dezenas de ferramentas para pós-produção, como o extensor de vídeo com IA , garantindo que você tenha tudo o que precisa para concluir o trabalho.
Basta acessar o Pollo AI e criar uma conta. Você pode começar a gerar vídeos com o Wan 3.0 gratuitamente através do período de teste grátis . Garanto que, após algumas horas usando a plataforma, você a considerará sua assistente pessoal de produção de vídeo.
Perguntas frequentes sobre o Guia de prompts do Wan 3.0
Qual é a duração máxima de uma geração Wan 3.0 ?
O Wan 3.0 permite gerar vídeos com áudio nativo de até 30 segundos de duração em uma única passagem. Certifique-se de que o seu comando abranja cada segundo da cena para obter o melhor resultado possível. Caso contrário, o programa poderá preencher as lacunas de forma inesperada, usando seu próprio critério.
Quantas referências o Wan 3.0 suporta?
Você pode enviar até 10 imagens de referência, 5 vídeos e 5 arquivos de áudio, com suporte para links de documentos e páginas da web incluídos por geração. Lembre-se sempre de rotular a função de cada uma dessas referências; caso contrário, elas podem acabar influenciando o resultado final de forma aleatória.
Como posso melhorar um prompt longo da Wan 3.0 ?
Concentre-se em fornecer diretrizes em camadas para Wan 3.0 . Por exemplo: “Uma floresta silenciosa. De repente, o chão treme e se abre. Zumbis saem das fendas.” Separe todos os estados principais e trate-os como momentos cronológicos independentes. Para cenas de 30 segundos, use marcadores de tempo para cada estado final.
Como devo proceder para gerar vídeos a partir de imagens?
A capacidade de ancoragem de referência do Wan 3.0 é bastante forte, por isso ele tende a preferir uma evolução gradual em vez de mudanças drásticas na imagem de origem. Concentre-se em criar instruções que mostrem uma progressão natural da cena, especificando como a câmera ou o objeto devem se mover nela.
Como posso melhorar a consistência dos caracteres com o Wan 3.0?
Você pode usar uma imagem/vídeo de referência da personagem e, em seguida, definir os atributos que deseja que o Wan 3.0 mantenha estáveis. Por exemplo: "Preservar o cabelo loiro comprido e as feições da mulher ao longo da cena". Basta minimizar o número de personagens, ações e mudanças de localização.
Como faço para controlar o áudio ao usar a Wan 3.0?
Ao escrever a descrição, você deve colocar o áudio em sua própria categoria e descrever a fonte/comportamento de cada elemento separadamente. Por exemplo: “Uma voz feminina suave fala. A chuva bate no vidro. Uma música de piano toca ao fundo do diálogo.” Isso abrange a voz, os efeitos sonoros e a música de fundo, garantindo que cada parte seja capturada na cena gerada.






