Guía de prompts de Wan 3.0: cómo sacar el máximo partido a Wan 3.0
He estado usando Wan 3.0 durante un tiempo y diría que se basa más en el modelo del director que sus predecesores. Ahora admite generaciones de 30 segundos con texto, imágenes, audio, vídeo, documentos y páginas web como entradas de referencia, por lo que la introducción de comandos requiere un poco más de delicadeza. ¿Quieres saber el secreto? Sigue leyendo, porque te explicaremos a qué responde mejor Wan 3.0 .
TL;DR
Lo que escribas al inicio de tu prompt será lo primero que Wan 3.0 procesará, ya que define la composición desde el principio. Establece la toma y la escena antes de identificar al sujeto, luego describe la acción, especifica la iluminación y el estilo, y finalmente añade el audio. Además, especifica la función de cada referencia para evitar resultados aleatorios. Puedes usar Pollo AI como el espacio de trabajo ideal para generar vídeos con Wan 3.0 .
Guía de prompt de Wan 3.0 : Comprensión de los aspectos clave
Antes de entrar en cómo crear la prompt perfecta Wan 3.0 , primero debes comprender la fórmula básica para cualquier solicitud de prompt básica, así que vamos a desglosarla rápidamente para ti:
Aspecto | Pregunta para responder | Ejemplo |
|---|---|---|
| Sujeto | ¿Cuál es el sujeto y qué debe permanecer reconocible? | Una bicicleta de reparto azul desgastada con una cesta de mimbre. |
| Escena | ¿Dónde está y qué lo rodea? | Una estrecha calle francesa después de la lluvia, fachadas alicatadas, charcos de agua, pavimento reflectante. |
| Movimiento | ¿Qué se mueve, en qué orden y a qué velocidad? | La bicicleta rueda cuesta abajo lentamente; el agua salpica de los neumáticos. |
| Control de la cámara | ¿Cómo debería filmarse la toma? | Toma en seguimiento desde un ángulo bajo, lente de 35 mm, luz suave de cielo nublado. |
| Estilización | ¿Qué estética visual rige la escena? | Vídeo documental con colores apagados |
¿Por qué Wan 3.0 exige indicaciones más matizadas?
Las mejoras de Wan 3.0 me obligaron a adoptar un estilo de indicaciones diferente al que solía usar con Wan 2.7. Una de las razones es que la duración máxima de los vídeos de IA se ha ampliado a 30 segundos por clip. Ahora bien, ¿por qué es importante esto? Aquí está la explicación…
Probé Wan 3.0 a fondo, y una diferencia clave entre los vídeos que no cumplieron mis expectativas y los que sí lo hicieron fue la falta de control del tiempo en mis indicaciones. Cuando simplemente daba descripciones visuales sin tener en cuenta cada segundo de la toma, el resultado era un fracaso.
Sin una línea de tiempo clara, Wan 3.0 llenaría los segundos vacíos con cambios aleatorios. Las mejores indicaciones definen las acciones clave y el comportamiento de la cámara a lo largo del clip, asignando un papel definido a cada imagen, vídeo, archivo de audio o enlace.
También observé que Wan 3.0 establece la composición desde el principio, utilizando a menudo los detalles de la primera prompt como base de la escena. El orden importa, especialmente en la conversión de imagen a vídeo, donde conserva la composición inicial y la identidad del sujeto, pero tiende a no ejecutar con la suficiente contundencia los cambios drásticos.
Por ejemplo, si estoy renderizando una foto para convertirla en un anuncio de video y solicito una transformación demasiado radical, es posible que no obtenga un resultado óptimo. Teniendo en cuenta todo esto, creo que es justo decir que se requiere un enfoque matizado para usar Wan 3.0. Así que veamos cómo obtener las mejores indicaciones posibles.
Antes de adentrarnos en las indicaciones de Wan 3.0 , explore las últimas actualizaciones del modelo en nuestra guía sobre qué es Wan 3.0.
Prueba Wan 3.0 gratis en Pollo AI ahora.
Introduce tus ideas creativas para crear vídeos impresionantes con Wan 3.0 en Pollo AI.
Comienza a crear gratis
Wan 3.0 : Mensajes de texto a vídeo frente a mensajes de imagen a vídeo.
La forma de elaborar las indicaciones de Wan 3.0 para T2V será diferente a la de I2V porque toda la secuencia depende de definir correctamente el sujeto, el entorno, la acción, la cámara y el estilo visual.
Como mencioné antes, Wan 3.0 define la composición desde el principio, por lo que el modelo prioriza lo que se indica en la prompt antes que el resto de la escena. Por ejemplo, si la prompt comienza con una sensación, Wan 3.0 se centrará en esa sensación en lugar de en los sujetos.
Por este motivo, debes definir el tipo de plano de cámara antes de identificar el sujeto y las características que deseas conservar. Luego, puedes proceder a definir la iluminación, el estilo y, finalmente, añadir diálogos, efectos de sonido o música. Aquí tienes un ejemplo de una película de animación que generé:
Prompt | Producción |
|---|---|
| Toma continua estilizada en 3D con estilo cinematográfico 8K. Un joven con un pañuelo azul usa un reloj inteligente holográfico para desplegar brazos mecánicos que lavan su Mazda RX-7 embarrado. El auto se transforma, cargando de electricidad azul y cambiando de blanco a negro brillante con energía púrpura resplandeciente. El auto negro acelera a través de una ciudad ciberpunk neón mojada por la lluvia nocturna. Se activa una pantalla en el parabrisas y el auto salta, transformándose en el aire en un robot bípedo gigante con el conductor visible en la cabina brillante del pecho. El robot aterriza pesadamente en la calle y luego usa propulsores azules para volar y erguirse heroicamente en el techo de un rascacielos. |
Por otro lado, si se pretende utilizar imágenes de referencia, entonces se requiere un enfoque diferente. Por lo que he visto al usarlo, Wan 3.0 parece controlar la composición y la identidad del sujeto de la imagen original de forma mucho más estricta que otros modelos.
Por eso, puede resultar bastante difícil usar indicaciones que sean radicalmente transformadoras o que provoquen cambios abruptos. En la mayoría de esos casos, Wan 3.0 no cumpliría con mi visión de la escena, así que recomiendo usar indicaciones con transiciones suaves y continuas como las que se muestran a continuación:
Prompt:
Secuencia de acción real de cuatro tomas. Usar la Imagen 1 como fotograma inicial exacto y ancla visual. Conservar la misma princesa mercenaria, el rudo contrabandista, los rostros, el vestuario, la pistola, el decorado de la nave espacial, la iluminación y la dirección de pantalla. Película práctica de acción espacial de los años 80: actores reales, decorados físicos, traje alienígena de goma, robot animatrónico de tamaño real, chispas/humo reales, láseres ópticos controlados, formato anamórfico de 35 mm.
DISPARO 1 (0–3.2s): Disparo doble mediano fijo. Ella se recuesta a la izquierda, bota arriba, pistola colgando; él se sienta a la derecha.
DISPARO 2 (3,2–6,7 s): Retroceso rápido. Ráfagas alienígenas a su paso. Ella dispara un tiro preciso que pasa rozando su hombro; el proyectil impacta en su pecho, chisporrotea y cae. Puñalada orquestal, chasquido láser.
DISPARO 3 (6,7–10,3 s): Tres cuartos bajos. El robot da un pisotón a la derecha y levanta el brazo. Gira y dispara dos veces (articulación y luego pecho); el brazo cae y se estrella con chispas y humo. Él la mira con asombro; ella baja la pistola. Suena la percusión y los metales retumban.
TOMA 4 (10,3–14 s): Plano medio de dos personas. Línea de mirada original. Retoma su pose aburrida, con la pistola colgando, mirando fijamente. Se mantiene imperturbable, controlada y sin inmutarse.
Aporte | Producción |
|---|---|
![]() |
Wan 3.0 Indicaciones: Manejo del movimiento
Hablando desde mi experiencia personal, manejar el movimiento con Wan 3.0 requiere bastante secuenciación. Si bien se puede usar una prompt como "un hombre camina por la playa", diría que esta descripción es solo una acción predefinida simple, lo que deja la sincronización y la interacción poco claras.
Una mejor opción es añadir una secuencia de eventos observables. Por ejemplo: «Un hombre camina por la playa, se detiene al oír un ladrido fuerte, se vuelve hacia el sonido y mira hacia abajo para ver a un golden retriever corriendo hacia él». Esto crea un movimiento más realista fotograma a fotograma.
Pero al mismo tiempo, no conviene sobrecargar el vídeo con coreografías excesivas. Esto es algo que también he notado que Wan 3.0 no maneja bien. Cuando intentaba que un personaje realizara demasiadas acciones precisas o interactuara con muchos objetos, el resultado no era el ideal.
Así pues, aunque Wan 3.0 ahora admite clips más largos de 30 segundos, sugiero que se centre en asignar al sujeto una tarea o acción principal clara y sencilla para garantizar la estabilidad temporal. Puede ver un buen ejemplo de esto en el vídeo realista que generé a continuación:
Prompt:
@Image1 es el único personaje principal. Conserva su rostro, peinado, cuerpo y vestimenta exactos en todo momento. Escena ultrarrealista de 30 segundos con la cámara congelada en el tiempo en una calle soleada del casco antiguo italiano (edificios de piedra, adoquines, cafés, peatones, palomas).
0–5s: Camina con seguridad hacia la cámara (la cámara Steadicam retrocede) en medio de la vida cotidiana.
5–8s: Se detiene, chasquea los dedos → una elegante onda expansiva invisible lo congela todo.
8–20s: Solo ella se mueve; la cámara la rodea mientras camina por la calle helada, toca una gota suspendida, luego mira a la cámara con una media sonrisa y vuelve a disparar.
20-30 segundos: La segunda onda expansiva descongela el mundo; ella permanece tranquila.
Estilo: fotorrealista, 50 mm, poca profundidad de campo, luz natural, grano sutil, física y efectos visuales realistas. Sin transformaciones, efectos adicionales ni artefactos.
Aporte | Producción |
|---|---|
![]() |
Mensajes de Wan 3.0 : Idioma de la cámara
En cuanto al lenguaje cinematográfico, una regla general que me gusta seguir es estructurarlo en cuatro partes: tamaño del plano, ángulo, movimiento y lente. Por ejemplo: «un plano general de establecimiento desde un ángulo alto, seguido de un descenso lento con dolly hacia adelante hasta el faro; usar una perspectiva cinematográfica de 50 mm».
Puedes usar esta regla en todas tus indicaciones de Wan 3.0 , pero recuerda evitar siempre el lenguaje contradictorio. Por ejemplo, no puedes decir: «Una cámara estática fija gira rápidamente alrededor del sujeto». Estas dos instrucciones son incompatibles, así que no le pidas al modelo que las haga funcionar.
Si alguna vez quieres generar una secuencia dinámica como un vídeo promocional, por ejemplo, aquí tienes una guía general sobre la perspectiva de la cámara a la que puedes recurrir repetidamente al crear la escena:
Intención | Dirección de la cámara | Efecto visual |
|---|---|---|
| Establecer lugar | Plano general, grúa lenta o retirada | Contexto y escala |
| Fomentar la intimidad | Primer plano medio, acercamiento suave | Atención emocional |
| Siga las acciones | Plano de seguimiento lateral o dolly hacia adelante | Impulso y participación |
| Mostrar importancia | Órbita lenta, composición centrada | Énfasis heroico o icónico |
| Conservar los detalles | Primer plano fijo, poca profundidad de campo. | Enfoque e inspección |
| Crear inestabilidad | Movimiento manual controlado | Urgencia o energía documental |
Otro aspecto importante es que simplemente decir “movimiento de cámara cinematográfico” no basta para crear una escena adecuada con Wan 3.0. Es necesario ser más específico; por ejemplo, “la cámara se desplaza hacia la izquierda a velocidad de caminata mientras el perro corre” producirá resultados más intencionados. Aquí hay un buen ejemplo:
Prompt | Producción |
|---|---|
| Estilo: Documental invernal cinematográfico ultrarrealista, 4K HDR, iluminación natural, poca profundidad de campo, movimiento de cámara suave, gradación de color suave, atmósfera pacífica. Escena 1 (0–3s) Toma aérea con dron de una pequeña cabaña de madera escondida en lo profundo de un bosque de pinos cubierto de nieve. La nieve cae suavemente mientras cálidas luces doradas brillan desde las ventanas. Un fino humo se eleva de la chimenea mientras la cámara desciende lentamente hacia la cabaña. Escena 2 (3–6s) Dentro de la cabaña, la misma mujer está sentada junto a una chimenea de piedra crepitante, envuelta en una suave manta de lana, leyendo un libro. Escena 3 (6–10s) Abre la puerta principal de madera y sale al porche nevado. Los copos de nieve caen suavemente sobre su suéter y cabello. Sonríe, toma una respiración lenta y profunda, y mira a través del bosque silencioso mientras la cámara gira suavemente a su alrededor. Escena 4 (10-13 s): Primeros planos cinematográficos: botas dejando huellas frescas en la nieve virgen, su mano enguantada quitando la nieve de las ramas de los pinos, copos de nieve posándose en la cálida ventana de la cabaña y humo flotando en el aire fresco del invierno. Escena 5 (13-15 s): Plano general cinematográfico alejándose de la cabaña al anochecer. La nieve sigue cayendo mientras la cabaña iluminada se hace más pequeña entre el vasto bosque blanco. |
Además de aprender a crear indicaciones para Wan 3.0 , consulta nuestra guía sobre cómo usar Wan 3.0 para crear vídeos de IA aún mejores.
Wan 3.0 Indicaciones: Escenas de audio/diálogo
Sabemos que Wan 3.0 admite la generación de audio nativa, pero es fácil olvidar que el audio también necesita ser descrito con la misma precisión que las imágenes. En lo que respecta a los diálogos, lo que he aprendido sobre Wan 3.0 después de generar videoblogs, tutoriales, cortometrajes, etc., a diario, es que las líneas deben ser breves.
Lamentablemente, la sincronización labial no siempre es del todo fiable, así que considéralo como breves indicaciones de interpretación, no como un guion extenso. Por lo que he visto, esto es lo que mejor funciona con Wan 3.0. Puedes ver cómo esto contribuyó a obtener un excelente resultado audiovisual a continuación:
Prompt:
Conservar el rostro, el peinado, la identidad, el tono de piel y el cuerpo exactos de @image1. Auténtica mujer indonesia con camisa de lino color terracota extragrande, pantalones anchos color burdeos empolvado, sandalias de cuero marrón, pequeños pendientes de aro dorados y cabello suelto y ondulado.
Vídeo sin editar grabado con cámara de viñetas a finales de la década de 2000: temblores fuertes, problemas de enfoque, cambios de exposición, colores cálidos y apagados, ruido digital. Sin poses ni retoques modernos.
00:00–00:04 Camina por un pueblo tropical sonriendo: “¡Hoy vamos a buscar cocos frescos!”
00:04–00:08 Observa al vendedor cortar coco, emocionado.
00:08–00:12 Toma un sorbo de agua de coco, sonríe: “¡Esto es tan refrescante!”
00:12–00:16 Charlas/risas con aldeanos que sostienen un coco.
00:16–00:20 Intenta abrir un coco, le cuesta, se ríe; los lugareños lo aplauden.
00:20–00:24 Coge la carne, la prueba, pulgar hacia arriba.
00:24–00:27 Camina saludando a los lugareños.
00:27–00:30 Sonrisas, saludos: “Nos vemos en mi próxima aventura. ¡Adiós!”
Aporte | Producción |
![]() |
Otra cosa que noté es que, si se trata de una escena con varios personajes, asegúrate de usar etiquetas. Por ejemplo: “[Sarah, con voz ronca] dice: ‘Tenemos que irnos a las seis’. “[Jon, con voz suave y vacilante] la mira y dice: ‘Está bien. Empecemos a empacar’”.
¿Quieres ver más ejemplos de lo que puede crear Wan 3.0 ? Consulta este artículo sobre los mejores casos de uso de Wan 3.0.
¿Quieres generar vídeos con Wan 3.0? Visita Pollo AI.
Ahora que ya sabes cómo crear una buena prompt Wan 3.0 , probablemente quieras empezar a generar vídeos con ella. Si es así, te recomiendo Pollo AI. ¿Por qué? Porque es la suite creativa de IA definitiva que reúne todos los mejores modelos de vídeo de IA en un solo lugar.
Aquí podrás acceder a Wan 3.0, Seedance 2.5, Kling 3.0 y Veo 3.1, además de docenas de otras opciones, lo que facilita la comparación de diferentes resultados para obtener el mejor resultado posible. Y no solo eso, también podrás subir todos tus archivos y alojar todos tus proyectos en esta única plataforma.

En esencia, lo considero el espacio de trabajo perfecto que complementará cualquier cosa que pretendas hacer con Wan 3.0. ¿Y lo mejor de todo? Ofrece Pollo Agent, un AI Agent para vídeos, historias, anuncios y diseño creativo, que automatiza todo, desde la estructura y el ritmo hasta los elementos visuales, lo que significa que también puede guiarte para crear la prompt perfecta.
Prueba Wan 3.0 gratis en Pollo AI ahora.
Haz realidad tus ideas más audaces con Wan 3.0 y conviértelas en vídeos listos para publicar en Pollo AI.
Comienza a crear gratis
Solo necesitas unos minutos para convertir cualquier idea, por vaga que sea, en un resultado listo para producción. Además, Pollo AI incluye decenas de herramientas para la postproducción, como el extensor de vídeo con IA, lo que garantiza que tengas todo lo necesario para completar el trabajo.
Solo tienes que ir a Pollo AI y crear una cuenta. Puedes empezar a generar vídeos con Wan 3.0 sin coste alguno gracias a la prueba gratuita. Te garantizo que, tras unas horas en esta plataforma, la verás como tu asistente personal de producción de vídeo.
Preguntas frecuentes sobre la guía de prompt de Wan 3.0
¿Cuánto tiempo puede durar una generación de Wan 3.0 ?
Wan 3.0 te permite generar vídeos con audio nativo de hasta 30 segundos de duración en una sola pasada. Asegúrate de que la prompt contemple cada segundo de la toma para obtener el mejor resultado posible. De lo contrario, podría rellenar los huecos de forma impredecible.
¿Cuántas referencias admite Wan 3.0 ?
Puedes subir hasta 10 imágenes de referencia, 5 vídeos y 5 archivos de audio, con soporte para enlaces a documentos y páginas web en cada generación. Recuerda siempre etiquetar la función de cada una de estas referencias; de lo contrario, podrían influir aleatoriamente en el resultado final.
¿Cómo puedo mejorar un prompt de Wan 3.0 demasiado largo?
Concéntrese en proporcionar directivas por capas a Wan 3.0 . Por ejemplo: «Un bosque tranquilo. De repente, el suelo tiembla y se abre. Zombis emergen de las grietas». Separe todos los estados clave y trátelos como momentos cronológicos independientes. Para escenas de 30 segundos, utilice marcas de tiempo para cada estado final.
¿Cómo debo prompt la generación de vídeo a partir de imágenes?
La capacidad de Wan 3.0 para establecer referencias es bastante sólida, por lo que tiende a preferir una evolución gradual a cambios drásticos en la imagen original. Concéntrese en crear indicaciones que muestren una progresión natural de la escena, especificando cómo debe moverse la cámara o el sujeto dentro de ella.
¿Cómo puedo mejorar la coherencia de los personajes con Wan 3.0?
Puedes usar una imagen o video de referencia del personaje y luego definir los atributos que deseas que Wan 3.0 mantenga estables. Por ejemplo: «Conservar el cabello rubio largo y los rasgos faciales de la mujer durante toda la escena». Simplemente minimiza la cantidad de personajes, acciones y cambios de ubicación.
¿Cómo puedo controlar el audio al usar Wan 3.0?
Al redactar la prompt, debes colocar el audio en una categoría aparte y describir la fuente/comportamiento de cada elemento por separado. Por ejemplo: «Una suave voz femenina habla. La lluvia golpea el cristal. Suena música de piano de fondo». Esto abarca la voz, los efectos de sonido y la música ambiental, asegurando que cada elemento quede plasmado en la escena generada.






