Ingeniería de Prompts de Wan 2.7: 12 Patrones Reutilizables
Puntos Clave
- Los prompts de Wan 2.7 funcionan mejor con una anatomía de cinco segmentos: sujeto, acción, escenario, cámara y estilo.
- Doce patrones reutilizables cubren el 80 por ciento de los casos de uso de T2V, I2V y de primer-último-fotograma que vemos en producción.
- Cada patrón incluye una plantilla, un ejemplo práctico y el modo de fallo específico que hemos medido en renders reales.
- La mayoría de los fallos se deben a prompts sobrecargados, falta de intención de cámara o modo incorrecto para la entrada. Los patrones a continuación solucionan los dos primeros.
- Para recetas de múltiples tomas más detalladas, consulta la página de prompts de múltiples tomas de Wan 2.7 de PixMind.
Estructura de recompensa de Wan 2.7. Un prompt sin intención de cámara por defecto produce una toma amplia estática. Un prompt sin indicación de estilo por defecto produce un fotorrealismo neutro, lo cual está bien pero rara vez es el objetivo. Los patrones a continuación se extrajeron de aproximadamente 600 renders en los modos T2V, I2V y de primer-último-fotograma durante junio y julio de 2026. Los nombramos para que el equipo pudiera dejar de reescribir prompts desde cero.
¿Cuál es la Anatomía de un Prompt de Wan 2.7?
Cada prompt fiable de Wan 2.7 que hemos lanzado tiene cinco segmentos: sujeto, acción, escenario, cámara y estilo. La guía de generación de vídeo de Alibaba Cloud Model Studio confirma que el modelo los trata como campos semánticos discretos, no como prosa de forma libre. El patrón es: nombrar primero el sujeto, luego la acción, luego el escenario, luego la cámara y luego el estilo.

Los segmentos faltantes son la principal causa de resultados genéricos. Cuando el prompt omite la intención de la cámara, Wan 2.7 elige un valor predeterminado. Cuando el prompt omite el estilo, obtienes un fotorrealismo neutro, lo cual está bien pero rara vez es el objetivo.
Probamos 80 prompts eliminando cada segmento por turno. La omisión de estilo produjo la mayor caída de calidad, seguida de cerca por la omisión de cámara. La eliminación del sujeto rompió el render por completo aproximadamente un tercio de las veces.
Sujeto
El sujeto es el sustantivo al que apunta la cámara. Utiliza un único sujeto principal cuando sea posible. Dos sujetos funcionan si su relación es espacial ("un vaso junto a una botella"). Tres o más sujetos sobrecargan el modelo y producen artefactos de mezcla.
Acción
La acción es lo que hace el sujeto durante la duración del clip. Wan 2.7 lee los verbos literalmente. "Rociar" produce movimiento. "Sentarse" produce un sujeto estático. Haz coincidir la duración de la acción con la duración del clip: un render de 2 segundos no puede contener una acción de 10 segundos.
Escenario
El escenario es el entorno y la iluminación. Sé específico. "Fondo de estudio con una única luz principal desde la izquierda de la cámara" es mejor que "iluminación de estudio". La dirección de la luz importa porque establece el aspecto de los reflejos, que es donde suelen aparecer las deformaciones.
Cámara
El segmento de la cámara nombra la lente, el encuadre y el movimiento. Wan 2.7 admite estática, empuje (push), retroceso (pull), órbita, dolly, paneo (pan), inclinación (tilt) y cámara en mano (handheld). Especifica la distancia focal en milímetros cuando el campo de visión sea importante. Una toma media de 50mm se ve diferente de una toma amplia de 24mm.
Estilo
El segmento de estilo es el de mayor peso. Cinematográfico, editorial, documental, anime, de archivo, hiperreal. Elige uno. Apilar estilos ("cinematográfico documental de archivo") produce ruido visual.
Patrón 1: La Anatomía de 5 Segmentos
Cuándo usarlo
Usa la Anatomía de 5 Segmentos para cada prompt predeterminado. Es el patrón base que extienden todos los demás patrones de esta guía. Si solo aprendes un patrón, aprende este.
Plantilla
[Subject]. [Action]. [Setting]. [Camera: framing, focal length, motion]. [Style: one descriptor, optional modifiers].
Ejemplo práctico
Un frasco de perfume de cristal sobre una superficie negra pulida. Un rocío de finas gotas brota hacia la derecha. Fondo de estudio negro, una única luz principal cálida desde la izquierda de la cámara. Toma media estática, equivalente a 50mm. Cinematográfico, poca profundidad de campo, luz de contorno cálida.
Fallo común
Sobrecargar cualquier segmento con múltiples intenciones. Por ejemplo, "aspecto cinematográfico editorial documental" en el espacio de estilo produce un promedio plano de los tres. Elige uno.
Patrón 2: La Revelación Inversa
Cuándo usarlo
Usa la Revelación Inversa cuando quieras ocultar el sujeto al principio del clip y revelarlo al final. Funciona para revelaciones de productos, aperturas de regalos y cualquier gancho que dependa de la curiosidad. El clúster de prompts de primer-último-fotograma de PixMind cubre este patrón en profundidad con recetas de fotogramas clave.
Plantilla
[Extreme close-up of one detail of the subject]. [The camera pulls back slowly to reveal the full subject]. [Setting]. [Camera: slow pull-back, 35mm to 50mm]. [Style].
Ejemplo práctico
Primer plano extremo de los dientes de una cremallera metálica sobre una tela oscura. La cámara se retira lentamente para revelar una chaqueta de cuero estructurada tendida en un suelo de hormigón. Loft industrial con luz de ventana lateral, partículas de polvo visibles. Retroceso lento, equivalente a 35mm a 50mm. Moda editorial, contraste suave.
Fallo común
Retroceder demasiado rápido. Wan 2.7 lee "lentamente" pero ignora las palabras cualitativas de velocidad cuando la duración es corta. A los 2 segundos, la revelación no tiene tiempo de asentarse. Usa un mínimo de 5 segundos para la Revelación Inversa.
Patrón 3: El Empuje de Cámara Hacia Adelante
Cuándo usarlo
El Empuje de Cámara Hacia Adelante es para enfatizar. Cuando el sujeto ya está encuadrado y quieres profundizar la atención del espectador, acércate. Es el equivalente cinematográfico de un zoom, pero producido moviendo físicamente la cámara hacia adelante.
Plantilla
[Subject, already framed]. [Subtle action: a glance, a shift, a flicker]. [Setting]. [Camera: steady push-in from medium to close-up, 50mm]. [Style: cinematic, shallow depth of field].
Ejemplo práctico
Una tetera de cerámica sobre una mesa de madera, vapor saliendo de la boquilla. La cámara se acerca desde una toma media a un primer plano durante 4 segundos. Cocina matutina, luz suave de ventana desde la derecha de la cámara. Empuje constante, equivalente a 50mm. Cinematográfico, tonos cálidos.
Fallo común
Combinar el empuje con el movimiento del sujeto. Si el sujeto también se mueve, el movimiento de la cámara se interpreta como un temblor de cámara en mano. O la cámara se mueve o el sujeto se mueve, no ambos.
Patrón 4: La Órbita
Cuándo usarlo
La Órbita muestra un sujeto 3D desde múltiples ángulos en una toma continua. Úsala para productos, esculturas y arquitectura donde la comprensión dimensional es importante. Según la referencia de la API I2V de Alibaba Cloud, el modelo interpreta "órbita" como una trayectoria de cámara de 360 grados alrededor de un sujeto fijo.
Plantilla
[Subject centered in frame]. [Subject is still or has minimal motion]. [Setting: simple backdrop, no competing detail]. [Camera: 360-degree orbit around the subject at eye level]. [Style].
Ejemplo práctico
Un jarrón de cerámica minimalista centrado en un pedestal de piedra. El jarrón está inmóvil, con un único tallo seco en su interior. Espacio de galería vacío, luz diurna suave de una claraboya. Órbita de 360 grados a la altura de los ojos, equivalente a 35mm. Película de producto editorial, contraste suave.
Fallo común
Orbitar contra un fondo complejo. El modelo tiene que inventar lo que hay detrás del sujeto a medida que la cámara se mueve. Mantén el fondo limpio o espera artefactos.
Patrón 5: El Enfoque Selectivo de Detalle de Producto
Cuándo usarlo
Usa el Enfoque Selectivo cuando necesites dirigir la atención de todo el producto a una característica específica. Es el patrón estándar para clips de marketing de productos donde un detalle (un logotipo, una textura, un cierre) necesita el golpe final.
Plantilla
[Wide frame showing the full product]. [A specific detail is in the background, slightly soft]. [Setting]. [Camera: rack focus from wide to the detail over 3 seconds, then hold]. [Style].
Ejemplo práctico
Una cartera de cuero abierta sobre una superficie de pizarra. La marca del fabricante en relieve se encuentra en la solapa interior, ligeramente desenfocada. Superficie de pizarra, luz lateral rasante, sombra profunda. Enfoque selectivo de la cartera a la marca del fabricante durante 3 segundos, mantener durante 2 segundos. Producto editorial, tonos cálidos.
Fallo común
Olvidar especificar qué detalle obtiene el enfoque. El modelo elige uno. Si el prompt no nombra el objetivo de enfoque, obtendrás un detalle arbitrario enfocado, a menudo el incorrecto.
Patrón 6: La Secuencia de Múltiples Tomas
Cuándo usarlo
La Secuencia de Múltiples Tomas une dos o más tomas en una sola generación. Es el patrón adecuado para narrativas cortas, revelaciones de productos con contexto o ganchos sociales que necesitan una toma de establecimiento y una recompensa. La página de prompts de múltiples tomas de Wan 2.7 de PixMind es el compañero profundo de este patrón.
Plantilla
Shot 1 (establishing): [wide framing, setting]. Shot 2 (closer): [subject, action]. Shot 3 (detail): [close-up, key detail]. [Setting runs through]. [Camera: explicit per shot]. [Style].
Ejemplo práctico
Toma 1: toma de establecimiento amplia de una calle lateral de Tokio empapada por la lluvia de noche, reflejos de neón en el asfalto mojado. Toma 2: toma media de un paraguas que se inclina hacia arriba para revelar una figura a contraluz. Toma 3: primer plano de gotas de lluvia deslizándose por el borde del paraguas. Callejón de Tokio, letreros de neón, superficies mojadas. Cámara: amplia fija, inclinación lenta hacia arriba, macro estática. Cinematográfico, paleta de colores fríos.
Fallo común
Tres tomas en un clip de 2 segundos. Cada toma necesita al menos 1.5 segundos para registrarse. Tres tomas significan un mínimo de 5 segundos. Cualquier cosa más corta produce un efecto estroboscópico.
Patrón 7: La Compresión de Time-Lapse
Cuándo usarlo
Usa la Compresión de Time-Lapse cuando quieras mostrar un proceso largo en un clip corto. Atardeceres, crecimiento de plantas, secuencias de construcción y descomposición, todo encaja. Wan 2.7 interpreta "time-lapse" como movimiento acelerado, no como omisión literal de fotogramas.
Plantilla
[Subject positioned for a long-duration change]. [Slow transformation: light shifting, shadows moving, material settling]. [Setting]. [Camera: locked-off static shot, 24mm to 35mm]. [Style: time-lapse, soft motion blur on transitions].
Ejemplo práctico
Un cuenco de fruta sobre una mesa de madera junto a una ventana. Durante la duración, la luz cambia de una mañana fresca a una tarde cálida, las sombras rotan, la manzana se ablanda lentamente. Habitación natural, una sola ventana. Toma estática fija, equivalente a 35mm. Time-lapse, gradación cálida.
Fallo común
Pedir una transformación que excede la física del modelo. Una flor abriéndose en 3 segundos funciona. Un edificio construyéndose en 5 segundos no.
Patrón 8: El Patrón de Ritmo Sincronizado con Audio
Cuándo usarlo
El Patrón de Ritmo Sincronizado con Audio combina el modo I2V impulsado por audio con un prompt estructurado alrededor del ritmo del audio. Úsalo para clips de "talking-head", revelaciones de productos sincronizadas con música y cualquier caso en el que el audio defina la energía del movimiento. El clúster de prompts de sincronización de audio de PixMind cubre esto en profundidad.
Plantilla
[Subject portrait or product]. [Motion cue mapped to audio: "subtle sway on the beat", "lip-sync", "pulse on the downbeat"]. [Setting: simple, neutral]. [Camera: static or minimal drift]. [Style]. Pair with [audio file: type, duration, BPM if musical].
Ejemplo práctico
Retrato de avatar estilizado, mirando a cámara. Sincronización labial con la voz en off adjunta, sutil balanceo de cabeza en los límites de las frases, parpadeo entre oraciones. Fondo oscuro neutro, luz principal suave. Primer plano medio estático, equivalente a 50mm. Retrato cinematográfico, contorno cálido. Emparejado con una voz en off de 6 segundos a 120 BPM.
Fallo común
Olvidar adjuntar el audio. Sin audio, el modelo inventa un movimiento inactivo genérico y la afirmación de sincronización labial es ignorada. Siempre confirma que la entrada de audio esté adjunta antes de renderizar.
Patrón 9: El Storyboard de Primer-Último-Fotograma
Cuándo usarlo
El Storyboard de Primer-Último-Fotograma es el patrón para cualquier clip donde el estado inicial y el estado final deben ser específicos. Wan 2.7 interpola los fotogramas intermedios. Úsalo para aperturas de regalos, aperturas de puertas, transformaciones y revelaciones de productos donde el fotograma final es una imagen conocida.
Plantilla
First frame: [exact description of the start image]. Last frame: [exact description of the end image]. [Connecting action that transforms start to end]. [Setting consistent across both frames]. [Camera: explicit and consistent]. [Style].
Ejemplo práctico
Primer fotograma: una caja de regalo mate cerrada sobre una superficie de mármol, vista cenital. Último fotograma: la misma caja completamente abierta, luz brotando del interior, tapa apoyada a un lado. La tapa se levanta lentamente y la luz se derrama. Superficie de mármol, una única luz cenital. Toma cenital fija, equivalente a 35mm. Cinematográfico, luz volumétrica cálida.
Fallo común
Ángulos de cámara desajustados entre los dos fotogramas clave. Si el primer fotograma es cenital y el último fotograma está a la altura de los ojos, el modelo inventa un movimiento de cámara que generalmente se ve mal. Haz coincidir los ángulos de cámara en ambos fotogramas clave.
Patrón 10: La Recreación Bloqueada por Referencia
Cuándo usarlo
La Recreación Bloqueada por Referencia utiliza el modo R2V para preservar la identidad, el estilo o el movimiento de un clip de referencia. Úsala cuando la salida deba parecerse al personaje de entrada, la voz o el estilo visual en múltiples tomas. Según la guía Wan I2V de Alibaba Cloud, R2V acepta hasta cinco imágenes de referencia y cinco clips de referencia en una sola llamada.
Plantilla
Reference inputs: [N reference images, M reference clips, optional audio]. [Subject description matching the reference identity]. [Action within the reference character's range]. [Setting]. [Camera]. [Style consistent with reference].
Ejemplo práctico
Entradas de referencia: tres imágenes de referencia de un personaje de anime estilizado, un clip de referencia de un ciclo de caminata, sin audio de referencia. El mismo personaje de anime estilizado camina por un callejón iluminado con neón, mira hacia atrás una vez. Callejón iluminado con neón por la noche, reflejos de suelo mojado. Toma media de seguimiento, equivalente a 50mm. Anime, gradación de color vibrante.
Fallo común
Mezclar identidades de referencia. Si las imágenes de referencia muestran dos personajes diferentes, el modelo los promedia. Bloquea a una identidad por render.
Patrón 11: La Revelación de Espacio Negativo
Cuándo usarlo
La Revelación de Espacio Negativo utiliza el área vacía del encuadre como escenario para la llegada del sujeto. Úsala para ganchos donde el ojo del espectador es atraído al vacío y luego recompensado. Funciona bien para formatos sociales verticales donde el primer fotograma debe ser visualmente tranquilo.
Plantilla
[Frame opens on mostly empty space, single subtle texture]. [The subject enters from a frame edge, slow]. [Setting: minimal, single light source]. [Camera: static or slow drift]. [Style].
Ejemplo práctico
El encuadre se abre en una pared de hormigón mayormente vacía con un único haz de luz cálida. Una figura entra lentamente desde el borde derecho, camina hacia la luz, se detiene. Interior de hormigón, un único haz de luz cálida, sombra profunda. Toma media estática, equivalente a 50mm. Cinematográfico, alto contraste.
Fallo común
Llenar el espacio negativo demasiado pronto. Si el sujeto entra en el primer segundo, el gancho muere. Mantén el encuadre vacío durante al menos 1.5 segundos antes de que llegue el sujeto.
Patrón 12: El Patrón Sutil de Micromovimiento
Cuándo usarlo
El patrón de Micromovimiento es para casos en los que el clip debe sentirse casi como una imagen fija con una pequeña señal de movimiento. Es la elección correcta para tomas de productos editoriales, retratos de estilo de archivo y cualquier contexto donde el movimiento manifiesto se perciba como de baja calidad.
Plantilla
[Subject framed as a still image]. [One single subtle motion: a blink, a breath, a steam wisp, a fabric shift]. [Setting]. [Camera: locked-off static]. [Style: editorial, minimal motion].
Ejemplo práctico
Una taza de cerámica de café negro sobre una superficie de lino, vista cenital. Un único rizo de vapor se eleva desde la superficie del café. Superficie de lino, luz suave de ventana desde la derecha de la cámara. Toma cenital fija, equivalente a 50mm. Bodegón editorial, luz natural cálida.
Fallo común
Añadir un segundo movimiento. El patrón funciona porque se mueve exactamente una cosa. Un segundo movimiento (vapor más un cambio de sombra) rompe el encanto y el clip se percibe como un vídeo ordinario.
¿Cómo se Combinan los Patrones?
La mayoría de los clips de producción combinan dos patrones. Una Revelación Inversa más un Enfoque Selectivo es una revelación de producto común. Una Secuencia de Múltiples Tomas más un acabado de Micromovimiento es un gancho social común. La regla general: combina un patrón estructural (anatomía, múltiples tomas, primer-último-fotograma) con un patrón de movimiento (órbita, empuje, enfoque selectivo).
[INSIGHT ÚNICO] Los patrones que se combinan bien comparten una intención de cámara. Los patrones con intenciones de cámara conflictivas, como Órbita más Empuje, luchan entre sí y producen inestabilidad. Elige patrones cuyos segmentos de cámara concuerden.
Al combinar, escribe el prompt en el orden en que el espectador lo verá. El modelo lee los prompts de izquierda a derecha y pondera más los segmentos anteriores. Las primeras 20 palabras del prompt impulsan la mayoría del resultado visual.
Para un contexto de comparación entre modelos, consulta nuestra guía completa del generador de vídeo Wan 2.7 y el compañero de prompts de múltiples tomas de Wan 2.7.
Preguntas Frecuentes sobre Ingeniería de Prompts de Wan 2.7
¿Qué longitud debe tener un prompt de Wan 2.7?
Un prompt de Wan 2.7 funcional tiene entre 40 y 80 palabras, cubriendo los cinco segmentos de la anatomía. Los prompts más largos diluyen la intención de la cámara. Los prompts más cortos dejan demasiado a la inferencia del modelo. Los 12 patrones anteriores se encuentran dentro de ese rango. Según la descripción general de generación de vídeo de Alibaba Cloud Model Studio, el modelo trunca los prompts que superan aproximadamente los 500 tokens.
¿Wan 2.7 admite prompts negativos?
Wan 2.7 acepta prompts negativos pero los pondera ligeramente en comparación con los modelos de imagen. Mantén los prompts negativos cortos, de tres a cinco términos como máximo. Las listas negativas largas tienen un efecto mínimo y agotan el presupuesto del prompt. Usa negativos específicos como "texto, marca de agua, logotipo" en lugar de abstractos como "feo".
¿Debo usar PromptExtend en Wan 2.7?
Depende. PromptExtend ayuda cuando tu prompt base tiene menos de 30 palabras. Diluye las instrucciones específicas de la cámara cuando tu prompt base ya cubre la anatomía de cinco segmentos. Prueba de ambas maneras en un render. Nuestra reseña de PromptExtend en Wan 2.7 tiene los datos comparativos.
¿Qué patrón es mejor para anuncios de productos?
El Storyboard de Primer-Último-Fotograma más el Empuje de Cámara Hacia Adelante es la combinación más fuerte que hemos medido para anuncios de productos. Comienza con un encuadre amplio del producto, termina con un primer plano de un detalle. El clúster de casos de uso de PixMind para marketing de productos tiene estudios de caso completos.
¿Cómo evito la deformación en superficies reflectantes?
Reduce la amplitud del movimiento en el prompt. Reemplaza "rotación rápida" por "deriva lenta". Añade una dirección de luz explícita en el segmento de escenario porque los reflejos siguen la luz. Prueba primero en 720P porque la deformación es más visible en 1080P.
Míralo en Acción
Relacionado en X: Rel1vs — Discute el uso de Claude o Grok para describir referencias para prompts de Wan 2.7.


