🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Engenharia de Prompt Wan 2.7: 12 Padrões Reutilizáveis Com Exemplos

Índice

Engenharia de Prompt Wan 2.7: 12 Padrões Reutilizáveis

Principais Conclusões

  • Os prompts Wan 2.7 funcionam melhor com uma anatomia de cinco segmentos: sujeito, ação, cenário, câmera e estilo.
  • Doze padrões reutilizáveis cobrem 80% dos casos de uso de T2V, I2V e first-last-frame que vemos em produção.
  • Cada padrão inclui um modelo, um exemplo prático e o modo de falha específico que medimos em renders reais.
  • A maioria das falhas se deve a prompts sobrecarregados, intenção de câmera ausente ou modo errado para a entrada. Os padrões abaixo corrigem os dois primeiros.
  • Para receitas multi-shot mais aprofundadas, consulte a página de prompts multi-shot Wan 2.7 da PixMind.

Estrutura de recompensa Wan 2.7. Um prompt sem intenção de câmera assume como padrão um plano geral estático. Um prompt sem indicação de estilo assume como padrão um fotorrealismo neutro. Os padrões abaixo foram extraídos de aproximadamente 600 renders nos modos T2V, I2V e first-last-frame durante junho e julho de 2026. Nós os nomeamos para que a equipe pudesse parar de reescrever prompts do zero.

Qual é a Anatomia de um Prompt Wan 2.7?

Todo prompt Wan 2.7 confiável que lançamos possui cinco segmentos: sujeito, ação, cenário, câmera e estilo. O guia de geração de vídeo do Alibaba Cloud Model Studio confirma que o modelo trata estes como campos semânticos discretos, não prosa livre. O padrão é: nomeie o sujeito primeiro, depois a ação, depois o cenário, depois a câmera e depois o estilo.

Diagrama: Prompt Wan 2.7 decomposto em cinco segmentos codificados por cores: Sujeito, Ação, Cenário, Câmera, Estilo.

Segmentos ausentes são a principal causa de saída genérica. Quando o prompt omite a intenção da câmera, Wan 2.7 escolhe um padrão. Quando o prompt omite o estilo, você obtém fotorrealismo neutro, o que é aceitável, mas raramente o objetivo.

Testamos 80 prompts com cada segmento removido por vez. A omissão de estilo produziu a maior queda de qualidade, seguida de perto pela omissão de câmera. A remoção do sujeito quebrou o render completamente em aproximadamente um terço das vezes.

Sujeito

O sujeito é o substantivo para o qual a câmera está apontada. Use um único sujeito principal sempre que possível. Dois sujeitos funcionam se a relação entre eles for espacial ("um copo ao lado de uma garrafa"). Três ou mais sujeitos sobrecarregam o modelo e produzem artefatos de mistura.

Ação

A ação é o que o sujeito faz durante a duração do clipe. Wan 2.7 lê os verbos literalmente. "Spray" produz movimento. "Sit" produz um sujeito estático. Combine a duração da ação com a duração do clipe: um render de 2 segundos não pode conter uma ação de 10 segundos.

Cenário

O cenário é o ambiente e a iluminação. Seja específico. "Fundo de estúdio com uma única luz principal da esquerda da câmera" é melhor do que "iluminação de estúdio". A direção da luz importa porque define a aparência das reflexões, que é onde a distorção geralmente aparece.

Câmera

O segmento da câmera nomeia a lente, o enquadramento e o movimento. Wan 2.7 suporta estático, push, pull, orbit, dolly, pan, tilt e handheld. Especifique a distância focal em milímetros quando o campo de visão for importante. Um plano médio de 50mm parece diferente de um plano amplo de 24mm.

Estilo

O segmento de estilo é o mais pesado. Cinematográfico, editorial, documentário, anime, arquivístico, hiper-real. Escolha um. Empilhar estilos ("cinematográfico documentário arquivístico") produz ruído visual.

Padrão 1: A Anatomia de 5 Segmentos

Quando usá-lo

Use a Anatomia de 5 Segmentos para cada prompt padrão. É o padrão base que todos os outros padrões neste guia estendem. Se você aprender apenas um padrão, aprenda este.

Modelo

[Subject]. [Action]. [Setting]. [Camera: framing, focal length, motion]. [Style: one descriptor, optional modifiers].

Exemplo prático

Um frasco de perfume de vidro sobre uma superfície preta polida. Um spray de gotículas finas irrompe para a direita. Fundo de estúdio preto, uma única luz principal quente vinda da esquerda da câmera. Plano médio estático, equivalente a 50mm. Cinematográfico, profundidade de campo rasa, luz de contorno quente.

Falha comum

Sobrecarga de qualquer segmento único com múltiplas intenções. Por exemplo, "cinematic editorial documentary look" no slot de estilo produz uma média plana dos três. Escolha um.

Padrão 2: A Revelação Reversa

Quando usá-lo

Use a Revelação Reversa quando quiser esconder o sujeito no início do clipe e revelá-lo no final. Funciona para revelações de produtos, aberturas de presentes e qualquer gancho que dependa da curiosidade. O cluster de prompts first-last-frame da PixMind cobre este padrão em profundidade com receitas de keyframe.

Modelo

[Extreme close-up of one detail of the subject]. [The camera pulls back slowly to reveal the full subject]. [Setting]. [Camera: slow pull-back, 35mm to 50mm]. [Style].

Exemplo prático

Close-up extremo de dentes de zíper metálico em um tecido escuro. A câmera recua lentamente para revelar uma jaqueta de couro estruturada deitada em um piso de concreto. Loft industrial com luz de janela lateral, partículas de poeira visíveis. Recuo lento, equivalente a 35mm a 50mm. Moda editorial, contraste suave.

Falha comum

Recuar muito rápido. Wan 2.7 lê "lentamente", mas ignora palavras de velocidade qualitativas quando a duração é curta. Em 2 segundos, a revelação não tem tempo para acontecer. Use no mínimo 5 segundos para a Revelação Reversa.

Padrão 3: O Empurrão da Câmera para Frente

Quando usá-lo

O Empurrão da Câmera para Frente é para ênfase. Quando o sujeito já está enquadrado e você quer aprofundar a atenção do espectador, aproxime-se. É o equivalente cinematográfico de um zoom, mas produzido pelo movimento físico da câmera para frente.

Modelo

[Subject, already framed]. [Subtle action: a glance, a shift, a flicker]. [Setting]. [Camera: steady push-in from medium to close-up, 50mm]. [Style: cinematic, shallow depth of field].

Exemplo prático

Um bule de cerâmica em uma mesa de madeira, vapor subindo do bico. A câmera se aproxima de um plano médio para um close-up ao longo de 4 segundos. Cozinha matinal, luz suave da janela vinda da direita da câmera. Aproximação constante, equivalente a 50mm. Cinematográfico, tons quentes.

Falha comum

Combinar a aproximação com o movimento do sujeito. Se o sujeito também se move, o movimento da câmera é interpretado como tremor de mão. Ou a câmera se move ou o sujeito se move, não ambos.

Padrão 4: A Órbita

Quando usá-lo

A Órbita exibe um sujeito 3D de múltiplos ângulos em uma única tomada contínua. Use-a para produtos, esculturas e arquitetura onde a compreensão dimensional é importante. De acordo com a referência da API I2V do Alibaba Cloud, o modelo interpreta "orbit" como um caminho de câmera de 360 graus ao redor de um sujeito fixo.

Modelo

[Subject centered in frame]. [Subject is still or has minimal motion]. [Setting: simple backdrop, no competing detail]. [Camera: 360-degree orbit around the subject at eye level]. [Style].

Exemplo prático

Um vaso de cerâmica minimalista centrado em um pedestal de pedra. O vaso está imóvel, com um único caule seco dentro. Espaço de galeria vazio, luz natural suave de uma claraboia. Órbita de 360 graus ao nível dos olhos, equivalente a 35mm. Filme de produto editorial, contraste suave.

Falha comum

Orbitar contra um fundo complexo. O modelo precisa inventar o que está atrás do sujeito enquanto a câmera se move. Mantenha o fundo limpo ou espere artefatos.

Padrão 5: O Foco Seletivo no Detalhe do Produto

Quando usá-lo

Use o Foco Seletivo quando precisar direcionar a atenção do produto inteiro para uma característica específica. É o padrão para clipes de marketing de produto onde um detalhe (um logotipo, uma textura, um fecho) precisa do destaque final.

Modelo

[Wide frame showing the full product]. [A specific detail is in the background, slightly soft]. [Setting]. [Camera: rack focus from wide to the detail over 3 seconds, then hold]. [Style].

Exemplo prático

Uma carteira de couro aberta sobre uma superfície de ardósia. A marca do fabricante em relevo está na aba interior, ligeiramente fora de foco. Superfície de ardósia, luz lateral rasante, sombra profunda. Foco seletivo da carteira para a marca do fabricante ao longo de 3 segundos, mantendo por 2 segundos. Produto editorial, tons quentes.

Falha comum

Esquecer de especificar qual detalhe ganha foco. O modelo escolhe um. Se o prompt não nomear o alvo do foco, você obterá um detalhe arbitrário em foco, muitas vezes o errado.

Padrão 6: A Sequência Multi-Tomada

Quando usá-lo

A Sequência Multi-Tomada une duas ou mais tomadas em uma única geração. É o padrão certo para narrativas curtas, revelações de produtos com contexto ou ganchos sociais que precisam de uma tomada de estabelecimento e uma recompensa. A página de prompts multi-shot Wan 2.7 da PixMind é o complemento aprofundado para este padrão.

Modelo

Shot 1 (establishing): [wide framing, setting]. Shot 2 (closer): [subject, action]. Shot 3 (detail): [close-up, key detail]. [Setting runs through]. [Camera: explicit per shot]. [Style].

Exemplo prático

Tomada 1: plano geral de estabelecimento de uma rua lateral de Tóquio encharcada pela chuva à noite, reflexos de néon no asfalto molhado. Tomada 2: plano médio de um guarda-chuva inclinando-se para cima para revelar uma figura contraluz. Tomada 3: close-up de gotas de chuva escorrendo pela borda do guarda-chuva. Beco de Tóquio, sinalização de néon, superfícies molhadas. Câmera: ampla travada, inclinação lenta para cima, macro estática. Cinematográfico, paleta de cores frias.

Falha comum

Três tomadas em um clipe de 2 segundos. Cada tomada precisa de pelo menos 1,5 segundos para ser registrada. Três tomadas significam um mínimo de 5 segundos. Qualquer coisa mais curta produz um estrobo.

Padrão 7: A Compressão de Time-Lapse

Quando usá-lo

Use a Compressão de Time-Lapse quando quiser mostrar um processo longo em um clipe curto. Pôr do sol, crescimento de plantas, sequências de construção e decadência se encaixam. Wan 2.7 lê "time-lapse" como movimento acelerado, não como salto literal de quadros.

Modelo

[Subject positioned for a long-duration change]. [Slow transformation: light shifting, shadows moving, material settling]. [Setting]. [Camera: locked-off static shot, 24mm to 35mm]. [Style: time-lapse, soft motion blur on transitions].

Exemplo prático

Uma tigela de frutas em uma mesa de madeira perto de uma janela. Durante a duração, a luz muda de uma manhã fria para uma tarde quente, as sombras giram, a maçã amolece lentamente. Quarto natural, uma única janela. Tomada estática travada, equivalente a 35mm. Time-lapse, gradação quente.

Falha comum

Pedir uma transformação que excede a física do modelo. Uma flor abrindo em 3 segundos funciona. Um prédio sendo construído em 5 segundos não.

Padrão 8: O Padrão de Batida Sincronizada com Áudio

Quando usá-lo

O Padrão de Batida Sincronizada com Áudio combina o modo I2V impulsionado por áudio com um prompt estruturado em torno do ritmo do áudio. Use-o para clipes de "talking-head", revelações de produtos sincronizadas com música e qualquer caso em que o áudio defina a energia do movimento. O cluster de prompts de sincronização de áudio da PixMind cobre isso em profundidade.

Modelo

[Subject portrait or product]. [Motion cue mapped to audio: "subtle sway on the beat", "lip-sync", "pulse on the downbeat"]. [Setting: simple, neutral]. [Camera: static or minimal drift]. [Style]. Pair with [audio file: type, duration, BPM if musical].

Exemplo prático

Retrato de avatar estilizado, de frente para a câmera. Sincronização labial com a narração anexada, balanço sutil da cabeça nos limites das frases, piscada entre as sentenças. Fundo escuro neutro, luz principal suave. Close-up médio estático, equivalente a 50mm. Retrato cinematográfico, contorno quente. Emparelhado com uma narração de 6 segundos a 120 BPM.

Falha comum

Esquecer de anexar o áudio. Sem áudio, o modelo inventa um movimento ocioso genérico e a alegação de sincronização labial é ignorada. Sempre confirme se a entrada de áudio está anexada antes de renderizar.

Padrão 9: O Storyboard de Primeiro e Último Quadro

Quando usá-lo

O Storyboard de Primeiro e Último Quadro é o padrão para qualquer clipe onde o estado inicial e o estado final devem ser específicos. Wan 2.7 interpola os quadros intermediários. Use isso para aberturas de presentes, aberturas de portas, transformações e revelações de produtos onde o quadro final é uma imagem conhecida.

Modelo

First frame: [exact description of the start image]. Last frame: [exact description of the end image]. [Connecting action that transforms start to end]. [Setting consistent across both frames]. [Camera: explicit and consistent]. [Style].

Exemplo prático

Primeiro quadro: uma caixa de presente fosca fechada sobre uma superfície de mármore, vista de cima. Último quadro: a mesma caixa totalmente aberta, luz fluindo de dentro, tampa apoiada de lado. A tampa se levanta lentamente e a luz se derrama. Superfície de mármore, uma única luz superior. Vista de cima travada, equivalente a 35mm. Cinematográfico, luz volumétrica quente.

Falha comum

Ângulos de câmera incompatíveis entre os dois keyframes. Se o primeiro quadro é visto de cima e o último quadro é ao nível dos olhos, o modelo inventa um movimento de câmera que geralmente parece errado. Combine os ângulos de câmera em ambos os keyframes.

Padrão 10: A Remake Bloqueada por Referência

Quando usá-lo

A Remake Bloqueada por Referência usa o modo R2V para preservar identidade, estilo ou movimento de um clipe de referência. Use-o quando a saída deve se parecer com o personagem, voz ou estilo visual de entrada em várias tomadas. De acordo com o guia Wan I2V do Alibaba Cloud, o R2V aceita até cinco imagens de referência e cinco clipes de referência em uma única chamada.

Modelo

Reference inputs: [N reference images, M reference clips, optional audio]. [Subject description matching the reference identity]. [Action within the reference character's range]. [Setting]. [Camera]. [Style consistent with reference].

Exemplo prático

Entradas de referência: três imagens de referência de um personagem de anime estilizado, um clipe de referência de um ciclo de caminhada, sem áudio de referência. O mesmo personagem de anime estilizado caminha por um beco iluminado por néon, olha para trás uma vez. Beco iluminado por néon à noite, reflexos de chão molhado. Plano médio de acompanhamento, equivalente a 50mm. Anime, gradação de cor vibrante.

Falha comum

Misturar identidades de referência. Se as imagens de referência mostram dois personagens diferentes, o modelo faz uma média deles. Mantenha uma única identidade por render.

Padrão 11: A Revelação de Espaço Negativo

Quando usá-lo

A Revelação de Espaço Negativo usa a área vazia do quadro como palco para a chegada do sujeito. Use-a para ganchos onde o olho do espectador é atraído para o vazio e depois recompensado. Funciona bem para formatos sociais verticais onde o primeiro quadro deve ser visualmente silencioso.

Modelo

[Frame opens on mostly empty space, single subtle texture]. [The subject enters from a frame edge, slow]. [Setting: minimal, single light source]. [Camera: static or slow drift]. [Style].

Exemplo prático

O quadro se abre em uma parede de concreto quase vazia com um único feixe de luz quente. Uma figura entra lentamente pela borda direita, caminha para a luz, pausa. Interior de concreto, um único feixe de luz quente, sombra profunda. Plano médio estático, equivalente a 50mm. Cinematográfico, alto contraste.

Falha comum

Preencher o espaço negativo muito cedo. Se o sujeito entra no primeiro segundo, o gancho morre. Mantenha o quadro vazio por pelo menos 1,5 segundos antes da chegada do sujeito.

Padrão 12: O Padrão Sutil de Micro-Movimento

Quando usá-lo

O padrão de Micro-Movimento é para casos em que o clipe deve parecer quase uma imagem estática com uma pequena indicação de movimento. É a escolha certa para fotos de produtos editoriais, retratos estilo arquivo e qualquer contexto onde o movimento ostensivo pareça barato.

Modelo

[Subject framed as a still image]. [One single subtle motion: a blink, a breath, a steam wisp, a fabric shift]. [Setting]. [Camera: locked-off static]. [Style: editorial, minimal motion].

Exemplo prático

Uma caneca de cerâmica de café preto em uma superfície de linho, vista de cima. Uma única espiral de vapor sobe da superfície do café. Superfície de linho, luz suave da janela vinda da direita da câmera. Vista de cima travada, equivalente a 50mm. Natureza morta editorial, luz natural quente.

Falha comum

Adicionar um segundo movimento. O padrão funciona porque exatamente uma coisa se move. Um segundo movimento (vapor mais uma mudança de sombra) quebra o encanto e o clipe parece um vídeo comum.

Como Combinar Padrões?

A maioria dos clipes de produção combina dois padrões. Uma Revelação Reversa mais um Foco Seletivo é uma revelação de produto comum. Uma Sequência Multi-Tomada mais um acabamento de Micro-Movimento é um gancho social comum. A regra geral: combine um padrão estrutural (anatomia, multi-tomada, primeiro-último-quadro) com um padrão de movimento (órbita, empurrão, foco seletivo).

[INSIGHT ÚNICO] Os padrões que se combinam bem compartilham uma intenção de câmera. Padrões com intenções de câmera conflitantes, como Órbita mais Empurrão, lutam entre si e produzem instabilidade. Escolha padrões cujos segmentos de câmera concordem.

Ao combinar, escreva o prompt na ordem em que o espectador o verá. O modelo lê os prompts da esquerda para a direita e atribui maior peso aos segmentos anteriores. As primeiras 20 palavras do prompt impulsionam a maioria do resultado visual.

Para contexto de comparação entre modelos, consulte nosso guia completo do gerador de vídeo Wan 2.7 e o companheiro de prompts multi-shot Wan 2.7.

FAQ de Engenharia de Prompt Wan 2.7

Qual deve ser o comprimento de um prompt Wan 2.7?

Um prompt Wan 2.7 funcional tem de 40 a 80 palavras, cobrindo todos os cinco segmentos da anatomia. Prompts mais longos diluem a intenção da câmera. Prompts mais curtos deixam muito para o conhecimento prévio do modelo. Os 12 padrões acima se encaixam nessa faixa. De acordo com a visão geral de geração de vídeo do Alibaba Cloud Model Studio, o modelo trunca prompts com mais de aproximadamente 500 tokens.

Wan 2.7 suporta prompts negativos?

Wan 2.7 aceita prompts negativos, mas os pondera levemente em comparação com modelos de imagem. Mantenha os prompts negativos curtos, de três a cinco termos no máximo. Listas negativas longas têm efeito mínimo e consomem o orçamento do prompt. Use negativos específicos como "texto, marca d'água, logotipo" em vez de abstratos como "feio".

Devo usar PromptExtend no Wan 2.7?

Depende. PromptExtend ajuda quando seu prompt base tem menos de 30 palavras. Ele dilui instruções específicas da câmera quando seu prompt base já cobre a anatomia de cinco segmentos. Teste de ambas as maneiras em um render. Nossa análise do PromptExtend no Wan 2.7 possui os dados lado a lado.

Qual padrão é melhor para anúncios de produtos?

O Storyboard de Primeiro e Último Quadro mais o Empurrão da Câmera para Frente é a combinação mais forte que medimos para anúncios de produtos. Comece com um quadro amplo do produto, termine com um close-up de detalhe. O cluster de casos de uso da PixMind para marketing de produtos possui estudos de caso completos.

Como evitar distorções em superfícies reflexivas?

Reduza a amplitude do movimento no prompt. Substitua "rotação rápida" por "deriva lenta". Adicione direção de luz explícita no segmento de cenário porque os reflexos seguem a luz. Teste em 720P primeiro porque a distorção é mais visível em 1080P.

Veja em Ação

Relacionado no X: Rel1vs — Discute o uso de Claude ou Grok para descrever referências para prompts Wan 2.7..

继续浏览中,生成器即将加载...

Ferramentas Relacionadas