🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Gerador de Vídeo Wan 2.7: Guia Completo para Texto, Imagem e Vídeo de Referência

Índice

Gerador de Vídeo Wan 2.7: O Guia Completo para os Modos de Texto, Imagem e Referência

Principais Pontos

  • Wan 2.7 é um modelo unificado que abrange texto-para-vídeo (T2V), imagem-para-vídeo (I2V) e referência-para-vídeo (R2V) em um único fluxo de trabalho.
  • Suporta saída 720P e 1080P, duração de 2 a 15 segundos e cinco proporções de tela, incluindo 16:9, 9:16 e 1:1.
  • Os modos de quadro inicial-final e acionado por áudio oferecem controle de estado inicial e final que os modelos I2V de imagem única não conseguem igualar.
  • O modo referência-para-vídeo (R2V) aceita até cinco imagens de referência, cinco clipes de referência e uma faixa de áudio de referência em uma única chamada.
  • Experimente o gerador de vídeo Wan 2.7 para acompanhar qualquer exemplo neste guia.

O Que É o Gerador de Vídeo Wan 2.7?

Wan 2.7 é o mais recente modelo de geração de vídeo da equipe Wan da Alibaba, exposto através do Alibaba Cloud Model Studio. Ele unifica quatro capacidades anteriormente separadas em uma única família de modelos: texto-para-vídeo, imagem-para-vídeo, referência-para-vídeo e edição de vídeo. De acordo com a visão geral de geração de vídeo do Alibaba Cloud, o modelo aceita entrada multimodal e gera MP4 ou MOV em até 1080P.

A principal mudança no 2.7 é a unificação do fluxo de trabalho. Em vez de alternar entre fornecedores para texto-para-vídeo e imagem-para-vídeo, você chama o mesmo modelo e permite que a API direcione com base nas entradas que você passa. Isso corresponde à página do produto PixMind Wan 2.7, onde uma única interface de criação lida com todos os modos.

Para os criadores, isso é importante porque a troca de modos é onde a maior parte do tempo de produção é perdida. Você escreve um prompt, renderiza, percebe que o estado inicial está errado e, em seguida, reconstrói do zero em uma ferramenta diferente. A superfície unificada do Wan 2.7 permite que você troque as entradas sem trocar os modelos.

Quantos Modos o Wan 2.7 Suporta?

Wan 2.7 expõe quatro modos. A referência da API I2V documenta a matriz de entrada completa. Aqui está o detalhamento prático.

Modo Entrada Melhor Para Duração Máx. Resolução Máx.
T2V (Texto-para-Vídeo) Prompt de texto, áudio opcional Storyboarding, movimento abstrato, B-roll 15s 1080P
I2V (Imagem-para-Vídeo) Primeiro quadro, último quadro opcional, áudio opcional Revelações de produtos, ação de personagens, animação 15s 1080P
R2V (Referência-para-Vídeo) Até 5 imagens de referência + 5 clipes de referência + áudio de referência Preservação de identidade, clonagem de voz, cenas com múltiplos personagens 10s 1080P
Edição de Vídeo Vídeo fonte + instrução Transferência de estilo, edições baseadas em instruções 10s 1080P

Diagram: Four-quadrant grid showing Text-to-Video, Image-to-Video, First-Last-Frame, and Reference-Video modes connected to a central hub.

Texto-para-Vídeo (T2V)

O T2V recebe um prompt de texto e gera um vídeo. A referência da API T2V do Wan 2.7 lista os parâmetros suportados, incluindo resolução, duração, proporção e uma faixa de áudio opcional. O T2V é o caminho mais rápido da ideia ao clipe.

Use o T2V quando você não tiver um quadro inicial fixo. Movimento abstrato, B-roll, storyboards e sequências estilizadas se encaixam. Evite o T2V quando o estado inicial for importante: se você precisar de um produto específico na tela no quadro zero, mude para o I2V.

Imagem-para-Vídeo (I2V)

O I2V é onde a unificação do fluxo de trabalho do Wan 2.7 se destaca. O guia do usuário de imagem-para-vídeo do Wan 2.7 documenta quatro sub-modos:

  1. Quadro-inicial-para-vídeo: uma imagem se torna o estado inicial, o modelo inventa o movimento.
  2. Quadro-inicial-e-final-para-vídeo: duas imagens definem os estados inicial e final, o modelo interpola.
  3. Continuação de vídeo: um clipe curto se torna o estado inicial, o modelo o estende.
  4. Acionado por áudio: uma imagem mais uma faixa de áudio impulsiona a sincronização labial ou o movimento.

Para um aprofundamento nos quatro caminhos I2V, consulte o cluster de prompts de quadro inicial-final do PixMind.

Referência-para-Vídeo (R2V)

O R2V é o modo mais poderoso e menos documentado. A referência da API R2V do Wan 2.7 descreve uma chamada que aceita até cinco imagens de referência, cinco clipes de referência e uma faixa de áudio de referência. O modelo usa estes para preservar a identidade, voz e estilo na saída.

O R2V é o que usar quando você precisa que um personagem pareça o mesmo em diferentes tomadas, ou quando você quer clonar uma voz em uma nova cena. A desvantagem é a duração: o R2V tem um limite de 10 segundos, mais curto do que o limite de 15 segundos do T2V e I2V.

Edição de Vídeo

A edição de vídeo pega um vídeo fonte mais uma instrução de texto e retorna um clipe editado. A API de edição de vídeo do Wan 2.7 suporta edições baseadas em instruções e transferência de estilo. Este modo está fora do escopo de um guia de geração, mas vale a pena saber que existe.

Como Funciona o Modo Quadro Inicial-Final?

O quadro inicial-final é um sub-modo do I2V. Você fornece duas imagens: uma para o primeiro quadro, outra para o último. O Wan 2.7 gera os quadros intermediários.

Diagram: Timeline showing two keyframes with three interpolated frames between them, with the Wan 2.7 logo concept marking the in-between frames.

Isso é importante porque o I2V de imagem única deixa o estado final para o modelo. Se sua tomada precisa terminar em um quadro específico (um produto totalmente girado, uma caixa totalmente aberta, um personagem totalmente virado), o quadro inicial-final é como você garante essa finalização.

O padrão prático é: fotografar ou gerar dois keyframes, carregá-los como inicial e final, definir a duração, renderizar. O Wan 2.7 interpola o movimento entre eles. A página de prompts de quadro inicial-final do PixMind possui modelos de prompts para revelações de produtos, transições e padrões de storytelling.

Modos de falha comuns a serem observados:

  • Distorção em superfícies reflexivas: vidro, metal e água podem borrar durante a interpolação.
  • Desvio de identidade em personagens: rostos podem mudar entre os quadros.
  • Inconsistência da câmera: se os dois keyframes implicam ângulos de câmera diferentes, o modelo tem que inventar uma transição.

Teste com durações curtas primeiro (2-3 segundos) antes de se comprometer com renderizações de 5-10 segundos.

Como Funciona o Vídeo Acionado por Áudio?

O modo acionado por áudio pega uma imagem estática mais uma faixa de áudio e produz um vídeo onde o sujeito parece falar ou se mover em sincronia com o áudio. Esta é a base do conteúdo de "talking-head" e avatar.

O modelo usa a forma de onda de áudio para impulsionar duas coisas: movimento labial (se um rosto estiver presente) e energia de movimento geral. A API I2V do Wan 2.7 aceita o áudio como parte do array de mídia, usando o tipo driving_audio.

Para casos de uso de "talking-head", combine isso com o cluster de desempenho de personagens do PixMind. A combinação de I2V acionado por áudio mais um retrato de referência limpo é o melhor caminho aberto atual para um avatar com sincronia labial sem treinar um modelo personalizado.

Duas notas práticas:

  • A qualidade do áudio impulsiona a qualidade do vídeo. Uma gravação de estúdio limpa supera um microfone de telefone.
  • Teste com um clipe de 3 segundos primeiro. Problemas de sincronização são mais fáceis de detectar cedo.

Qual Resolução, Duração e Proporção de Tela Você Deve Escolher?

O Wan 2.7 suporta saída 720P e 1080P. A compensação é custo versus nitidez. De acordo com a estratégia de preços do PixMind, 1080P consome aproximadamente o dobro de créditos de 720P por segundo.

Configuração Quando Escolher Compensação
720P Conteúdo para redes sociais, vídeo vertical, iterações de teste Custo mais baixo, suavidade visível em telas grandes
1080P Vitrines de produtos, pré-visualização cinematográfica, criativos de anúncios Custo mais alto, detalhes mais nítidos
16:9 YouTube, incorporações em sites Widescreen padrão
9:16 Reels, TikTok, Shorts Vertical para celular
1:1 Publicações em feed, incorporações quadradas Neutro entre plataformas
4:3 / 3:4 Editorial, estilo vintage Nicho

A duração impulsiona o custo linearmente. Uma renderização de 10 segundos custa aproximadamente 5 vezes uma renderização de 2 segundos na mesma resolução. Para iteração, trabalhe com durações curtas. Para o final, vá com durações longas.

Um padrão razoável para novos usuários: 720P, 5 segundos, 16:9. Confirme que a tomada funciona, depois aumente para 1080P para a versão final.

Como Escolher o Modo Certo do Wan 2.7?

A árvore de decisão é direta, uma vez que você sabe quais entradas possui.

Workflow diagram showing 5 stages: Input, Mode Detection, Model Routing, Generation, Output.

  • Você tem apenas uma ideia: use T2V. Itere no prompt antes de adicionar visuais.
  • Você tem uma foto de produto: use o modo I2V de primeiro quadro.
  • Você tem dois keyframes que devem ser o início e o fim: use I2V quadro inicial-final.
  • Você tem um clipe curto que precisa ser estendido: use I2V continuação de vídeo.
  • Você tem um retrato mais uma narração: use I2V acionado por áudio.
  • Você precisa de preservação de identidade ou voz em diferentes tomadas: use R2V.
  • Você tem filmagens existentes que precisam de edição ou mudança de estilo: use edição de vídeo.

Se você estiver em dúvida, comece no hub da família PixMind Wan e escolha pelo caso de uso em vez do nome do modo. O hub o direciona para a interface correta com base no que você está tentando criar.

Como Você Deve Criar Prompts para o Wan 2.7?

A estrutura do prompt importa mais do que o comprimento do prompt. O Wan 2.7 recompensa uma anatomia de cinco segmentos: sujeito, ação, cenário, câmera, estilo.

Uma estrutura de exemplo:

Sujeito: um frasco de perfume de vidro em uma superfície escura. Ação: um spray de gotículas irrompe para a direita. Cenário: fundo de estúdio preto, uma única luz principal da esquerda da câmera. Câmera: plano médio estático, equivalente a 50mm. Estilo: cinematográfico, profundidade de campo rasa, luz de contorno quente.

Cada segmento restringe o espaço de saída. Segmentos ausentes assumem o padrão do modelo, que geralmente é genérico.

Para padrões de prompt mais aprofundados, o cluster de prompts multi-tomada do PixMind abrange 12 estruturas reutilizáveis, incluindo sequências multi-tomada, padrões de sincronização de áudio e storyboards de quadro inicial-final.

Duas armadilhas de prompt a evitar:

  • Prompts sobrecarregados: mais de cinco assuntos em um prompt confunde o modelo. Divida em várias renderizações.
  • Uso excessivo de prompts negativos: o Wan 2.7 não pondera prompts negativos da mesma forma que os modelos de imagem. Mantenha-os curtos.

Como o Wan 2.7 se Compara a Outros Modelos?

O Wan 2.7 está em um campo concorrido. Sora 2, VEO 3, Kling 2.0 e Seedance visam casos de uso sobrepostos. A diferenciação está nos modos que cada modelo expõe e a que custo.

Capacidade Wan 2.7 Sora 2 VEO 3 Kling 2.0
Texto-para-Vídeo Sim Sim Sim Sim
Imagem-para-Vídeo Sim Limitado Sim Sim
Quadro Inicial-Final Sim Não Limitado Limitado
Vídeo de Referência (R2V) Sim Não Não Limitado
I2V Acionado por Áudio Sim Sim Sim Limitado
Duração Máx. 15s 20s 8s 10s
Resolução Máx. 1080P 1080P 1080P 1080P

Esta tabela reflete as especificações publicadas pelos fornecedores em julho de 2026. Testes independentes diretos estão em nosso teste de prompt Wan 2.7 versus Sora 2 e no confronto VEO e Kling.

A vantagem distintiva do Wan 2.7 é o quadro inicial-final combinado com o R2V. Nenhum outro modelo na tabela expõe ambos com capacidade total. Se o seu fluxo de trabalho precisa de controle preciso de início e fim, além de preservação de identidade, o Wan 2.7 é atualmente o único caminho de modelo único.

Quais São os Modos de Falha Comuns?

Todo modelo de vídeo de IA falha. Nomear os modos de falha ajuda você a lançar mais rápido.

  • Distorção em superfícies reflexivas: vidro, espelhos, metal polido. Mitigue reduzindo a amplitude do movimento no prompt.
  • Desvio de identidade entre tomadas: rostos mudam entre as gerações. Mitigue com entradas de referência R2V.
  • Texto alucinado nos quadros: sinais, rótulos, logotipos aparecem como rabiscos. Mitigue removendo o texto das imagens de entrada.
  • Incompatibilidade de proporção de tela: alimentar uma imagem 9:16 em uma geração 16:9 corta inesperadamente. Combine a proporção de entrada com a proporção de saída.
  • Queima de créditos em iterações longas: renderizações de teste de 10 segundos consomem créditos rapidamente. Itere em 2-3 segundos.

O cluster de casos de uso do PixMind possui notas de modo de falha por cenário para marketing de produtos, desempenho de personagens, pré-visualização cinematográfica e ganchos sociais.

Perguntas Frequentes sobre o Gerador de Vídeo Wan 2.7

O Wan 2.7 é gratuito para experimentar?

Sim. A página PixMind Wan 2.7 inclui um teste gratuito sem necessidade de cartão de crédito. Os planos pagos só são ativados quando você excede a cota de teste.

O Wan 2.7 suporta 4K?

Não. O vídeo do Wan 2.7 atinge o máximo de 1080P. O modelo de imagem do Wan 2.7 suporta imagens estáticas 4K através do nível Pro, mas a saída de vídeo é limitada a 1080P.

O Wan 2.7 pode clonar o rosto de uma pessoa específica?

O Wan 2.7 pode preservar a identidade a partir de entradas de referência, mas a política do PixMind proíbe a clonagem não consensual de semelhanças de pessoas reais e identificáveis. Use R2V com personagens originais, referências de banco de imagens ou sua própria semelhança.

Quanto tempo leva uma renderização do Wan 2.7?

O tempo de geração depende da duração, resolução e carga. Renderizações típicas de 5 segundos em 720P terminam em 60-90 segundos. Renderizações de 10 segundos em 1080P podem levar de 3 a 5 minutos. A API retorna um ID de tarefa que você consulta para verificar o status.

O Wan 2.7 gera áudio?

Sim, mas apenas em modos que aceitam entrada de áudio. O T2V pode pegar uma faixa de áudio e sincronizá-la com o movimento. O modo I2V acionado por áudio usa o áudio para impulsionar a sincronização labial e de movimento. A geração de áudio puro (música, efeitos sonoros) é um modelo separado da Alibaba.

Posso usar as saídas do Wan 2.7 comercialmente?

Sim. As saídas que você gera são suas para uso comercial sob os termos do Alibaba Cloud Model Studio. Revise os termos atuais na visão geral do Alibaba Cloud Model Studio antes de lançar.

Veja em Ação

继续浏览中,生成器即将加载...