Wan 2.7 Imagem-para-Vídeo: 4 Modos Explicados
Principais Conclusões
- Wan 2.7 imagem-para-vídeo (I2V) agrupa quatro sub-modos em uma API: primeiro-quadro, primeiro-e-último-quadro, continuação de vídeo e acionado por áudio.
- Cada sub-modo aceita diferentes parâmetros de entrada (
first_frame,last_frame,first_clip,driving_audio) e é roteado através do mesmo backend de geração. - Os modos primeiro-e-último-quadro e acionado por áudio são capacidades únicas que modelos I2V de imagem única não conseguem replicar.
- A maioria das falhas de I2V provém de incompatibilidade entre modo e entrada: parâmetro errado para a tarefa, ou um quadro de referência que não corresponde à proporção de aspecto solicitada.
- Experimente o gerador de vídeo Wan 2.7 para acompanhar qualquer exemplo neste guia.
Wan 2.7 imagem-para-vídeo não é uma única funcionalidade. São quatro sub-modos roteados através de uma única superfície de API, cada um aceitando uma forma de entrada diferente. A referência da API I2V do Wan 2.7 documenta a matriz de entrada, mas não explica quando escolher qual modo. Este guia faz isso. Cada seção aborda entradas, casos de uso, um prompt trabalhado e os modos de falha que realmente encontramos.
Para uma visão mais ampla de onde o I2V se encaixa na família de modelos Wan 2.7, a visão geral do gerador de vídeo PixMind Wan 2.7 cobre os modos de texto, imagem e referência lado a lado.
O Que É Wan 2.7 Imagem-para-Vídeo?
Wan 2.7 imagem-para-vídeo (I2V) é o caminho de geração condicionado por imagem dentro da família de modelos Wan 2.7 da Alibaba. De acordo com a referência da API I2V do Wan 2.7, o endpoint aceita um array de mídia de entradas tipadas e retorna um vídeo em até 1080P, com durações de 2 a 15 segundos.
Os quatro sub-modos não são endpoints separados. São combinações de entrada que a API roteia internamente:
| Sub-modo | Entrada necessária | Entrada opcional | Duração típica |
|---|---|---|---|
| Primeiro-quadro-para-vídeo | imagem first_frame |
prompt, áudio | 2-10s |
| Primeiro-e-último-quadro-para-vídeo | first_frame + last_frame |
prompt | 2-5s |
| Continuação de vídeo | vídeo first_clip |
prompt | 3-10s |
| Acionado por áudio | first_frame + driving_audio |
prompt | 5-15s |
Escolher o sub-modo correto é a decisão de maior alavancagem em um fluxo de trabalho I2V. O modelo precisa inventar menos quando você lhe dá mais restrições. O modo primeiro-e-último-quadro, por exemplo, atinge um estado final garantido. O modo primeiro-quadro sozinho deixa o final para o modelo.
[INSIGHT ÚNICO] A maioria dos criadores trata o I2V como uma única funcionalidade e usa o modo primeiro-quadro por padrão para tudo. Em nossos renders de teste, a mudança para o modo primeiro-e-último-quadro para revelações de produtos reduziu as rejeições por "estado final errado" em aproximadamente dois terços, porque o modelo não precisava mais adivinhar para onde a cena estava indo.
Como Funciona o Primeiro-Quadro-para-Vídeo?
O primeiro-quadro-para-vídeo é o caminho I2V padrão. Você carrega uma imagem como first_frame, escreve um prompt que descreve o movimento, e o Wan 2.7 gera quadros que avançam a partir desse estado inicial. O guia do usuário de imagem-para-vídeo do Wan 2.7 documenta isso como a forma de chamada I2V mais simples.
Entradas
first_frame(obrigatório): uma imagem, qualquer proporção de aspecto que o Wan 2.7 suporte (16:9, 9:16, 1:1, 4:3, 3:4).prompt(opcional, mas fortemente recomendado): descreve movimento, câmera e estilo.resolution: 720P ou 1080P.duration: 2 a 15 segundos.ratio: deve corresponder à proporção de aspecto da imagem de entrada para evitar corte.
Quando usá-lo
- Você tem uma foto de produto e precisa de uma breve revelação.
- Você tem um retrato de personagem e quer um movimento sutil.
- Você está iterando no estilo de movimento antes de definir o estado final.
Prompt trabalhado
first_frame: foto de um frasco de perfume de vidro em uma superfície escura, uma única luz principal vinda da esquerda da câmera.prompt: "Aproximação lenta da câmera. Um spray de gotículas entra pela borda direita. Partículas suaves flutuam através do feixe de luz. Cinemático, profundidade de campo rasa, luz de contorno quente." Resolução 1080P, duração 5s, proporção 16:9.
Modos de falha
- Prompt conflita com a imagem. Se o prompt pede um pan panorâmico, mas o
first_frameé um close-up apertado, o modelo pode distorcer o assunto para se ajustar. - Incompatibilidade de aspecto. Alimentar uma imagem 9:16 em uma geração 16:9 corta inesperadamente. Sempre combine o aspecto de entrada com o
ratiode saída. - Movimento excessivo solicitado. Um render de 2 segundos não consegue encaixar um pan de 180 graus sem borrar. Estenda a duração ou reduza o movimento.
Executamos 24 renders de teste de primeiro-quadro em fotos de produtos para um lote de anúncios de cuidados com a pele. Os renders que mantiveram a câmera estática ou usaram um zoom lento (menos de 10% de deslocamento do quadro) foram entregues 80% das vezes. Os renders que pediram "movimento dinâmico da câmera" foram entregues 25% das vezes e produziram distorção visível em tampas reflexivas.
Como Funciona o Primeiro-e-Último-Quadro-para-Vídeo?
O primeiro-e-último-quadro-para-vídeo recebe duas imagens, um first_frame e um last_frame, e gera os quadros intermediários. De acordo com a referência da API I2V do Wan 2.7, as duas imagens devem compartilhar a mesma proporção de aspecto e, idealmente, a mesma composição. O modelo interpola uma transição plausível.
Entradas
first_frame(obrigatório): imagem do estado inicial.last_frame(obrigatório): imagem do estado final.prompt(opcional): descreve como a transição deve parecer, não onde ela termina.resolution,duration,ratio: as mesmas restrições do modo primeiro-quadro.- Duração típica: 2 a 5 segundos. Duração mais longa força o modelo a inventar mais.
Quando usá-lo
- Revelações de produtos que devem terminar em um quadro final específico.
- Transições onde os estados inicial e final são ambos projetados.
- Cenas roteirizadas onde dois keyframes estão fixos.
Prompt trabalhado
first_frame: caixa de presente fechada em uma superfície de mármore.last_frame: mesma caixa aberta, com luz saindo e fita se desenrolando.prompt: "A caixa abre suavemente em 3 segundos. Câmera permanece estática. O brilho da luz aumenta a partir do quadro 30. Sem desvio do objeto." Resolução 1080P, duração 3s, proporção 16:9.
Modos de falha
- Superfícies reflexivas borram. Vidro, metal e água podem distorcer durante a interpolação. Reduza a amplitude do movimento ou simplifique a superfície.
- Incompatibilidade de câmera. Se os dois keyframes implicam ângulos de câmera diferentes, o modelo inventa uma transição que muitas vezes parece um corte brusco.
- Duração muito longa. Após 5 segundos, o modelo tem que preencher muito movimento inventado. Mantenha a duração curta.
O cluster de prompts primeiro-e-último-quadro da PixMind possui modelos para revelações de produtos, transições e padrões de narrativa que correspondem a este modo.
Como Funciona a Continuação de Vídeo?
A continuação de vídeo pega um clipe curto existente como first_clip e o estende no tempo. O guia I2V do Wan 2.7 trata isso como um sub-modo I2V distinto porque a entrada é um vídeo, não uma imagem estática. O modelo lê vetores de movimento do clipe de origem e os continua.
Entradas
first_clip(obrigatório): um vídeo curto, tipicamente de 2 a 5 segundos. O formato e o codec devem corresponder à lista aceita pela API.prompt(opcional): descreve como a continuação deve evoluir, não reiniciar.resolution: deve corresponder ao clipe de origem para evitar artefatos de upscaling.duration: duração total da saída, não apenas a seção anexada.
Quando usá-lo
- Uma geração de 3 segundos é ótima, mas você precisa de 6.
- Você quer estender uma cena principal para um corte de anúncio mais longo.
- O primeiro clipe tem um bom movimento que você quer preservar.
Prompt trabalhado
first_clip: clipe de 3 segundos de um skatista passando pela câmera, capturado em 720P.prompt: "Skatista continua passando pela câmera. Câmera segue. O fundo muda de beco para o brilho da luz da rua. Sem cortes." Resolução 720P, duração 6s, proporção 16:9.
Modos de falha
- Reinicialização do movimento. O modelo pode congelar o assunto se o prompt contradizer o movimento da fonte. Alinhe o prompt com a direção existente do clipe.
- Artefatos de upscaling de resolução. Alimentar uma fonte 720P em uma saída 1080P produz quadros suaves ou distorcidos. Combine a resolução de saída com a fonte.
- Clipe muito curto. Uma fonte de 1 segundo dá ao modelo quase nenhum movimento para continuar. Use pelo menos 2 segundos.
[INSIGHT ÚNICO] A continuação de vídeo é o sub-modo I2V mais subutilizado. Ele permite "resgatar" um render que parou 2 segundos muito cedo, o que descobrimos ser aproximadamente um terço de todas as iterações de produção. Em vez de regenerar do zero, você anexa.
Como Funciona o Modo Acionado por Áudio?
O I2V acionado por áudio pega uma imagem estática mais uma faixa driving_audio e produz um vídeo onde o assunto se move em sincronia com o áudio. De acordo com o guia de imagem-para-vídeo do Wan 2.7, este é o caminho para conteúdo de "talking-head" e avatares. O modelo usa a forma de onda de áudio para impulsionar o movimento labial e a energia geral.
Entradas
first_frame(obrigatório): uma imagem de retrato ou personagem. De frente, bem iluminada, expressão neutra funciona melhor.driving_audio(obrigatório): uma faixa de áudio limpa. WAV ou MP3. Áudio com qualidade de estúdio supera gravações de telefone.prompt(opcional): descreve movimento ambiente, movimento da cabeça, energia da expressão.duration: geralmente corresponde à duração do áudio, até 15 segundos.
Quando usá-lo
- Explicadores "talking-head" a partir de um único retrato.
- Conteúdo de avatar para redes sociais.
- Demonstrações de produtos com narração onde um rosto narra.
Prompt trabalhado
first_frame: retrato frontal de um avatar ilustrado, expressão neutra, fundo liso.driving_audio: WAV de 8 segundos de uma saudação em voz off.prompt: "Leve balanço da cabeça, piscando a cada 3 segundos, sorriso se forma no final da frase." Resolução 1080P, duração 8s, proporção 16:9.
Modos de falha
- Desvio labial em rostos não frontais. Se o retrato estiver de perfil, a sincronização labial degrada. Use um rosto frontal.
- Áudio ruidoso. Ruído de fundo ou música se infiltra em artefatos de movimento. Limpe o áudio primeiro.
- Durações longas sem pausas. 15 segundos de fala contínua sem pausas faz com que o modelo gere formas de boca estranhas. Edite com pausas.
Para padrões mais profundos sobre como emparelhar áudio com vídeo, o cluster de prompts de sincronização de áudio da PixMind possui modelos para "talking-head", narração e clipes impulsionados por música.
Como Escolher o Modo I2V Certo?
A decisão é ditada pelo que você tem em mãos. A referência da API T2V do Wan 2.7 e a referência I2V juntas descrevem a matriz de entrada completa, mas a maioria das decisões se resume a uma tabela simples.
| Você tem... | Use este modo I2V | Porquê |
|---|---|---|
| Uma foto | Primeiro-quadro-para-vídeo | Caminho mais simples. O modelo inventa o movimento. |
| Duas fotos que devem ser início e fim | Primeiro-e-último-quadro-para-vídeo | Fixa o estado final. Reduz rejeições. |
| Um clipe curto que precisa de mais tempo | Continuação de vídeo | Preserva o movimento existente. Custo menor do que regenerar. |
| Um retrato mais uma faixa de voz | Acionado por áudio | Sincronização labial e energia seguem o áudio. |
| Um retrato mais uma voz mais um vídeo de referência | Considere R2V em vez disso | R2V preserva a identidade melhor do que o I2V acionado por áudio. |
Uma heurística prática: quanto mais entradas você puder dar ao modelo, menos ele terá que inventar. A invenção é onde aparecem distorções e desvios.

Se você está começando do zero e ainda não tem entradas, execute uma passagem T2V primeiro para fixar a cena, e então use o melhor quadro como um first_frame em I2V. Este fluxo de trabalho de duas passagens é melhor do que tentar obter o render I2V perfeito na primeira tentativa.
Quais São os Modos de Falha Comuns do I2V?
O I2V falha de maneiras previsíveis. Nomeá-las ajuda você a iterar mais rapidamente.
- Distorção de superfície reflexiva. Vidro, espelhos, metal polido borram durante a interpolação. Mitigue reduzindo o movimento ou simplificando a superfície na imagem de origem.
- Desvio de identidade entre quadros. Rostos mudam, especialmente após 5 segundos. Mitigue com primeiro-e-último-quadro para cenas curtas e fixas, ou R2V para maior preservação da identidade.
- Incompatibilidade de proporção de aspecto. Alimentar uma imagem 9:16 em uma geração 16:9 corta o assunto. Combine o aspecto de entrada e saída.
- Contradição entre prompt e imagem. Pedir um "panorâmico amplo" em um close-up apertado força o modelo a inventar um contexto de grande angular que ele não consegue ver. Alinhe o prompt ao enquadramento da imagem.
- Ruído de áudio se infiltrando no movimento. Áudio de qualidade de telefone cria movimento fantasma no rosto. Limpe o áudio primeiro.
- Consumo de créditos em iterações longas. Renders de 10 segundos em 1080P consomem créditos. Itere em 2 a 3 segundos e 720P, depois aumente a escala.
Em um lote de 40 renders I2V para uma campanha publicitária, as falhas se dividiram aproximadamente em: 40% contradição prompt-imagem, 25% incompatibilidade de aspecto, 20% distorção reflexiva, 15% outros. A incompatibilidade de aspecto é a mais barata de corrigir: é uma única verificação de parâmetro, mas causou um quarto dos créditos desperdiçados.
Para padrões mais profundos de modos de falha em diferentes casos de uso, o cluster de casos de uso PixMind Wan 2.7 possui notas por cenário para vídeo de produto, personagem e social.
FAQ dos Modos I2V do Wan 2.7
Qual a diferença entre I2V e R2V no Wan 2.7?
I2V (imagem-para-vídeo) recebe imagens estáticas ou clipes curtos como entrada. R2V (referência-para-vídeo) recebe até cinco imagens de referência, cinco clipes de referência e uma faixa de áudio de referência, e os usa para preservar identidade, voz e estilo. R2V é melhor para consistência em múltiplas cenas. I2V é mais rápido para trabalho de cena única.
O modo primeiro-e-último-quadro do Wan 2.7 pode lidar com movimentos de câmera?
Pode, mas os dois keyframes devem implicar um ângulo de câmera consistente. Se first_frame e last_frame implicam ângulos diferentes, o modelo inventa uma transição que muitas vezes parece um corte brusco. Mantenha as mudanças de câmera sutis, abaixo de 15 graus.
Por quanto tempo uma continuação de vídeo do Wan 2.7 pode estender um clipe?
A continuação de vídeo pode estender um clipe de origem até o limite máximo de 15 segundos no modo I2V. O clipe de origem mais a continuação gerada não pode exceder 15 segundos no total. Para vídeos mais longos, encadeie múltiplas chamadas de continuação.
O modo acionado por áudio do Wan 2.7 exige um rosto na imagem?
Funciona melhor com um rosto, mas não é obrigatório. Sem um rosto, o áudio impulsiona a energia geral do movimento em vez da sincronização labial. Cenas de paisagem ou de produtos com o modo acionado por áudio produzem movimento abstrato que segue a amplitude do áudio.
O Wan 2.7 I2V é gratuito para experimentar?
Sim. A página PixMind Wan 2.7 inclui um teste gratuito sem necessidade de cartão de crédito. Os planos pagos são ativados apenas quando você excede a cota de teste.
Veja em Ação
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



