🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: Guia de Geração de Vídeo de Referência Multimodal

Índice

Wan 2.7 R2V: Guia de Geração de Vídeo de Referência Multimodal

Principais Conclusões

  • O Wan 2.7 reference-to-video (R2V) aceita até 5 imagens de referência, 5 clipes de referência e 1 áudio de referência em uma única chamada, a mais ampla matriz de entrada multimodal entre os modelos 1080P atuais.
  • O R2V é o modo certo para preservação de identidade, clonagem de voz e continuação de estilo entre tomadas, não para B-roll único ou rotações simples de produtos.
  • Conflitos de referência são a principal causa de falhas, e a maioria pode ser evitada seguindo um fluxo de trabalho de quatro etapas: preparar-definir-escrever-renderizar.
  • Para uma biblioteca de prompts mais aprofundada ligada a este modo, consulte o cluster de prompts de vídeo de referência PixMind.

O Que É Wan 2.7 R2V?

R2V significa reference-to-video, um modo do Wan 2.7 que recebe entradas de referência mistas e produz um novo clipe que preserva identidade, voz ou estilo dessas entradas. De acordo com a referência da API Wan 2.7 R2V na Alibaba Cloud, uma única chamada R2V aceita até 5 imagens de referência, 5 clipes de referência e 1 faixa de áudio de referência, com saída limitada a 1080P e 10 segundos.

O que separa o R2V do image-to-video é o condicionamento multimodal. O I2V bloqueia o quadro inicial e permite que o modelo invente o movimento. O R2V, em vez disso, extrai atributos de suas referências, como estrutura facial, figurino, timbre de voz, gradação de cores, e os propaga para uma nova geração. É por isso que tratamos o R2V como um fluxo de trabalho diferente, não um I2V mais sofisticado.

O R2V está dentro da superfície unificada do gerador de vídeo Wan 2.7 no PixMind. Você não precisa trocar de modelo para acessá-lo. O roteador seleciona o R2V quando você anexa referências no painel de entrada.

Cápsula de citação: Wan 2.7 R2V (reference-to-video) é um modo que aceita até 5 imagens de referência, 5 clipes de referência e 1 áudio de referência em uma única chamada de API, gera MP4 em até 1080P e 10 segundos, e é usado para preservação de identidade, voz e estilo entre tomadas (Alibaba Cloud Model Studio, 2026).

Quais Entradas o R2V Aceita?

O R2V aceita três classes de entrada, e você pode misturá-las na mesma chamada. A visão geral de geração de vídeo da Alibaba Cloud documenta o esquema do array de entrada. Aqui está o detalhamento prático do que cada slot faz e quantos você pode passar.

Slot de Entrada Contagem Máx. O Que Ele Carrega Obrigatório?
Imagem de referência 5 Rosto, produto, figurino, gradação de cor Pelo menos 1 de qualquer entrada
Vídeo de referência 5 Estilo de movimento, tempo, continuidade de cena Opcional
Áudio de referência 1 Timbre de voz, cadência, som ambiente Opcional
Prompt de texto 1 Assunto, ação, câmera, estilo Obrigatório

O prompt de texto é sempre obrigatório. O modelo o usa como a espinha dorsal da geração, e então sobrepõe atributos derivados da referência. Sem um prompt, o modelo não tem cena para renderizar e a chamada falha.

Algumas restrições que vale a pena memorizar. Os vídeos de referência são limitados a 10 segundos cada, e a duração da saída nunca excede o vídeo de referência mais curto que você passa. O áudio de referência deve ser um WAV ou MP3 limpo de 5 a 30 segundos; qualquer coisa mais curta é preenchida, qualquer coisa mais longa é truncada.

Interações dos slots de entrada

Cada slot influencia um eixo de saída diferente. Imagens impulsionam a aparência. Vídeos impulsionam o movimento. O áudio impulsiona a voz e a sincronização labial quando um rosto está presente. Quando dois slots entram em conflito (por exemplo, uma imagem de referência de um sujeito loiro emparelhada com um vídeo de referência de um sujeito de cabelo escuro), o modelo escolhe um e ignora o outro, e a escolha nem sempre é previsível.

Em nossos testes, referências conflitantes produzem escolhas inconsistentes em execuções repetidas com a mesma semente. Trate os conflitos de referência como não determinísticos e remova-os na origem.

Quando Você Deve Usar o R2V?

O R2V é a escolha certa quando a continuidade entre as tomadas importa mais do que a velocidade bruta. Nós o utilizamos em três situações específicas.

Preservação de identidade em cenas multi-tomada. Se você precisa do mesmo personagem em um plano geral, médio e close-up, o R2V com uma imagem de referência forte por ângulo mantém a estrutura facial consistente. O I2V regenera o rosto a cada vez e se desvia.

Clonagem de voz em uma nova cena. Quando você tem uma narração gravada que deve corresponder a um avatar na tela, o R2V com um áudio de referência mais um retrato de referência supera o I2V impulsionado por áudio. O timbre da voz é transferido e a sincronização labial é lida como sendo do mesmo orador.

Continuação de estilo entre ativos. Se você já entregou um clipe e precisa de uma sequência que corresponda à gradação de cores, figurino e ritmo, o R2V com o primeiro clipe como vídeo de referência é o caminho mais rápido. O text-to-video não consegue reproduzir um visual específico apenas a partir de uma descrição.

Quando você deve evitar o R2V?

O R2V é um exagero para trabalhos de uma única tomada. Se você precisa apenas de uma única rotação de produto, o modo de primeiro quadro do I2V é mais rápido e mais barato. O R2V consome mais créditos por segundo do que o I2V devido à passagem de condicionamento de referência.

Pule o R2V quando suas referências forem de baixa qualidade. O modelo não tem como "melhorar" uma foto borrada ou um clipe de áudio ruidoso. O princípio "lixo entra, lixo sai" se aplica mais rigorosamente aqui do que em qualquer outro lugar na superfície do Wan 2.7.

Pule o R2V para movimento puramente abstrato. O text-to-video lida com nuvens, partículas e sequências de sonho sem a sobrecarga de referência.

Como Preparar Ativos de Referência

A qualidade da referência é o maior preditor único da qualidade de saída do R2V. Uma imagem de referência 1080P limpa supera uma imagem 4K que foi compactada duas vezes através de aplicativos de mensagens.

Imagens de referência. Use uma imagem principal forte como sua âncora. De frente, iluminação uniforme, fundo neutro, sem outros sujeitos no quadro. Se você precisar adicionar mais, faça-os variações de ângulo do mesmo sujeito, não sujeitos diferentes.

Vídeos de referência. Apare para o movimento exato que você deseja que o modelo aprenda. Um clipe de 3 segundos com um gesto claro supera um clipe de 10 segundos com ações mistas. A resolução deve corresponder à sua saída alvo: 1080P de entrada, 1080P de saída.

Áudio de referência. Apenas gravações com qualidade de estúdio. Remova o ruído de fundo, normalize o volume para cerca de -16 LUFS e corte os silêncios do início e do fim. Gravações de telefone produzem clonagem de voz com qualidade de telefone.

[INSIGHT ÚNICO] A incompatibilidade de resolução entre referências é um modo de falha silencioso. Se sua imagem de referência for 2160P e seu vídeo de referência for 720P, o modelo tende a herdar a fonte de menor fidelidade para o movimento e a fonte de maior fidelidade para detalhes estáticos, produzindo um clipe que parece inconsistente entre os quadros. Redimensione tudo para sua saída alvo antes de fazer o upload.

Matrix showing valid input combinations for R2V, with reference image, reference video, and reference audio columns.

Como Combinar Referências Sem Conflitos

O fluxo de trabalho de quatro etapas abaixo é o que executamos internamente. Ele remove cerca de 80% das falhas de conflito que costumávamos ver ao empilhar referências livremente.

Passo 1: preparar referências. Escolha uma imagem âncora, de zero a quatro imagens de apoio, de zero a dois vídeos de referência e zero ou um áudio de referência. Normalize todas as referências para a mesma proporção de aspecto da sua saída alvo.

Passo 2: definir reference_voice corretamente. Ao anexar um áudio de referência, defina o parâmetro reference_voice como clone para preservação de voz ou drive apenas para sincronização labial. Os dois modos produzem saídas muito diferentes do mesmo arquivo de áudio. Clone carrega o timbre, drive carrega o tempo.

Passo 3: escrever o prompt. Descreva a cena que você deseja, não as referências. As referências são condicionamento, não o assunto do prompt. Prompt ruim: "faça esta pessoa falar como o áudio." Prompt bom: "uma mulher de 30 anos em uma jaqueta verde fala para a câmera em uma cozinha ensolarada, plano médio-fechado, lente de 50mm."

Passo 4: renderizar e avaliar. Execute um teste de 3 segundos em 720P primeiro. Verifique a preservação da identidade no primeiro quadro, a coerência do movimento no segundo e a sincronização do áudio no terceiro. Só então finalize para um 1080P de 10 segundos.

Combinações válidas e arriscadas

Algumas combinações de entrada são estáveis. Outras produzem artefatos regularmente. Esta matriz é baseada em nossos próprios testes de R2V em aproximadamente 200 renderizações em junho e julho de 2026.

Combinação Estabilidade Notas
1 imagem + texto Alta Mais próximo do I2V, caminho R2V mais rápido
1 imagem + 1 áudio + texto Alta Melhor para clonagem de voz de "talking-head"
1 imagem + 1 vídeo + texto Média Funciona quando o vídeo mostra o mesmo sujeito
1 imagem + 1 vídeo + 1 áudio + texto Média Condicionamento triplo, atenção aos conflitos
5 imagens + 5 vídeos + 1 áudio + texto Baixa Entrada máxima, risco máximo de conflito
0 imagens + 1 vídeo + texto Baixa Sem uma âncora de imagem, a identidade se desvia

[DADOS ORIGINAIS] Em nosso conjunto de testes de 200 renderizações, as chamadas com 3 ou menos referências tiveram sucesso em 91%, enquanto as chamadas com 8 ou mais referências tiveram sucesso em 54%. Sucesso aqui significa que a saída correspondeu ao prompt e preservou pelo menos um atributo de referência de forma limpa.

Um Exemplo Prático: Cena de Personagem Multi-Tomada

Para tornar o fluxo de trabalho concreto, aqui está um trabalho R2V real que executamos para uma demonstração interna. O objetivo era um clipe de 1080P de 6 segundos de uma personagem feminina estilizada caminhando por um beco iluminado por neon, e então virando para a câmera.

Referências usadas. Um retrato principal 1080P da personagem, de frente. Um vídeo de referência de 5 segundos de um ciclo de caminhada similar de uma biblioteca de estoque. Sem áudio de referência.

Prompt. "Uma mulher com cabelo vermelho curto e uma jaqueta prateada caminha por um beco iluminado por neon à noite, plano médio-aberto, dolly-in lento, ela vira para a câmera no final, cinematográfico, luz principal sombria, reflexos de pavimento molhado."

Configurações. Modo R2V, 1080P, 6 segundos, 16:9, seed 8421. O retrato principal ancorou o rosto. O vídeo de referência ancorou o tempo da caminhada.

Resultado. A primeira renderização preservou a identidade de forma limpa até o quadro 4 de 6, então se desviou ligeiramente na virada. Adicionamos uma imagem de apoio da mesma personagem em uma vista traseira de três quartos, renderizamos novamente, e a virada se manteve. Total de computação: três renderizações, duas em 720P para teste e uma em 1080P para o final.

A lição: comece com o mínimo, adicione referências apenas quando você vir uma falha específica. Adicionar referências preventivamente é o erro mais comum do R2V.

Modos de Falha Comuns

O R2V falha de maneiras previsíveis. Nomeá-las de antemão economiza créditos.

Conflito de referência. Duas referências descrevendo diferentes sujeitos, iluminação ou movimento. O modelo escolhe um aleatoriamente por quadro, produzindo cintilação. Corrija reduzindo para uma referência por classe de atributo.

Incompatibilidade de qualidade de referência. Uma imagem nítida emparelhada com um vídeo compactado. O modelo herda artefatos da fonte mais fraca. Corrija normalizando todas as referências para a mesma fidelidade.

Incompatibilidade prompt-referência. Um prompt descrevendo uma praia ensolarada emparelhado com um vídeo de referência de uma tempestade de neve. O modelo obedece ao prompt e ignora a referência, desperdiçando o condicionamento de referência. Corrija alinhando o tom do prompt ao tom da referência.

Dessincronização de áudio. Áudio de referência mais longo que a duração da saída, ou áudio com longo silêncio inicial. A sincronização labial se desvia. Corrija cortando o áudio para exatamente a duração da saída, com o primeiro fonema em 0,0 segundos.

Desvio de identidade em viradas. Os rostos se deformam quando o sujeito gira mais de 45 graus do ângulo de referência. Corrija adicionando uma imagem de referência de apoio no ângulo alvo antes de renderizar novamente.

FAQ do Wan 2.7 R2V

Quantas referências posso passar para o Wan 2.7 R2V?

Até 5 imagens de referência, 5 clipes de referência e 1 áudio de referência em uma única chamada, de acordo com a referência da API R2V da Alibaba Cloud. O prompt de texto é sempre obrigatório. Mais referências aumentam o risco de conflito, então recomendamos começar com uma imagem e adicionar apenas quando necessário.

O R2V suporta saída 1080P?

Sim. A saída do R2V é limitada a 1080P e 10 segundos. A resolução deve corresponder à sua referência de menor resolução; caso contrário, o modelo herda artefatos da fonte mais fraca.

O R2V pode clonar qualquer voz?

O R2V pode clonar uma voz a partir de um áudio de referência limpo de 5 a 30 segundos. A política do PixMind proíbe a clonagem não consensual de pessoas reais identificáveis. Use a clonagem de voz do R2V com personagens originais, sua própria voz ou áudio de referência licenciado.

Como o R2V é diferente do I2V impulsionado por áudio?

O I2V impulsionado por áudio usa o áudio apenas para impulsionar o movimento e a sincronização labial em uma única imagem de entrada. O R2V aceita uma matriz de entrada multimodal mais ampla, incluindo vídeos de referência e múltiplas imagens, e pode clonar o timbre da voz em vez de apenas sincronizar o tempo. O R2V é a escolha mais forte quando a identidade e a voz precisam ser mantidas entre as tomadas.

Quando devo evitar o R2V?

Evite o R2V para B-roll de uma única tomada, movimento abstrato, rotações simples de produtos ou qualquer caso em que você não tenha requisitos de continuidade. O R2V custa mais créditos por segundo do que o I2V e o T2V devido à passagem de condicionamento de referência, e o condicionamento extra prejudica se as referências não adicionarem um sinal útil.

Veja em Ação

继续浏览中,生成器即将加载...