Pixmind

Wan 2.7 R2V: Guía de Generación de Video Multimodal por Referencia

PixMind Editorial Team
继续浏览中,生成器即将加载...

Wan 2.7 R2V: Guía de Generación de Video Multimodal por Referencia

Puntos Clave

  • Wan 2.7 reference-to-video (R2V) acepta hasta 5 imágenes de referencia, 5 clips de referencia y 1 audio de referencia en una sola llamada, la matriz de entrada multimodal más amplia entre los modelos 1080P actuales.
  • R2V es el modo adecuado para la preservación de la identidad, la clonación de voz y la continuación del estilo entre tomas, no para tomas B-roll únicas o giros de producto simples.
  • Los conflictos de referencia son la principal causa de fallos, y la mayoría se pueden prevenir siguiendo un flujo de trabajo de cuatro pasos: preparar-establecer-escribir-renderizar.
  • Para una biblioteca de prompts más profunda vinculada a este modo, consulte el clúster de prompts de video de referencia de PixMind.

¿Qué es Wan 2.7 R2V?

R2V significa reference-to-video, un modo de Wan 2.7 que toma entradas de referencia mixtas y produce un nuevo clip que preserva la identidad, la voz o el estilo de esas entradas. Según la referencia de la API de Wan 2.7 R2V en Alibaba Cloud, una sola llamada a R2V acepta hasta 5 imágenes de referencia, 5 clips de referencia y 1 pista de audio de referencia, con una salida limitada a 1080P y 10 segundos.

Lo que separa a R2V de image-to-video es el condicionamiento multimodal. I2V bloquea el fotograma inicial y permite que el modelo invente el movimiento. R2V, en cambio, extrae atributos de sus referencias, cosas como la estructura facial, el vestuario, el timbre de voz, la gradación de color, y los propaga a una nueva generación. Por eso tratamos a R2V como un flujo de trabajo diferente, no como un I2V más sofisticado.

R2V se encuentra dentro de la superficie unificada del generador de video Wan 2.7 en PixMind. No necesita cambiar de modelo para acceder a él. El enrutador selecciona R2V cuando adjunta referencias en el panel de entrada.

Cápsula de cita: Wan 2.7 R2V (reference-to-video) es un modo que acepta hasta 5 imágenes de referencia, 5 clips de referencia y 1 audio de referencia en una sola llamada API, genera MP4 de hasta 1080P y 10 segundos, y se utiliza para la preservación de la identidad, la voz y el estilo entre tomas (Alibaba Cloud Model Studio, 2026).

¿Qué Entradas Acepta R2V?

R2V acepta tres clases de entrada, y puede mezclarlas en la misma llamada. La descripción general de generación de video de Alibaba Cloud documenta el esquema del array de entrada. Aquí está el desglose práctico de lo que hace cada slot y cuántos puede pasar.

Slot de Entrada Cantidad Máx. Lo que Contiene ¿Requerido?
Imagen de referencia 5 Cara, producto, vestuario, gradación de color Al menos 1 de cualquier entrada
Video de referencia 5 Estilo de movimiento, sincronización, continuidad de escena Opcional
Audio de referencia 1 Timbre de voz, cadencia, sonido ambiental Opcional
Prompt de texto 1 Sujeto, acción, cámara, estilo Requerido

El prompt de texto siempre es requerido. El modelo lo utiliza como la columna vertebral de la generación, luego superpone atributos derivados de la referencia. Sin un prompt, el modelo no tiene ninguna escena que renderizar y la llamada falla.

Algunas restricciones que vale la pena memorizar. Los videos de referencia están limitados a 10 segundos cada uno, y la duración de la salida nunca excede el video de referencia más corto que pase. El audio de referencia debe ser un WAV o MP3 limpio de 5 a 30 segundos; cualquier cosa más corta se rellena, cualquier cosa más larga se trunca.

Interacciones de los slots de entrada

Cada slot influye en un eje de salida diferente. Las imágenes impulsan la apariencia. Los videos impulsan el movimiento. El audio impulsa la voz y la sincronización labial cuando hay una cara presente. Cuando dos slots entran en conflicto (por ejemplo, una imagen de referencia de un sujeto rubio emparejada con un video de referencia de un sujeto de cabello oscuro), el modelo elige uno e ignora el otro, y la elección no siempre es predecible.

En nuestras pruebas, las referencias conflictivas producen selecciones inconsistentes en las repeticiones con la misma semilla. Trate los conflictos de referencia como no determinísticos y elimínelos en la fuente.

¿Cuándo Debería Usar R2V?

R2V es la opción correcta cuando la continuidad entre tomas importa más que la velocidad bruta. Recurrimos a él en tres situaciones específicas.

Preservación de la identidad en escenas de múltiples tomas. Si necesita el mismo personaje en un plano general, medio y primer plano, R2V con una imagen de referencia fuerte por ángulo mantiene la estructura facial consistente. I2V regenera la cara cada vez y se desvía.

Clonación de voz en una nueva escena. Cuando tiene una voz en off grabada que debe coincidir con un avatar en pantalla, R2V con un audio de referencia más un retrato de referencia supera a I2V impulsado por audio. El timbre de voz se transfiere y la sincronización labial se interpreta como el mismo hablante.

Continuación de estilo entre activos. Si ya ha entregado un clip y necesita una secuela que coincida con la gradación de color, el vestuario y el ritmo, R2V con el primer clip como video de referencia es el camino más rápido. Text-to-video no puede reproducir un aspecto específico solo a partir de una descripción.

¿Cuándo debería evitar R2V?

R2V es excesivo para trabajos de una sola toma. Si solo necesita un giro de producto, el modo de primer fotograma de I2V es más rápido y económico. R2V consume más créditos por segundo que I2V debido al pase de condicionamiento de referencia.

Evite R2V cuando sus referencias sean de baja calidad. El modelo no tiene forma de "mejorar" una foto borrosa o un clip de audio ruidoso. El principio "basura entra, basura sale" se aplica con más fuerza aquí que en cualquier otra parte de la superficie de Wan 2.7.

Evite R2V para movimientos puramente abstractos. Text-to-video maneja nubes, partículas y secuencias de sueños sin la sobrecarga de referencias.

Cómo Preparar Activos de Referencia

La calidad de la referencia es el predictor más importante de la calidad de salida de R2V. Una imagen de referencia limpia de 1080P supera a una imagen 4K que ha sido comprimida dos veces a través de aplicaciones de mensajería.

Imágenes de referencia.

Utilice una imagen principal fuerte como ancla. De frente, iluminación uniforme, fondo neutro, sin otros sujetos en el encuadre. Si debe añadir más, que sean variaciones de ángulo del mismo sujeto, no sujetos diferentes.

Videos de referencia.

Recorte al movimiento exacto que desea que el modelo aprenda. Un clip de 3 segundos con un gesto claro es mejor que un clip de 10 segundos con acciones mixtas. La resolución debe coincidir con su salida objetivo: 1080P de entrada, 1080P de salida.

Audio de referencia.

Solo grabaciones con calidad de estudio. Elimine el ruido de fondo, normalice el volumen a alrededor de -16 LUFS y recorte los silencios del principio y del final. Las grabaciones telefónicas producen clonación de voz con calidad telefónica.

[INFORMACIÓN ÚNICA] La falta de coincidencia de resolución entre las referencias es un modo de fallo silencioso. Si su imagen de referencia es 2160P y su video de referencia es 720P, el modelo tiende a heredar la fuente de menor fidelidad para el movimiento y la fuente de mayor fidelidad para el detalle estático, produciendo un clip que parece inconsistente entre fotogramas. Reduzca la escala de todo a su salida objetivo antes de subirlo.

Matrix showing valid input combinations for R2V, with reference image, reference video, and reference audio columns.

Cómo Combinar Referencias Sin Conflictos

El flujo de trabajo de cuatro pasos que se presenta a continuación es el que ejecutamos internamente. Elimina aproximadamente el 80 por ciento de los fallos por conflicto que solíamos ver al apilar referencias libremente.

Paso 1: preparar referencias. Elija una imagen ancla, de cero a cuatro imágenes de apoyo, de cero a dos videos de referencia y cero o un audio de referencia. Normalice todas las referencias a la misma relación de aspecto que su salida objetivo.

Paso 2: establecer reference_voice correctamente. Cuando adjunte un audio de referencia, establezca el parámetro reference_voice en clone para la preservación de la voz o drive solo para la sincronización labial. Los dos modos producen salidas muy diferentes del mismo archivo de audio. Clone transfiere el timbre, drive transfiere la sincronización.

Paso 3: escribir el prompt. Describa la escena que desea, no las referencias. Las referencias son condicionamiento, no el sujeto del prompt. Prompt incorrecto: "haz que esta persona hable como el audio". Prompt correcto: "una mujer de 30 años con una chaqueta verde habla a la cámara en una cocina iluminada por el sol, primer plano medio, lente de 50mm".

Paso 4: renderizar y evaluar. Ejecute primero una prueba de 3 segundos a 720P. Verifique la preservación de la identidad en el primer fotograma, la coherencia del movimiento en el segundo y la sincronización del audio en el tercero. Solo entonces comprométase con un final de 10 segundos a 1080P.

Combinaciones válidas y arriesgadas

Algunas combinaciones de entrada son estables. Otras producen artefactos regularmente. Esta matriz se deriva de nuestras propias pruebas de R2V en aproximadamente 200 renders en junio y julio de 2026.

Combinación Estabilidad Notas
1 imagen + texto Alta Lo más cercano a I2V, ruta R2V más rápida
1 imagen + 1 audio + texto Alta Mejor para clonación de voz de cabeza parlante
1 imagen + 1 video + texto Media Funciona cuando el video muestra el mismo sujeto
1 imagen + 1 video + 1 audio + texto Media Triple condicionamiento, cuidado con los conflictos
5 imágenes + 5 videos + 1 audio + texto Baja Entrada máxima, riesgo máximo de conflicto
0 imágenes + 1 video + texto Baja Sin una imagen ancla, la identidad se desvía

[DATOS ORIGINALES] En nuestro conjunto de pruebas de 200 renders, las llamadas con 3 o menos referencias tuvieron éxito en un 91 por ciento, mientras que las llamadas con 8 o más referencias tuvieron éxito en un 54 por ciento. El éxito aquí significa que la salida coincidió con el prompt y preservó al menos un atributo de referencia de forma limpia.

Un Ejemplo Práctico: Escena de Personaje con Múltiples Tomas

Para hacer el flujo de trabajo concreto, aquí hay un trabajo real de R2V que ejecutamos para una demostración interna. El encargo era un clip de 6 segundos a 1080P de un personaje femenino estilizado caminando por un callejón iluminado con neón, y luego girando hacia la cámara.

Referencias utilizadas.

Un retrato principal 1080P del personaje, de frente. Un video de referencia de 5 segundos de un ciclo de caminata similar de una biblioteca de stock. Sin audio de referencia.

Prompt.

"A woman with short red hair and a silver jacket walks down a neon-lit alley at night, medium-wide shot, slow dolly-in, she turns to camera at the end, cinematic, moody key light, wet pavement reflections."

Configuración.

Modo R2V, 1080P, 6 segundos, 16:9, semilla 8421. El retrato principal ancló la cara. El video de referencia ancló la sincronización de la caminata.

Resultado.

El primer render preservó la identidad limpiamente hasta el fotograma 4 de 6, luego se desvió ligeramente en el giro. Añadimos una imagen de apoyo del mismo personaje en una vista de tres cuartos de espalda, volvimos a renderizar, y el giro se mantuvo. Cómputo total: tres renders, dos a 720P para pruebas y uno a 1080P para el final.

La lección: empiece con lo mínimo, añada referencias solo cuando vea un fallo específico. Añadir referencias de forma preventiva es el error más común de R2V.

Modos de Fallo Comunes

R2V falla de maneras predecibles. Nombrarlos de antemano ahorra créditos.

Conflicto de referencia.

Dos referencias que describen diferentes sujetos, iluminación o movimiento. El modelo elige una al azar por fotograma, produciendo parpadeo. Solución: reducir a una referencia por clase de atributo.

Desajuste de calidad de referencia.

Una imagen nítida emparejada con un video comprimido. El modelo hereda artefactos de la fuente más débil. Solución: normalizar todas las referencias a la misma fidelidad.

Desajuste prompt-referencia.

Un prompt que describe una playa soleada emparejado con un video de referencia de una tormenta de nieve. El modelo obedece el prompt e ignora la referencia, desperdiciando el condicionamiento de referencia. Solución: alinear el tono del prompt con el tono de la referencia.

Desincronización de audio.

Audio de referencia más largo que la duración de salida, o audio con un largo silencio inicial. La sincronización labial se desvía. Solución: recortar el audio a la duración exacta de la salida, con el primer fonema en 0.0 segundos.

Desviación de identidad en giros.

Las caras se deforman cuando el sujeto gira más de 45 grados desde el ángulo de referencia. Solución: añadir una imagen de referencia de apoyo en el ángulo objetivo antes de volver a renderizar.

Preguntas Frecuentes de Wan 2.7 R2V

¿Cuántas referencias puedo pasar a Wan 2.7 R2V?

Hasta 5 imágenes de referencia, 5 clips de referencia y 1 audio de referencia en una sola llamada, según la referencia de la API de R2V de Alibaba Cloud. El prompt de texto siempre es requerido. Más referencias aumentan el riesgo de conflicto, por lo que recomendamos empezar con una imagen y añadir solo cuando sea necesario.

¿R2V soporta salida 1080P?

Sí. La salida de R2V está limitada a 1080P y 10 segundos. La resolución debe coincidir con su referencia de menor resolución; de lo contrario, el modelo hereda artefactos de la fuente más débil.

¿Puede R2V clonar cualquier voz?

R2V puede clonar una voz a partir de un audio de referencia limpio de 5 a 30 segundos. La política de PixMind prohíbe la clonación no consensuada de personas reales identificables. Utilice la clonación de voz de R2V con personajes originales, su propia voz o audio de referencia con licencia.

¿En qué se diferencia R2V de I2V impulsado por audio?

I2V impulsado por audio utiliza el audio solo para impulsar el movimiento y la sincronización labial en una sola imagen de entrada. R2V acepta una matriz de entrada multimodal más amplia, incluyendo videos de referencia y múltiples imágenes, y puede clonar el timbre de voz en lugar de solo sincronizar el tiempo. R2V es la opción más sólida cuando la identidad y la voz necesitan mantenerse en todas las tomas.

¿Cuándo debería evitar R2V?

Evite R2V para tomas B-roll únicas, movimiento abstracto, giros de producto simples o cualquier caso en el que no tenga un requisito de continuidad. R2V cuesta más créditos por segundo que I2V y T2V debido al pase de condicionamiento de referencia, y el condicionamiento adicional perjudica si las referencias no añaden una señal útil.

Véalo en Acción