
Wan 2.7 R2V: Guía de Generación de Video Multimodal por Referencia
Wan 2.7 reference to video R2V acepta hasta 5 imágenes de referencia, 5 clips de referencia y un audio de referencia en una sola llamada.…
Leer Más
Wan 2.7 es el último modelo de generación de video del equipo Wan de Alibaba, expuesto a través de Alibaba Cloud Model Studio. Unifica cuatro capacidades previamente separadas en una familia de modelos: texto a video, imagen a video, referencia a video y edición de video. Según la descripción general de generación de video de Alibaba Cloud, el modelo acepta entrada multimodal y produce MP4 o MOV hasta 1080P.
El cambio clave en 2.7 es la unificación del flujo de trabajo. En lugar de cambiar entre proveedores para texto a video e imagen a video, se llama al mismo modelo y se deja que la API enrute según las entradas que se pasen. Esto coincide con la página de producto de PixMind Wan 2.7, donde una única superficie de creación maneja todos los modos.
Para los creadores, esto es importante porque el cambio de modo es donde se pierde la mayor parte del tiempo de producción. Se escribe un prompt, se renderiza, se da cuenta de que el estado inicial es incorrecto y luego se reconstruye desde cero en una herramienta diferente. La superficie unificada de Wan 2.7 permite intercambiar entradas sin cambiar de modelo.
Wan 2.7 expone cuatro modos. La referencia de la API I2V documenta la matriz de entrada completa. Aquí está el desglose práctico.
| Modo | Entrada | Mejor para | Duración máxima | Resolución máxima |
|---|---|---|---|---|
| T2V (Texto a Video) | Prompt de texto, audio opcional | Storyboarding, movimiento abstracto, B-roll | 15s | 1080P |
| I2V (Imagen a Video) | Primer fotograma, último fotograma opcional, audio opcional | Revelaciones de productos, acción de personajes, animación | 15s | 1080P |
| R2V (Referencia a Video) | Hasta 5 imágenes de referencia + 5 clips de referencia + audio de referencia | Preservación de identidad, clonación de voz, escenas con múltiples personajes | 10s | 1080P |
| Edición de Video | Video fuente + instrucción | Transferencia de estilo, ediciones basadas en instrucciones | 10s | 1080P |

T2V toma un prompt de texto y produce un video. La referencia de la API T2V de Wan 2.7 enumera los parámetros admitidos, incluyendo resolución, duración, relación y una pista de audio opcional. T2V es el camino más rápido de la idea al clip.
Use T2V cuando no tenga un fotograma inicial fijo. El movimiento abstracto, el B-roll, los storyboards y las secuencias estilizadas encajan. Evite T2V cuando el estado inicial sea importante: si necesita un producto específico en pantalla en el fotograma cero, cambie a I2V.
I2V es donde se manifiesta la unificación del flujo de trabajo de Wan 2.7. La guía de usuario de imagen a video de Wan 2.7 documenta cuatro submodos:
Para una explicación más detallada de los cuatro caminos de I2V, consulte el clúster de prompts de fotograma inicial-final de PixMind.
R2V es el modo más potente y menos documentado. La referencia de la API R2V de Wan 2.7 describe una llamada que acepta hasta cinco imágenes de referencia, cinco clips de referencia y una pista de audio de referencia. El modelo utiliza estos elementos para preservar la identidad, la voz y el estilo en la salida.
R2V es lo que debe usar cuando necesita que un personaje se vea igual en diferentes tomas, o cuando desea clonar una voz en una nueva escena. La desventaja es la duración: R2V tiene un límite de 10 segundos, más corto que el límite de 15 segundos de T2V e I2V.
La edición de video toma un video fuente más una instrucción de texto y devuelve un clip editado. La API de edición de video de Wan 2.7 soporta ediciones basadas en instrucciones y transferencia de estilo. Este modo está fuera del alcance de una guía de generación, pero vale la pena saber que existe.
El fotograma inicial-final es un submodo de I2V. Usted proporciona dos imágenes: una para el primer fotograma y otra para el último. Wan 2.7 genera los fotogramas intermedios.

Esto es importante porque I2V de una sola imagen deja el estado final al modelo. Si su toma necesita aterrizar en un fotograma específico (un producto completamente rotado, una caja completamente abierta, un personaje completamente girado), el fotograma inicial-final es la forma de garantizar ese aterrizaje.
El patrón práctico es: tome o genere dos fotogramas clave, súbalos como inicial y final, establezca la duración, renderice. Wan 2.7 interpola el movimiento entre ellos. La página de prompts de fotograma inicial-final de PixMind tiene plantillas de prompts para revelaciones de productos, transiciones y patrones de narración.
Modos de fallo comunes a tener en cuenta:
Pruebe primero con duraciones cortas (2-3 segundos) antes de comprometerse con renders de 5-10 segundos.
El modo impulsado por audio toma una imagen fija más una pista de audio y produce un video donde el sujeto parece hablar o moverse sincronizado con el audio. Esta es la base del contenido de cabezas parlantes y avatares.
El modelo utiliza la forma de onda de audio para impulsar dos cosas: el movimiento de los labios (si hay una cara presente) y la energía de movimiento general. La API I2V de Wan 2.7 acepta el audio como parte del array de medios, utilizando el tipo driving_audio.
Para casos de uso de cabezas parlantes, combine esto con el clúster de rendimiento de personajes de PixMind. La combinación de I2V impulsado por audio más un retrato de referencia limpio es el mejor camino abierto actual para un avatar con sincronización labial sin entrenar un modelo personalizado.
Dos notas prácticas:
Wan 2.7 soporta salida 720P y 1080P. La compensación es el costo versus la nitidez. Según la estrategia de precios de PixMind, 1080P consume aproximadamente el doble de créditos que 720P por segundo.
| Configuración | Cuándo elegir | Compensación |
|---|
| 720P | Contenido para redes sociales, video vertical, iteraciones de prueba | Menor costo, suavidad visible en pantallas grandes |
| 1080P | Demostraciones de productos, previs cinematográfica, creatividad publicitaria | Mayor costo, detalle más nítido |
| 16:9 | YouTube, incrustaciones en sitios web | Pantalla ancha estándar |
| 9:16 | Reels, TikTok, Shorts | Vertical móvil |
| 1:1 | Publicaciones en feeds, incrustaciones cuadradas | Neutral multiplataforma |
| 4:3 / 3:4 | Editorial, estilo vintage | Nicho |
La duración impulsa el costo linealmente. Un render de 10 segundos cuesta aproximadamente 5 veces más que un render de 2 segundos a la misma resolución. Para la iteración, trabaje corto. Para el final, vaya largo.
Un valor predeterminado razonable para nuevos usuarios: 720P, 5 segundos, 16:9. Confirme que la toma funciona, luego aumente a 1080P para el final.
La toma de decisiones es sencilla una vez que conoce las entradas que tiene.

Si no está seguro, comience en el centro de la familia PixMind Wan y elija por caso de uso en lugar de por nombre de modo. El centro lo dirige a la superficie correcta según lo que esté tratando de crear.
La estructura del prompt importa más que la longitud del prompt. Wan 2.7 recompensa una anatomía de cinco segmentos: sujeto, acción, escenario, cámara, estilo.
Subject: a glass perfume bottle on a dark surface. Action: a spray of droplets erupts to the right. Setting: studio black backdrop, single key light from camera-left. Camera: static medium shot, 50mm equivalent. Style: cinematic, shallow depth of field, warm rim light.
Cada segmento reduce el espacio de salida. Los segmentos faltantes recurren al conocimiento previo del modelo, que suele ser genérico.
Para patrones de prompt más profundos, el clúster de prompts de múltiples tomas de PixMind cubre 12 estructuras reutilizables que incluyen secuencias de múltiples tomas, patrones de sincronización de audio y storyboards de fotograma inicial-final.
Dos trampas de prompts a evitar:
Wan 2.7 se encuentra en un campo concurrido. Sora 2, VEO 3, Kling 2.0 y Seedance apuntan a casos de uso superpuestos. La diferenciación radica en los modos que cada modelo expone y a qué costo.
| Capacidad | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Texto a Video | Sí | Sí | Sí | Sí |
| Imagen a Video | Sí | Limitado | Sí | Sí |
| Fotograma Inicial-Final | Sí | No | Limitado | Limitado |
| Video de Referencia (R2V) | Sí | No | No | Limitado |
| I2V Impulsado por Audio | Sí | Sí | Sí | Limitado |
| Duración Máxima | 15s | 20s | 8s | 10s |
| Resolución Máxima | 1080P | 1080P | 1080P | 1080P |
Esta tabla refleja las especificaciones publicadas por los proveedores a partir de julio de 2026. Las pruebas comparativas independientes se encuentran en nuestra prueba de prompts de Wan 2.7 versus Sora 2 y el enfrentamiento de VEO y Kling.
La ventaja distintiva de Wan 2.7 es el fotograma inicial-final combinado con R2V. Ningún otro modelo en la tabla expone ambos con plena capacidad. Si su flujo de trabajo necesita un control preciso de inicio y fin, además de la preservación de la identidad, Wan 2.7 es actualmente el único camino de modelo único.
Todo modelo de video de IA falla. Nombrar los modos de fallo le ayuda a lanzar más rápido.
El clúster de casos de uso de PixMind tiene notas de modos de fallo por escenario para marketing de productos, rendimiento de personajes, previs cinematográfica y ganchos sociales.
Sí. La página de PixMind Wan 2.7 incluye una prueba gratuita sin necesidad de tarjeta de crédito. Los planes de pago se activan solo cuando excede la cuota de prueba.
No. El video de Wan 2.7 tiene un límite de 1080P. El modelo de imagen de Wan 2.7 soporta imágenes fijas 4K a través del nivel Pro, pero la salida de video está limitada a 1080P.
Wan 2.7 puede preservar la identidad a partir de entradas de referencia, pero la política de PixMind prohíbe la clonación no consensual de la imagen de personas reales e identificables. Use R2V con personajes originales, referencias de stock o su propia imagen.
El tiempo de generación depende de la duración, la resolución y la carga. Los renders típicos de 5 segundos 720P terminan en 60-90 segundos. Los renders de 10 segundos 1080P pueden tardar de 3 a 5 minutos. La API devuelve un ID de tarea que se consulta para conocer el estado.
Sí, pero solo en modos que aceptan entrada de audio. T2V puede tomar una pista de audio y sincronizar el movimiento con ella. El modo I2V impulsado por audio utiliza el audio para impulsar la sincronización labial y de movimiento. La generación de audio puro (música, efectos de sonido) es un modelo separado de Alibaba.
Sí. Las salidas que genere son suyas para usar comercialmente bajo los términos de Alibaba Cloud Model Studio. Revise los términos actuales en la descripción general de Alibaba Cloud Model Studio antes de su lanzamiento.
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b

Wan 2.7 reference to video R2V acepta hasta 5 imágenes de referencia, 5 clips de referencia y un audio de referencia en una sola llamada.…
Leer Más

Convierta cualquier foto de producto en un video de marketing 1080P con el modo de primer fotograma I2V de Wan 2.7. Aquí está el flujo de trabajo de 5 pasos con tres plantillas de…
Leer Más

El modo Wan 2.7 I2V impulsado por audio convierte un retrato estático más una pista de audio en un video sincronizado con los labios.…
Leer Más