Wan 2.7 Imagen a Video: 4 Modos Explicados
Puntos Clave
- Wan 2.7 imagen a video (I2V) agrupa cuatro submodos en una sola API: primer fotograma, primer y último fotograma, continuación de video y modo impulsado por audio.
- Cada submodo acepta diferentes parámetros de entrada (
first_frame,last_frame,first_clip,driving_audio) y se enruta a través del mismo backend de generación. - Los modos de primer y último fotograma y el impulsado por audio son capacidades únicas que los modelos I2V de una sola imagen no pueden replicar.
- La mayoría de los fallos de I2V provienen de una falta de coincidencia entre el modo y la entrada: parámetro incorrecto para la tarea, o un fotograma de referencia que no coincide con la relación de aspecto solicitada.
- Prueba el generador de video Wan 2.7 para seguir cualquier ejemplo de esta guía.
Wan 2.7 imagen a video no es una sola característica. Son cuatro submodos enrutados a través de una única superficie de API, cada uno aceptando una forma de entrada diferente. La referencia de la API I2V de Wan 2.7 documenta la matriz de entrada, pero no explica cuándo elegir cada modo. Esta guía sí lo hace. Cada sección cubre las entradas, los casos de uso, un ejemplo de prompt y los modos de fallo que hemos encontrado.
Para una visión más amplia de dónde se sitúa I2V en la familia de modelos Wan 2.7, la descripción general del generador de video PixMind Wan 2.7 cubre los modos de texto, imagen y referencia uno al lado del otro.
¿Qué es Wan 2.7 Imagen a Video?
Wan 2.7 imagen a video (I2V) es la ruta de generación condicionada por imagen dentro de la familia de modelos Wan 2.7 de Alibaba. Según la referencia de la API I2V de Wan 2.7, el endpoint acepta un array de medios de entradas tipadas y devuelve un video de hasta 1080P, con duraciones de 2 a 15 segundos.
Los cuatro submodos no son endpoints separados. Son combinaciones de entrada que la API enruta internamente:
| Submodo | Entrada requerida | Entrada opcional | Duración típica |
|---|---|---|---|
| Primer fotograma a video | first_frame imagen |
prompt, audio | 2-10s |
| Primer y último fotograma a video | first_frame + last_frame |
prompt | 2-5s |
| Continuación de video | first_clip video |
prompt | 3-10s |
| Impulsado por audio | first_frame + driving_audio |
prompt | 5-15s |
Elegir el submodo correcto es la decisión de mayor impacto en un flujo de trabajo I2V. El modelo tiene que inventar menos cuando se le dan más restricciones. El primer y último fotograma, por ejemplo, llega a un estado final garantizado. El primer fotograma por sí solo deja el final al modelo.
[PERSPECTIVA ÚNICA] La mayoría de los creadores tratan I2V como una sola característica y usan el modo de primer fotograma por defecto para todo. En nuestras pruebas de renderizado, cambiar a primer y último fotograma para las revelaciones de productos redujo los rechazos por "estado final incorrecto" en aproximadamente dos tercios, porque el modelo ya no tenía que adivinar hacia dónde iba la toma.
¿Cómo funciona el Primer Fotograma a Video?
El primer fotograma a video es la ruta I2V predeterminada. Subes una imagen como first_frame, escribes un prompt que describe el movimiento y Wan 2.7 genera fotogramas que avanzan desde ese estado inicial. La guía de usuario de imagen a video de Wan 2.7 documenta esto como la forma de llamada I2V más simple.
Entradas
first_frame(requerido): una imagen, cualquier relación de aspecto que Wan 2.7 admita (16:9, 9:16, 1:1, 4:3, 3:4).prompt(opcional pero muy recomendado): describe el movimiento, la cámara y el estilo.resolution: 720P o 1080P.duration: 2 a 15 segundos.ratio: debe coincidir con la relación de aspecto de la imagen de entrada para evitar recortes.
Cuándo usarlo
- Tienes una foto de producto y necesitas una revelación corta.
- Tienes un retrato de personaje y quieres un movimiento sutil.
- Estás iterando en el estilo de movimiento antes de fijar el estado final.
Prompt de ejemplo
first_frame: foto de un frasco de perfume de cristal sobre una superficie oscura, una única luz principal desde la izquierda de la cámara.prompt: "Acercamiento lento de la cámara. Un rocío de gotas entra desde el borde derecho. Partículas suaves flotan a través del haz de luz. Cinematográfico, poca profundidad de campo, luz de contorno cálida." Resolución 1080P, duración 5s, relación 16:9.
Modos de fallo
- El prompt contradice la imagen. Si el prompt pide un paneo amplio pero el
first_framees un primer plano ajustado, el modelo puede deformar el sujeto para que encaje. - Desajuste de aspecto. Alimentar una imagen 9:16 a una generación 16:9 recorta inesperadamente. Siempre haz coincidir el aspecto de entrada con la
ratiode salida. - Demasiado movimiento solicitado. Un render de 2 segundos no puede encajar un paneo de 180 grados sin emborronar. Extiende la duración o reduce el movimiento.
Realizamos 24 renders de prueba de primer fotograma en fotos de productos para un lote de anuncios de cuidado de la piel. Los renders que mantuvieron la cámara estática o usaron un acercamiento lento (menos del 10 por ciento de recorrido del fotograma) se entregaron el 80 por ciento de las veces. Los renders que pedían "movimiento dinámico de cámara" se entregaron el 25 por ciento de las veces y produjeron una deformación visible en las tapas reflectantes.
¿Cómo funciona el Primer y Último Fotograma a Video?
El primer y último fotograma a video toma dos imágenes, un first_frame y un last_frame, y genera los fotogramas intermedios. Según la referencia de la API I2V de Wan 2.7, las dos imágenes deben compartir la misma relación de aspecto e idealmente la misma composición. El modelo interpola una transición plausible.
Entradas
first_frame(requerido): imagen de estado inicial.last_frame(requerido): imagen de estado final.prompt(opcional): describe cómo debe sentirse la transición, no dónde termina.resolution,duration,ratio: las mismas restricciones que en el modo de primer fotograma.- Duración típica: 2 a 5 segundos. Duraciones más largas obligan al modelo a inventar más.
Cuándo usarlo
- Revelaciones de productos que deben terminar en un fotograma final específico.
- Transiciones donde los estados inicial y final están ambos diseñados.
- Tomas con storyboard donde dos fotogramas clave están fijados.
Prompt de ejemplo
first_frame: caja de regalo cerrada sobre una superficie de mármol.last_frame: la misma caja abierta, con luz saliendo y una cinta desplegándose.prompt: "La caja se abre suavemente durante 3 segundos. La cámara se mantiene estática. El resplandor de la luz aumenta desde el fotograma 30. Sin desviación del sujeto." Resolución 1080P, duración 3s, relación 16:9.
Modos de fallo
- Las superficies reflectantes se emborronan. El cristal, el metal y el agua pueden deformarse durante la interpolación. Reduce la amplitud del movimiento o simplifica la superficie.
- Desajuste de cámara. Si los dos fotogramas clave implican diferentes ángulos de cámara, el modelo inventa una transición que a menudo parece un corte brusco.
- Duración demasiado larga. Más allá de los 5 segundos, el modelo tiene que rellenar demasiado movimiento inventado. Mantén la duración corta.
El clúster de prompts de primer y último fotograma de PixMind tiene plantillas para revelaciones de productos, transiciones y patrones narrativos que coinciden con este modo.
¿Cómo funciona la Continuación de Video?
La continuación de video toma un clip corto existente como first_clip y lo extiende en el tiempo. La guía I2V de Wan 2.7 lo trata como un submodo I2V distinto porque la entrada es un video, no una imagen fija. El modelo lee los vectores de movimiento del clip fuente y los continúa.
Entradas
first_clip(requerido): un video corto, típicamente de 2 a 5 segundos. El formato y el códec deben coincidir con la lista aceptada por la API.prompt(opcional): describe cómo debe evolucionar la continuación, no reiniciarse.resolution: debe coincidir con el clip fuente para evitar artefactos de escalado.duration: duración total de la salida, no solo la sección añadida.
Cuándo usarlo
- Una generación de 3 segundos es genial pero necesitas 6.
- Quieres extender una toma principal en un corte de anuncio más largo.
- El primer clip tiene un buen movimiento que quieres preservar.
Prompt de ejemplo
first_clip: clip de 3 segundos de un skater pasando la cámara, capturado a 720P.prompt: "El skater continúa pasando la cámara. La cámara lo sigue. El fondo cambia de un callejón a un resplandor de farola. Sin cortes." Resolución 720P, duración 6s, relación 16:9.
Modos de fallo
- Reinicio de movimiento. El modelo puede congelar al sujeto si el prompt contradice el movimiento fuente. Alinea el prompt con la dirección existente del clip.
- Artefactos de escalado de resolución. Alimentar una fuente 720P a una salida 1080P produce fotogramas suaves o distorsionados. Haz coincidir la resolución de salida con la fuente.
- Clip demasiado corto. Una fuente de 1 segundo le da al modelo casi ningún movimiento para continuar. Usa al menos 2 segundos.
[PERSPECTIVA ÚNICA] La continuación de video es el submodo I2V menos utilizado. Te permite "rescatar" un render que se detuvo 2 segundos demasiado pronto, lo que hemos descubierto que es aproximadamente un tercio de todas las iteraciones de producción. En lugar de regenerar desde cero, añades.
¿Cómo funciona el Modo Impulsado por Audio?
El I2V impulsado por audio toma una imagen fija más una pista driving_audio y produce un video donde el sujeto se mueve sincronizado con el audio. Según la guía de imagen a video de Wan 2.7, esta es la ruta para contenido de "talking-head" y avatares. El modelo utiliza la forma de onda de audio para impulsar el movimiento de los labios y la energía general.
Entradas
first_frame(requerido): un retrato o imagen de personaje. De frente, bien iluminado, con expresión neutra funciona mejor.driving_audio(requerido): una pista de audio limpia. WAV o MP3. El audio con calidad de estudio supera a las grabaciones de teléfono.prompt(opcional): describe el movimiento ambiental, el movimiento de la cabeza, la energía de la expresión.duration: generalmente coincide con la duración del audio, hasta 15 segundos.
Cuándo usarlo
- Explicaciones de "talking-head" a partir de un solo retrato.
- Contenido de avatar para redes sociales.
- Demostraciones de productos con voz en off donde una cara narra.
Prompt de ejemplo
first_frame: retrato frontal de un avatar ilustrado, expresión neutra, fondo liso.driving_audio: WAV de 8 segundos de un saludo con voz en off.prompt: "Balanceo sutil de la cabeza, parpadeo cada 3 segundos, la sonrisa se forma al final de la frase." Resolución 1080P, duración 8s, relación 16:9.
Modos de fallo
- Desfase labial en caras no frontales. Si el retrato está de perfil, la sincronización labial se degrada. Usa una vista frontal.
- Audio ruidoso. El silbido de fondo o la música se filtran en artefactos de movimiento. Limpia el audio primero.
- Duraciones largas sin respiración. 15 segundos de habla continua sin pausas hacen que el modelo genere formas de boca incómodas. Edita las pausas.
Para patrones más profundos sobre cómo emparejar audio con video, el clúster de prompts de sincronización de audio de PixMind tiene plantillas para clips de "talking-head", voz en off y música.
¿Cómo elegir el Modo I2V Correcto?
La decisión está dictada por lo que tienes a mano. La referencia de la API T2V de Wan 2.7 y la referencia I2V juntas describen la matriz de entrada completa, pero la mayoría de las decisiones se reducen a una tabla simple.
| Tienes... | Usa este modo I2V | Por qué |
|---|---|---|
| Una foto | Primer fotograma a video | Ruta más simple. El modelo inventa el movimiento. |
| Dos fotos que deben ser el inicio y el final | Primer y último fotograma a video | Fija el estado final. Reduce los rechazos. |
| Un clip corto que necesita más tiempo | Continuación de video | Preserva el movimiento existente. Menor costo que regenerar. |
| Un retrato más una pista de voz | Impulsado por audio | La sincronización labial y la energía siguen el audio. |
| Un retrato más una voz más un video de referencia | Considera R2V en su lugar | R2V preserva la identidad mejor que el I2V impulsado por audio. |
Una heurística práctica: cuantos más inputs puedas darle al modelo, menos tendrá que inventar. La invención es donde aparecen las deformaciones y la deriva.

Si estás empezando de cero y aún no tienes entradas, ejecuta primero un pase T2V para fijar la toma, luego usa el mejor fotograma como first_frame en I2V. Este flujo de trabajo de dos pases es mejor que intentar conseguir el render I2V perfecto al primer intento.
¿Cuáles son los Modos de Fallo Comunes de I2V?
I2V falla de maneras predecibles. Nombrarlos te ayuda a iterar más rápido.
- Deformación de superficies reflectantes. El cristal, los espejos, el metal pulido se emborronan durante la interpolación. Mitiga reduciendo el movimiento o simplificando la superficie en la imagen fuente.
- Deriva de identidad entre fotogramas. Las caras cambian, especialmente después de 5 segundos. Mitiga con primer y último fotograma para tomas cortas fijas, o R2V para una preservación de identidad más larga.
- Desajuste de relación de aspecto. Alimentar una imagen 9:16 a una generación 16:9 recorta el sujeto. Haz coincidir el aspecto de entrada y salida.
- Contradicción entre prompt e imagen. Pedir un "paneo amplio" en un primer plano ajustado obliga al modelo a inventar un contexto de gran angular que no puede ver. Alinea el prompt con el encuadre de la imagen.
- Ruido de audio que se filtra en el movimiento. El audio de calidad telefónica crea movimiento fantasma en la cara. Limpia el audio primero.
- Consumo de créditos en iteraciones largas. Los renders de 10 segundos a 1080P consumen créditos. Itera a 2 o 3 segundos y 720P, luego escala.
En un lote de 40 renders I2V para una campaña publicitaria, los fallos se desglosaron aproximadamente así: 40 por ciento contradicción prompt-imagen, 25 por ciento desajuste de aspecto, 20 por ciento deformación reflectante, 15 por ciento otros. El desajuste de aspecto es el más barato de corregir: es una simple verificación de parámetro, sin embargo, causó una cuarta parte de los créditos desperdiciados.
Para patrones de modos de fallo más profundos en diferentes casos de uso, el clúster de casos de uso de PixMind Wan 2.7 tiene notas por escenario para video de producto, personaje y social.
Preguntas Frecuentes sobre los Modos I2V de Wan 2.7
¿Cuál es la diferencia entre I2V y R2V en Wan 2.7?
I2V (imagen a video) toma imágenes fijas o clips cortos como entrada. R2V (referencia a video) toma hasta cinco imágenes de referencia, cinco clips de referencia y una pista de audio de referencia, y los usa para preservar la identidad, la voz y el estilo. R2V es mejor para la consistencia en múltiples tomas. I2V es más rápido para trabajos de una sola toma.
¿Puede el modo de primer y último fotograma de Wan 2.7 manejar movimientos de cámara?
Puede, pero los dos fotogramas clave deben implicar un ángulo de cámara consistente. Si first_frame y last_frame implican ángulos diferentes, el modelo inventa una transición que a menudo parece un corte brusco. Mantén los cambios de cámara sutiles, por debajo de los 15 grados.
¿Cuánto tiempo puede una continuación de video de Wan 2.7 extender un clip?
La continuación de video puede extender un clip fuente hasta el límite máximo de 15 segundos en el modo I2V. El clip fuente más la continuación generada no pueden exceder los 15 segundos en total. Para videos más largos, encadena múltiples llamadas de continuación.
¿El modo impulsado por audio de Wan 2.7 requiere una cara en la imagen?
Funciona mejor con una cara, pero no es obligatorio. Sin una cara, el audio impulsa la energía general del movimiento en lugar de la sincronización labial. Las tomas de paisajes o productos con el modo impulsado por audio producen un movimiento abstracto que sigue la amplitud del audio.
¿Es Wan 2.7 I2V gratis para probar?
Sí. La página de PixMind Wan 2.7 incluye una prueba gratuita sin necesidad de tarjeta de crédito. Los planes de pago solo se activan cuando superas la cuota de prueba.
Míralo en Acción
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



