Pixmind

Generador de video Wan 2.7: Guía completa de texto, imagen y video de referencia

PixMind Editorial Team
继续浏览中,生成器即将加载...

Generador de video Wan 2.7: La guía completa de los modos de texto, imagen y referencia

Puntos clave

  • Wan 2.7 es un modelo unificado que cubre texto a video (T2V), imagen a video (I2V) y referencia a video (R2V) en un solo flujo de trabajo.
  • Soporta salida 720P y 1080P, de 2 a 15 segundos de duración, y cinco relaciones de aspecto incluyendo 16:9, 9:16 y 1:1.
  • Los modos de fotograma inicial-final y de audio le brindan un control del estado inicial y final que los modelos I2V de una sola imagen no pueden igualar.
  • Referencia a video (R2V) acepta hasta cinco imágenes de referencia, cinco clips de referencia y una pista de audio de referencia en una sola llamada.
  • Pruebe el generador de video Wan 2.7 para seguir cualquier ejemplo de esta guía.

¿Qué es el generador de video Wan 2.7?

Wan 2.7 es el último modelo de generación de video del equipo Wan de Alibaba, expuesto a través de Alibaba Cloud Model Studio. Unifica cuatro capacidades previamente separadas en una familia de modelos: texto a video, imagen a video, referencia a video y edición de video. Según la descripción general de generación de video de Alibaba Cloud, el modelo acepta entrada multimodal y produce MP4 o MOV hasta 1080P.

El cambio clave en 2.7 es la unificación del flujo de trabajo. En lugar de cambiar entre proveedores para texto a video e imagen a video, se llama al mismo modelo y se deja que la API enrute según las entradas que se pasen. Esto coincide con la página de producto de PixMind Wan 2.7, donde una única superficie de creación maneja todos los modos.

Para los creadores, esto es importante porque el cambio de modo es donde se pierde la mayor parte del tiempo de producción. Se escribe un prompt, se renderiza, se da cuenta de que el estado inicial es incorrecto y luego se reconstruye desde cero en una herramienta diferente. La superficie unificada de Wan 2.7 permite intercambiar entradas sin cambiar de modelo.

¿Cuántos modos soporta Wan 2.7?

Wan 2.7 expone cuatro modos. La referencia de la API I2V documenta la matriz de entrada completa. Aquí está el desglose práctico.

Modo Entrada Mejor para Duración máxima Resolución máxima
T2V (Texto a Video) Prompt de texto, audio opcional Storyboarding, movimiento abstracto, B-roll 15s 1080P
I2V (Imagen a Video) Primer fotograma, último fotograma opcional, audio opcional Revelaciones de productos, acción de personajes, animación 15s 1080P
R2V (Referencia a Video) Hasta 5 imágenes de referencia + 5 clips de referencia + audio de referencia Preservación de identidad, clonación de voz, escenas con múltiples personajes 10s 1080P
Edición de Video Video fuente + instrucción Transferencia de estilo, ediciones basadas en instrucciones 10s 1080P

Diagram: Four-quadrant grid showing Text-to-Video, Image-to-Video, First-Last-Frame, and Reference-Video modes connected to a central hub.

Texto a Video (T2V)

T2V toma un prompt de texto y produce un video. La referencia de la API T2V de Wan 2.7 enumera los parámetros admitidos, incluyendo resolución, duración, relación y una pista de audio opcional. T2V es el camino más rápido de la idea al clip.

Use T2V cuando no tenga un fotograma inicial fijo. El movimiento abstracto, el B-roll, los storyboards y las secuencias estilizadas encajan. Evite T2V cuando el estado inicial sea importante: si necesita un producto específico en pantalla en el fotograma cero, cambie a I2V.

Imagen a Video (I2V)

I2V es donde se manifiesta la unificación del flujo de trabajo de Wan 2.7. La guía de usuario de imagen a video de Wan 2.7 documenta cuatro submodos:

  1. Fotograma inicial a video: una imagen se convierte en el estado inicial, el modelo inventa el movimiento.
  2. Fotograma inicial y final a video: dos imágenes definen los estados inicial y final, el modelo interpola.
  3. Continuación de video: un clip corto se convierte en el estado inicial, el modelo lo extiende.
  4. Impulsado por audio: una imagen más una pista de audio impulsan la sincronización labial o el movimiento.

Para una explicación más detallada de los cuatro caminos de I2V, consulte el clúster de prompts de fotograma inicial-final de PixMind.

Referencia a Video (R2V)

R2V es el modo más potente y menos documentado. La referencia de la API R2V de Wan 2.7 describe una llamada que acepta hasta cinco imágenes de referencia, cinco clips de referencia y una pista de audio de referencia. El modelo utiliza estos elementos para preservar la identidad, la voz y el estilo en la salida.

R2V es lo que debe usar cuando necesita que un personaje se vea igual en diferentes tomas, o cuando desea clonar una voz en una nueva escena. La desventaja es la duración: R2V tiene un límite de 10 segundos, más corto que el límite de 15 segundos de T2V e I2V.

Edición de Video

La edición de video toma un video fuente más una instrucción de texto y devuelve un clip editado. La API de edición de video de Wan 2.7 soporta ediciones basadas en instrucciones y transferencia de estilo. Este modo está fuera del alcance de una guía de generación, pero vale la pena saber que existe.

¿Cómo funciona el modo de fotograma inicial-final?

El fotograma inicial-final es un submodo de I2V. Usted proporciona dos imágenes: una para el primer fotograma y otra para el último. Wan 2.7 genera los fotogramas intermedios.

Diagram: Timeline showing two keyframes with three interpolated frames between them, with the Wan 2.7 logo concept marking the in-between frames.

Esto es importante porque I2V de una sola imagen deja el estado final al modelo. Si su toma necesita aterrizar en un fotograma específico (un producto completamente rotado, una caja completamente abierta, un personaje completamente girado), el fotograma inicial-final es la forma de garantizar ese aterrizaje.

El patrón práctico es: tome o genere dos fotogramas clave, súbalos como inicial y final, establezca la duración, renderice. Wan 2.7 interpola el movimiento entre ellos. La página de prompts de fotograma inicial-final de PixMind tiene plantillas de prompts para revelaciones de productos, transiciones y patrones de narración.

Modos de fallo comunes a tener en cuenta:

  • Deformación en superficies reflectantes: el vidrio, el metal y el agua pueden emborronarse durante la interpolación.
  • Deriva de identidad en personajes: los rostros pueden cambiar entre fotogramas.
  • Inconsistencia de la cámara: si los dos fotogramas clave implican diferentes ángulos de cámara, el modelo tiene que inventar una transición.

Pruebe primero con duraciones cortas (2-3 segundos) antes de comprometerse con renders de 5-10 segundos.

¿Cómo funciona el video impulsado por audio?

El modo impulsado por audio toma una imagen fija más una pista de audio y produce un video donde el sujeto parece hablar o moverse sincronizado con el audio. Esta es la base del contenido de cabezas parlantes y avatares.

El modelo utiliza la forma de onda de audio para impulsar dos cosas: el movimiento de los labios (si hay una cara presente) y la energía de movimiento general. La API I2V de Wan 2.7 acepta el audio como parte del array de medios, utilizando el tipo driving_audio.

Para casos de uso de cabezas parlantes, combine esto con el clúster de rendimiento de personajes de PixMind. La combinación de I2V impulsado por audio más un retrato de referencia limpio es el mejor camino abierto actual para un avatar con sincronización labial sin entrenar un modelo personalizado.

Dos notas prácticas:

  • La calidad del audio impulsa la calidad del video. Una grabación de estudio limpia supera a un micrófono de teléfono.
  • Pruebe primero con un clip de 3 segundos. Los problemas de sincronización son más fáciles de detectar temprano.

¿Qué resolución, duración y relación de aspecto debe elegir?

Wan 2.7 soporta salida 720P y 1080P. La compensación es el costo versus la nitidez. Según la estrategia de precios de PixMind, 1080P consume aproximadamente el doble de créditos que 720P por segundo.

| Configuración | Cuándo elegir | Compensación |
|---|
| 720P | Contenido para redes sociales, video vertical, iteraciones de prueba | Menor costo, suavidad visible en pantallas grandes |
| 1080P | Demostraciones de productos, previs cinematográfica, creatividad publicitaria | Mayor costo, detalle más nítido |
| 16:9 | YouTube, incrustaciones en sitios web | Pantalla ancha estándar |
| 9:16 | Reels, TikTok, Shorts | Vertical móvil |
| 1:1 | Publicaciones en feeds, incrustaciones cuadradas | Neutral multiplataforma |
| 4:3 / 3:4 | Editorial, estilo vintage | Nicho |

La duración impulsa el costo linealmente. Un render de 10 segundos cuesta aproximadamente 5 veces más que un render de 2 segundos a la misma resolución. Para la iteración, trabaje corto. Para el final, vaya largo.

Un valor predeterminado razonable para nuevos usuarios: 720P, 5 segundos, 16:9. Confirme que la toma funciona, luego aumente a 1080P para el final.

¿Cómo elegir el modo correcto de Wan 2.7?

La toma de decisiones es sencilla una vez que conoce las entradas que tiene.

Workflow diagram showing 5 stages: Input, Mode Detection, Model Routing, Generation, Output.

  • Solo tiene una idea: use T2V. Itere en el prompt antes de añadir elementos visuales.
  • Tiene una foto de producto: use el modo de primer fotograma de I2V.
  • Tiene dos fotogramas clave que deben ser el inicio y el final: use el modo de fotograma inicial-final de I2V.
  • Tiene un clip corto que necesita extenderse: use la continuación de video de I2V.
  • Tiene un retrato más una voz en off: use I2V impulsado por audio.
  • Necesita preservar la identidad o la voz en diferentes tomas: use R2V.
  • Tiene metraje existente que necesita una edición o cambio de estilo: use la edición de video.

Si no está seguro, comience en el centro de la familia PixMind Wan y elija por caso de uso en lugar de por nombre de modo. El centro lo dirige a la superficie correcta según lo que esté tratando de crear.

¿Cómo debe hacer prompts en Wan 2.7?

La estructura del prompt importa más que la longitud del prompt. Wan 2.7 recompensa una anatomía de cinco segmentos: sujeto, acción, escenario, cámara, estilo.

Subject: a glass perfume bottle on a dark surface. Action: a spray of droplets erupts to the right. Setting: studio black backdrop, single key light from camera-left. Camera: static medium shot, 50mm equivalent. Style: cinematic, shallow depth of field, warm rim light.

Cada segmento reduce el espacio de salida. Los segmentos faltantes recurren al conocimiento previo del modelo, que suele ser genérico.

Para patrones de prompt más profundos, el clúster de prompts de múltiples tomas de PixMind cubre 12 estructuras reutilizables que incluyen secuencias de múltiples tomas, patrones de sincronización de audio y storyboards de fotograma inicial-final.

Dos trampas de prompts a evitar:

  • Prompts sobrecargados: más de cinco sujetos en un prompt confunden al modelo. Divida en múltiples renders.
  • Uso excesivo de prompts negativos: Wan 2.7 no pondera los prompts negativos de la misma manera que los modelos de imagen. Manténgalos cortos.

¿Cómo se compara Wan 2.7 con otros modelos?

Wan 2.7 se encuentra en un campo concurrido. Sora 2, VEO 3, Kling 2.0 y Seedance apuntan a casos de uso superpuestos. La diferenciación radica en los modos que cada modelo expone y a qué costo.

Capacidad Wan 2.7 Sora 2 VEO 3 Kling 2.0
Texto a Video
Imagen a Video Limitado
Fotograma Inicial-Final No Limitado Limitado
Video de Referencia (R2V) No No Limitado
I2V Impulsado por Audio Limitado
Duración Máxima 15s 20s 8s 10s
Resolución Máxima 1080P 1080P 1080P 1080P

Esta tabla refleja las especificaciones publicadas por los proveedores a partir de julio de 2026. Las pruebas comparativas independientes se encuentran en nuestra prueba de prompts de Wan 2.7 versus Sora 2 y el enfrentamiento de VEO y Kling.

La ventaja distintiva de Wan 2.7 es el fotograma inicial-final combinado con R2V. Ningún otro modelo en la tabla expone ambos con plena capacidad. Si su flujo de trabajo necesita un control preciso de inicio y fin, además de la preservación de la identidad, Wan 2.7 es actualmente el único camino de modelo único.

¿Cuáles son los modos de fallo comunes?

Todo modelo de video de IA falla. Nombrar los modos de fallo le ayuda a lanzar más rápido.

  • Deformación en superficies reflectantes: vidrio, espejos, metal pulido. Mitigue reduciendo la amplitud de movimiento en el prompt.
  • Deriva de identidad entre tomas: los rostros cambian entre generaciones. Mitigue con entradas de referencia R2V.
  • Texto alucinado en fotogramas: letreros, etiquetas, logotipos se renderizan como galimatías. Mitigue eliminando texto de las imágenes de entrada.
  • Desajuste de relación de aspecto: alimentar una imagen 9:16 en una generación 16:9 recorta inesperadamente. Haga coincidir el aspecto de entrada con el aspecto de salida.
  • Consumo de créditos en iteraciones largas: los renders de prueba de 10 segundos consumen créditos rápidamente. Itere a 2-3 segundos.

El clúster de casos de uso de PixMind tiene notas de modos de fallo por escenario para marketing de productos, rendimiento de personajes, previs cinematográfica y ganchos sociales.

Preguntas frecuentes del generador de video Wan 2.7

¿Es Wan 2.7 gratis para probar?

Sí. La página de PixMind Wan 2.7 incluye una prueba gratuita sin necesidad de tarjeta de crédito. Los planes de pago se activan solo cuando excede la cuota de prueba.

¿Soporta Wan 2.7 4K?

No. El video de Wan 2.7 tiene un límite de 1080P. El modelo de imagen de Wan 2.7 soporta imágenes fijas 4K a través del nivel Pro, pero la salida de video está limitada a 1080P.

¿Puede Wan 2.7 clonar la cara de una persona específica?

Wan 2.7 puede preservar la identidad a partir de entradas de referencia, pero la política de PixMind prohíbe la clonación no consensual de la imagen de personas reales e identificables. Use R2V con personajes originales, referencias de stock o su propia imagen.

¿Cuánto tarda un render de Wan 2.7?

El tiempo de generación depende de la duración, la resolución y la carga. Los renders típicos de 5 segundos 720P terminan en 60-90 segundos. Los renders de 10 segundos 1080P pueden tardar de 3 a 5 minutos. La API devuelve un ID de tarea que se consulta para conocer el estado.

¿Genera audio Wan 2.7?

Sí, pero solo en modos que aceptan entrada de audio. T2V puede tomar una pista de audio y sincronizar el movimiento con ella. El modo I2V impulsado por audio utiliza el audio para impulsar la sincronización labial y de movimiento. La generación de audio puro (música, efectos de sonido) es un modelo separado de Alibaba.

¿Puedo usar las salidas de Wan 2.7 comercialmente?

Sí. Las salidas que genere son suyas para usar comercialmente bajo los términos de Alibaba Cloud Model Studio. Revise los términos actuales en la descripción general de Alibaba Cloud Model Studio antes de su lanzamiento.

Véalo en acción