Control de primer y último fotograma en Wan 2.7: Guía práctica en 5 pasos
Puntos clave
- El modo de primer y último fotograma en Wan 2.7 I2V permite fijar tanto el estado inicial como el final de un clip, con el modelo interpolando el movimiento intermedio.
- Cinco pasos conducen a una renderización limpia: preparar los fotogramas clave, subir ambos fotogramas, establecer la duración, escribir el prompt de transición y luego evaluar en cinco ejes.
- Los modos de fallo comunes son la deformación de superficies reflectantes, la deriva de identidad en los personajes y los saltos de cámara cuando los dos fotogramas clave no coinciden en el ángulo.
- Empiece con una duración corta de 2 a 5 segundos; la duración escala el costo de los créditos linealmente, y las renderizaciones largas amplifican los artefactos.
- El PixMind first-last-frame prompts cluster tiene plantillas que coinciden con los tres patrones de ejemplo de esta guía.
¿Qué es el modo de primer y último fotograma?
El primer y último fotograma es un submodo de imagen a video (I2V) de Wan 2.7. Se proporcionan dos imágenes: una para el primer fotograma y otra para el último. Wan 2.7 genera los fotogramas intermedios que los conectan. Según la referencia de la API I2V de Alibaba Cloud, el modelo acepta un par ordenado de entradas de imagen y produce un MP4 de hasta 1080P.
Esto es importante porque el I2V de una sola imagen deja el estado final al modelo. Si su toma debe terminar en un fotograma específico, un producto completamente rotado o una caja completamente abierta, el primer y último fotograma es la forma de garantizar ese resultado. Para obtener más contexto sobre el modo, consulte el generador de video PixMind Wan 2.7, donde una superficie de creación maneja cada submodo I2V.
El flujo de trabajo principal consta de cinco pasos: preparar dos fotogramas clave, subirlos en orden, establecer la duración, escribir el prompt de transición y luego renderizar y evaluar. Cada paso tiene una única decisión que determina si la renderización tiene éxito.
Paso 1: Prepare sus fotogramas clave
La calidad del fotograma clave es el predictor más importante de una renderización limpia de primer y último fotograma. La guía de usuario de imagen a video de Wan 2.7 recomienda hacer coincidir la composición, la iluminación y el ángulo de la cámara en ambos fotogramas. Hemos descubierto que los fotogramas clave no coincidentes obligan al modelo a inventar una transición, que es donde aparecen la deformación y la deriva de identidad.
Tres reglas de consistencia cubren la mayoría de los casos. Haga coincidir la composición encuadrando ambos sujetos en la misma posición de la pantalla. Haga coincidir la iluminación manteniendo la misma dirección de la luz principal y la temperatura de color. Haga coincidir la cámara manteniendo la distancia focal, el ángulo y la distancia constantes. Rompa cualquiera de estas reglas y el modelo tendrá que interpolar a través de una discontinuidad.
Cápsula de citación: La consistencia de los fotogramas clave es el factor dominante en la calidad del primer y último fotograma de Wan 2.7. La guía de usuario de imagen a video de Alibaba Cloud recomienda hacer coincidir la composición, la iluminación y el ángulo de la cámara en ambos fotogramas de entrada para evitar transiciones inventadas por el modelo que causan deformación y deriva de identidad.
Lista de verificación de composición
- El sujeto ocupa el mismo cuadrante de la pantalla en ambos fotogramas.
- Los elementos de fondo permanecen en posiciones fijas.
- La relación de aspecto de ambos fotogramas coincide con la relación de salida deseada.
- El espacio negativo se conserva para que el movimiento tenga a dónde ir.
Lista de verificación de iluminación
- La dirección de la luz principal es idéntica en ambos fotogramas.
- La temperatura de color coincide dentro de los 200K.
- La longitud y el ángulo de la sombra son consistentes con una única fuente de luz.
- Los reflejos especulares caen en las mismas regiones de la superficie.
Lista de verificación de la cámara
- La distancia focal es idéntica (use datos EXIF o metadatos).
- El ángulo de disparo coincide dentro de los 5 grados.
- La altura de la cámara es consistente.
- Las características de distorsión de la lente coinciden (fija versus zoom).
Hemos gastado créditos probando pares donde el primer fotograma fue tomado a 35mm y el último a 50mm. El modelo produjo un "chasquido" discordante a mitad del clip. Bloquee la distancia focal antes de generar.
Paso 2: Suba el primer y el último fotograma
Wan 2.7 espera los dos fotogramas en un orden definido. La primera imagen que pasa se convierte en el estado inicial, la segunda se convierte en el estado final. Según la descripción general de Alibaba Cloud Model Studio, la llamada I2V acepta URLs de imágenes o cargas útiles codificadas en base64, y el modelo trata el array de entrada como una secuencia ordenada.
El orden importa más de lo que la gente espera. Si sube primero la imagen de la caja abierta y luego la imagen de la caja cerrada, obtendrá una animación de cierre. Invierta el orden y obtendrá una animación de apertura. El modelo no infiere la intención solo del prompt; la secuencia de fotogramas es la fuente de verdad para la dirección.
Formato y tamaño de la carga
Ambos fotogramas deben compartir la misma relación de aspecto que la salida deseada. Alimentar un primer fotograma 9:16 y un último fotograma 1:1 fuerza un recorte, y los recortes introducen artefactos en los bordes. Redimensione ambos fotogramas a la resolución de salida antes de subirlos.
Una receta práctica de tamaño: apunte a 1920x1080 para una salida 16:9 a 1080P, 1080x1920 para 9:16 y 1080x1080 para 1:1. Mantenga el tamaño del archivo por debajo de 10MB por fotograma para evitar fallos por tiempo de espera en conexiones lentas.
Disciplina de nombres y orden
Nombre sus archivos de una manera que haga obvia la secuencia. keyframe-01-closed.png y keyframe-02-open.png elimina las conjeturas al momento de la carga. Esto parece trivial, pero las cargas en orden inverso son el segundo fallo más común que vemos.
Paso 3: Establezca la duración (y por qué debe empezar con poco)
La duración controla cuántos fotogramas interpolados debe producir el modelo entre sus dos fotogramas clave. Duraciones más largas significan más interpolación, lo que significa más posibilidades de que el modelo se desvíe. La referencia de la API I2V de Wan 2.7 admite duraciones de 2 a 15 segundos para I2V.
Recomendamos empezar con 2 a 5 segundos para cualquier nuevo par de fotogramas clave. Las renderizaciones cortas revelan los modos de fallo de forma económica. Si el modelo puede interpolar limpiamente en 3 segundos, puede extender con confianza a 8 o 10 segundos en la siguiente pasada.
Cápsula de citación: Wan 2.7 I2V admite duraciones de 2 a 15 segundos, pero el costo de los créditos escala linealmente con la duración. Las pruebas de 2 a 5 segundos revelan los modos de fallo de deformación, deriva y salto de cámara a una fracción del costo de una renderización de 10 segundos.
Duración versus amplitud de movimiento
Las duraciones cortas funcionan para movimientos pequeños. Una renderización de 3 segundos encaja con una tapa que se levanta de una caja. Una renderización de 5 segundos encaja con un personaje que gira de espalda a frente. Si se supera los 8 segundos, el modelo tiene que inventar un movimiento intermedio que ninguno de los fotogramas clave implica, que es donde entra el movimiento alucinado.
Cálculo del costo de créditos
La duración escala el costo linealmente. Una renderización de 10 segundos a 1080P cuesta aproximadamente cinco veces lo que cuesta una renderización de 2 segundos a 1080P. Si prueba a 10 segundos y falla, paga el precio completo por una renderización que no puede usar. Pruebe con duraciones cortas y luego comprométase.
Paso 4: Escriba el prompt de transición
El prompt en el modo de primer y último fotograma describe el movimiento entre los dos fotogramas. No vuelve a describir el sujeto; los fotogramas clave ya lo hacen. El PixMind first-last-frame prompts cluster cataloga patrones de prompt para los tres ejemplos prácticos que se muestran a continuación.
Un prompt de transición tiene cuatro partes: la acción, la velocidad, el comportamiento de la cámara y el estilo. Mantenga cada parte en una cláusula corta. Los prompts largos diluyen la atención del modelo y producen un movimiento más suave.
Cápsula de citación: Los prompts de transición en el modo de primer y último fotograma de Wan 2.7 deben describir el movimiento, no el sujeto. Los prompts efectivos cubren cuatro partes: acción, velocidad, comportamiento de la cámara y estilo. Cada parte como una cláusula corta supera a los prompts de longitud de párrafo que vuelven a describir lo que ya muestran los fotogramas clave.
Anatomía del prompt
- Acción: qué se mueve. "La tapa se levanta", "la figura gira", "el cielo se oscurece".
- Velocidad: qué tan rápido. "Lento", "gradual", "durante tres segundos".
- Cámara: qué hace la cámara. "Estática", "acercamiento sutil", "fija".
- Estilo: tratamiento visual. "Cinemático", "documental", "enfoque suave".
Antipatrón: exceso de prompts
Resista la tentación de volver a describir el sujeto. Si el primer fotograma clave es una caja de regalo cerrada, su prompt no necesita decir "una caja de regalo cerrada sobre una mesa de madera". El modelo ya lo sabe. Volver a describir empuja al modelo a volver a renderizar la caja, lo que dificulta la interpolación.
[PERSPECTIVA ÚNICA] El trabajo del prompt de transición es restringir el movimiento, no declarar el sujeto. Trátelo como notas de coreografía para un bailarín que ya conoce el vestuario.
Paso 5: Renderice y evalúe en cinco ejes
Cada renderización de primer y último fotograma necesita un pase de evaluación explícito. Evaluamos en cinco ejes, cada uno calificado como aprobado o reprobado. Una renderización que falla en cualquier eje vuelve al paso 1 o al paso 4, no a la entrega final.

Los cinco ejes cubren la identidad, la cámara, la iluminación, el movimiento y la precisión del fotograma objetivo. Los tres primeros provienen de la calidad del fotograma clave. Los dos últimos provienen de las elecciones de prompt y duración.
Cápsula de citación: Las renderizaciones de primer y último fotograma de Wan 2.7 deben evaluarse en cinco ejes binarios: consistencia de identidad, continuidad de cámara, continuidad de iluminación, plausibilidad de movimiento y logro del fotograma objetivo. Una renderización que falla en cualquier eje debe reelaborarse en la etapa de fotograma clave o prompt en lugar de volver a intentarse a ciegas.
Eje 1: Consistencia de identidad
¿El sujeto se ve como el mismo sujeto en todos los fotogramas? Para los personajes, verifique la geometría facial. Para los productos, verifique la silueta y la marca. La deriva aquí generalmente se debe a fotogramas clave que no coinciden en el ángulo.
Eje 2: Continuidad de la cámara
¿La cámara permanece donde debería? Si especificó estática, verifique si hay acercamientos involuntarios. Si especificó un acercamiento, verifique que el movimiento sea suave y no entrecortado.
Eje 3: Continuidad de la iluminación
¿La dirección de la luz permanece constante? Esté atento a los cambios de sombra a mitad del clip, lo que indica que el modelo intercambió fuentes de luz entre fotogramas.
Eje 4: Plausibilidad del movimiento
¿El movimiento parece físicamente creíble? Las tapas no atraviesan las cajas. Las extremidades no se doblan hacia atrás. El cabello no se congela en el aire. El movimiento inverosímil generalmente significa que el prompt pidió demasiado en una duración demasiado corta.
Eje 5: Logro del fotograma objetivo
¿El último fotograma del video generado coincide con la imagen del último fotograma que subió? Esta es la prueba que da nombre al modo. Si el modelo aterriza en algún lugar cercano pero no exacto, ajuste su prompt o acorte la duración.
Tres ejemplos prácticos (revelación de producto, giro de personaje, día a noche)
Los tres patrones a continuación cubren aproximadamente el 80 por ciento de los casos de uso de primer y último fotograma que vemos en PixMind. Cada uno incluye la preparación del fotograma clave, el prompt, la duración y el modo de fallo que más a menudo ocurre.
Ejemplo 1: Revelación de producto (caja de regalo cerrada a abierta)
Fotogramas clave: dos tomas de producto, cámara e iluminación idénticas. Primer fotograma: tapa cerrada. Segundo fotograma: tapa completamente abierta con el interior visible.
Prompt: "La tapa se levanta lentamente hacia arriba y se inclina hacia atrás, revelando el interior. Cámara estática, iluminación cinematográfica suave, duración de tres segundos."
Duración: 3 segundos a 1080P, 16:9.
Modo de fallo: deformación de superficies reflectantes. Si la caja tiene un acabado brillante, el modelo difumina el reflejo a medida que la tapa se mueve. Mitíguelo reduciendo el brillo en los fotogramas clave o añadiendo "superficie mate" al prompt.
Ejemplo 2: Giro de personaje (vista trasera a vista frontal)
Fotogramas clave: dos renderizaciones de personajes, iluminación y distancia focal idénticas. Primer fotograma: personaje visto desde atrás. Segundo fotograma: personaje mirando a la cámara.
Prompt: "La figura gira lentamente para mirar a la cámara, girando en el sentido de las agujas del reloj durante cuatro segundos. Toma media estática, profundidad de campo cinematográfica."
Duración: 4 a 5 segundos a 1080P.
Modo de fallo: deriva de identidad. La cara puede cambiar a mitad del giro. Mitíguelo haciendo que ambos fotogramas clave sean lo más frontales posible dentro del giro, o utilizando el modo de referencia a video (R2V) para una mayor preservación de la identidad.
Ejemplo 3: De día a noche (paso del tiempo)
Fotogramas clave: dos tomas de paisaje, composición idéntica. Primer fotograma: luz diurna. Segundo fotograma: noche con luces artificiales encendidas.
Prompt: "El cielo se oscurece gradualmente de día a noche durante cinco segundos, las luces artificiales se encienden suavemente, la temperatura de color se enfría. Cámara estática, trípode fijo."
Duración: 5 segundos a 1080P.
Modo de fallo: salto de cámara. Si las dos tomas de paisaje se tomaron desde posiciones incluso ligeramente diferentes, el modelo inventa un movimiento de cámara para unirlas. Mitíguelo tomando ambos fotogramas clave desde un trípode fijo, o utilizando una sola toma con horquillado de exposición.
Modos de fallo comunes (y cómo solucionarlos)
Nombrar los modos de fallo es cómo se entrega más rápido. Los tres siguientes representan la mayoría de las renderizaciones rechazadas que vemos.
Deformación de superficies reflectantes
El vidrio, el metal pulido y el agua se difuminan durante la interpolación porque el modelo no puede seguir los reflejos de manera consistente. Reduzca la amplitud del movimiento, cambie a superficies mate en los fotogramas clave o acorte la duración para que el modelo tenga menos fotogramas que inventar.
Deriva de identidad
Las caras y las siluetas cambian entre fotogramas. Esto es más común cuando los dos fotogramas clave no coinciden en el ángulo o la expresión. Vuelva a tomar los fotogramas clave con ángulos coincidentes, o cambie al modo R2V con una imagen de referencia para anclar la identidad.
Salto de cámara
El modelo inventa un movimiento de cámara para unir dos fotogramas clave que implican ángulos diferentes. La solución está aguas arriba: bloquee la distancia focal, el ángulo y la altura en ambos fotogramas clave. Si no puede volver a tomar la foto, acepte el movimiento de la cámara e inclúyalo en el prompt.
Hemos descubierto que los saltos de cámara son el modo de fallo que con mayor frecuencia se diagnostica erróneamente como un "error del modelo". El modelo está haciendo exactamente lo que los fotogramas clave le indican que haga. Corrija las entradas.
Preguntas frecuentes sobre el primer y último fotograma de Wan 2.7
¿Cuál es la diferencia entre el primer fotograma y el primer y último fotograma en Wan 2.7?
El modo de primer fotograma acepta una imagen como estado inicial y permite que el modelo invente el estado final. El modo de primer y último fotograma acepta dos imágenes y obliga al modelo a terminar en la segunda imagen. El primer y último fotograma le da un control del estado final que el primer fotograma no puede.
¿Cuánto debe durar mi primera renderización de primer y último fotograma de Wan 2.7?
Empiece con 2 a 5 segundos. Las duraciones cortas revelan los modos de fallo de forma económica. Según la referencia de la API I2V de Alibaba Cloud, se admiten duraciones de 2 a 15 segundos, pero las duraciones largas aumentan la distancia de interpolación y el riesgo de artefactos.
¿Puede el primer y último fotograma de Wan 2.7 manejar superficies reflectantes como el vidrio y el metal?
Sí, pero con precaución. Las superficies reflectantes son el modo de fallo de deformación más común. Mitíguelo reduciendo el brillo en los fotogramas clave, manteniendo una amplitud de movimiento pequeña e incluyendo "superficie mate" en el prompt. Los espejos y el cromo pulido siguen siendo los casos más difíciles.
¿Cómo evito la deriva de identidad entre los dos fotogramas clave?
Haga coincidir el ángulo de la cámara, la distancia focal y la iluminación en ambos fotogramas clave con tolerancias estrictas. Si la deriva persiste, cambie al modo de referencia a video (R2V) y pase una imagen de referencia para anclar la identidad. R2V está documentado en la guía del generador de video PixMind Wan 2.7.
¿El primer y último fotograma de Wan 2.7 es compatible con 1080P?
Sí. Wan 2.7 I2V admite salida de 720P y 1080P. El primer y último fotograma hereda ambos. 1080P consume aproximadamente el doble de créditos por segundo que 720P, así que itere a 720P y finalice a 1080P.
Véalo en acción