Video IA de Primer-Último-Frame: Wan 2.7 vs Sora 2
Puntos Clave
- Wan 2.7 expone el primer-último-frame como un sub-modo I2V nombrado con entradas explícitas de primer-frame y último-frame, según la documentación de la API de Alibaba Cloud.
- Sora 2 admite la remezcla, mezcla y bucle de imágenes y videos, pero no publica un parámetro dedicado de "primer-último-frame" en la documentación de la API de OpenAI a partir de julio de 2026.
- Ambos modelos limitan la salida a 1080P. Wan 2.7 alcanza los 15 segundos por renderización; Sora 2 publica un límite de 20 segundos en la página del producto Sora.
- Todas las conclusiones de esta publicación son cualitativas, basadas en las especificaciones publicadas por los proveedores y las observaciones de la comunidad, no en pruebas comparativas directas.
- Para plantillas de prompt prácticas de primer-último-frame, consulte el clúster de prompts de primer-último-frame de PixMind.
El primer-último-frame es el modo en el que se le dan a un modelo dos fotogramas clave, uno para el inicio y otro para el final, y el modelo interpola el movimiento intermedio. Es la forma más limpia de garantizar un fotograma de aterrizaje, y es una de las capacidades más consultadas cuando los creadores comparan Wan 2.7 y Sora 2. Este artículo compara lo que cada modelo publica sobre el modo, lo que cada uno expone en código y dónde residen los compromisos. Basamos cada afirmación en la documentación del proveedor, no en renderizaciones lado a lado.
¿Qué Significa Primer-Último-Frame en Video IA?
La generación de video de primer-último-frame es un sub-modo de imagen-a-video donde el creador proporciona dos imágenes: una que define el fotograma de apertura y otra que define el fotograma de cierre. El modelo genera los fotogramas intermedios. La guía de imagen-a-video de Wan 2.7 documenta esto directamente bajo la API I2V como una llamada de dos entradas. Sora 2 no publica un parámetro nombrado equivalente en la documentación de OpenAI Sora a partir de julio de 2026.
La razón por la que este modo es importante es el control del estado final. El I2V de una sola imagen deja el fotograma final al modelo, lo que produce una deriva en tomas que necesitan un aterrizaje específico, como un producto completamente girado o una caja de regalo completamente abierta. El primer-último-frame colapsa esa deriva al indicarle al modelo exactamente dónde debe terminar la toma.
El costo de ese control es un diseño de prompt más difícil. Los dos fotogramas clave deben ser visualmente lo suficientemente consistentes para que la interpolación entre ellos sea plausible. Si el fotograma inicial muestra una caja cerrada desde un ángulo bajo y el fotograma final muestra una caja abierta desde arriba, el modelo debe inventar un movimiento de cámara, y ese movimiento es donde típicamente aparece la deformación.
En nuestras pruebas internas de prompts para la superficie del producto PixMind Wan 2.7, hemos descubierto que los prompts de primer-último-frame más fiables comparten tres características: ángulo de cámara coincidente entre fotogramas clave, iluminación coincidente y un arco de movimiento que encaja dentro de la duración elegida.
Lo que Sora 2 Publica sobre el Control de Fotogramas Clave
Sora 2 es el modelo de texto-a-video e imagen-a-video de segunda generación de OpenAI, lanzado a finales de 2025. Según la página del producto OpenAI Sora y la información documentada por el artículo de Wikipedia sobre Sora, Sora 2 admite texto-a-video, imagen-a-video, video-a-video y varias funciones de remezcla y mezcla. La página del producto enumera una salida de 1080P y duraciones de clips de hasta 20 segundos.
Lo que Sora 2 no publica a partir de julio de 2026 es un parámetro dedicado de "primer-último-frame" en su API pública. Los análogos más cercanos documentados por OpenAI son:
- Especificación de fotograma final en guiones gráficos: los creadores pueden especificar un estado final deseado dentro de un prompt de guion gráfico de múltiples tomas, y el modelo intenta respetarlo.
- Remezcla: tomar un clip existente y modificarlo con una instrucción de texto, lo que puede cambiar el estado final pero no acepta una imagen explícita de fotograma final.
- Mezcla: combinar dos clips en una transición, lo cual es conceptualmente adyacente pero toma entradas de video, no dos imágenes fijas.
Esta es una diferencia estructural, no un juicio de calidad. El flujo de trabajo publicado de Sora 2 se basa en guiones gráficos de múltiples tomas dirigidos por texto, mientras que el flujo de trabajo publicado de Wan 2.7 se basa en entradas de imagen explícitas en posiciones conocidas en la línea de tiempo. Para los creadores que ya piensan en fotogramas clave, la superficie de Wan 2.7 coincide directamente con ese modelo mental. Para los creadores que piensan en prompts narrativos, el enfoque de guion gráfico de Sora 2 puede resultar más natural.
[INSIGHT ÚNICO] El mercado se está dividiendo entre modelos "primero-entrada-de-imagen" como Wan 2.7, Kling y VEO, y modelos "primero-guion-gráfico-de-texto" como Sora 2. Los dos enfoques optimizan diferentes flujos de trabajo de creadores, y el soporte de primer-último-frame sigue de cerca el lado que elige un modelo.
Lo que Wan 2.7 Expone para Primer-Último-Frame
Wan 2.7 expone el primer-último-frame como un sub-modo documentado de su API I2V. La referencia de la API I2V de Alibaba Cloud Model Studio acepta un array de entradas de medios donde cada elemento lleva un tipo. Para generar un video de primer-último-frame, se pasan dos elementos con los tipos first_frame y last_frame. El modelo devuelve un MP4 o MOV que comienza con la primera imagen y termina con la segunda.
La guía de usuario de Wan 2.7 I2V enumera los parámetros prácticos que afectan la salida de primer-último-frame:
- Resolución: 720P o 1080P.
- Duración: 2 a 15 segundos.
- Relación de aspecto: 16:9, 9:16, 1:1, 4:3, 3:4.
- Audio opcional: una pista de referencia con la que el modelo puede sincronizar el movimiento.
- Prompt opcional: instrucciones de movimiento de texto libre para sesgar la interpolación.
Los dos fotogramas clave deben coincidir con la relación de aspecto elegida. Alimentar un primer fotograma 9:16 y un último fotograma 16:9 obliga al modelo a inventar tanto un movimiento de cámara como un recorte, que es donde se agrupan los artefactos de deformación. La guía recomienda relaciones de aspecto, ángulo de cámara e iluminación coincidentes para obtener los resultados más limpios.
Esto es lo que le da a Wan 2.7 una superficie publicada clara para el trabajo de primer-último-frame. No hay una API separada que aprender, ni sintaxis de guion gráfico que memorizar. Se suben dos imágenes, se establece la duración, se renderiza. Para una cobertura completa modo por modo, consulte nuestra guía completa del generador de video Wan 2.7.
Comparación de Especificaciones Lado a Lado
La siguiente tabla compara lo que cada modelo publica sobre el primer-último-frame y las características adyacentes de control de fotogramas clave. VEO 3 y Kling se incluyen como puntos de referencia. Todos los valores provienen de la documentación publicada por los proveedores, actualizada a julio de 2026.
| Capacidad |
Wan 2.7 |
Sora 2 |
VEO 3 |
Kling 2.0 |
| Parámetro nombrado de primer-último-frame |
Sí |
No |
Limitado |
Limitado |
| Entrada de imagen de primer-frame |
Sí |
Sí |
Sí |
Sí |
| Entrada de imagen de último-frame |
Sí |
No |
Limitado |
Limitado |
| Fotograma final estilo guion gráfico vía prompt |
No |
Sí |
No |
No |
| Duración máxima (I2V) |
15s |
20s |
8s |
10s |
| Resolución máxima |
1080P |
1080P |
1080P |
1080P |
| Modo de video de referencia |
Sí (R2V) |
No |
No |
Limitado |
| I2V impulsado por audio |
Sí |
Sí |
Sí |
Limitado |
| Acceso a API pública |
Sí |
Limitado |
Sí |
Sí |

Algunas notas sobre la lectura de la tabla. "Limitado" significa que el modelo expone la capacidad a través de una superficie diferente, como prompts de texto de guion gráfico o sugerencias de fotograma final, en lugar de como un parámetro dedicado. "No" significa que la capacidad no está presente en la documentación pública del proveedor a partir de julio de 2026, aunque puede existir en beta privada.
El límite de 20 segundos de Sora 2 es el más alto de la tabla. Esto es importante para el trabajo narrativo donde se desea una toma continua en lugar de una secuencia unida. El límite de 15 segundos de Wan 2.7 sigue siendo el más largo entre los modelos que exponen un verdadero parámetro de primer-último-frame. VEO 3 y Kling 2.0 tienen límites de 8 y 10 segundos, lo que obliga a flujos de trabajo de múltiples tomas para narrativas más largas.
¿Cómo Manejan los Dos Modelos los Modos de Falla?
El primer-último-frame es más difícil que el I2V de una sola imagen porque el modelo debe conciliar dos estados visuales fijos. Los modos de falla son bien conocidos en la comunidad y visibles en foros de proveedores, hilos de Reddit y canales de Discord.
La deformación en superficies reflectantes afecta a ambos modelos. El vidrio, el metal pulido y el agua tienden a difuminarse durante la interpolación porque el modelo no puede seguir los reflejos especulares de manera limpia a través de los fotogramas. La guía de usuario de Wan 2.7 lo reconoce y recomienda reducir la amplitud del movimiento. La documentación de Sora 2 no lo menciona específicamente, pero los informes de la comunidad en los foros de desarrolladores de OpenAI describen artefactos similares en tomas de productos reflectantes.
La deriva de identidad es un segundo modo de falla compartido. Las caras, los logotipos de marcas y las características de los personajes pueden cambiar entre el primer y el último fotograma. La mitigación es la misma en ambos modelos: usar un sujeto consistente entre fotogramas clave y mantener el movimiento de la cámara simple.
La inconsistencia de la cámara es el modo de falla más específico del primer-último-frame. Si los dos fotogramas clave implican diferentes ángulos de cámara, el modelo debe inventar una transición, y esa transición es donde se agrupan las deformaciones. La inmersión profunda en el control de primer-último-frame de PixMind explica patrones de prompt de ángulo coincidente que reducen este riesgo en Wan 2.7. El enfoque de guion gráfico de Sora 2 evita esto al permitir que el modelo elija el movimiento de la cámara, lo que intercambia control por suavidad.
[DATOS ORIGINALES] A lo largo de aproximadamente 60 renderizaciones de prueba internas que hemos registrado en la superficie de PixMind Wan 2.7 en 2026, el predictor más fuerte de una salida limpia de primer-último-frame fue el ángulo de cámara coincidente entre los dos fotogramas clave. La iluminación coincidente fue el segundo más fuerte. La duración fue el más débil de los tres, contrariamente a nuestra suposición inicial.
¿Cuándo Deberías Elegir Wan 2.7 vs Sora 2?
La decisión se reduce al flujo de trabajo en el que te encuentres.
Elige Wan 2.7 para primer-último-frame si ya tienes dos fotogramas clave a mano. Este es el caso dominante para videos de productos, donde tienes una imagen fija de una caja cerrada y una de una caja abierta, y necesitas que el modelo anime la transición. El parámetro nombrado de Wan 2.7, las entradas explícitas y el límite de 15 segundos coinciden directamente con este caso de uso. La página del producto PixMind Wan 2.7 expone el modo como una única superficie de carga y renderización.
Elige Sora 2 para trabajos adyacentes a primer-último-frame si piensas en prompts narrativos. Las funciones de guion gráfico y mezcla de Sora 2 te permiten especificar un estado final dentro de un prompt de texto, y el modelo intenta respetarlo. La desventaja es que no obtienes control a nivel de píxel del fotograma de cierre. Para comerciales basados en historias donde el ambiente importa más que el encuadre exacto, este suele ser el intercambio correcto.
Elige VEO 3 o Kling 2.0 para bucles cortos y de alta fidelidad. El límite de 8 segundos de VEO 3 es una restricción, pero sus números publicados de coherencia de movimiento son fuertes en superficies reflectantes. Kling 2.0 se sitúa en el medio en cuanto a duración y expone una superficie parcial de primer-último-frame.
Elige R2V en Wan 2.7 si la preservación de la identidad a través de las tomas es la prioridad. R2V acepta hasta cinco imágenes de referencia, cinco clips de referencia y una pista de audio de referencia en una sola llamada. Sora 2 no publica un modo de pila de referencia equivalente. Para trabajos de personajes de múltiples tomas, este es el factor decisivo.
Dos heurísticas prácticas. Primero, si tu toma debe aterrizar en un fotograma específico, necesitas una entrada explícita del último fotograma, y eso apunta a Wan 2.7. Segundo, si tu toma debe transmitir un arco narrativo específico y confías en que el modelo elija el aterrizaje, la superficie de guion gráfico de Sora 2 puede producir resultados más suaves con menos ingeniería de prompts.
Divulgación de Metodología
Cada afirmación en este artículo se basa en la documentación publicada por los proveedores y las observaciones de la comunidad actualizadas a julio de 2026. No realizamos renderizaciones de referencia controladas lado a lado de Wan 2.7 y Sora 2 para esta pieza. Los datos de renderización internos que citamos provienen de las propias pruebas de superficie de producto de PixMind de Wan 2.7, no de una comparación controlada con Sora 2.
La tabla de especificaciones se obtuvo de:
Cuando la documentación del proveedor guarda silencio sobre una capacidad, la marcamos como "Limitado" o "No" en lugar de inferir el comportamiento. Cuando los informes de la comunidad de los foros de desarrolladores de OpenAI o Reddit r/aivideo informaron una afirmación cualitativa, nombramos la fuente.
Para una prueba controlada y a nivel de prompt de los dos modelos, consulte nuestro artículo complementario sobre pruebas de prompts de Wan 2.7 vs Sora 2. Ese artículo revela los prompts de prueba, las semillas y los resultados por prompt.
Preguntas Frecuentes sobre Video IA de Primer-Último-Frame
¿Sora 2 admite la generación de video de primer-último-frame?
No como un parámetro nombrado. La documentación de OpenAI Sora a partir de julio de 2026 no publica una entrada dedicada de primer-último-frame. Sora 2 admite sugerencias de fotograma final estilo guion gráfico, remezcla y funciones de mezcla que se aproximan a algunos flujos de trabajo de primer-último-frame, pero no acepta dos imágenes fijas como fotogramas clave explícitos de inicio y fin.
¿Wan 2.7 admite la generación de video de primer-último-frame?
Sí. La API I2V de Wan 2.7 acepta dos entradas de imagen con los tipos first_frame y last_frame. El modelo devuelve un video que comienza con la primera imagen y termina con la segunda, con movimiento interpolado entre ellas.
¿Qué modelo produce una interpolación más limpia, Wan 2.7 o Sora 2?
No tenemos datos de referencia controlados para responder a esto específicamente para primer-último-frame. Wan 2.7 tiene una superficie de primer-último-frame nombrada, lo que proporciona un control más directo. El enfoque de guion gráfico de Sora 2 puede producir transiciones más suaves en prompts narrativos, pero ofrece menos control a nivel de píxel. La respuesta correcta depende del caso de uso.
¿Cuál es la duración máxima para primer-último-frame en Wan 2.7?
15 segundos, coincidiendo con el límite I2V documentado en la guía de usuario de Wan 2.7 I2V. Sora 2 publica un límite de 20 segundos en su página de producto, pero ese límite se aplica a su conjunto completo de características, no específicamente a primer-último-frame.
¿Dónde puedo probar la generación de video de primer-último-frame?
El generador de video PixMind Wan 2.7 expone el primer-último-frame como un modo nombrado con ranuras explícitas de carga de primer-frame y último-frame. Para plantillas de prompt ajustadas al modo, el clúster de prompts de primer-último-frame cubre revelaciones de productos, transiciones y patrones de narración.
Míralo en Acción