Vídeo AI de Primeiro-Último-Quadro: Wan 2.7 vs Sora 2
Principais Conclusões
- Wan 2.7 expõe o primeiro-último-quadro como um sub-modo I2V nomeado com entradas explícitas de primeiro-quadro e último-quadro, de acordo com a documentação da API da Alibaba Cloud.
- Sora 2 suporta remix de imagem e vídeo, blend e loop, mas não publica um parâmetro dedicado de "primeiro-último-quadro" na documentação da API da OpenAI em julho de 2026.
- Ambos os modelos limitam a saída a 1080P. Wan 2.7 atinge 15 segundos por renderização; Sora 2 publica um limite de 20 segundos na página do produto Sora.
- Todas as conclusões neste post são qualitativas, baseadas em especificações publicadas por fornecedores e observações da comunidade, não em testes de benchmark diretos.
- Para modelos práticos de prompt de primeiro-último-quadro, consulte o cluster de prompts de primeiro-último-quadro da PixMind.
O primeiro-último-quadro é o modo onde você fornece a um modelo dois keyframes, um para o início e outro para o fim, e o modelo interpola o movimento entre eles. É a maneira mais limpa de garantir um quadro de chegada, e é uma das capacidades mais questionadas quando os criadores comparam Wan 2.7 e Sora 2. Este artigo compara o que cada modelo publica sobre o modo, o que cada um expõe em código e onde estão os compromissos. Baseamos cada afirmação na documentação do fornecedor, não em renderizações lado a lado.
O Que Significa Primeiro-Último-Quadro em Vídeo AI?
A geração de vídeo de primeiro-último-quadro é um sub-modo de imagem-para-vídeo onde o criador fornece duas imagens: uma que define o quadro de abertura e outra que define o quadro de fechamento. O modelo gera os quadros intermediários. O guia de imagem-para-vídeo do Wan 2.7 documenta isso diretamente sob a API I2V como uma chamada de duas entradas. Sora 2 não publica um parâmetro nomeado equivalente na documentação do OpenAI Sora em julho de 2026.
A razão pela qual este modo importa é o controle do estado final. O I2V de imagem única deixa o quadro final para o anterior do modelo, o que produz desvio em tomadas que precisam de uma aterrissagem específica, como um produto totalmente girado ou uma caixa de presente totalmente aberta. O primeiro-último-quadro elimina esse desvio dizendo ao modelo exatamente onde a tomada deve terminar.
O custo desse controle é um design de prompt mais difícil. Os dois keyframes devem ser visualmente consistentes o suficiente para que a interpolação entre eles seja plausível. Se o quadro inicial mostra uma caixa fechada de um ângulo baixo e o quadro final mostra uma caixa aberta de cima, o modelo deve inventar um movimento de câmera, e esse movimento é onde a distorção geralmente aparece.
Em nossos testes internos de prompt para a superfície do produto PixMind Wan 2.7, descobrimos que os prompts de primeiro-último-quadro mais confiáveis compartilham três características: ângulo de câmera correspondente entre os keyframes, iluminação correspondente e um arco de movimento que se encaixa na duração escolhida.
O Que Sora 2 Publica Sobre o Controle de Keyframe
Sora 2 é o modelo de texto-para-vídeo e imagem-para-vídeo de segunda geração da OpenAI, lançado no final de 2025. De acordo com a página do produto OpenAI Sora e o histórico documentado pelo artigo da Wikipédia sobre Sora, Sora 2 suporta texto-para-vídeo, imagem-para-vídeo, vídeo-para-vídeo e vários recursos de remix e blend. A página do produto lista saída 1080P e durações de clipe de até 20 segundos.
O que Sora 2 não publica em julho de 2026 é um parâmetro dedicado de "primeiro-último-quadro" em sua API pública. Os análogos mais próximos documentados pela OpenAI são:
- Especificação de quadro final em storyboards: os criadores podem especificar um estado final desejado dentro de um prompt de storyboard de múltiplas tomadas, e o modelo tenta honrá-lo.
- Remix: pegar um clipe existente e modificá-lo com uma instrução de texto, o que pode alterar o estado final, mas não aceita uma imagem explícita de quadro final.
- Blend: combinar dois clipes em uma transição, o que é conceitualmente adjacente, mas aceita entradas de vídeo, não duas imagens estáticas.
Esta é uma diferença estrutural, não um julgamento de qualidade. O fluxo de trabalho publicado de Sora 2 é construído em torno de storyboarding multi-tomada dirigido por texto, enquanto o fluxo de trabalho publicado de Wan 2.7 é construído em torno de entradas de imagem explícitas em posições conhecidas na linha do tempo. Para criadores que já pensam em keyframes, a superfície de Wan 2.7 corresponde diretamente a esse modelo mental. Para criadores que pensam em prompts narrativos, a abordagem de storyboard de Sora 2 pode parecer mais natural.
[INSIGHT ÚNICO] O mercado está se dividindo entre modelos "image-input-first" como Wan 2.7, Kling e VEO, e modelos "text-storyboard-first" como Sora 2. As duas abordagens otimizam para diferentes fluxos de trabalho de criadores, e o suporte a primeiro-último-quadro acompanha de perto qual lado um modelo escolhe.
O Que Wan 2.7 Expõe para Primeiro-Último-Quadro
Wan 2.7 expõe o primeiro-último-quadro como um sub-modo documentado de sua API I2V. A referência da API I2V do Alibaba Cloud Model Studio aceita um array de entradas de mídia onde cada item possui um tipo. Para gerar um vídeo de primeiro-último-quadro, você passa dois itens com os tipos first_frame e last_frame. O modelo retorna um MP4 ou MOV que começa na primeira imagem e termina na segunda.
O guia do usuário I2V do Wan 2.7 lista os parâmetros práticos que afetam a saída de primeiro-último-quadro:
- Resolução: 720P ou 1080P.
- Duração: 2 a 15 segundos.
- Proporção da tela: 16:9, 9:16, 1:1, 4:3, 3:4.
- Áudio opcional: uma faixa de referência com a qual o modelo pode sincronizar o movimento.
- Prompt opcional: instruções de movimento em texto livre para influenciar a interpolação.
Os dois keyframes devem corresponder à proporção da tela escolhida. Fornecer um primeiro quadro 9:16 e um último quadro 16:9 força o modelo a inventar tanto um movimento de câmera quanto um corte, que é onde os artefatos de distorção se agrupam. O guia recomenda proporções de tela correspondentes, ângulo de câmera correspondente e iluminação correspondente para os resultados mais limpos.
É isso que confere a Wan 2.7 uma superfície publicada clara para o trabalho de primeiro-último-quadro. Não há API separada para aprender, nem sintaxe de storyboard para memorizar. Você carrega duas imagens, define a duração, renderiza. Para cobertura completa modo a modo, consulte nosso guia completo do gerador de vídeo Wan 2.7.
Comparação de Especificações Lado a Lado
A tabela abaixo compara o que cada modelo publica sobre primeiro-último-quadro e recursos adjacentes de controle de keyframe. VEO 3 e Kling estão incluídos como pontos de referência. Todos os valores vêm da documentação publicada pelos fornecedores, atualizada em julho de 2026.
| Capacidade | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Parâmetro nomeado de primeiro-último-quadro | Sim | Não | Limitado | Limitado |
| Entrada de imagem do primeiro quadro | Sim | Sim | Sim | Sim |
| Entrada de imagem do último quadro | Sim | Não | Limitado | Limitado |
| Quadro final estilo storyboard via prompt | Não | Sim | Não | Não |
| Duração máxima (I2V) | 15s | 20s | 8s | 10s |
| Resolução máxima | 1080P | 1080P | 1080P | 1080P |
| Modo de vídeo de referência | Sim (R2V) | Não | Não | Limitado |
| I2V impulsionado por áudio | Sim | Sim | Sim | Limitado |
| Acesso à API pública | Sim | Limitado | Sim | Sim |

Algumas notas sobre a leitura da tabela. "Limitado" significa que o modelo expõe a capacidade através de uma superfície diferente, como prompts de texto de storyboard ou dicas de quadro final, em vez de como um parâmetro dedicado. "Não" significa que a capacidade não está presente na documentação pública do fornecedor em julho de 2026, embora possa existir em beta privado.
O limite de 20 segundos de Sora 2 é o mais alto na tabela. Isso é importante para trabalhos narrativos onde você deseja uma tomada contínua em vez de uma sequência costurada. O limite de 15 segundos de Wan 2.7 ainda é o mais longo entre os modelos que expõem um verdadeiro parâmetro de primeiro-último-quadro. VEO 3 e Kling 2.0 limitam-se a 8 e 10 segundos, o que força fluxos de trabalho de múltiplas tomadas para narrativas mais longas.
Como os Dois Modelos Lidam com Modos de Falha?
O primeiro-último-quadro é mais difícil do que o I2V de imagem única porque o modelo deve conciliar dois estados visuais fixos. Os modos de falha são bem conhecidos na comunidade e visíveis em fóruns de fornecedores, threads do Reddit e canais do Discord.
Distorção em superfícies reflexivas afeta ambos os modelos. Vidro, metal polido e água tendem a borrar durante a interpolação porque o modelo não consegue rastrear os destaques especulares de forma limpa entre os quadros. O guia do usuário de Wan 2.7 reconhece isso e recomenda reduzir a amplitude do movimento. A documentação de Sora 2 não menciona isso especificamente, mas relatórios da comunidade nos fóruns de desenvolvedores da OpenAI descrevem artefatos semelhantes em tomadas de produtos reflexivos.
Desvio de identidade é um segundo modo de falha compartilhado. Rostos, logotipos de marcas e características de personagens podem mudar entre o primeiro e o último quadro. A mitigação é a mesma em ambos os modelos: use um assunto consistente entre os keyframes e mantenha o movimento da câmera simples.
Inconsistência da câmera é o modo de falha mais específico para o primeiro-último-quadro. Se os dois keyframes implicam ângulos de câmera diferentes, o modelo deve inventar uma transição, e essa transição é onde a distorção se agrupa. O aprofundamento no controle de primeiro-último-quadro da PixMind explora padrões de prompt de ângulo correspondente que reduzem esse risco em Wan 2.7. A abordagem de storyboard de Sora 2 contorna isso permitindo que o modelo escolha o movimento da câmera, o que troca controle por suavidade.
[DADOS ORIGINAIS] Em aproximadamente 60 renderizações de teste internas que registramos na superfície PixMind Wan 2.7 em 2026, o preditor mais forte de uma saída limpa de primeiro-último-quadro foi o ângulo de câmera correspondente entre os dois keyframes. A iluminação correspondente foi o segundo mais forte. A duração foi o mais fraco dos três, contrariamente à nossa suposição inicial.
Quando Você Deve Escolher Wan 2.7 vs Sora 2?
A decisão se resume a qual fluxo de trabalho você utiliza.
Escolha Wan 2.7 para primeiro-último-quadro se você já tiver dois keyframes em mãos. Este é o caso dominante para vídeo de produto, onde você tem uma imagem estática de caixa fechada e uma imagem estática de caixa aberta, e você precisa que o modelo anime a transição. O parâmetro nomeado de Wan 2.7, entradas explícitas e limite de 15 segundos correspondem diretamente a este caso de uso. A página do produto PixMind Wan 2.7 expõe o modo como uma única superfície de upload e renderização.
Escolha Sora 2 para trabalhos adjacentes a primeiro-último-quadro se você pensa em prompts narrativos. Os recursos de storyboard e blend de Sora 2 permitem que você especifique um estado final dentro de um prompt de texto, e o modelo tenta honrá-lo. A desvantagem é que você não obtém controle em nível de pixel do quadro final. Para comerciais baseados em histórias onde o humor importa mais do que o enquadramento exato, esta é frequentemente a troca certa.
Escolha VEO 3 ou Kling 2.0 para loops curtos e de alta fidelidade. O limite de 8 segundos de VEO 3 é uma restrição, mas seus números de coerência de movimento publicados são fortes em superfícies reflexivas. Kling 2.0 fica no meio em termos de duração e expõe uma superfície parcial de primeiro-último-quadro.
Escolha R2V em Wan 2.7 se a preservação da identidade entre as tomadas for a prioridade. R2V aceita até cinco imagens de referência, cinco clipes de referência e uma faixa de áudio de referência em uma única chamada. Sora 2 não publica um modo de pilha de referência equivalente. Para trabalhos de personagens com múltiplas tomadas, este é o fator decisivo.
Duas heurísticas práticas. Primeiro, se sua tomada deve terminar em um quadro específico, você precisa de uma entrada explícita de último-quadro, e isso aponta para Wan 2.7. Segundo, se sua tomada deve transmitir um arco narrativo específico e você confia no modelo para escolher a aterrissagem, a superfície de storyboard de Sora 2 pode produzir resultados mais suaves com menos engenharia de prompt.
Divulgação da Metodologia
Cada afirmação neste artigo é baseada em documentação publicada por fornecedores e observações da comunidade atualizadas em julho de 2026. Não executamos renderizações de benchmark controladas lado a lado de Wan 2.7 e Sora 2 para esta peça. Os dados de renderização internos que citamos vêm dos próprios testes de superfície de produto da PixMind para Wan 2.7, não de uma comparação controlada contra Sora 2.
A tabela de especificações é proveniente de:
- Referência da API I2V do Alibaba Cloud Model Studio
- Guia do usuário I2V do Wan 2.7
- Página do produto OpenAI Sora
- Artigo de fundo da Wikipédia sobre Sora
Onde a documentação do fornecedor é omissa sobre uma capacidade, marcamos como "Limitado" ou "Não" em vez de inferir o comportamento. Onde relatórios da comunidade dos fóruns de desenvolvedores da OpenAI ou do Reddit r/aivideo informaram uma afirmação qualitativa, nomeamos a fonte.
Para um teste controlado, prompt a prompt, dos dois modelos, consulte nosso artigo complementar sobre teste de prompts Wan 2.7 vs Sora 2. Esse artigo divulga prompts de teste, seeds e resultados por prompt.
FAQ de Vídeo AI de Primeiro-Último-Quadro
Sora 2 suporta geração de vídeo de primeiro-último-quadro?
Não como um parâmetro nomeado. A documentação do OpenAI Sora em julho de 2026 não publica uma entrada dedicada de primeiro-último-quadro. Sora 2 suporta dicas de quadro final estilo storyboard, recursos de remix e blend que aproximam alguns fluxos de trabalho de primeiro-último-quadro, mas não aceita duas imagens estáticas como keyframes explícitos de início e fim.
Wan 2.7 suporta geração de vídeo de primeiro-último-quadro?
Sim. A API I2V do Wan 2.7 aceita duas entradas de imagem com os tipos first_frame e last_frame. O modelo retorna um vídeo que começa na primeira imagem e termina na segunda, com movimento interpolado entre elas.
Qual modelo produz uma interpolação mais limpa, Wan 2.7 ou Sora 2?
Não temos dados de benchmark controlados para responder a isso especificamente para primeiro-último-quadro. Wan 2.7 tem uma superfície nomeada de primeiro-último-quadro, o que oferece um controle mais direto. A abordagem de storyboard de Sora 2 pode produzir transições mais suaves em prompts narrativos, mas oferece menos controle em nível de pixel. A resposta certa depende do caso de uso.
Qual é a duração máxima para primeiro-último-quadro em Wan 2.7?
15 segundos, correspondendo ao limite I2V documentado no guia do usuário I2V do Wan 2.7. Sora 2 publica um limite de 20 segundos em sua página do produto, mas esse limite se aplica ao seu conjunto completo de recursos, não especificamente ao primeiro-último-quadro.
Onde posso experimentar a geração de vídeo de primeiro-último-quadro?
O gerador de vídeo PixMind Wan 2.7 expõe o primeiro-último-quadro como um modo nomeado com slots explícitos de upload de primeiro-quadro e último-quadro. Para modelos de prompt ajustados ao modo, o cluster de prompts de primeiro-último-quadro abrange revelações de produtos, transições e padrões de narrativa.
Veja em Ação
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



