
첫 프레임-마지막 프레임 AI 비디오: Wan 2.7 vs Sora 2 (사양, 모드 및 장단점)
Wan 2.7과 Sora 2는 모두 키프레임에서 비디오를 생성하지만, 서로 다른 제어 방식을 제공합니다. 다음은 2026년 7월 기준으로 공급업체가 공개한 사양을 기반으로 한 비교입니다.
더 읽기
첫 프레임-마지막 프레임은 Wan 2.7 이미지-투-비디오(I2V)의 하위 모드입니다. 첫 프레임용 이미지 하나와 마지막 프레임용 이미지 하나, 총 두 개의 이미지를 제공합니다. Wan 2.7은 이들을 연결하는 중간 프레임을 생성합니다. Alibaba Cloud I2V API reference에 따르면, 모델은 정렬된 이미지 입력 쌍을 받아 최대 1080P의 MP4를 출력합니다.
이는 단일 이미지 I2V가 최종 상태를 모델에 맡기기 때문에 중요합니다. 만약 특정 프레임에 샷이 착지해야 한다면(예: 완전히 회전된 제품 또는 완전히 열린 상자), 첫 프레임-마지막 프레임 모드가 이를 보장하는 방법입니다. 모드 컨텍스트에 대해서는 모든 I2V 하위 모드를 처리하는 단일 생성 표면을 제공하는 PixMind Wan 2.7 video generator를 참조하십시오.
핵심 워크플로우는 5단계입니다: 두 개의 키프레임 준비, 순서대로 업로드, 지속 시간 설정, 전환 프롬프트 작성, 그리고 렌더링 및 평가. 각 단계에는 렌더링 성공 여부를 결정하는 단일 결정이 있습니다.
키프레임 품질은 깨끗한 첫 프레임-마지막 프레임 렌더링의 가장 큰 예측 변수입니다. Wan 2.7 image-to-video user guide는 두 프레임 모두에서 구성, 조명 및 카메라 각도를 일치시킬 것을 권장합니다. 일치하지 않는 키프레임은 모델이 전환을 만들어내도록 강제하며, 여기서 왜곡과 정체성 표류가 나타나는 것을 발견했습니다.
세 가지 일관성 규칙이 대부분의 경우를 다룹니다. 두 피사체를 동일한 화면 위치에 배치하여 구성을 일치시킵니다. 동일한 주광 방향과 색온도를 유지하여 조명을 일치시킵니다. 초점 거리, 각도 및 거리를 일정하게 유지하여 카메라를 일치시킵니다. 이 규칙 중 하나라도 어기면 모델은 불연속성을 보간해야 합니다.
인용 요약: 키프레임 일관성은 Wan 2.7 첫 프레임-마지막 프레임 품질의 주요 요인입니다. Alibaba Cloud 이미지-투-비디오 사용자 가이드는 왜곡 및 정체성 표류를 유발하는 모델이 만들어낸 전환을 피하기 위해 두 입력 프레임 모두에서 구성, 조명 및 카메라 각도를 일치시킬 것을 권장합니다.
첫 프레임은 35mm로, 마지막 프레임은 50mm로 촬영된 쌍을 테스트하면서 크레딧을 낭비했습니다. 모델은 클립 중간에 거슬리는 "스냅"을 생성했습니다. 생성하기 전에 초점 거리를 고정하십시오.
Wan 2.7은 두 프레임을 정의된 순서대로 예상합니다. 전달하는 첫 번째 이미지는 시작 상태가 되고, 두 번째 이미지는 종료 상태가 됩니다. Alibaba Cloud Model Studio overview에 따르면, I2V 호출은 이미지 URL 또는 base64 인코딩된 페이로드를 허용하며, 모델은 입력 배열을 정렬된 시퀀스로 처리합니다.
순서는 사람들이 예상하는 것보다 더 중요합니다. 열린 상자 이미지를 먼저 업로드하고 닫힌 상자 이미지를 두 번째로 업로드하면 닫히는 애니메이션을 얻습니다. 순서를 바꾸면 열리는 애니메이션을 얻습니다. 모델은 프롬프트만으로 의도를 추론하지 않습니다. 프레임 시퀀스가 방향에 대한 진실의 원천입니다.
두 프레임 모두 목표 출력과 동일한 종횡비를 공유해야 합니다. 9:16 첫 프레임과 1:1 마지막 프레임을 제공하면 잘라내기가 강제되며, 잘라내기는 가장자리에 아티팩트를 유발합니다. 업로드하기 전에 두 프레임 모두 출력 해상도로 크기를 조정하십시오.
실용적인 크기 조정 방법: 1080P에서 16:9 출력의 경우 1920x1080, 9:16의 경우 1080x1920, 1:1의 경우 1080x1080을 목표로 합니다. 느린 연결에서 시간 초과 실패를 피하기 위해 각 프레임의 파일 크기를 10MB 미만으로 유지하십시오.
시퀀스를 명확하게 알 수 있도록 파일 이름을 지정하십시오. keyframe-01-closed.png 및 keyframe-02-open.png는 업로드 시 추측을 없애줍니다. 이는 사소하게 들리지만, 순서가 뒤바뀐 업로드는 우리가 보는 두 번째로 흔한 실패입니다.
지속 시간은 모델이 두 키프레임 사이에 생성해야 하는 보간 프레임 수를 제어합니다. 지속 시간이 길수록 보간이 많아지고, 이는 모델이 표류할 가능성이 더 많아진다는 것을 의미합니다. Wan 2.7 I2V API reference는 I2V에 대해 2초에서 15초까지의 지속 시간을 지원합니다.
새로운 키프레임 쌍에 대해서는 2초에서 5초로 시작하는 것을 권장합니다. 짧은 렌더링은 실패 모드를 저렴하게 드러냅니다. 모델이 3초 동안 깨끗하게 보간할 수 있다면, 다음 시도에서 8초 또는 10초로 자신 있게 확장할 수 있습니다.
인용 요약: Wan 2.7 I2V는 2초에서 15초까지의 지속 시간을 지원하지만, 크레딧 비용은 지속 시간에 비례하여 증가합니다. 2초에서 5초로 테스트하면 10초 렌더링 비용의 일부만으로 왜곡, 표류 및 카메라 점프 실패 모드를 발견할 수 있습니다.
짧은 지속 시간은 작은 움직임에 적합합니다. 3초 렌더링은 상자에서 뚜껑이 들어 올려지는 움직임에 맞습니다. 5초 렌더링은 캐릭터가 뒤에서 앞으로 도는 움직임에 맞습니다. 8초를 넘어가면 모델은 어떤 키프레임도 암시하지 않는 중간 움직임을 만들어내야 하며, 여기서 환각적인 움직임이 발생합니다.
지속 시간은 비용을 선형적으로 증가시킵니다. 10초 1080P 렌더링은 2초 1080P 렌더링 비용의 약 5배입니다. 10초로 테스트하여 실패하면 사용할 수 없는 렌더링에 대해 전액을 지불하게 됩니다. 짧게 테스트한 다음 확정하십시오.
첫 프레임-마지막 프레임 모드의 프롬프트는 두 프레임 사이의 움직임을 설명합니다. 피사체를 다시 설명하지 않습니다. 키프레임이 이미 그 역할을 합니다. PixMind first-last-frame prompts cluster는 아래 세 가지 예시를 위한 프롬프트 패턴을 분류합니다.
전환 프롬프트는 네 부분으로 구성됩니다: 동작, 속도, 카메라 동작, 그리고 스타일. 각 부분을 하나의 짧은 절로 유지하십시오. 긴 프롬프트는 모델의 주의를 분산시키고 부드럽지 않은 움직임을 생성합니다.
인용 요약: Wan 2.7 첫 프레임-마지막 프레임 모드의 전환 프롬프트는 피사체가 아닌 움직임을 설명해야 합니다. 효과적인 프롬프트는 동작, 속도, 카메라 동작 및 스타일의 네 부분을 다룹니다. 각 부분을 하나의 짧은 절로 구성하는 것이 키프레임이 이미 보여주는 것을 다시 설명하는 단락 길이의 프롬프트보다 더 나은 성능을 발휘합니다.
피사체를 다시 설명하려는 충동을 억제하십시오. 첫 번째 키프레임이 닫힌 선물 상자라면, 프롬프트에 "나무 테이블 위의 닫힌 선물 상자"라고 말할 필요가 없습니다. 모델은 이미 알고 있습니다. 다시 설명하는 것은 모델이 상자를 다시 렌더링하도록 유도하여 보간과 충돌합니다.
[고유한 통찰] 전환 프롬프트의 역할은 피사체를 선언하는 것이 아니라 움직임을 제약하는 것입니다. 의상을 이미 알고 있는 무용수를 위한 안무 노트로 취급하십시오.
모든 첫 프레임-마지막 프레임 렌더링은 명시적인 평가 단계를 거쳐야 합니다. 우리는 다섯 가지 축으로 평가하며, 각 축은 통과 또는 실패로 점수가 매겨집니다. 어떤 축에서든 실패한 렌더링은 최종 납품이 아니라 1단계 또는 4단계로 돌아갑니다.

다섯 가지 축은 정체성, 카메라, 조명, 움직임, 그리고 목표 프레임 정확도를 다룹니다. 처음 세 가지는 키프레임 품질에서 비롯됩니다. 마지막 두 가지는 프롬프트 및 지속 시간 선택에서 비롯됩니다.
인용 요약: Wan 2.7 첫 프레임-마지막 프레임 렌더링은 정체성 일관성, 카메라 연속성, 조명 연속성, 움직임 타당성, 그리고 목표 프레임 달성이라는 다섯 가지 이진 축으로 평가되어야 합니다. 어떤 축에서든 실패한 렌더링은 맹목적으로 다시 시도하기보다는 키프레임 또는 프롬프트 단계에서 다시 작업해야 합니다.
피사체가 모든 프레임에서 동일한 피사체처럼 보이나요? 캐릭터의 경우 얼굴 형태를 확인하십시오. 제품의 경우 실루엣과 브랜딩을 확인하십시오. 여기서의 표류는 일반적으로 각도에 동의하지 않는 키프레임에서 비롯됩니다.
카메라가 있어야 할 곳에 머무나요? 정적을 지정했다면 의도치 않은 푸시인을 확인하십시오. 푸시인을 지정했다면 움직임이 부드럽고 끊기지 않는지 확인하십시오.
조명 방향이 일정하게 유지되나요? 클립 중간에 그림자가 뒤집히는 것을 주시하십시오. 이는 모델이 프레임 사이에 광원을 바꿨음을 나타냅니다.
움직임이 물리적으로 신뢰할 수 있나요? 뚜껑은 상자를 통과하지 않습니다. 팔다리는 뒤로 굽히지 않습니다. 머리카락은 공중에서 얼어붙지 않습니다. 비현실적인 움직임은 일반적으로 프롬프트가 너무 짧은 지속 시간 안에 너무 많은 것을 요구했음을 의미합니다.
생성된 비디오의 마지막 프레임이 업로드한 마지막 프레임 이미지와 일치하나요? 이것이 이 모드의 이름을 부여하는 테스트입니다. 모델이 거의 비슷하지만 정확하지 않은 곳에 착지한다면, 프롬프트를 강화하거나 지속 시간을 줄이십시오.
아래 세 가지 패턴은 PixMind에서 볼 수 있는 첫 프레임-마지막 프레임 사용 사례의 약 80%를 다룹니다. 각 예시에는 키프레임 준비, 프롬프트, 지속 시간, 그리고 가장 자주 발생하는 실패 모드가 포함됩니다.
키프레임: 두 개의 제품 샷, 동일한 카메라 및 조명. 첫 프레임: 뚜껑 닫힘. 두 번째 프레임: 내부가 보이는 완전히 열린 뚜껑.
프롬프트: "뚜껑이 천천히 위로 들어 올려지고 뒤로 기울어져 내부를 드러냅니다. 정적 카메라, 부드러운 시네마틱 조명, 3초 지속."
지속 시간: 1080P, 16:9에서 3초.
실패 모드: 반사 표면 왜곡. 상자에 광택 마감이 있는 경우, 뚜껑이 움직일 때 모델이 하이라이트를 번지게 합니다. 키프레임에서 광택을 줄이거나 프롬프트에 "무광 표면"을 추가하여 완화하십시오.
키프레임: 두 개의 캐릭터 렌더링, 동일한 조명 및 초점 거리. 첫 프레임: 뒤에서 본 캐릭터. 두 번째 프레임: 카메라를 향한 캐릭터.
프롬프트: "인물이 4초에 걸쳐 시계 방향으로 천천히 회전하여 카메라를 향합니다. 정적 미디엄 샷, 시네마틱 피사계 심도."
지속 시간: 1080P에서 4~5초.
실패 모드: 정체성 표류. 얼굴이 회전 중간에 바뀔 수 있습니다. 회전 내에서 두 키프레임을 가능한 한 정면으로 만들거나, 더 강력한 정체성 보존을 위해 참조-투-비디오(R2V) 모드를 사용하여 완화하십시오.
키프레임: 두 개의 풍경 샷, 동일한 구성. 첫 프레임: 낮. 두 번째 프레임: 인공 조명이 켜진 밤.
프롬프트: "하늘이 5초에 걸쳐 낮에서 밤으로 점차 어두워지고, 인공 조명이 서서히 켜지며, 색온도가 차가워집니다. 정적 카메라, 고정된 삼각대."
지속 시간: 1080P에서 5초.
실패 모드: 카메라 점프. 두 풍경 샷이 약간이라도 다른 위치에서 촬영되었다면, 모델은 이들을 연결하기 위해 카메라 움직임을 만들어냅니다. 고정된 삼각대에서 두 키프레임을 촬영하거나, 노출 브라케팅이 적용된 단일 샷을 사용하여 완화하십시오.
실패 모드를 명명하는 것은 더 빠르게 출시하는 방법입니다. 아래 세 가지는 우리가 보는 대부분의 거부된 렌더링을 설명합니다.
유리, 광택 금속, 물은 모델이 반사를 일관되게 추적할 수 없기 때문에 보간 중에 번집니다. 움직임 진폭을 줄이거나, 키프레임에서 무광 표면으로 전환하거나, 모델이 만들어낼 프레임 수를 줄이기 위해 지속 시간을 단축하십시오.
얼굴과 실루엣이 프레임 사이에서 바뀝니다. 이는 두 키프레임이 각도나 표정에 동의하지 않을 때 가장 흔합니다. 일치하는 각도로 키프레임을 다시 촬영하거나, 참조 이미지를 사용하여 정체성을 고정하는 R2V 모드로 전환하십시오.
모델은 다른 각도를 암시하는 두 키프레임을 연결하기 위해 카메라 움직임을 만들어냅니다. 해결책은 상류에 있습니다: 두 키프레임 모두에서 초점 거리, 각도 및 높이를 고정하십시오. 다시 촬영할 수 없다면, 카메라 움직임을 받아들이고 프롬프트에 작성하십시오.
우리는 카메라 점프가 "모델 버그"로 가장 자주 오진되는 실패 모드임을 발견했습니다. 모델은 키프레임이 지시하는 대로 정확히 수행하고 있습니다. 입력을 수정하십시오.
첫 프레임 모드는 하나의 이미지를 시작 상태로 받아들이고 모델이 종료 상태를 만들어내도록 합니다. 첫 프레임-마지막 프레임 모드는 두 개의 이미지를 받아들이고 모델이 두 번째 이미지에 착지하도록 강제합니다. 첫 프레임-마지막 프레임은 첫 프레임 모드가 제공할 수 없는 종료 상태 제어 기능을 제공합니다.
2초에서 5초로 시작하십시오. 짧은 지속 시간은 실패 모드를 저렴하게 드러냅니다. Alibaba Cloud I2V API reference에 따르면 2초에서 15초까지의 지속 시간이 지원되지만, 긴 지속 시간은 보간 거리를 늘리고 아티팩트 위험을 증가시킵니다.
네, 하지만 주의해야 합니다. 반사 표면은 가장 흔한 왜곡 실패 모드입니다. 키프레임에서 광택을 줄이고, 움직임 진폭을 작게 유지하며, 프롬프트에 "무광 표면"을 작성하여 완화하십시오. 거울과 광택 크롬은 여전히 가장 어려운 경우입니다.
두 키프레임 모두에서 카메라 각도, 초점 거리 및 조명을 엄격한 허용 오차 내에서 일치시키십시오. 표류가 지속되면 참조-투-비디오(R2V) 모드로 전환하고 참조 이미지를 전달하여 정체성을 고정하십시오. R2V는 PixMind Wan 2.7 video generator guide에 문서화되어 있습니다.
네. Wan 2.7 I2V는 720P 및 1080P 출력을 지원합니다. 첫 프레임-마지막 프레임은 둘 다 상속합니다. 1080P는 720P보다 초당 약 두 배의 크레딧을 소비하므로, 720P로 반복하고 1080P로 마무리하십시오.
11 minutes of work turned into 8.7M views in 5 days
— Woody (@woody_research) May 28, 2026
no camera, no real person, no photoshoots, just a 24 year old kid and an ai girl he generated on his laptop.
I've been watching how the page is built. the whole pipeline is three tools running in sequence.
> chatgpt writes… https://t.co/iNPeLY9r3K pic.twitter.com/4jB5QObIvw

Wan 2.7과 Sora 2는 모두 키프레임에서 비디오를 생성하지만, 서로 다른 제어 방식을 제공합니다. 다음은 2026년 7월 기준으로 공급업체가 공개한 사양을 기반으로 한 비교입니다.
더 읽기

스킨케어 브랜드가 Wan 2.7 첫 프레임 마지막 프레임을 사용하여 5초 길이의 9:16 인스타그램 공개 광고를 제작한 방법을 보여주는 종합 사례 연구로, 프롬프트, 비용, 그리고 세 번의 반복을 통해 얻은 교훈을 포함합니다.
더 읽기

Wan 2.7 first last frame은 소셜 비디오 훅에 이상적입니다. 스크롤을 멈추게 하는 첫 프레임과 행동 유도 마지막 프레임을 제공합니다. 여기 키프레임 준비, 프롬프트, 실패 모드를 포함한 5가지 훅 패턴이 있습니다.
더 읽기