Pixmind

Wan 2.7 비디오 생성기: 텍스트, 이미지 및 참조 비디오에 대한 완벽 가이드

PixMind Editorial Team
继续浏览中,生成器即将加载...

Wan 2.7 비디오 생성기: 텍스트, 이미지 및 참조 모드에 대한 완벽 가이드

주요 내용

  • Wan 2.7은 텍스트-투-비디오(T2V), 이미지-투-비디오(I2V), 참조-투-비디오(R2V)를 단일 워크플로에서 다루는 통합 모델입니다.
  • 720P 및 1080P 출력, 2초에서 15초 길이, 16:9, 9:16, 1:1을 포함한 5가지 화면 비율을 지원합니다.
  • 첫 프레임-마지막 프레임 및 오디오 기반 모드는 단일 이미지 I2V 모델이 제공할 수 없는 시작 상태 및 종료 상태 제어를 제공합니다.
  • 참조-투-비디오(R2V)는 한 번의 호출로 최대 5개의 참조 이미지, 5개의 참조 클립 및 하나의 참조 오디오 트랙을 허용합니다.
  • 이 가이드의 모든 예시를 따라하려면 Wan 2.7 비디오 생성기를 사용해 보세요.

Wan 2.7 비디오 생성기란 무엇인가요?

Wan 2.7은 Alibaba의 Wan 팀에서 개발한 최신 비디오 생성 모델로, Alibaba Cloud Model Studio를 통해 공개되었습니다. 이 모델은 이전에 분리되어 있던 네 가지 기능(텍스트-투-비디오, 이미지-투-비디오, 참조-투-비디오, 비디오 편집)을 하나의 모델군으로 통합합니다. Alibaba Cloud 비디오 생성 개요에 따르면, 이 모델은 다중 모달 입력을 받아 최대 1080P의 MP4 또는 MOV를 출력합니다.

2.7의 핵심 변화는 워크플로 통합입니다. 텍스트-투-비디오와 이미지-투-비디오를 위해 여러 공급업체를 전환하는 대신, 동일한 모델을 호출하고 전달하는 입력에 따라 API가 라우팅하도록 합니다. 이는 모든 모드를 하나의 생성 인터페이스에서 처리하는 PixMind Wan 2.7 제품 페이지와 일치합니다.

창작자에게 이것이 중요한 이유는 대부분의 제작 시간이 모드 전환에서 낭비되기 때문입니다. 프롬프트를 작성하고 렌더링한 후 시작 상태가 잘못되었음을 깨닫고 다른 도구에서 처음부터 다시 구축해야 합니다. Wan 2.7의 통합 인터페이스를 사용하면 모델을 변경하지 않고도 입력을 교체할 수 있습니다.

Wan 2.7은 몇 가지 모드를 지원하나요?

Wan 2.7은 네 가지 모드를 제공합니다. I2V API 참조는 전체 입력 매트릭스를 문서화합니다. 다음은 실질적인 분석입니다.

| 모드 | 입력 | 최적의 용도 | 최대 길이 | 최대 해상도 |
|---|
| T2V (텍스트-투-비디오) | 텍스트 프롬프트, 선택적 오디오 | 스토리보딩, 추상적인 움직임, B-롤 | 15초 | 1080P |
| I2V (이미지-투-비디오) | 첫 프레임, 선택적 마지막 프레임, 선택적 오디오 | 제품 공개, 캐릭터 액션, 애니메이션 | 15초 | 1080P |
| R2V (참조-투-비디오) | 최대 5개 참조 이미지 + 5개 참조 클립 + 참조 오디오 | 아이덴티티 보존, 음성 복제, 다중 캐릭터 장면 | 10초 | 1080P |
| 비디오 편집 | 원본 비디오 + 지침 | 스타일 전송, 지침 기반 편집 | 10초 | 1080P |

다이어그램: 텍스트-투-비디오, 이미지-투-비디오, 첫 프레임-마지막 프레임, 참조-비디오 모드가 중앙 허브에 연결된 4분면 그리드.

텍스트-투-비디오 (T2V)

T2V는 텍스트 프롬프트를 받아 비디오를 출력합니다. Wan 2.7 T2V API 참조는 해상도, 길이, 비율 및 선택적 오디오 트랙을 포함한 지원되는 매개변수를 나열합니다. T2V는 아이디어에서 클립으로 가는 가장 빠른 경로입니다.

고정된 시작 프레임이 없을 때 T2V를 사용하세요. 추상적인 움직임, B-롤, 스토리보드, 양식화된 시퀀스 모두 적합합니다. 시작 상태가 중요할 때는 T2V를 피하세요. 프레임 0에서 특정 제품이 화면에 나타나야 한다면 I2V로 전환하세요.

이미지-투-비디오 (I2V)

I2V는 Wan 2.7의 워크플로 통합이 나타나는 부분입니다. Wan 2.7 이미지-투-비디오 사용자 가이드는 네 가지 하위 모드를 문서화합니다.

  1. 첫 프레임-투-비디오: 하나의 이미지가 시작 상태가 되고, 모델이 움직임을 생성합니다.
  2. 첫 프레임-마지막 프레임-투-비디오: 두 개의 이미지가 시작 및 종료 상태를 정의하고, 모델이 보간합니다.
  3. 비디오 연속: 짧은 클립이 시작 상태가 되고, 모델이 이를 확장합니다.
  4. 오디오 기반: 이미지와 오디오 트랙이 립싱크 또는 움직임을 구동합니다.

네 가지 I2V 경로에 대한 자세한 내용은 PixMind 첫 프레임-마지막 프레임 프롬프트 클러스터를 참조하세요.

참조-투-비디오 (R2V)

R2V는 가장 강력하고 문서화가 가장 부족한 모드입니다. Wan 2.7 R2V API 참조는 최대 5개의 참조 이미지, 5개의 참조 클립 및 하나의 참조 오디오 트랙을 허용하는 호출을 설명합니다. 모델은 이를 사용하여 출력 전반에 걸쳐 아이덴티티, 음성 및 스타일을 보존합니다.

R2V는 여러 샷에서 캐릭터가 동일하게 보이도록 하거나, 새로운 장면에 음성을 복제하고 싶을 때 사용합니다. 절충점은 길이입니다. R2V는 10초로 제한되며, T2V 및 I2V의 15초 상한선보다 짧습니다.

비디오 편집

비디오 편집은 원본 비디오와 텍스트 지침을 받아 편집된 클립을 반환합니다. Wan 2.7 비디오 편집 API는 지침 기반 편집 및 스타일 전송을 지원합니다. 이 모드는 생성 가이드의 범위를 벗어나지만, 존재한다는 것을 알아두면 좋습니다.

첫 프레임-마지막 프레임 모드는 어떻게 작동하나요?

첫 프레임-마지막 프레임은 I2V의 하위 모드입니다. 첫 프레임용 이미지 하나와 마지막 프레임용 이미지 하나, 총 두 개의 이미지를 제공합니다. Wan 2.7은 그 사이의 프레임을 생성합니다.

다이어그램: 두 개의 키프레임과 그 사이에 3개의 보간된 프레임을 보여주는 타임라인으로, Wan 2.7 로고 개념이 중간 프레임을 표시합니다.

이것이 중요한 이유는 단일 이미지 I2V는 최종 상태를 모델에 맡기기 때문입니다. 샷이 특정 프레임(완전히 회전된 제품, 완전히 열린 상자, 완전히 돌아선 캐릭터)에 도달해야 한다면, 첫 프레임-마지막 프레임이 그 도달을 보장하는 방법입니다.

실용적인 패턴은 다음과 같습니다: 두 개의 키프레임을 촬영하거나 생성하고, 이를 첫 번째와 마지막으로 업로드한 다음, 길이를 설정하고 렌더링합니다. Wan 2.7은 그 사이의 움직임을 보간합니다. PixMind 첫 프레임-마지막 프레임 프롬프트 페이지에는 제품 공개, 전환 및 스토리텔링 패턴을 위한 프롬프트 템플릿이 있습니다.

주의해야 할 일반적인 실패 모드:

  • 반사 표면의 왜곡: 유리, 금속, 물은 보간 중에 번질 수 있습니다.
  • 캐릭터의 아이덴티티 변화: 얼굴이 프레임 간에 바뀔 수 있습니다.
  • 카메라 불일치: 두 키프레임이 다른 카메라 각도를 암시하는 경우, 모델은 전환을 생성해야 합니다.

5-10초 렌더링을 시작하기 전에 짧은 길이(2-3초)로 먼저 테스트하세요.

오디오 기반 비디오는 어떻게 작동하나요?

오디오 기반 모드는 정지 이미지와 오디오 트랙을 받아, 피사체가 오디오와 동기화되어 말하거나 움직이는 것처럼 보이는 비디오를 생성합니다. 이것이 토킹 헤드 및 아바타 콘텐츠의 기반입니다.

모델은 오디오 파형을 사용하여 두 가지를 구동합니다: 입술 움직임(얼굴이 있는 경우)과 전반적인 움직임 에너지. Wan 2.7 I2V APIdriving_audio 유형을 사용하여 오디오를 미디어 배열의 일부로 허용합니다.

토킹 헤드 사용 사례의 경우, 이를 PixMind 캐릭터 퍼포먼스 클러스터와 함께 사용하세요. 오디오 기반 I2V와 깨끗한 참조 인물 사진의 조합은 맞춤형 모델을 훈련하지 않고 립싱크 아바타를 만드는 현재 최고의 공개 경로입니다.

두 가지 실용적인 참고 사항:

  • 오디오 품질이 비디오 품질을 결정합니다. 깨끗한 스튜디오 녹음이 휴대폰 마이크보다 우수합니다.
  • 3초 클립으로 먼저 테스트하세요. 동기화 문제는 초기에 파악하기 쉽습니다.

어떤 해상도, 길이 및 화면 비율을 선택해야 하나요?

Wan 2.7은 720P 및 1080P 출력을 지원합니다. 절충점은 비용 대 선명도입니다. PixMind 가격 전략에 따르면, 1080P는 720P보다 초당 약 두 배의 크레딧을 소모합니다.

| 설정 | 선택 시기 | 절충점 |
|---|
| 720P | 소셜 우선 콘텐츠, 세로 비디오, 테스트 반복 | 낮은 비용, 큰 화면에서 눈에 띄는 부드러움 |
| 1080P | 제품 쇼케이스, 시네마틱 프리비즈, 광고 크리에이티브 | 높은 비용, 더 선명한 디테일 |
| 16:9 | YouTube, 웹사이트 임베드 | 표준 와이드스크린 |
| 9:16 | Reels, TikTok, Shorts | 모바일 세로 |
| 1:1 | 피드 게시물, 정사각형 임베드 | 플랫폼 간 중립 |
| 4:3 / 3:4 | 에디토리얼, 빈티지 스타일 | 틈새 시장 |

길이는 비용을 선형적으로 증가시킵니다. 10초 렌더링은 동일한 해상도에서 2초 렌더링보다 약 5배의 비용이 듭니다. 반복 작업에는 짧게, 최종 작업에는 길게 하세요.

새로운 사용자를 위한 합리적인 기본값: 720P, 5초, 16:9. 샷이 작동하는지 확인한 다음, 최종본을 위해 1080P로 올리세요.

올바른 Wan 2.7 모드를 선택하는 방법은 무엇인가요?

어떤 입력을 가지고 있는지 알면 의사 결정 트리는 간단합니다.

워크플로 다이어그램: 입력, 모드 감지, 모델 라우팅, 생성, 출력의 5단계.

  • 아이디어만 있는 경우: T2V를 사용하세요. 시각 자료를 추가하기 전에 프롬프트를 반복하세요.
  • 제품 사진이 하나 있는 경우: I2V 첫 프레임 모드를 사용하세요.
  • 시작과 끝이 되어야 하는 두 개의 키프레임이 있는 경우: I2V 첫 프레임-마지막 프레임을 사용하세요.
  • 확장해야 하는 짧은 클립이 있는 경우: I2V 비디오 연속 모드를 사용하세요.
  • 인물 사진과 보이스오버가 있는 경우: I2V 오디오 기반 모드를 사용하세요.
  • 여러 샷에서 아이덴티티 또는 음성 보존이 필요한 경우: R2V를 사용하세요.
  • 편집 또는 스타일 변경이 필요한 기존 푸티지가 있는 경우: 비디오 편집을 사용하세요.

확실하지 않다면 PixMind Wan 제품군 허브에서 시작하여 모드 이름 대신 사용 사례별로 선택하세요. 허브는 만들려는 내용에 따라 올바른 인터페이스로 안내합니다.

Wan 2.7에 프롬프트를 어떻게 입력해야 하나요?

프롬프트 길이는 프롬프트 구조보다 덜 중요합니다. Wan 2.7은 주체, 행동, 배경, 카메라, 스타일의 5가지 세그먼트 구조에 보상을 제공합니다.

샘플 구조:

주체: 어두운 표면 위의 유리 향수병. 행동: 오른쪽으로 물방울이 튀어 오릅니다. 배경: 스튜디오 검은색 배경, 카메라 왼쪽에서 단일 키 라이트. 카메라: 정적인 미디엄 샷, 50mm 상당. 스타일: 시네마틱, 얕은 피사계 심도, 따뜻한 림 라이트.

각 세그먼트는 출력 공간을 좁힙니다. 누락된 세그먼트는 모델의 이전 기본값으로 설정되며, 이는 일반적으로 일반적입니다.

더 깊은 프롬프트 패턴을 위해 PixMind 다중 샷 프롬프트 클러스터는 다중 샷 시퀀스, 오디오 동기화 패턴, 첫 프레임-마지막 프레임 스토리보드를 포함한 12가지 재사용 가능한 구조를 다룹니다.

피해야 할 두 가지 프롬프트 함정:

  • 과부하 프롬프트: 하나의 프롬프트에 5개 이상의 주체가 있으면 모델이 혼란스러워합니다. 여러 렌더로 분할하세요.
  • 부정 프롬프트 과용: Wan 2.7은 이미지 모델처럼 부정 프롬프트에 가중치를 두지 않습니다. 짧게 유지하세요.

Wan 2.7은 다른 모델과 어떻게 비교되나요?

Wan 2.7은 경쟁이 치열한 분야에 있습니다. Sora 2, VEO 3, Kling 2.0 및 Seedance는 모두 중복되는 사용 사례를 목표로 합니다. 차이점은 각 모델이 어떤 모드를 어떤 비용으로 제공하는지에 있습니다.

| 기능 | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|
| 텍스트-투-비디오 | 예 | 예 | 예 | 예 |
| 이미지-투-비디오 | 예 | 제한적 | 예 | 예 |
| 첫 프레임-마지막 프레임 | 예 | 아니요 | 제한적 | 제한적 |
| 참조-비디오 (R2V) | 예 | 아니요 | 아니요 | 제한적 |
| 오디오 기반 I2V | 예 | 예 | 예 | 제한적 |
| 최대 길이 | 15초 | 20초 | 8초 | 10초 |
| 최대 해상도 | 1080P | 1080P | 1080P | 1080P |

이 표는 2026년 7월 기준 공급업체 공개 사양을 반영합니다. 독립적인 직접 비교 테스트는 Wan 2.7 대 Sora 2 프롬프트 테스트VEO와 Kling 대결에서 확인할 수 있습니다.

Wan 2.7의 독특한 강점은 첫 프레임-마지막 프레임과 R2V의 결합입니다. 표에 있는 다른 어떤 모델도 이 두 가지를 완전한 기능으로 제공하지 않습니다. 워크플로에 정확한 시작 및 종료 제어와 아이덴티티 보존이 필요하다면, Wan 2.7이 현재 유일한 단일 모델 경로입니다.

일반적인 실패 모드는 무엇인가요?

모든 AI 비디오 모델은 실패합니다. 실패 모드를 파악하면 더 빠르게 출시할 수 있습니다.

  • 반사 표면의 왜곡: 유리, 거울, 광택 금속. 프롬프트에서 움직임 진폭을 줄여 완화하세요.
  • 샷 간 아이덴티티 변화: 얼굴이 생성 간에 바뀝니다. R2V 참조 입력을 사용하여 완화하세요.
  • 프레임 내 환각 텍스트: 표지판, 라벨, 로고가 의미 없는 글자로 렌더링됩니다. 입력 이미지에서 텍스트를 제거하여 완화하세요.
  • 화면 비율 불일치: 9:16 이미지를 16:9 생성에 넣으면 예기치 않게 잘립니다. 입력 화면 비율을 출력 화면 비율과 일치시키세요.
  • 긴 반복 시 크레딧 소모: 10초 테스트 렌더링은 크레딧을 빠르게 소모합니다. 2-3초로 반복하세요.

PixMind 사용 사례 클러스터에는 제품 마케팅, 캐릭터 퍼포먼스, 시네마틱 프리비즈 및 소셜 훅에 대한 시나리오별 실패 모드 노트가 있습니다.

Wan 2.7 비디오 생성기 FAQ

Wan 2.7은 무료로 사용해 볼 수 있나요?

네. PixMind Wan 2.7 페이지에는 신용카드 없이 무료 체험이 포함되어 있습니다. 유료 요금제는 체험 할당량을 초과할 때만 시작됩니다.

Wan 2.7은 4K를 지원하나요?

아니요. Wan 2.7 비디오는 최대 1080P입니다. Wan 2.7 이미지 모델은 Pro 티어를 통해 4K 스틸 이미지를 지원하지만, 비디오 출력은 1080P로 제한됩니다.

Wan 2.7은 특정 인물의 얼굴을 복제할 수 있나요?

Wan 2.7은 참조 입력에서 아이덴티티를 보존할 수 있지만, PixMind 정책은 실제 식별 가능한 인물의 비동의적 유사성 복제를 금지합니다. R2V는 원본 캐릭터, 스톡 참조 또는 자신의 유사성과 함께 사용하세요.

Wan 2.7 렌더링 하나는 얼마나 걸리나요?

생성 시간은 길이, 해상도 및 부하에 따라 달라집니다. 일반적인 5초 720P 렌더링은 60-90초 내에 완료됩니다. 10초 1080P 렌더링은 3-5분이 걸릴 수 있습니다. API는 상태를 폴링할 작업 ID를 반환합니다.

Wan 2.7은 오디오를 생성하나요?

네, 하지만 오디오 입력을 허용하는 모드에서만 가능합니다. T2V는 오디오 트랙을 받아 움직임을 동기화할 수 있습니다. I2V 오디오 기반 모드는 오디오를 사용하여 입술 및 움직임 동기화를 구동합니다. 순수 오디오 생성(음악, 음향 효과)은 별도의 Alibaba 모델입니다.

Wan 2.7 출력물을 상업적으로 사용할 수 있나요?

네. 생성된 출력물은 Alibaba Cloud Model Studio 약관에 따라 상업적으로 사용할 수 있습니다. 출시 전에 Alibaba Cloud Model Studio 개요에서 현재 약관을 검토하세요.

작동 모습 보기