Pixmind

Wan 2.7 R2V: 멀티모달 참조 비디오 생성 가이드

PixMind Editorial Team
继续浏览中,生成器即将加载...

Wan 2.7 R2V: 멀티모달 참조 비디오 생성 가이드

주요 내용

  • Wan 2.7 R2V(참조-투-비디오)는 단일 호출로 최대 5개의 참조 이미지, 5개의 참조 클립, 1개의 참조 오디오를 허용하며, 이는 현재 1080P 모델 중 가장 광범위한 멀티모달 입력 매트릭스입니다.
  • R2V는 아이덴티티 보존, 음성 복제, 샷 간 스타일 연속성 유지에 적합한 모드이며, 일회성 B-roll이나 간단한 제품 스핀에는 적합하지 않습니다.
  • 참조 충돌은 가장 큰 실패 원인이며, 대부분은 4단계(준비-설정-작성-렌더링) 워크플로우를 따르면 방지할 수 있습니다.
  • 이 모드와 관련된 더 심층적인 프롬프트 라이브러리는 PixMind reference-video prompts cluster를 참조하십시오.

Wan 2.7 R2V란 무엇인가요?

R2V는 reference-to-video의 약자로, 혼합된 참조 입력을 받아 해당 입력에서 아이덴티티, 음성 또는 스타일을 보존하는 새로운 클립을 생성하는 Wan 2.7 모드입니다. Alibaba Cloud의 Wan 2.7 R2V API 참조에 따르면, 단일 R2V 호출은 최대 5개의 참조 이미지, 5개의 참조 클립, 1개의 참조 오디오 트랙을 허용하며, 출력은 1080P 및 10초로 제한됩니다.

R2V와 이미지-투-비디오를 구분하는 것은 멀티모달 컨디셔닝입니다. I2V는 시작 프레임을 고정하고 모델이 움직임을 생성하도록 합니다. 반면 R2V는 참조에서 얼굴 구조, 의상, 음성 음색, 색상 등과 같은 속성을 추출하여 새로운 생성물에 전파합니다. 이것이 우리가 R2V를 단순한 고급 I2V가 아닌 다른 워크플로우로 취급하는 이유입니다.

R2V는 PixMind의 통합 Wan 2.7 비디오 생성기 표면에 포함되어 있습니다. 이를 사용하기 위해 모델을 전환할 필요가 없습니다. 입력 패널에 참조를 첨부하면 라우터가 R2V를 선택합니다.

인용 요약: Wan 2.7 R2V (reference-to-video)는 단일 API 호출로 최대 5개의 참조 이미지, 5개의 참조 클립, 1개의 참조 오디오를 허용하며, 최대 1080P 및 10초 길이의 MP4를 출력하고, 샷 간 아이덴티티, 음성 및 스타일 보존에 사용됩니다 (Alibaba Cloud Model Studio, 2026).

R2V는 어떤 입력을 받나요?

R2V는 세 가지 입력 클래스를 받으며, 동일한 호출에서 이들을 혼합할 수 있습니다. Alibaba Cloud 비디오 생성 개요는 입력 배열 스키마를 설명합니다. 각 슬롯의 기능과 전달할 수 있는 개수에 대한 실제적인 분석은 다음과 같습니다.

입력 슬롯 최대 개수 전달하는 내용 필수 여부
참조 이미지 5 얼굴, 제품, 의상, 색상 등급 어떤 입력이든 최소 1개
참조 비디오 5 움직임 스타일, 타이밍, 장면 연속성 선택 사항
참조 오디오 1 음성 음색, 억양, 주변 소리 선택 사항
텍스트 프롬프트 1 주제, 동작, 카메라, 스타일 필수

텍스트 프롬프트는 항상 필수입니다. 모델은 이를 생성의 핵심으로 사용한 다음, 참조에서 파생된 속성을 그 위에 계층화합니다. 프롬프트가 없으면 모델은 렌더링할 장면이 없어 호출이 실패합니다.

기억해 둘 만한 몇 가지 제약 사항이 있습니다. 참조 비디오는 각각 10초로 제한되며, 출력 길이는 전달하는 가장 짧은 참조 비디오를 초과하지 않습니다. 참조 오디오는 5초에서 30초 사이의 깨끗한 WAV 또는 MP3 파일이어야 합니다. 더 짧으면 채워지고, 더 길면 잘립니다.

입력 슬롯 상호 작용

각 슬롯은 다른 출력 축에 영향을 미칩니다. 이미지는 외모를 구동합니다. 비디오는 움직임을 구동합니다. 오디오는 얼굴이 있을 때 음성과 립싱크를 구동합니다. 두 슬롯이 충돌할 때(예: 금발 피사체의 참조 이미지와 검은 머리 피사체의 참조 비디오가 함께 사용될 때), 모델은 하나를 선택하고 다른 하나는 무시하며, 그 선택은 항상 예측 가능하지 않습니다.

우리의 테스트에서, 충돌하는 참조는 동일한 시드로 재실행할 때 일관성 없는 선택을 생성했습니다. 참조 충돌을 비결정적인 것으로 간주하고 원본에서 제거하십시오.

R2V는 언제 사용해야 하나요?

R2V는 순수한 속도보다 샷 간의 연속성이 더 중요할 때 올바른 선택입니다. 우리는 세 가지 특정 상황에서 R2V를 사용합니다.

다중 샷 장면에서 아이덴티티 보존. 와이드, 미디엄, 클로즈업에서 동일한 캐릭터가 필요한 경우, 각도당 하나의 강력한 참조 이미지를 사용하는 R2V는 얼굴 구조를 일관되게 유지합니다. I2V는 매번 얼굴을 재생성하여 변화를 일으킵니다.

새로운 장면으로 음성 복제. 화면 속 아바타와 일치해야 하는 녹음된 보이스오버가 있는 경우, 참조 오디오와 참조 인물 사진을 함께 사용하는 R2V가 오디오 기반 I2V보다 뛰어납니다. 음성 음색이 전달되고 립싱크가 동일한 화자로 인식됩니다.

자산 간 스타일 연속성. 이미 하나의 클립을 출시했고 색상 등급, 의상, 페이싱이 일치하는 속편이 필요한 경우, 첫 번째 클립을 참조 비디오로 사용하는 R2V가 가장 빠른 방법입니다. 텍스트-투-비디오는 설명만으로는 특정 모양을 재현할 수 없습니다.

R2V를 피해야 할 때는 언제인가요?

R2V는 단일 샷 작업에는 과합니다. 단일 제품 스핀만 필요한 경우, I2V 첫 프레임 모드가 더 빠르고 저렴합니다. R2V는 참조 컨디셔닝 패스 때문에 I2V보다 초당 더 많은 크레딧을 소비합니다.

참조 품질이 낮을 때는 R2V를 건너뛰십시오. 모델은 흐릿한 사진이나 노이즈가 많은 오디오 클립을 "개선"할 방법이 없습니다. Wan 2.7 표면의 다른 어떤 곳보다 '쓰레기를 넣으면 쓰레기가 나온다'는 원칙이 여기에 더 강하게 적용됩니다.

순수하게 추상적인 움직임에는 R2V를 건너뛰십시오. 텍스트-투-비디오는 참조 오버헤드 없이 구름, 입자, 꿈 시퀀스를 처리합니다.

참조 자산 준비 방법

참조 품질은 R2V 출력 품질의 가장 큰 단일 예측 변수입니다. 깨끗한 1080P 참조 이미지는 메시징 앱을 통해 두 번 압축된 4K 이미지보다 뛰어납니다.

참조 이미지. 하나의 강력한 히어로 이미지를 앵커로 사용하십시오. 정면을 향하고, 균일한 조명, 중립적인 배경, 프레임 안에 다른 피사체가 없어야 합니다. 더 추가해야 한다면, 다른 피사체가 아닌 동일한 피사체의 각도 변화를 만드십시오.

참조 비디오. 모델이 학습하기를 원하는 정확한 움직임으로 자르십시오. 하나의 명확한 제스처가 있는 3초 클립이 혼합된 동작이 있는 10초 클립보다 낫습니다. 해상도는 목표 출력과 일치해야 합니다: 1080P 입력, 1080P 출력.

참조 오디오. 스튜디오급 녹음만 사용하십시오. 배경 소음을 제거하고, 음량을 약 -16 LUFS로 정규화하며, 시작과 끝 부분의 무음 구간을 자르십시오. 전화 녹음은 전화 품질의 음성 복제를 생성합니다.

[고유한 통찰] 참조 간 해상도 불일치는 조용한 실패 모드입니다. 참조 이미지가 2160P이고 참조 비디오가 720P인 경우, 모델은 움직임에 대해서는 낮은 충실도의 소스를, 정지 세부 사항에 대해서는 높은 충실도의 소스를 상속하는 경향이 있어 프레임 전체에서 일관성이 없어 보이는 클립을 생성합니다. 업로드하기 전에 모든 것을 목표 출력 해상도로 다운스케일링하십시오.

R2V의 유효한 입력 조합을 보여주는 매트릭스, 참조 이미지, 참조 비디오, 참조 오디오 열 포함.

충돌 없이 참조를 결합하는 방법

아래의 4단계 워크플로우는 우리가 내부적으로 실행하는 것입니다. 이는 참조를 자유롭게 쌓을 때 발생했던 충돌 실패의 약 80%를 제거합니다.

1단계: 참조 준비. 하나의 앵커 이미지, 0~4개의 보조 이미지, 0~2개의 참조 비디오, 0 또는 1개의 참조 오디오를 선택하십시오. 모든 참조를 목표 출력과 동일한 종횡비로 정규화하십시오.

2단계: reference_voice를 올바르게 설정. 참조 오디오를 첨부할 때, 음성 보존을 위해 reference_voice 매개변수를 clone으로 설정하거나 립싱크만을 위해 drive로 설정하십시오. 이 두 모드는 동일한 오디오 파일에서 매우 다른 출력을 생성합니다. clone은 음색을 전달하고, drive는 타이밍을 전달합니다.

3단계: 프롬프트 작성. 참조가 아닌 원하는 장면을 설명하십시오. 참조는 컨디셔닝이며 프롬프트의 주제가 아닙니다. 나쁜 프롬프트: "이 사람이 오디오처럼 말하게 해줘." 좋은 프롬프트: "햇살 가득한 부엌에서 초록색 재킷을 입은 30대 여성이 카메라를 보고 말한다, 미디엄 클로즈업, 50mm 렌즈."

4단계: 렌더링 및 평가. 먼저 3초짜리 720P 테스트를 실행하십시오. 첫 프레임에서 아이덴티티 보존, 두 번째 프레임에서 움직임 일관성, 세 번째 프레임에서 오디오 동기화를 확인하십시오. 그런 다음 10초짜리 1080P 최종 렌더링을 진행하십시오.

유효하고 위험한 조합

일부 입력 조합은 안정적입니다. 다른 조합은 정기적으로 아티팩트를 생성합니다. 이 매트릭스는 2026년 6월과 7월에 약 200개의 렌더링에 걸친 자체 R2V 테스트에서 도출되었습니다.

조합 안정성 참고 사항
이미지 1개 + 텍스트 높음 I2V에 가장 가깝고, 가장 빠른 R2V 경로
이미지 1개 + 오디오 1개 + 텍스트 높음 토킹 헤드 음성 복제에 최적
이미지 1개 + 비디오 1개 + 텍스트 중간 비디오가 동일한 피사체를 보여줄 때 작동
이미지 1개 + 비디오 1개 + 오디오 1개 + 텍스트 중간 삼중 컨디셔닝, 충돌 주의
이미지 5개 + 비디오 5개 + 오디오 1개 + 텍스트 낮음 최대 입력, 최대 충돌 위험
이미지 0개 + 비디오 1개 + 텍스트 낮음 이미지 앵커 없이는 아이덴티티가 표류함

[원본 데이터] 200개 렌더링 테스트 세트에서, 3개 이하의 참조를 사용한 호출은 91% 성공률을 보인 반면, 8개 이상의 참조를 사용한 호출은 54% 성공률을 보였습니다. 여기서 성공은 출력이 프롬프트와 일치하고 최소한 하나의 참조 속성을 깨끗하게 보존했음을 의미합니다.

실제 예시: 다중 샷 캐릭터 장면

워크플로우를 구체화하기 위해, 내부 데모를 위해 실행했던 실제 R2V 작업을 소개합니다. 요청은 네온 불빛이 비치는 골목을 걷다가 카메라를 향해 돌아보는 스타일화된 여성 캐릭터의 6초짜리 1080P 클립이었습니다.

사용된 참조. 캐릭터의 정면을 향한 1080P 히어로 인물 사진 1장. 스톡 라이브러리에서 가져온 유사한 걷기 사이클의 5초 참조 비디오 1개. 참조 오디오 없음.

프롬프트. "짧은 빨간 머리와 은색 재킷을 입은 여성이 밤에 네온 불빛이 비치는 골목을 걷는다, 미디엄 와이드 샷, 느린 돌리 인, 끝에서 카메라를 향해 돌아본다, 시네마틱, 분위기 있는 키 라이트, 젖은 포장도로 반사."

설정. R2V 모드, 1080P, 6초, 16:9, 시드 8421. 히어로 인물 사진이 얼굴을 고정했습니다. 참조 비디오가 걷기 타이밍을 고정했습니다.

결과. 첫 번째 렌더링은 6프레임 중 4프레임까지 아이덴티티를 깨끗하게 보존했지만, 회전 시 약간 표류했습니다. 동일한 캐릭터의 쿼터백 뷰 보조 이미지 하나를 추가하고 다시 렌더링하자 회전이 유지되었습니다. 총 계산: 세 번의 렌더링, 테스트용 720P 두 번, 최종용 1080P 한 번.

교훈: 최소한으로 시작하고, 특정 실패가 보일 때만 참조를 추가하십시오. 참조를 미리 추가하는 것이 가장 흔한 R2V 실수입니다.

일반적인 실패 모드

R2V는 예측 가능한 방식으로 실패합니다. 미리 이름을 지정하면 크레딧을 절약할 수 있습니다.

참조 충돌. 다른 피사체, 조명 또는 움직임을 설명하는 두 개의 참조. 모델은 프레임당 하나를 무작위로 선택하여 깜빡임을 생성합니다. 속성 클래스당 하나의 참조로 줄여서 해결하십시오.

참조 품질 불일치. 선명한 이미지와 압축된 비디오가 짝을 이룸. 모델은 약한 소스에서 아티팩트를 상속합니다. 모든 참조를 동일한 충실도로 정규화하여 해결하십시오.

프롬프트-참조 불일치. 화창한 해변을 묘사하는 프롬프트와 눈보라의 참조 비디오가 짝을 이룸. 모델은 프롬프트에 따르고 참조를 무시하여 참조 컨디셔닝을 낭비합니다. 프롬프트 톤을 참조 톤에 맞춰서 해결하십시오.

오디오 비동기화. 출력 길이보다 긴 참조 오디오 또는 긴 선행 무음이 있는 오디오. 립싱크가 표류합니다. 오디오를 정확히 출력 길이로 자르고, 첫 번째 음소를 0.0초에 배치하여 해결하십시오.

회전 시 아이덴티티 표류. 피사체가 참조 각도에서 45도를 초과하여 회전할 때 얼굴이 왜곡됩니다. 다시 렌더링하기 전에 목표 각도에서 보조 참조 이미지를 추가하여 해결하십시오.

Wan 2.7 R2V 자주 묻는 질문

Wan 2.7 R2V에 몇 개의 참조를 전달할 수 있나요?

Alibaba Cloud R2V API 참조에 따라, 한 번의 호출로 최대 5개의 참조 이미지, 5개의 참조 클립, 1개의 참조 오디오를 전달할 수 있습니다. 텍스트 프롬프트는 항상 필수입니다. 참조가 많을수록 충돌 위험이 높아지므로, 하나의 이미지로 시작하고 필요할 때만 추가하는 것을 권장합니다.

R2V는 1080P 출력을 지원하나요?

네. R2V 출력은 1080P 및 10초로 제한됩니다. 해상도는 가장 낮은 해상도의 참조와 일치해야 합니다. 그렇지 않으면 모델이 가장 약한 소스에서 아티팩트를 상속합니다.

R2V는 어떤 음성이든 복제할 수 있나요?

R2V는 5초에서 30초 사이의 깨끗한 참조 오디오에서 음성을 복제할 수 있습니다. PixMind 정책은 식별 가능한 실제 인물의 비동의 복제를 금지합니다. R2V 음성 복제는 오리지널 캐릭터, 자신의 음성 또는 라이선스된 참조 오디오와 함께 사용하십시오.

R2V는 오디오 기반 I2V와 어떻게 다른가요?

오디오 기반 I2V는 단일 입력 이미지에서 움직임과 립싱크를 구동하기 위해 오디오만 사용합니다. R2V는 참조 비디오 및 여러 이미지를 포함하는 더 광범위한 멀티모달 입력 매트릭스를 허용하며, 타이밍 동기화뿐만 아니라 음성 음색도 복제할 수 있습니다. 아이덴티티와 음성 모두 샷 간에 전달되어야 할 때 R2V가 더 강력한 선택입니다.

R2V를 피해야 할 때는 언제인가요?

일회성 B-roll, 추상적인 움직임, 간단한 제품 스핀, 또는 연속성 요구 사항이 없는 모든 경우에 R2V를 피하십시오. R2V는 참조 컨디셔닝 패스 때문에 I2V 및 T2V보다 초당 더 많은 크레딧을 소비하며, 참조가 유용한 신호를 추가하지 않으면 추가 컨디셔닝이 해가 될 수 있습니다.

작동 모습 보기