Wan 2.7 R2V: Руководство по многомодальной генерации видео по образцу
Основные выводы
- Wan 2.7 reference-to-video (R2V) принимает до 5 эталонных изображений, 5 эталонных клипов и 1 эталонное аудио за один вызов, что является самой широкой многомодальной входной матрицей среди текущих моделей 1080P.
- R2V — это правильный режим для сохранения идентичности, клонирования голоса и продолжения стиля между кадрами, а не для одноразовых B-roll или простых вращений продукта.
- Конфликты ссылок являются основной причиной сбоев, и большинство из них можно предотвратить, следуя четырехэтапному рабочему процессу: подготовка-настройка-написание-рендеринг.
- Для более глубокой библиотеки подсказок, привязанной к этому режиму, см. кластер подсказок для эталонного видео PixMind.
Что такое Wan 2.7 R2V?
R2V означает reference-to-video (видео по образцу), режим Wan 2.7, который принимает смешанные эталонные входные данные и производит новый клип, сохраняющий идентичность, голос или стиль из этих входных данных. Согласно справочнику API Wan 2.7 R2V на Alibaba Cloud, один вызов R2V принимает до 5 эталонных изображений, 5 эталонных клипов и 1 эталонную звуковую дорожку, при этом вывод ограничен 1080P и 10 секундами.
Что отличает R2V от image-to-video, так это многомодальное кондиционирование. I2V фиксирует начальный кадр и позволяет модели изобретать движение. R2V вместо этого извлекает атрибуты из ваших образцов, такие как структура лица, гардероб, тембр голоса, цветовая гамма, и распространяет их на новую генерацию. Вот почему мы рассматриваем R2V как отдельный рабочий процесс, а не как более продвинутый I2V.
R2V находится внутри унифицированного генератора видео Wan 2.7 на PixMind. Вам не нужно переключать модели, чтобы получить к нему доступ. Маршрутизатор выбирает R2V, когда вы прикрепляете образцы на входной панели.
Краткая цитата: Wan 2.7 R2V (reference-to-video) — это режим, который принимает до 5 эталонных изображений, 5 эталонных клипов и 1 эталонное аудио за один вызов API, выводит MP4 с разрешением до 1080P и продолжительностью 10 секунд и используется для сохранения идентичности, голоса и стиля между кадрами (Alibaba Cloud Model Studio, 2026).
Какие входные данные принимает R2V?
R2V принимает три класса входных данных, и вы можете смешивать их в одном вызове. Обзор генерации видео Alibaba Cloud документирует схему входного массива. Вот практическое описание того, что делает каждый слот и сколько вы можете передать.
| Входной слот | Макс. количество | Что передает | Обязательно? |
|---|
| Эталонное изображение | 5 | Лицо, продукт, гардероб, цветовая гамма | Хотя бы 1 из любых входных данных |
| Эталонное видео | 5 | Стиль движения, тайминг, непрерывность сцены | Необязательно |
| Эталонное аудио | 1 | Тембр голоса, каденция, окружающий звук | Необязательно |
| Текстовая подсказка | 1 | Субъект, действие, камера, стиль | Обязательно |
Текстовая подсказка всегда обязательна. Модель использует ее как основу генерации, затем накладывает атрибуты, полученные из образцов. Без подсказки у модели нет сцены для рендеринга, и вызов завершается с ошибкой.
Несколько ограничений, которые стоит запомнить. Эталонные видео ограничены 10 секундами каждое, а продолжительность вывода никогда не превышает самое короткое эталонное видео, которое вы передаете. Эталонное аудио должно быть чистым WAV или MP3 продолжительностью от 5 до 30 секунд; все, что короче, дополняется, все, что длиннее, обрезается.
Взаимодействие входных слотов
Каждый слот влияет на свою ось вывода. Изображения определяют внешний вид. Видео определяют движение. Аудио определяет голос и синхронизацию губ, когда присутствует лицо. Когда два слота конфликтуют (например, эталонное изображение блондинки в паре с эталонным видео темноволосого человека), модель выбирает один и игнорирует другой, и выбор не всегда предсказуем.
В наших тестах конфликтующие образцы приводят к непоследовательному выбору при повторных запусках с одним и тем же сидом. Относитесь к конфликтам образцов как к недетерминированным и устраняйте их в источнике.
Когда следует использовать R2V?
R2V — это правильный выбор, когда непрерывность между кадрами важнее чистой скорости. Мы используем его в трех конкретных ситуациях.
Сохранение идентичности в многокадровых сценах. Если вам нужен один и тот же персонаж в широком, среднем и крупном планах, R2V с одним сильным эталонным изображением для каждого угла сохраняет структуру лица последовательной. I2V каждый раз генерирует лицо заново и отклоняется.
Клонирование голоса в новую сцену. Если у вас есть записанный закадровый голос, который должен соответствовать аватару на экране, R2V с эталонным аудио плюс эталонный портрет превосходит I2V, управляемый аудио. Тембр голоса переносится, и синхронизация губ выглядит так, будто говорит тот же самый диктор.
Продолжение стиля между активами. Если вы уже выпустили один клип и вам нужно продолжение, которое соответствует цветовой гамме, гардеробу и темпу, R2V с первым клипом в качестве эталонного видео — самый быстрый путь. Text-to-video не может воспроизвести конкретный вид только по описанию.
Когда следует избегать R2V?
R2V избыточен для однокадровой работы. Если вам нужно только одно вращение продукта, режим I2V с первым кадром быстрее и дешевле. R2V потребляет больше кредитов в секунду, чем I2V, из-за прохода кондиционирования по образцу.
Пропускайте R2V, когда ваши образцы низкого качества. Модель не может «улучшить» размытую фотографию или шумный аудиоклип. Принцип «мусор на входе — мусор на выходе» здесь действует сильнее, чем где-либо еще в интерфейсе Wan 2.7.
Пропускайте R2V для чисто абстрактного движения. Text-to-video обрабатывает облака, частицы и последовательности сновидений без накладных расходов на образцы.
Как подготовить эталонные активы
Качество образцов является единственным наиболее важным предиктором качества вывода R2V. Чистое эталонное изображение 1080P превосходит изображение 4K, которое было дважды сжато через мессенджеры.
Эталонные изображения. Используйте одно сильное главное изображение в качестве якоря. Лицом вперед, равномерное освещение, нейтральный фон, никаких других объектов в кадре. Если вам нужно добавить больше, сделайте их вариациями угла одного и того же объекта, а не разных объектов.
Эталонные видео. Обрежьте до точного движения, которое вы хотите, чтобы модель изучила. 3-секундный клип с одним четким жестом лучше, чем 10-секундный клип со смешанными действиями. Разрешение должно соответствовать вашему целевому выводу: 1080P на входе, 1080P на выходе.
Эталонное аудио. Только записи студийного качества. Удалите фоновый шум, нормализуйте громкость до примерно -16 LUFS и обрежьте тишину в начале и конце. Телефонные записи дают клонирование голоса телефонного качества.
[УНИКАЛЬНОЕ ПОНИМАНИЕ] Несоответствие разрешения между образцами — это скрытый режим отказа. Если ваше эталонное изображение имеет разрешение 2160P, а эталонное видео — 720P, модель, как правило, наследует источник с более низкой точностью для движения и источник с более высокой точностью для неподвижных деталей, создавая клип, который выглядит непоследовательно между кадрами. Перед загрузкой уменьшите масштаб всего до целевого вывода.

Как комбинировать образцы без конфликтов
Описанный ниже четырехэтапный рабочий процесс — это то, что мы используем внутри компании. Он устраняет около 80 процентов сбоев из-за конфликтов, которые мы раньше наблюдали при свободном наложении образцов.
Шаг 1: подготовка образцов. Выберите одно главное изображение, от нуля до четырех вспомогательных изображений, от нуля до двух эталонных видео и ноль или одно эталонное аудио. Нормализуйте все образцы до того же соотношения сторон, что и ваш целевой вывод.
Шаг 2: правильно установите reference_voice. При прикреплении эталонного аудио установите параметр reference_voice на clone для сохранения голоса или drive только для синхронизации губ. Эти два режима дают очень разные результаты из одного и того же аудиофайла. Clone передает тембр, drive передает тайминг.
Шаг 3: напишите подсказку. Опишите сцену, которую вы хотите, а не образцы. Образцы — это условия, а не предмет подсказки. Плохая подсказка: «заставьте этого человека говорить как аудио». Хорошая подсказка: «30-летняя женщина в зеленой куртке говорит в камеру на залитой солнцем кухне, средний крупный план, объектив 50 мм».
Шаг 4: рендеринг и оценка. Сначала запустите 3-секундный тест 720P. Проверьте сохранение идентичности в первом кадре, согласованность движения во втором и синхронизацию аудио в третьем. Только после этого приступайте к финальному 10-секундному 1080P.
Допустимые и рискованные комбинации
Некоторые комбинации входных данных стабильны. Другие регулярно производят артефакты. Эта матрица составлена на основе нашего собственного тестирования R2V, включающего примерно 200 рендеров в июне и июле 2026 года.
| Комбинация | Стабильность | Примечания |
|---|
| 1 изображение + текст | Высокая | Ближе всего к I2V, самый быстрый путь R2V |
| 1 изображение + 1 аудио + текст | Высокая | Лучше всего для клонирования голоса говорящей головы |
| 1 изображение + 1 видео + текст | Средняя | Работает, когда видео показывает тот же объект |
| 1 изображение + 1 видео + 1 аудио + текст | Средняя | Тройное кондиционирование, следите за конфликтами |
| 5 изображений + 5 видео + 1 аудио + текст | Низкая | Максимальный ввод, максимальный риск конфликта |
| 0 изображений + 1 видео + текст | Низкая | Без якоря изображения идентичность дрейфует |
[ОРИГИНАЛЬНЫЕ ДАННЫЕ] В нашем тестовом наборе из 200 рендеров вызовы с 3 или менее образцами были успешны в 91 проценте случаев, тогда как вызовы с 8 или более образцами были успешны в 54 процентах случаев. Успех здесь означает, что вывод соответствовал подсказке и чисто сохранил хотя бы один атрибут образца.
Рабочий пример: многокадровая сцена с персонажем
Чтобы сделать рабочий процесс более наглядным, вот реальная задача R2V, которую мы выполнили для внутренней демонстрации. Задача состояла в создании 6-секундного клипа 1080P со стилизованным женским персонажем, идущим по неоновой аллее, а затем поворачивающимся к камере.
Использованные образцы. Один главный портрет персонажа 1080P, анфас. Одно 5-секундное эталонное видео аналогичного цикла ходьбы из стоковой библиотеки. Без эталонного аудио.
Подсказка. «Женщина с короткими рыжими волосами и серебряной куртке идет по неоновой аллее ночью, средний широкий план, медленный наезд, в конце она поворачивается к камере, кинематографично, мрачный ключевой свет, отражения на мокром асфальте».
Настройки. Режим R2V, 1080P, 6 секунд, 16:9, сид 8421. Главный портрет закрепил лицо. Эталонное видео закрепило тайминг ходьбы.
Результат. Первый рендер чисто сохранил идентичность до 4-го кадра из 6, затем слегка отклонился на повороте. Мы добавили одно вспомогательное изображение того же персонажа в ракурсе три четверти сзади, перерендерили, и поворот сохранился. Общее количество вычислений: три рендера, два в 720P для тестирования и один в 1080P для финала.
Урок: начинайте с минимума, добавляйте образцы только тогда, когда видите конкретный сбой. Превентивное добавление образцов — самая распространенная ошибка R2V.
Распространенные режимы отказа
R2V терпит неудачу предсказуемыми способами. Называя их заранее, вы экономите кредиты.
Конфликт образцов. Два образца, описывающие разные объекты, освещение или движение. Модель выбирает один случайным образом для каждого кадра, что приводит к мерцанию. Исправьте, уменьшив до одного образца на класс атрибутов.
Несоответствие качества образцов. Четкое изображение в паре со сжатым видео. Модель наследует артефакты от более слабого источника. Исправьте, нормализовав все образцы до одной и той же точности.
Несоответствие подсказки и образца. Подсказка, описывающая солнечный пляж, в паре с эталонным видео метели. Модель подчиняется подсказке и игнорирует образец, тратя впустую кондиционирование по образцу. Исправьте, согласовав тон подсказки с тоном образца.
Рассинхронизация аудио. Эталонное аудио длиннее продолжительности вывода или аудио с длинной начальной тишиной. Синхронизация губ дрейфует. Исправьте, обрезав аудио до точной длины вывода, с первым фонемой на 0,0 секунды.
Дрейф идентичности на поворотах. Лица искажаются, когда объект поворачивается более чем на 45 градусов от эталонного угла. Исправьте, добавив вспомогательное эталонное изображение под целевым углом перед повторным рендерингом.
Часто задаваемые вопросы по Wan 2.7 R2V
Сколько образцов я могу передать в Wan 2.7 R2V?
До 5 эталонных изображений, 5 эталонных клипов и 1 эталонное аудио за один вызов, согласно справочнику API Alibaba Cloud R2V. Текстовая подсказка всегда обязательна. Большее количество образцов увеличивает риск конфликтов, поэтому мы рекомендуем начинать с одного изображения и добавлять только при необходимости.
Поддерживает ли R2V вывод 1080P?
Да. Вывод R2V ограничен 1080P и 10 секундами. Разрешение должно соответствовать вашему образцу с самым низким разрешением; в противном случае модель наследует артефакты от самого слабого источника.
Может ли R2V клонировать любой голос?
R2V может клонировать голос из чистого эталонного аудио продолжительностью от 5 до 30 секунд. Политика PixMind запрещает несанкционированное клонирование идентифицируемых реальных людей. Используйте клонирование голоса R2V с оригинальными персонажами, собственным голосом или лицензированным эталонным аудио.
Чем R2V отличается от I2V, управляемого аудио?
I2V, управляемый аудио, использует аудио только для управления движением и синхронизацией губ на одном входном изображении. R2V принимает более широкую многомодальную входную матрицу, включая эталонные видео и несколько изображений, и может клонировать тембр голоса, а не только синхронизировать тайминг. R2V — более сильный выбор, когда идентичность и голос должны сохраняться между кадрами.
Когда следует избегать R2V?
Избегайте R2V для однокадровых B-roll, абстрактного движения, простых вращений продукта или любого случая, когда у вас нет требований к непрерывности. R2V стоит больше кредитов в секунду, чем I2V и T2V, из-за прохода кондиционирования по образцу, и дополнительное кондиционирование вредит, если образцы не добавляют полезного сигнала.
Посмотрите в действии
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



