Wan 2.7 Image-to-Video: Объяснение 4 режимов
Ключевые выводы
- Wan 2.7 image-to-video (I2V) объединяет четыре подрежима в один API: первый кадр, первый-последний кадр, продолжение видео и управляемый аудио.
- Каждый подрежим принимает различные входные параметры (
first_frame,last_frame,first_clip,driving_audio) и проходит через один и тот же бэкенд генерации. - Режимы первого-последнего кадра и управляемый аудио являются уникальными возможностями, которые не могут воспроизвести модели I2V с одним изображением.
- Большинство сбоев I2V происходят из-за несоответствия режима и ввода: неверный параметр для задачи или опорный кадр, который не соответствует запрошенному соотношению сторон.
- Попробуйте генератор видео Wan 2.7, чтобы следовать любому примеру в этом руководстве.
Wan 2.7 image-to-video — это не одна функция. Это четыре подрежима, маршрутизируемые через одну поверхность API, каждый из которых принимает различную форму ввода. Справочник API Wan 2.7 I2V документирует матрицу ввода, но не объясняет, когда какой режим выбирать. Это руководство объясняет. Каждый раздел охватывает входные данные, варианты использования, проработанный запрос и режимы сбоев, с которыми мы фактически сталкивались.
Для более широкого обзора места I2V в семействе моделей Wan 2.7, обзор генератора видео PixMind Wan 2.7 охватывает текстовые, графические и референсные режимы бок о бок.
Что такое Wan 2.7 Image-to-Video?
Wan 2.7 image-to-video (I2V) — это путь генерации, обусловленный изображением, внутри семейства моделей Wan 2.7 от Alibaba. Согласно справочнику API Wan 2.7 I2V, конечная точка принимает медиа-массив типизированных входных данных и возвращает видео с разрешением до 1080P, продолжительностью от 2 до 15 секунд.
Четыре подрежима не являются отдельными конечными точками. Это комбинации входных данных, которые API маршрутизирует внутренне:
| Подрежим | Обязательный ввод | Необязательный ввод | Типичная продолжительность |
|---|---|---|---|
| Из первого кадра в видео | first_frame изображение |
запрос, аудио | 2-10с |
| Из первого и последнего кадра в видео | first_frame + last_frame |
запрос | 2-5с |
| Продолжение видео | first_clip видео |
запрос | 3-10с |
| Управляемый аудио | first_frame + driving_audio |
запрос | 5-15с |
Выбор правильного подрежима — это самое важное решение в рабочем процессе I2V. Модели приходится меньше изобретать, когда вы даете ей больше ограничений. Например, режим первого-последнего кадра приводит к гарантированному конечному состоянию. Только первый кадр оставляет конец на усмотрение модели.
[УНИКАЛЬНОЕ ПОНИМАНИЕ] Большинство создателей воспринимают I2V как одну функцию и по умолчанию используют режим первого кадра для всего. В наших тестовых рендерах переход на режим первого-последнего кадра для демонстрации продуктов сократил количество отклонений из-за "неправильного конечного состояния" примерно на две трети, потому что модели больше не приходилось угадывать, куда движется кадр.
Как работает режим «Из первого кадра в видео»?
Режим «Из первого кадра в видео» — это путь I2V по умолчанию. Вы загружаете одно изображение как first_frame, пишете запрос, описывающий движение, и Wan 2.7 генерирует кадры, которые движутся вперед от этого начального состояния. Руководство пользователя Wan 2.7 image-to-video документирует это как простейшую форму вызова I2V.
Входные данные
first_frame(обязательно): одно изображение, любое соотношение сторон, поддерживаемое Wan 2.7 (16:9, 9:16, 1:1, 4:3, 3:4).prompt(необязательно, но настоятельно рекомендуется): описывает движение, камеру и стиль.resolution: 720P или 1080P.duration: от 2 до 15 секунд.ratio: должно соответствовать соотношению сторон входного изображения, чтобы избежать обрезки.
Когда использовать
- У вас есть одно фото продукта, и вам нужна короткая демонстрация.
- У вас есть портрет персонажа, и вы хотите тонкое движение.
- Вы работаете над стилем движения, прежде чем зафиксировать конечное состояние.
Проработанный запрос
first_frame: фото стеклянного флакона духов на темной поверхности, один основной свет слева от камеры.prompt: "Медленное наплывание камеры. Струя капель входит с правого края. Мягкие частицы дрейфуют сквозь световой луч. Кинематографично, малая глубина резкости, теплый контровой свет." Разрешение 1080P, продолжительность 5с, соотношение 16:9.
Режимы сбоев
- Запрос конфликтует с изображением. Если запрос просит широкий панорамный кадр, но
first_frame— это крупный план, модель может исказить объект, чтобы он соответствовал. - Несоответствие соотношения сторон. Подача изображения 9:16 в генерацию 16:9 приводит к неожиданной обрезке. Всегда сопоставляйте соотношение сторон ввода с выходным
ratio. - Запрошено слишком много движения. 2-секундный рендер не может вместить панорамирование на 180 градусов без размытия. Увеличьте продолжительность или уменьшите движение.
Мы выполнили 24 тестовых рендера в режиме первого кадра на фотографиях продуктов для партии рекламы по уходу за кожей. Рендеры, в которых камера оставалась статичной или использовался медленный наезд (менее 10 процентов перемещения кадра), были выпущены в 80 процентах случаев. Рендеры, которые запрашивали "динамичное движение камеры", были выпущены в 25 процентах случаев и приводили к видимому искажению на отражающих крышках.
Как работает режим «Из первого и последнего кадра в видео»?
Режим «Из первого и последнего кадра в видео» принимает два изображения, first_frame и last_frame, и генерирует промежуточные кадры. Согласно справочнику API Wan 2.7 I2V, два изображения должны иметь одинаковое соотношение сторон и, в идеале, одинаковую композицию. Модель интерполирует правдоподобный переход.
Входные данные
first_frame(обязательно): изображение начального состояния.last_frame(обязательно): изображение конечного состояния.prompt(необязательно): описывает, как должен ощущаться переход, а не где он заканчивается.resolution,duration,ratio: те же ограничения, что и в режиме первого кадра.- Типичная продолжительность: от 2 до 5 секунд. Более длительные продолжительности заставляют модель больше изобретать.
Когда использовать
- Демонстрации продуктов, которые должны завершаться на определенном конечном кадре.
- Переходы, где начальное и конечное состояния разработаны.
- Кадры раскадровки, где два ключевых кадра зафиксированы.
Проработанный запрос
first_frame: закрытая подарочная коробка на мраморной поверхности.last_frame: та же коробка открыта, из нее льется свет и разворачивается лента.prompt: "Коробка плавно открывается в течение 3 секунд. Камера остается статичной. Световое свечение нарастает с 30-го кадра. Без смещения объекта." Разрешение 1080P, продолжительность 3с, соотношение 16:9.
Режимы сбоев
- Отражающие поверхности размываются. Стекло, металл и вода могут искажаться во время интерполяции. Уменьшите амплитуду движения или упростите поверхность.
- Несоответствие камеры. Если два ключевых кадра подразумевают разные углы камеры, модель изобретает переход, который часто выглядит как скачок.
- Слишком большая продолжительность. После 5 секунд модели приходится заполнять слишком много придуманного движения. Оставайтесь на коротких продолжительностях.
Кластер запросов PixMind first-last-frame содержит шаблоны для демонстрации продуктов, переходов и повествовательных паттернов, соответствующих этому режиму.
Как работает продолжение видео?
Продолжение видео принимает существующий короткий клип как first_clip и расширяет его во времени. Руководство Wan 2.7 I2V рассматривает это как отдельный подрежим I2V, потому что входными данными является видео, а не неподвижное изображение. Модель считывает векторы движения из исходного клипа и продолжает их.
Входные данные
first_clip(обязательно): короткое видео, обычно от 2 до 5 секунд. Формат и кодек должны соответствовать списку, принимаемому API.prompt(необязательно): описывает, как должно развиваться продолжение, а не перезапускаться.resolution: должно соответствовать исходному клипу, чтобы избежать артефактов масштабирования.duration: общая длина вывода, а не только добавленная часть.
Когда использовать
- 3-секундная генерация отличная, но вам нужно 6.
- Вы хотите расширить героический кадр до более длинного рекламного ролика.
- Первый клип имеет хорошее движение, которое вы хотите сохранить.
Проработанный запрос
first_clip: 3-секундный клип скейтбордиста, проезжающего мимо камеры, снятый в 720P.prompt: "Скейтбордист продолжает движение мимо камеры. Камера следует за ним. Фон меняется с переулка на свечение уличного фонаря. Без склеек." Разрешение 720P, продолжительность 6с, соотношение 16:9.
Режимы сбоев
- Сброс движения. Модель может заморозить объект, если запрос противоречит исходному движению. Согласуйте запрос с существующим направлением клипа.
- Артефакты масштабирования разрешения. Подача источника 720P в вывод 1080P приводит к мягким или искаженным кадрам. Сопоставьте выходное разрешение с источником.
- Слишком короткий клип. 1-секундный источник дает модели почти никакого движения для продолжения. Используйте не менее 2 секунд.
[УНИКАЛЬНОЕ ПОНИМАНИЕ] Продолжение видео — это наименее используемый подрежим I2V. Он позволяет "спасти" рендер, который остановился на 2 секунды раньше, что, как мы обнаружили, составляет примерно треть всех производственных итераций. Вместо того чтобы генерировать с нуля, вы добавляете.
Как работает режим, управляемый аудио?
Управляемый аудио I2V принимает неподвижное изображение плюс аудиодорожку driving_audio и создает видео, где объект движется синхронно с аудио. Согласно руководству Wan 2.7 image-to-video, это путь для контента с говорящими головами и аватарами. Модель использует аудиоволну для управления движением губ и общей энергией.
Входные данные
first_frame(обязательно): портрет или изображение персонажа. Лучше всего подходит фронтальное, хорошо освещенное, нейтральное выражение.driving_audio(обязательно): чистая аудиодорожка. WAV или MP3. Аудио студийного качества превосходит записи с телефона.prompt(необязательно): описывает окружающее движение, движение головы, энергию выражения.duration: обычно соответствует длине аудио, до 15 секунд.
Когда использовать
- Объясняющие видео с говорящей головой из одного портрета.
- Контент с аватарами для социальных сетей.
- Демонстрации продуктов с закадровым голосом, где лицо ведет повествование.
Проработанный запрос
first_frame: фронтальный портрет иллюстрированного аватара, нейтральное выражение, простой фон.driving_audio: 8-секундный WAV-файл приветствия закадрового голоса.prompt: "Легкое покачивание головой, моргание каждые 3 секунды, улыбка появляется в конце предложения." Разрешение 1080P, продолжительность 8с, соотношение 16:9.
Режимы сбоев
- Смещение губ на не-фронтальных лицах. Если портрет в профиль, синхронизация губ ухудшается. Используйте фронтальное изображение.
- Шумное аудио. Фоновый шум или музыка проникают в артефакты движения. Сначала очистите аудио.
- Длительные продолжительности без пауз. 15 секунд непрерывной речи без пауз заставляют модель генерировать неловкие формы рта. Добавьте паузы.
Для более глубоких паттернов сопряжения аудио с видео, кластер запросов PixMind audio-sync содержит шаблоны для говорящих голов, закадрового голоса и клипов, управляемых музыкой.
Как выбрать правильный режим I2V?
Решение диктуется тем, что у вас есть. Справочник API Wan 2.7 T2V и справочник I2V вместе описывают полную матрицу ввода, но большинство решений сводятся к простой таблице.
| У вас есть... | Используйте этот режим I2V | Почему |
|---|---|---|
| Одно фото | Из первого кадра в видео | Простейший путь. Модель изобретает движение. |
| Две фотографии, которые должны быть началом и концом | Из первого и последнего кадра в видео | Фиксирует конечное состояние. Уменьшает количество отклонений. |
| Короткий клип, которому нужно больше времени | Продолжение видео | Сохраняет существующее движение. Дешевле, чем повторная генерация. |
| Портрет плюс голосовая дорожка | Управляемый аудио | Синхронизация губ и энергия следуют за аудио. |
| Портрет плюс голос плюс референсное видео | Рассмотрите R2V вместо этого | R2V лучше сохраняет идентичность, чем управляемый аудио I2V. |
Практическая эвристика: чем больше входных данных вы можете дать модели, тем меньше ей приходится изобретать. Изобретение — это то место, где появляются искажения и дрейф.

Если вы начинаете с нуля и у вас еще нет входных данных, сначала выполните проход T2V, чтобы зафиксировать кадр, затем используйте лучший кадр в качестве first_frame в I2V. Этот двухэтапный рабочий процесс превосходит попытки получить идеальный рендер I2V с первой попытки.
Каковы распространенные режимы сбоев I2V?
I2V терпит неудачу предсказуемым образом. Называя их, вы быстрее итерируете.
- Искажение отражающих поверхностей. Стекло, зеркала, полированный металл размываются во время интерполяции. Смягчите это, уменьшив движение или упростив поверхность в исходном изображении.
- Дрейф идентичности между кадрами. Лица смещаются, особенно после 5 секунд. Смягчите это с помощью режима первого-последнего кадра для коротких зафиксированных кадров или R2V для более длительного сохранения идентичности.
- Несоответствие соотношения сторон. Подача изображения 9:16 в генерацию 16:9 обрезает объект. Сопоставьте соотношение сторон ввода и вывода.
- Противоречие запроса и изображения. Запрос "широкой панорамы" на крупном плане заставляет модель изобретать широкоугольный контекст, который она не может видеть. Согласуйте запрос с кадрированием изображения.
- Проникновение аудиошума в движение. Аудио телефонного качества создает призрачное движение на лице. Сначала очистите аудио.
- Расход кредитов на длительных итерациях. 10-секундные рендеры 1080P расходуют кредиты. Итерируйте на 2-3 секундах и 720P, затем масштабируйте.
В партии из 40 рендеров I2V для рекламной кампании сбои распределились примерно так: 40 процентов — противоречие запроса и изображения, 25 процентов — несоответствие соотношения сторон, 20 процентов — искажение отражающих поверхностей, 15 процентов — прочее. Несоответствие соотношения сторон — самое дешевое в исправлении: это одна проверка параметра, но оно привело к четверти потраченных впустую кредитов.
Для более глубоких паттернов режимов сбоев по вариантам использования, кластер вариантов использования PixMind Wan 2.7 содержит заметки по сценариям для продуктов, персонажей и социальных видео.
Часто задаваемые вопросы о режимах Wan 2.7 I2V
В чем разница между I2V и R2V в Wan 2.7?
I2V (image-to-video) принимает неподвижные изображения или короткие клипы в качестве входных данных. R2V (reference-to-video) принимает до пяти референсных изображений, пяти референсных клипов и одной референсной аудиодорожки и использует их для сохранения идентичности, голоса и стиля. R2V лучше подходит для многокадровой согласованности. I2V быстрее для однокадровой работы.
Может ли режим первого-последнего кадра Wan 2.7 обрабатывать движения камеры?
Может, но два ключевых кадра должны подразумевать согласованный угол камеры. Если first_frame и last_frame подразумевают разные углы, модель изобретает переход, который часто выглядит как скачок. Сохраняйте изменения камеры тонкими, менее 15 градусов.
Насколько долго Wan 2.7 может продлить клип в режиме продолжения видео?
Продолжение видео может продлить исходный клип до жесткого потолка в 15 секунд в режиме I2V. Исходный клип плюс сгенерированное продолжение не могут превышать 15 секунд в общей сложности. Для более длинных видео используйте цепочку из нескольких вызовов продолжения.
Требует ли режим Wan 2.7, управляемый аудио, наличия лица на изображении?
Лучше всего работает с лицом, но это не обязательно. Без лица аудио управляет общей энергией движения вместо синхронизации губ. Пейзажные или продуктовые снимки в режиме, управляемом аудио, создают абстрактное движение, которое следует за амплитудой аудио.
Можно ли бесплатно попробовать Wan 2.7 I2V?
Да. Страница PixMind Wan 2.7 включает бесплатную пробную версию без необходимости ввода кредитной карты. Платные планы активируются только при превышении пробной квоты.
Посмотрите в действии
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J


