Wan 2.7 Video Generator: Полное руководство по текстовому, изобразительному и эталонному режимам
Ключевые выводы
- Wan 2.7 — это единая модель, охватывающая преобразование текста в видео (T2V), изображения в видео (I2V) и эталонного видео в видео (R2V) в рамках единого рабочего процесса.
- Он поддерживает вывод 720P и 1080P, длительность от 2 до 15 секунд и пять соотношений сторон, включая 16:9, 9:16 и 1:1.
- Режимы "первый-последний кадр" и "управляемый аудио" дают вам контроль над начальным и конечным состояниями, что недоступно моделям I2V на основе одного изображения.
- Преобразование эталонного видео в видео (R2V) принимает до пяти эталонных изображений, пяти эталонных клипов и одну эталонную аудиодорожку за один вызов.
- Попробуйте Wan 2.7 video generator, чтобы следовать любому примеру из этого руководства.
Что такое Wan 2.7 Video Generator?
Wan 2.7 — это новейшая модель генерации видео от команды Wan компании Alibaba, представленная через Alibaba Cloud Model Studio. Она объединяет четыре ранее отдельные возможности в одно семейство моделей: преобразование текста в видео, изображения в видео, эталонного видео в видео и редактирование видео. Согласно обзору генерации видео Alibaba Cloud, модель принимает мультимодальный ввод и выводит MP4 или MOV с разрешением до 1080P.
Ключевое изменение в 2.7 — это унификация рабочего процесса. Вместо переключения между поставщиками для преобразования текста в видео и изображения в видео, вы вызываете одну и ту же модель и позволяете API маршрутизировать запрос на основе переданных вами входных данных. Это соответствует странице продукта PixMind Wan 2.7, где одна поверхность создания обрабатывает каждый режим.
Для создателей это важно, потому что переключение режимов — это то, где теряется большая часть производственного времени. Вы пишете запрос, рендерите, понимаете, что начальное состояние неверно, а затем перестраиваете все с нуля в другом инструменте. Унифицированная поверхность Wan 2.7 позволяет менять входные данные без смены моделей.
Сколько режимов поддерживает Wan 2.7?
Wan 2.7 предоставляет четыре режима. Справочник API I2V документирует полную матрицу входных данных. Вот практическая разбивка.
| Режим | Ввод | Лучше всего подходит для | Макс. длительность | Макс. разрешение |
|---|---|---|---|---|
| T2V (Текст в видео) | Текстовый запрос, опционально аудио | Раскадровка, абстрактное движение, B-roll | 15с | 1080P |
| I2V (Изображение в видео) | Первый кадр, опционально последний кадр, опционально аудио | Презентации продуктов, действия персонажей, анимация | 15с | 1080P |
| R2V (Эталонное видео в видео) | До 5 эталонных изображений + 5 эталонных клипов + эталонное аудио | Сохранение идентичности, клонирование голоса, сцены с несколькими персонажами | 10с | 1080P |
| Редактирование видео | Исходное видео + инструкция | Перенос стиля, редактирование на основе инструкций | 10с | 1080P |

Текст в видео (T2V)
T2V принимает текстовый запрос и выводит видео. Справочник API Wan 2.7 T2V перечисляет поддерживаемые параметры, включая разрешение, длительность, соотношение сторон и опциональную аудиодорожку. T2V — это самый быстрый путь от идеи до клипа.
Используйте T2V, когда у вас нет фиксированного начального кадра. Абстрактное движение, B-roll, раскадровки и стилизованные последовательности — все это подходит. Избегайте T2V, когда начальное состояние имеет значение: если вам нужен конкретный продукт на экране в нулевом кадре, переключитесь на I2V.
Изображение в видео (I2V)
I2V — это место, где проявляется унификация рабочего процесса Wan 2.7. Руководство пользователя Wan 2.7 по преобразованию изображения в видео документирует четыре подрежима:
- Первый кадр в видео: одно изображение становится начальным состоянием, модель придумывает движение.
- Первый и последний кадр в видео: два изображения определяют начальное и конечное состояния, модель интерполирует.
- Продолжение видео: короткий клип становится начальным состоянием, модель его расширяет.
- Управляемый аудио: изображение плюс аудиодорожка управляют синхронизацией губ или движением.
Для более подробного обзора четырех путей I2V см. кластер подсказок PixMind для первого и последнего кадра.
Эталонное видео в видео (R2V)
R2V — это самый мощный и наименее документированный режим. Справочник API Wan 2.7 R2V описывает вызов, который принимает до пяти эталонных изображений, пяти эталонных клипов и одну эталонную аудиодорожку. Модель использует их для сохранения идентичности, голоса и стиля в выходных данных.
R2V следует использовать, когда вам нужно, чтобы персонаж выглядел одинаково в разных кадрах, или когда вы хотите клонировать голос в новую сцену. Компромисс заключается в длительности: R2V ограничивается 10 секундами, что короче 15-секундного предела T2V и I2V.
Редактирование видео
Редактирование видео принимает исходное видео плюс текстовую инструкцию и возвращает отредактированный клип. API редактирования видео Wan 2.7 поддерживает редактирование на основе инструкций и перенос стиля. Этот режим выходит за рамки руководства по генерации, но стоит знать о его существовании.
Как работает режим "Первый-последний кадр"?
"Первый-последний кадр" — это подрежим I2V. Вы предоставляете два изображения: одно для первого кадра, одно для последнего. Wan 2.7 генерирует промежуточные кадры.

Это важно, потому что I2V на основе одного изображения оставляет конечное состояние на усмотрение модели. Если ваш кадр должен остановиться на определенном моменте (полностью повернутый продукт, полностью открытая коробка, полностью повернутый персонаж), режим "первый-последний кадр" — это способ гарантировать такое завершение.
Практический шаблон таков: снимите или сгенерируйте два ключевых кадра, загрузите их как первый и последний, установите длительность, отрендерите. Wan 2.7 интерполирует движение между ними. На странице подсказок PixMind для первого и последнего кадра есть шаблоны подсказок для презентаций продуктов, переходов и сюжетных паттернов.
Распространенные режимы отказа, на которые следует обратить внимание:
- Искажение на отражающих поверхностях: стекло, металл и вода могут размываться во время интерполяции.
- Дрейф идентичности персонажей: лица могут меняться между кадрами.
- Несогласованность камеры: если два ключевых кадра подразумевают разные ракурсы камеры, модель должна придумать переход.
Сначала тестируйте с короткой длительностью (2-3 секунды), прежде чем переходить к рендерингу 5-10 секунд.
Как работает видео, управляемое аудио?
Режим, управляемый аудио, принимает неподвижное изображение плюс аудиодорожку и создает видео, где объект, кажется, говорит или движется синхронно с аудио. Это основа контента с говорящими головами и аватарами.
Модель использует аудиоволну для управления двумя вещами: движением губ (если присутствует лицо) и общей энергией движения. API Wan 2.7 I2V принимает аудио как часть медиа-массива, используя тип driving_audio.
Для сценариев использования с говорящими головами, сочетайте это с кластером производительности персонажей PixMind. Комбинация управляемого аудио I2V плюс чистый эталонный портрет — это лучший на данный момент открытый путь к аватару с синхронизацией губ без обучения пользовательской модели.
Два практических замечания:
- Качество аудио определяет качество видео. Чистая студийная запись превосходит запись с микрофона телефона.
- Сначала протестируйте с 3-секундным клипом. Проблемы с синхронизацией легче обнаружить на ранней стадии.
Какое разрешение, длительность и соотношение сторон выбрать?
Wan 2.7 поддерживает вывод 720P и 1080P. Компромисс — это стоимость против четкости. Согласно стратегии ценообразования PixMind, 1080P потребляет примерно в два раза больше кредитов, чем 720P в секунду.
| Настройка | Когда выбирать | Компромисс |
|---|---|---|
| 720P | Контент для социальных сетей, вертикальное видео, тестовые итерации | Более низкая стоимость, заметная мягкость на больших экранах |
| 1080P | Презентации продуктов, кинематографический превизуализация, рекламный креатив | Более высокая стоимость, более четкая детализация |
| 16:9 | YouTube, встраивание на веб-сайты | Стандартный широкоэкранный формат |
| 9:16 | Reels, TikTok, Shorts | Мобильный вертикальный формат |
| 1:1 | Посты в ленте, квадратные встраивания | Кроссплатформенный нейтральный формат |
| 4:3 / 3:4 | Редакторский, винтажный стиль | Нишевый |
Длительность линейно влияет на стоимость. 10-секундный рендеринг стоит примерно в 5 раз дороже 2-секундного рендеринга при том же разрешении. Для итерации работайте с короткой длительностью. Для окончательного варианта — с длинной.
Разумный вариант по умолчанию для новых пользователей: 720P, 5 секунд, 16:9. Убедитесь, что кадр работает, затем переключитесь на 1080P для окончательного варианта.
Как выбрать правильный режим Wan 2.7?
Дерево решений становится простым, как только вы знаете, какие входные данные у вас есть.

- У вас есть только идея: используйте T2V. Итерируйте запрос, прежде чем добавлять визуальные элементы.
- У вас есть одна фотография продукта: используйте режим I2V "первый кадр".
- У вас есть два ключевых кадра, которые должны быть началом и концом: используйте режим I2V "первый-последний кадр".
- У вас есть короткий клип, который нужно расширить: используйте режим I2V "продолжение видео".
- У вас есть портрет плюс озвучка: используйте режим I2V "управляемый аудио".
- Вам нужно сохранение идентичности или голоса в разных кадрах: используйте R2V.
- У вас есть существующий материал, который нуждается в редактировании или изменении стиля: используйте редактирование видео.
Если вы не уверены, начните с хаба семейства PixMind Wan и выбирайте по сценарию использования, а не по названию режима. Хаб направит вас к правильной поверхности в зависимости от того, что вы пытаетесь создать.
Как следует составлять запросы для Wan 2.7?
Структура запроса важнее его длины. Wan 2.7 поощряет пятисегментную анатомию: субъект, действие, обстановка, камера, стиль.
Пример структуры:
Субъект: стеклянный флакон духов на темной поверхности. Действие: струя капель вырывается вправо. Обстановка: студийный черный фон, один основной свет слева от камеры. Камера: статичный средний план, эквивалент 50 мм. Стиль: кинематографический, малая глубина резкости, теплый контурный свет.
Каждый сегмент сужает пространство вывода. Отсутствующие сегменты по умолчанию используют предыдущие данные модели, которые обычно являются общими.
Для более глубоких шаблонов запросов кластер многокадровых запросов PixMind охватывает 12 многоразовых структур, включая многокадровые последовательности, шаблоны аудиосинхронизации и раскадровки "первый-последний кадр".
Две ловушки при составлении запросов, которых следует избегать:
- Перегруженные запросы: более пяти субъектов в одном запросе сбивают модель с толку. Разделите на несколько рендеров.
- Чрезмерное использование негативных запросов: Wan 2.7 не взвешивает негативные запросы так, как это делают модели изображений. Держите их короткими.
Как Wan 2.7 сравнивается с другими моделями?
Wan 2.7 находится в переполненной области. Sora 2, VEO 3, Kling 2.0 и Seedance — все они нацелены на пересекающиеся сценарии использования. Различие заключается в том, какие режимы предоставляет каждая модель и по какой цене.
| Возможность | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Текст в видео | Да | Да | Да | Да |
| Изображение в видео | Да | Ограничено | Да | Да |
| Первый-последний кадр | Да | Нет | Ограничено | Ограничено |
| Эталонное видео (R2V) | Да | Нет | Нет | Ограничено |
| I2V, управляемое аудио | Да | Да | Да | Ограничено |
| Макс. длительность | 15с | 20с | 8с | 10с |
| Макс. разрешение | 1080P | 1080P | 1080P | 1080P |
Эта таблица отражает опубликованные поставщиками спецификации по состоянию на июль 2026 года. Независимое прямое тестирование представлено в нашем тесте запросов Wan 2.7 против Sora 2 и сравнении VEO и Kling.
Отличительное преимущество Wan 2.7 — это сочетание режимов "первый-последний кадр" и R2V. Ни одна другая модель в таблице не предоставляет обе эти возможности в полном объеме. Если ваш рабочий процесс требует точного контроля начала и конца, а также сохранения идентичности, Wan 2.7 в настоящее время является единственным путем с использованием одной модели.
Каковы распространенные режимы отказа?
Каждая модель ИИ для видео терпит неудачу. Называние режимов отказа помогает быстрее выпускать продукт.
- Искажение на отражающих поверхностях: стекло, зеркала, полированный металл. Смягчите, уменьшив амплитуду движения в запросе.
- Дрейф идентичности в разных кадрах: лица меняются между генерациями. Смягчите с помощью эталонных входных данных R2V.
- Галлюцинации текста в кадрах: вывески, этикетки, логотипы отображаются как бессмыслица. Смягчите, удалив текст из входных изображений.
- Несоответствие соотношения сторон: подача изображения 9:16 в генерацию 16:9 обрезает его неожиданным образом. Сопоставьте соотношение сторон ввода с соотношением сторон вывода.
- Быстрый расход кредитов при длительных итерациях: 10-секундные тестовые рендеры быстро расходуют кредиты. Итерируйте с длительностью 2-3 секунды.
Кластер сценариев использования PixMind содержит заметки о режимах отказа для каждого сценария: продуктовый маркетинг, производительность персонажей, кинематографическая превизуализация и социальные зацепки.
Часто задаваемые вопросы о Wan 2.7 Video Generator
Можно ли попробовать Wan 2.7 бесплатно?
Да. Страница PixMind Wan 2.7 включает бесплатную пробную версию без необходимости ввода данных кредитной карты. Платные планы активируются только после превышения пробной квоты.
Поддерживает ли Wan 2.7 4K?
Нет. Видео Wan 2.7 достигает максимума в 1080P. Модель изображений Wan 2.7 поддерживает статичные изображения 4K через уровень Pro, но вывод видео ограничен 1080P.
Может ли Wan 2.7 клонировать лицо конкретного человека?
Wan 2.7 может сохранять идентичность из эталонных входных данных, но политика PixMind запрещает несанкционированное клонирование изображений реальных, идентифицируемых людей. Используйте R2V с оригинальными персонажами, стоковыми эталонами или своим собственным изображением.
Сколько времени занимает один рендеринг Wan 2.7?
Время генерации зависит от длительности, разрешения и нагрузки. Типичные 5-секундные рендеры 720P завершаются за 60-90 секунд. 10-секундные рендеры 1080P могут занимать 3-5 минут. API возвращает идентификатор задачи, по которому вы можете проверять статус.
Генерирует ли Wan 2.7 аудио?
Да, но только в режимах, которые принимают аудиовход. T2V может принимать аудиодорожку и синхронизировать с ней движение. Режим I2V, управляемый аудио, использует аудио для синхронизации губ и движения. Чистая генерация аудио (музыка, звуковые эффекты) — это отдельная модель Alibaba.
Могу ли я использовать результаты Wan 2.7 в коммерческих целях?
Да. Сгенерированные вами результаты вы можете использовать в коммерческих целях в соответствии с условиями Alibaba Cloud Model Studio. Ознакомьтесь с текущими условиями на обзоре Alibaba Cloud Model Studio перед выпуском продукта.
Посмотрите это в действии
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



