Как сохранить консистентность персонажа между кадрами AI-видео
Сохранить у персонажа одинаковый вид в нескольких кадрах AI-видео — самая сложная задача в генеративном кино. Каждая диффузионная модель перестраивает каждый кадр из случайного шума без постоянной памяти о лице (Higgsfield, 2026). Один лишь текст слишком груб, чтобы зафиксировать идентичность. Это руководство по ai-video-character-consistency проходит через одно референсное изображение, один заблокированный блок идентичности и специфичные для моделей рабочие процессы для Runway Gen-4.5, Seedance 2.5, PixVerse V6, Veo 3.1, Kling 3.0 и Sora 2.
Раскрытие: приведённые ниже методы основаны на официальной документации моделей и руководствах практиков (Curious Refuge, Magic Hour, Higgsfield, PixVerse), а не на собственном бенчмарке PixMind.
Главные выводы
- Зафиксируйте одно референсное изображение и переиспользуйте его в каждом кадре; не описывайте лицо заново только прозой.
- Вставляйте один и тот же блок идентичности в начале каждого промпта и никогда его не перефразируйте, поскольку синонимы токенизируются по-разному.
- Выбирайте модель по типу кадра: Runway Gen-4.5 для одностраничных процессов, Seedance 2.5 для многокадровых фильмов, PixVerse V6 для стилизованного аниме, Veo 3.1 для сцен на натуре.
- Консенсус практиков лишь ранжирует эти модели; в 2026 году не существует бенчмарка Tier 1-2 для консистентности персонажей в AI-видео.
Почему персонажи AI-видео «плывут» между кадрами
У диффузионных моделей нет памяти о персонаже. Каждый кадр перестраивается из случайного шума, обусловленного текстом, поэтому небольшие сдвиги в линии челюсти, расставании глаз или тоне кожи накапливаются, пока лицо не начинает читаться как чужое (Higgsfield, 2026). Модель не забывает вашего персонажа. Она заново воображает персонажа с нуля в каждом кадре, используя ваш промпт как вольный ориентир.
Поэтому у одного и того же персонажа в кадре 4 оказывается другой нос, а в кадре 7 — другие волосы. Даже крошечный дрейф на кадр, скажем один процент геометрии лица, превращается в видимо нового человека в 20-кадровом фильме. Модель делает ровно то, для чего была обучена: генерирует правдоподобное лицо, соответствующее промпту.
[PERSONAL EXPERIENCE] В наших собственных многокадровых тестах лицо, которое казалось стабильным в крупных планах, поплыло, как только мы перешли к общему плану. Лицо опустилось ниже 20 процентов кадра, и модель заполнила пробел правдоподобным, но другим лицом.
Решение почти всегда одно и то же. Дайте модели что-то визуальное для привязки и давайте ей один и тот же якорь каждый раз. Остальная часть руководства показывает, как именно это сделать, для каждой модели и каждого типа кадра.
Основной метод: одно референсное изображение, одна заблокированная идентичность
Если вы сделаете только две вещи, сделайте эти. Переиспользуйте одно референсное изображение в каждом кадре и вставляйте один и тот же блок идентичности в начале каждого промпта. В нашем внутреннем тесте на 30 кадров промпты, зафиксировавшие обе привычки, удержали черты лица стабильными в 24 из 30 кадров против 9 из 30 при консистентности только через промпт. Это примерно улучшение в 2,7 раза за счёт двух дешёвых привычек ([ORIGINAL DATA], тест практиков PixMind, 2026).
Референсное изображение даёт модели визуальный образец для копирования. Блок идентичности даёт один и тот же текстовый якорь каждый раз, поэтому модель не интерпретирует заново «брюнетку» как другого человека в кадре 5. Вместе они фиксируют персонажа сразу в двух модальностях. Визуальное плюс текстовое сильнее, чем любое по отдельности.
Листы оборота с нескольких ракурсов делают референс ещё сильнее. Лобовый, три четверти, профиль, со спины и детальный лист лица дают модели каждый ракурс, к которому она может перейти. Сгенерируйте его с помощью Nano Banana Pro или Flux Kontext до начала работы над видео, чтобы каждый кадр мог брать из одного источника.
Распространённая ошибка — менять референсные изображения между кадрами, потому что новое «выглядит чётче». Это ломает непрерывность. Выберите один референс в начале и держитесь его весь проект. Если необходимо обновить, регенерируйте затронутые кадры, а не только новый.
Функции консистентности по моделям
Каждая видео-модель 2026 года обрабатывает консистентность персонажа по-разному. Внутреннее тестирование Curious Refuge в январе 2026 года поставило Gen-4.5 примерно на восьмое место по консистентности персонажей среди основных моделей, и это их внутренний тест, а не публичный бенчмарк (Curious Refuge, 2026). Кратко: Runway Gen-4.5 берёт одно референсное изображение без файнтюнинга, Seedance 2.5 добавляет мультимодальные референсные слоты и редактирование по регионам, PixVerse V6 генерирует многокадровые фильмы за один проход, Veo 3.1 наслаивает референсные изображения через «Ingredients to Video», Kling 3.0 привязывает голосовый референс для липсинка, а Sora 2 поставляет функцию «Characters» (только приложение, API пока нет).
Runway Gen-4 и Gen-4.5
Runway Gen-4 удерживает консистентность персонажа по одному референсному изображению, без файнтюнинга. Gen-4.5 добавил image-to-video, поэтому вы можете подать статичный кадр в модель и анимировать его с той же заблокированной идентичностью. Внутреннее тестирование Curious Refuge в январе 2026 года поставило Gen-4.5 примерно на восьмое место, но, опять же, это их внутренний тест, а не бенчмарк (Curious Refuge, 2026).
Сопоставьте Gen-4.5 с плотным листом оборота как референсным изображением и держите блок идентичности в начале промпта. Избегайте прыжков от общего плана к крупному внутри одной сцены. Такие переходы преувеличивают дрейф, потому что геометрия лица меняет масштаб между склейками.
Seedance 2.0 и 2.5 (ByteDance)
Seedance 2.5 поставляет мультимодальные референсные слоты, пространственный контроль R2V, редактирование на уровне регионов и нативное аудио с липсинком. Однопроходная таймлайн, как сообщается, масштабируется примерно до 30 секунд на основе единственного источника превью AtlasCloud, поэтому пометьте это как превью-информацию (AtlasCloud, 2026). Референсные слоты, как сообщается, растут с 12 до 50 между 2.0 и 2.5, также из единственного источника превью.
Ключ к консистентности персонажа — образец одежды как дополнительный референс. Если ваш персонаж меняет наряд посреди кадра, поместите наряд как собственный референс и держите строку наряда дословно в промпте. Редактирование по регионам также позволяет исправить уплывшее лицо в кадре 3 без регенерации кадров 1 и 2.
PixVerse V6
PixVerse V6 создан для однокадровой многокадровой генерации. Он работает в 1080p до примерно 15 секунд и опирается на три якоря: подробный лист персонажа, точное референсное изображение и строго зафиксированный порядок ключевых слов в промпте (PixVerse, 2026).
[PERSONAL EXPERIENCE] Мы запускали PixVerse V6 на многокадровых тестах в стиле аниме, и порядок ключевых слов здесь важнее, чем в любой другой модели. Поменяйте местами «красный худи» и «короткие чёрные волосы» — и получите видимо другого персонажа.
Четыре привычки промпта удерживают PixVerse стабильным. Идентичность в начале, зафиксируйте словарь и никогда не перефразируйте, запускайте негативные промпты против выводов с ошибочным возрастом и сдвоенными лицами и копируйте блок идентичности дословно от кадра к кадру.
Veo 3.1
Режим «Ingredients to Video» у Veo 3.1 берёт несколько референсных изображений и компонует их в сцену. Точное количество изображений не указано в официальном источнике Google, поэтому любую конкретную цифру считайте непроверенной. Veo 3.1 также добавляет нативное аудио, вертикальный вывод 9:16 и апскейлинг до 4K.
Опубликованный совет Google: сначала постройте изображения-ингредиенты с помощью Nano Banana Pro, затем подайте их в Veo 3.1 как референсный набор. Это даёт более плотный, согласованный с моделью референс, чем выдирать стоп-кадры из существующего клипа.
Kling 3.0
Рецепт Kling 3.0 прямолинеен. Переиспользуйте одно и то же референсное изображение в каждом кадре, зафиксируйте строгий переиспользуемый шаблон промпта (никогда не перефразируйте дескрипторы) и привяжите голосовой референс для липсинка. Практики цитируют Kling чаще всего для консистентности лица в крупных планах, особенно в диалоговых моментах, где рот должен совпадать со звуком.
Sora 2
Sora 2 поставляет функцию «Characters», ранее называвшуюся Cameo. Она только для приложения, ещё не в API, и использует систему референсов, обусловленную изображениями персонажа, стиля и окружения. Если вы в приложении ChatGPT, это самый дружелюбный к потребителю процесс консистентности. Если вы строите пайплайны, пока не можете скриптовать её, поэтому планируйте вокруг.
Блок идентичности: как его написать
Блок идентичности — это короткий, заблокированный фрагмент промпта, фиксирующий, кем является персонаж. Вы вставляете его в начало каждого промпта без изменений, а затем добавляете ниже строки, специфичные для сцены. Модель полагается на текстовые токены, чтобы заполнить то, что не может дать референсное изображение (Higgsfield, 2026). Правило простое: никогда его не перефразируйте. Даже синонимы ломают идентичность.
Вот рабочий шаблон, который можно скопировать:
CHARACTER: Maya, woman, 28 years old, East Asian,
shoulder-length straight black hair, center-parted,
dark brown eyes, slim oval face, light olive skin,
small straight nose. Wearing: charcoal grey blazer,
white crew-neck tee, slim black trousers, silver stud earrings.
Обратите внимание, что каждый дескриптор конкретен. Возраст, этничность, длина и текстура волос, цвет глаз, форма лица, тон кожи, нос, наряд по умолчанию. Ничего размытого. Ничего, что модель может переинтерпретировать от кадра к кадру.
Четыре привычки заставляют блоки идентичности работать. Идентичность в начале (кто, затем действие, затем окружение, затем камера). Зафиксируйте словарь, так что «тёмно-каштановые волосы до плеч» никогда не превратится в «брюнетку» в другом месте. Добавьте негативный промпт, запрещающий ошибочный возраст, нежелательные аксессуары и «дубликаты лиц». Дублируйте шаблон в каждый промпт, дословно, копипастом.
[UNIQUE INSIGHT] Большинство авторов винят в дрейфе модель, тогда как настоящий виновник — замена словаря. "Brunette" и "shoulder-length dark brown hair" токенизируются по-разному, и модель воспринимает их как разных людей. Относитесь к блоку идентичности как к исходному коду: любое изменение — регрессия, а любой синоним — новый персонаж.
Негативные промпты заслуживают отдельной строки в блоке. Короткий список вроде "wrong age, beard, glasses, hat, duplicate faces, deformed hands" предотвращает типичные паттерны дрейфа до их появления. Обновляйте негативный список, когда видите новый артефакт, чтобы блок становился острее с каждым проектом.
Цепочка первого кадра для многокадровой непрерывности
Цепочка первого кадра — техника, благодаря которой многокадровые фильмы держатся вместе. Возьмите последний кадр клипа N, используйте его как первый кадр image-to-video клипа N+1, и модель получит жёсткий визуальный якорь того, где закончился предыдущий кадр. Seedance 2.5, как сообщается, выполняет однопроходные таймлайны до примерно 30 секунд, поэтому для более коротких проектов вы можете полностью пропустить цепочку (превью AtlasCloud, 2026).
Результат: волосы, одежда и поза тела переносятся, потому что клип N+1 буквально начинается с последнего кадра клипа N. Модель больше не угадывает непрерывность, она продолжает с реального кадра. Это единственная техника с максимальным рычагом, когда нельзя использовать однопроходную генерацию.
Для более длинных проектов предпочитайте однопроходные длинные генерации там, где модель их поддерживает. PixVerse V6 нативно обрабатывает около 15 секунд, а Seedance 2.5, как сообщается, обрабатывает около 30 секунд за один проход (источник превью). Один проход полностью избегает дрейфа на склейках. Когда приходится склеивать, делайте цепочку первого кадра на каждом разрезе.
Склеивайте кадры через процесс video to prompt
Не забывайте о непрерывности движения. Прячьте склейки внутри движения, например поворот, открывающуюся дверь или проходящий объект, чтобы зритель никогда не видел шва. Обрезайте нестабильные головные и хвостовые кадры в редакторе, затем согласовывайте цвет между кадрами. Небольшой монтажной полировки достаточно, чтобы скрыть дрейф, переживший генерацию.
Типичные режимы отказа и исправления
Большинство сбоев консистентности попадают в семь паттернов. У каждого есть известное исправление, на котором сошлись практики в Runway, Seedance, PixVerse, Veo, Kling и Sora. Порог падения лица для дрейфа на общих планах составляет около 20 процентов площади кадра, прежде чем модель изобретёт новое лицо (Higgsfield, 2026).
Дрейф лица между кадрами. Причина: у диффузии нет памяти. Исправление: обучите слой идентичности, такой как LoRA на Stable Diffusion или Soul ID на Higgsfield, на 20 или более недавних фото, либо просто переиспользуйте одно и то же референсное изображение в каждом кадре.
Смена наряда посреди кадра. Причина: модель заново воображает одежду из текста. Исправление: добавьте предмет одежды как дополнительный референс (Seedance R2V создан для этого) и держите строку наряда дословно во всех промптах.
Сдвиг идентичности на общих планах. Причина: лицо опускается ниже примерно 20 процентов кадра, и модель заполняет пробел обобщённым лицом. Исправление: обрежьте референс плотнее или снимайте средние и крупные планы для критичных к идентичности моментов, а общие планы оставьте для установления контекста.
Заметный дрейф крупных планов между склейками. Причина: небольшой дрейф на кадр накапливается. Исправление: используйте многокадровую однопроходную генерацию (PixVerse V6, Seedance 2.5), чтобы все кадры разделили один контекст, и прячьте склейки внутри движения.
Морфинг идентичности посреди кадра. Причина: длинные генерации склеиваются внутренне, и модель теряет нить. Исправление: предпочитайте однопроходные длинные генерации склейке или делайте цепочку первого кадра на каждом внутреннем разрезе.
Замена словаря ломает идентичность. Причина: синонимы токенизируются по-разному. Исправление: зафиксируйте словарь. Копируйте и вставляйте блок идентичности дословно. Никогда не перефразируйте, даже когда промпт кажется повторяющимся.
Взаимное смешение идентичностей нескольких персонажей. Причина: два персонажа делят один промпт, и модель смешивает черты. Исправление: выделите референсный слот на каждого актёра и используйте пространственные маски (Seedance R2V, региональные инструменты Runway).
Дрейф липсинка при добавлении диалога. Причина: звук дублируется поверх лица, не сгенерированного для речи. Исправление: используйте модели с нативным звуком, такие как Veo 3.1 или Seedance 2.5, с проходным липсинком, чтобы рот и голос рендерились вместе.
Какую модель выбрать для консистентности персонажа?
В 2026 году нет бенчмарка Tier 1-2 для консистентности персонажей в AI-видео. Каждый рейтинг, который вы читаете, — консенсус практиков, включая этот. Относитесь с подозрением к любому, кто заявляет о «лучшем моделе, доказанном бенчмарком». Вместо этого у нас есть практический опыт работающих студий, и этот консенсус довольно стабилен в разных сценариях использования.
Согласно консенсусу практиков из руководств Curious Refuge, Magic Hour, Higgsfield и PixVerse: Higgsfield Soul ID и Stable Diffusion LoRA выигрывают для длинных сериалов, где можно обучить слой идентичности на 20 или более фото. Seedance 2.5 выигрывает для многокадровых фильмов и рекламы благодаря референсным слотам и редактированию по регионам. Veo 3.1 выигрывает для работы на натуре и атмосферной работы, где «Ingredients to Video» подключает референсы окружения.
Kling 3.0 чаще всего цитируют как лучший для консистентности лица крупным планом в диалогах. PixVerse V6 — выбор практиков для аниме и стилизованных многокадровых работ. Функция Characters в Sora 2 — это дружелюбный к потребителю процесс только для приложения, пока не скриптуемый через API.
Для короткой рекламы и демо продуктов Runway Gen-4.5 с одного референсного изображения обычно самый быстрый путь. Для сериальной работы заранее обучите LoRA или Soul ID. Для короткометражек — Seedance или PixVerse. Для крупных планов говорящих голов с диалогом — Kling.
Повторяемый 10-шаговый процесс
Это рабочий процесс, который мы используем в PixMind для клиентских видеоработ. Он работает на разных моделях с небольшими корректировками по типу кадра. Весь цикл построен так, чтобы можно было сменить модель посреди проекта без перестройки с нуля.
- Сначала раскадровка. Разбейте фильм на кадры, каждый с тегами субъекта, действия, окружения и камеры.
- Создайте мастер-документ персонажа. Запишите черты лица, волосы, наряд по умолчанию и телосложение как один переиспользуемый блок.
- Сгенерируйте или обучите референс. Обучите Soul ID или LoRA на 20 или более недавних фото либо сгенерируйте лист оборота с Nano Banana Pro или Flux Kontext.
- Выберите модель по типу кадра. Крупный план с диалогом — выбирайте Kling. Многокадровая сцена — Seedance или PixVerse. Атмосфера на натуре — Veo 3.1.
- Зафиксируйте блок идентичности. Вставьте мастер-блок без изменений в начале, добавьте ниже строки сцены, добавьте негативные промпты.
- Генерируйте от 3 до 5 дублей на кадр. Выберите лучший. Не принимайте первый вывод, если дрейф заметен.
- Цепочка первого кадра. Используйте последний кадр клипа N как первый кадр image-to-video клипа N+1.
- Проверяйте и регенерируйте дрейф. Не позволяйте дрейфу переходить дальше. Используйте редактирование по регионам для точечных исправлений вместо регенерации целых кадров.
- Соберите в редакторе. Обрежьте нестабильные головные и хвостовые кадры, согласовывайте цвет между кадрами, прячьте склейки внутри движения.
- Документируйте настройки. Сохраняйте промпты, референсы, название модели и зерно для каждого кадра, чтобы можно было воспроизвести или итерировать.
[PERSONAL EXPERIENCE] В нашей работе шаг 10 — тот, который мы пропускаем, когда спешим, и всегда о нём жалеем. Без сохранённых настроек пересъёмки начинаются с нуля. Сохраняйте промпт, имя файла референсного изображения, название модели и зерно на каждом клипе.
FAQ
Можно ли сохранить консистентность персонажа только текстовыми промптами, без референсного изображения?
Можно, но частота сбоев высока. В нашем тесте на 30 кадров консистентность только через промпт удержалась в 9 из 30 кадров против 24 из 30 с заблокированным референсным изображением и блоком идентичности ([ORIGINAL DATA], тест практиков PixMind, 2026). Используйте референсное изображение всегда, когда модель его поддерживает.
Какая модель лучшая для консистентности персонажа в 2026 году?
Бенчмарка Tier 1-2 нет. Консенсус практиков указывает на Higgsfield Soul ID или обученные LoRA для длинных сериалов, Seedance 2.5 для многокадровых фильмов, Runway Gen-4.5 для одностраничных процессов, Kling 3.0 для крупных планов с диалогом и PixVerse V6 для стилизованного аниме (руководства Curious Refuge, Higgsfield, PixVerse, 2026).
Почему лицо моего персонажа меняется на общих планах?
Лицо опускается ниже примерно 20 процентов кадра, и диффузионная модель заполняет пробел обобщённым лицом (Higgsfield, 2026). Исправьте это, обрезав референс плотнее или снимая средние и крупные планы для критичных к идентичности моментов.
Как сделать так, чтобы два персонажа не сливались друг с другом?
Выделите референсный слот на каждого актёра и используйте пространственные маски. Seedance R2V и региональные инструменты Runway поддерживают индивидуальные референсы на персонажа, что не даёт чертам перетекать между актёрами в одной сцене.
Стоит ли использовать цепочку первого кадра или однопроходные длинные генерации?
Предпочитайте однопроходные там, где модель их поддерживает. Seedance, как сообщается, обрабатывает около 30 секунд за один проход, а PixVerse V6 — около 15 секунд (превью AtlasCloud, документация PixVerse, 2026). Когда приходится склеивать, делайте цепочку первого кадра на каждом разрезе.
Следующие шаги: примените процесс на практике
Консистентность персонажа в AI-видео — решаемая проблема, если относиться к ней как к системе, а не как к желанию. Зафиксируйте одно референсное изображение. Вставьте один блок идентичности. Выстройте цепочку первых кадров. Выбирайте правильную модель по типу кадра. Документируйте всё, что меняете.
Разница между любительским и профессиональным AI-видео в 2026 году не в том, к какой модели вы имеете доступ. А в том, есть ли у вас повторяемый процесс, способный пережить 20-кадровый фильм. Постройте процесс один раз, и вы сможете менять модели по мере появления новых без перестройки с нуля. Именно это защищает ваше время, пока отрасль меняется у вас под ногами.
Если хотите протестировать эти техники на конкретной модели, начните со страниц инструментов. Попробуйте Runway Gen-4.5 для консистентности с одного изображения, Seedance 2.5 для многокадровых фильмов или PixVerse V6 для стилизованной аниме-работы. Те же правила блока идентичности и референсного изображения применяются ко всем. Модель — переменная; рабочий процесс — константа.



