Видео в ComfyUI собирается из тех же узлов, что и картинки, плюс несколько
специфичных. Основная сложность не в схеме, а в том, что видео упирается в
видеопамять гораздо раньше изображений. Ниже устройство рабочей цепочки, выбор
модели и честный разговор про то, что помещается в вашу карту.
Почему видео это отдельная задача
Картинка это один кадр. Видео это последовательность кадров, которые должны
быть согласованы между собой. Если сгенерировать шестнадцать картинок по одному
описанию, вы получите шестнадцать разных людей в разных комнатах. Именно
согласованность, а не сама генерация, составляет суть задачи.
Модели для видео решают это тем, что обрабатывают весь отрезок сразу, а не
кадр за кадром. Отсюда и главное следствие для практики: потребление памяти
растёт не с площадью кадра, а с площадью, умноженной на количество кадров. Ролик
из тридцати двух кадров требует принципиально больше, чем одна картинка того же
разрешения.
Из этого вытекает вся дальнейшая логика. Почти все решения, которые вы будете
принимать, это торговля между длиной ролика, разрешением и тем, помещается ли всё
это в память. Понимание этой развилки экономит много бессмысленных попыток.
Если задача разовая и разбираться с узлами не хочется, есть готовые сервисы,
которые делают оживление фото в один шаг. Обзор таких вариантов есть в материале
про
бесплатные
NSFW видео из фото, а более общий разбор подхода в материале про то, как
оживить
фото нейросетью.

Два подхода: из текста и из картинки
Генерация видео делится на два сценария, и путать их не стоит, потому что
качество результата отличается радикально.
Первый это текст в видео. Вы описываете сцену словами, модель создаёт ролик с
нуля. Звучит привлекательнее, работает хуже: контроля мало, персонаж выходит
случайным, и попасть в задуманное сложно. Для NSFW этот путь особенно капризен,
потому что сцена и так сложная.
Второй это картинка в видео. Вы берёте готовый кадр, который вас устраивает, и
модель оживляет именно его. Персонаж, композиция и стиль уже зафиксированы, и
модели остаётся придумать только движение. На практике это даёт заметно более
предсказуемый результат, и почти вся осмысленная работа в этой нише идёт именно
так.
Рабочая схема поэтому обычно двухэтапная. Сначала вы добиваетесь идеального
кадра обычной генерацией, со всеми привычными инструментами доводки. И только
потом отправляете этот кадр в видеомодель. Пытаться получить всё одним запросом
из текста это самый долгий путь к разочарованию.
Из чего состоит цепочка
Если убрать частности, схема для оживления картинки состоит из нескольких
логических блоков, и понимание их назначения важнее, чем точные имена узлов,
которые от версии к версии меняются.
Блок загрузки модели. Здесь подгружается видеомодель, и это не тот же самый
чекпойнт, которым вы генерируете картинки. Видеомодели отдельные, и их нужно
скачивать дополнительно.
Блок входного изображения. Сюда подаётся ваш исходный кадр. Важный момент: его
разрешение и пропорции задают дальнейшую работу, и обычно кадр приводят к
размеру, на который рассчитана видеомодель, ещё до подачи.
Блок описания движения. Здесь текстом задаётся, что должно происходить.
Описания движения работают иначе, чем описания внешности: короткие и конкретные
формулировки про направление и характер движения дают больше, чем подробное
описание сцены, которая и так есть на картинке.
Блок параметров ролика. Количество кадров, частота кадров, шаги
сэмплирования. Именно здесь принимаются решения, от которых зависит, поместится
ли задача в память.
Блок сборки. Отдельные кадры собираются в видеофайл или в анимированное
изображение. Здесь же задаётся итоговая частота кадров, и это не то же самое, что
количество сгенерированных кадров.
Если базовая установка у вас ещё не сделана, начните с материала про
установку
ComfyUI, потому что видео стоит собирать на уже работающей и проверенной
сборке, а не осваивать оба слоя одновременно.
Сколько кадров и какая частота
Здесь путаются чаще всего, поэтому стоит развести два числа.
Количество кадров это сколько изображений модель сгенерирует. Именно оно
определяет нагрузку на память и время. Типичные значения в этой области
небольшие, обычно десятки кадров, а не сотни.
Частота кадров это скорость воспроизведения готового ролика. Она не влияет на
генерацию вообще, только на то, как быстро проиграются уже созданные кадры.
Шестнадцать кадров при восьми кадрах в секунду дадут две секунды видео, при
шестнадцати одну.
Отсюда практический вывод: если ролик кажется слишком коротким, не спешите
увеличивать количество кадров. Сначала попробуйте снизить частоту
воспроизведения. Это ничего не стоит по ресурсам, тогда как удвоение количества
кадров может просто не поместиться в память.
Второй практический вывод касается плавности. Существуют отдельные
инструменты, которые достраивают промежуточные кадры уже после генерации. Это
дешевле, чем генерировать больше кадров моделью, и обычно даёт более гладкое
движение при том же бюджете памяти.
Видеопамять: главный ограничитель
Разговор про железо здесь честнее вести без обещаний. Потребность зависит от
модели, разрешения, количества кадров и от того, используете ли вы облегчённые
версии весов, поэтому любые числа это ориентир.
Ориентировочно ситуация выглядит так. На картах примерно с восемью гигабайтами
короткие ролики в небольшом разрешении обычно получаются, особенно если брать
облегчённые варианты моделей. Примерно с двенадцатью гигабайтами становится
заметно свободнее по длине и размеру. Выше начинается территория, где можно не
экономить постоянно.
Что делать, когда не помещается. Первое: уменьшить количество кадров, это
самый действенный рычаг. Второе: снизить разрешение и увеличить готовый ролик
отдельным проходом апскейла. Третье: взять облегчённую версию весов, если она
существует для вашей модели. Четвёртое: закрыть всё, что занимает видеопамять,
включая браузер с тяжёлыми вкладками.
Разбор конкретной ошибки о нехватке памяти и её вариантов есть в материале про
нехватку
памяти CUDA. Если же карта принципиально не тянет, разумнее посмотреть в
сторону
аренды
GPU в облаке: видео это как раз та задача, где почасовая аренда окупается
быстрее всего, потому что нужна редко, но требовательна.
Какие модели вообще используют
Выбор видеомодели важнее, чем настройки схемы, и здесь стоит понимать
расклад по типам, а не заучивать названия: конкретные версии выходят и стареют
быстро.
Первое семейство это модели, выросшие из ранних экспериментов с анимацией
изображений. Они лёгкие, работают на скромном железе, дают короткие ролики с
умеренным движением. Качество среднее, зато порог входа низкий, и для первого
знакомства это разумный выбор.
Второе семейство это современные модели, которые обрабатывают
последовательность целиком и понимают текстовое описание движения. Они дают
заметно более осмысленное движение и лучше держат сцену, но требуют больше
памяти. Именно сюда стоит смотреть, если первое семейство разочаровало.
Третье это облегчённые версии тех же современных моделей, с уменьшенной
точностью весов. Они занимают существенно меньше памяти при умеренной потере
качества, и на средних картах часто оказываются единственным рабочим вариантом.
Проверяйте, существует ли такая версия для выбранной модели: это может решить
вопрос без покупки железа.
При скачивании обращайте внимание на то, что модель для видео идёт в комплекте
со вспомогательными файлами, и без них схема не заработает. Каталоги моделей
переезжают, а весной 2026 крупный хостинг разделился на два домена, поэтому
проверяйте актуальную страницу на момент чтения, а не ссылку из старой
инструкции.

Разрешение и пропорции для видео
Здесь действует то же правило, что и с картинками, только цена ошибки выше.
Каждая видеомодель рассчитана на определённый диапазон размеров, и выход за него
даёт не просто худший кадр, а разваливающееся движение.
Практический подход такой. Узнайте родное разрешение своей модели и приведите
входную картинку к нему заранее, отдельным шагом, а не надейтесь, что схема
подгонит размер сама. Автоматическая подгонка внутри цепочки нередко работает не
так, как ожидаешь, особенно если пропорции исходника сильно отличаются.
Если нужен ролик в большем размере, путь тот же, что с картинками: сгенерируйте
в родном разрешении и увеличьте готовое видео отдельным проходом. Апскейл видео
дороже, чем апскейл картинки, потому что кадров много, но всё равно дешевле, чем
попытка генерировать сразу крупно.
И помните про пропорции исходного кадра. Вертикальное видео из горизонтальной
картинки означает, что модель должна что-то придумать по краям, и придумывает она
обычно неудачно. Кадрируйте исходник заранее под ту рамку, которая вам нужна.
Как описывать движение
Описание движения это отдельный навык, и привычки из генерации картинок здесь
скорее мешают.
Работают короткие конкретные формулировки о том, что именно движется и в каком
направлении. Медленный поворот головы, лёгкое движение ткани, приближение камеры.
Одно основное движение на ролик даёт куда более чистый результат, чем попытка
описать целую сцену действий.
Плохо работают длинные повествования. Если вы опишете последовательность из
трёх событий, модель попытается уместить всё в свои несколько десятков кадров и
получится каша. Короткие модели не рассказывают истории, они анимируют момент.
Отдельно про камеру. Движение камеры и движение объекта это разные вещи, и
смешивать их в одном описании стоит осторожно. Если вы просите одновременно
приближение камеры и поворот персонажа, часто получаете невнятное среднее.
И общее правило, которое экономит время: не описывайте то, что уже есть на
входной картинке. Внешность, одежда и обстановка уже заданы кадром. Повторное их
описание отнимает влияние у описания движения, ради которого всё и затевалось.
Полезно также помнить про негативную часть. В видеогенерации она работает, но
её роль другая: туда обычно кладут не описания качества, а нежелательные типы
движения. Резкие рывки, деформация, мерцание. Это заметно полезнее, чем перенос
привычного негатива из генерации картинок, где половина меток к видео просто не
относится.
Отдельно стоит сказать про ожидания от сложных сцен. Если на исходном кадре
происходит что-то анатомически непростое, движение почти наверняка это сломает.
Модель достраивает промежуточные положения по своим представлениям, и чем сложнее
исходная поза, тем больше у неё возможностей ошибиться. Для сложных сцен разумнее
брать минимальную силу движения и короткий ролик, где ничего не успевает
развалиться.
Типичные проблемы и что с ними делать
Лицо плывёт от кадра к кадру. Самая частая жалоба. Обычно помогает уменьшение
силы движения и сокращение длины ролика: чем дальше кадр от исходного, тем больше
модель успевает уйти. Если нужна серия связных роликов с одним человеком,
задачу решают не здесь, а на этапе генерации исходников, где помогает
перенос
черт персонажа через IPAdapter.
Руки разваливаются в движении. Известная слабость. Практический обход это
выбирать исходный кадр, где руки не в фокусе и не совершают сложных действий.
Чинить руки в видео заметно сложнее, чем не ставить их в центр композиции.
Ролик дёргается. Чаще всего это низкая частота воспроизведения при малом числе
кадров. Попробуйте достроить промежуточные кадры отдельным инструментом вместо
увеличения генерации.
Движение почти отсутствует. Обычно это слишком осторожные параметры силы
движения или описание, которое ничего конкретного не просит. Усильте одно
конкретное движение, а не всё сразу.
Схема не запускается вовсе. Проверьте, что все нужные узлы установлены и что
модель действительно лежит там, где её ищет узел загрузки. Разбор частых поломок
сборки есть в материале про то, что делать, когда
ComfyUI не
работает.
Как организовать работу, чтобы не ждать зря
Видео считается долго, и главный источник потерянного времени это неудачно
построенный порядок работы, а не медленное железо.
Первое правило: никогда не ищите идею роликом. Проверяйте композицию и
персонажа картинками, они считаются в разы быстрее. К видеогенерации переходите,
когда исходный кадр вас полностью устраивает.
Второе: сначала короткий тестовый прогон. Поставьте минимальное количество
кадров и низкое разрешение, посмотрите, куда вообще идёт движение. Если
направление не то, вы узнаете это за минуту, а не за двадцать. Только убедившись,
что модель поняла задачу, поднимайте параметры до финальных.
Третье: меняйте по одному параметру. Сила движения, количество кадров и
описание влияют друг на друга, и одновременная правка трёх вещей превращает
отладку в гадание. При фиксированном сиде разница между двумя прогонами читается
однозначно.
Четвёртое: сохраняйте удачные схемы целиком. Узловая сборка позволяет
сохранить всю цепочку вместе с параметрами, и это едва ли не главное её
преимущество. Через месяц вы не вспомните, какая комбинация работала, а
сохранённая схема воспроизведёт её мгновенно.
Пятое, про терпение: первый прогон после запуска сборки всегда медленнее
последующих, потому что модель грузится в память. Судить о скорости по нему
бессмысленно.
Шестое, которое звучит банально, но экономит больше всего: записывайте, что
вы уже пробовали. Видеогенерация достаточно медленная, чтобы к третьему часу
работы вы перестали помнить, какая комбинация силы движения и длины уже
проверялась. Простой список попыток рядом с сохранёнными роликами избавляет от
повторного прохождения тех же тупиков и особенно помогает, когда возвращаешься к
задаче через несколько дней.
И седьмое: держите отдельно ту версию схемы, которая точно работает. Соблазн
улучшать рабочую цепочку прямо на ходу велик, а откатиться потом не к чему.
Копия проверенной схемы стоит ничего и не раз спасала вечер.

Что делать с готовым роликом
Генерация это не конец работы, и несколько простых шагов заметно поднимают
итоговое качество без дополнительных затрат на видеокарту.
Достройка промежуточных кадров. Отдельные инструменты умеют добавлять кадры
между существующими, делая движение гладким. Это дешевле, чем генерировать больше
кадров моделью, и обычно даёт лучший результат при том же бюджете памяти.
Апскейл. Увеличение готового ролика работает так же, как с картинками, и
позволяет генерировать в скромном разрешении, а отдавать в приличном.
Обрезка. Первые и последние кадры часто самые слабые: в начале движение ещё не
набрало ход, в конце модель уже уплыла от исходника. Отрезать по паре кадров с
каждого края это бесплатный способ улучшить впечатление.
И формат. Анимированное изображение удобно для быстрого просмотра, но весит
много и ограничено по цвету. Для чего-то серьёзнее собирайте нормальный
видеофайл, благо узлы для этого в сборке есть.
Отдельно про склейку нескольких роликов. Соблазн сделать длинное видео из
нескольких коротких понятен, но стык почти всегда заметен: освещение и детали
между отрезками не совпадают. Если склейка всё-таки нужна, планируйте её заранее и
делайте так, чтобы последний кадр одного отрезка служил исходником для
следующего. Это не убирает проблему полностью, но заметно смягчает переход.
И последнее наблюдение из практики: короткий чистый ролик почти всегда
производит лучшее впечатление, чем длинный с артефактами. Соблазн выжать
максимальную длину велик, но две секунды, где ничего не разваливается, выглядят
профессиональнее, чем шесть, где к концу плывёт лицо.
Стоит ли вообще связываться
Честный ответ зависит от того, что вам нужно. Если задача это несколько
роликов для себя, локальная сборка почти наверняка избыточна: настройка займёт
больше времени, чем вы сэкономите.
Готовый
сервис сделает то же самое без установки и без разговоров про видеопамять.
Локальный ComfyUI выигрывает в другом. Он даёт повторяемость, полный контроль
над каждым шагом и возможность встроить видео в собственную цепочку, где до этого
работают ваши модели и лоры. Если вы делаете много и вам важно, чтобы результат
был именно ваш, это окупается.
Сравнение ComfyUI с более простыми интерфейсами есть в материале
ComfyUI
против Forge и A1111. Для видео узловой подход остаётся практически
безальтернативным среди локальных решений, но именно поэтому имеет смысл сначала
убедиться, что видео вам действительно нужно.
Разумный порядок такой: попробуйте
онлайн-вариант,
поймите, нравится ли вам результат в принципе, и только потом стройте цепочку у
себя. Это дешевле, чем выяснять то же самое через неделю настроек.
Частые вопросы
Сколько видеопамяти нужно для видео в ComfyUI?
Обычно короткие ролики в небольшом разрешении получаются примерно от восьми
гигабайт, свободнее становится ближе к двенадцати. Точная потребность зависит от
модели, длины и разрешения.
Чем видеомодель отличается от обычного чекпойнта?
Это отдельная модель, обученная обрабатывать последовательность кадров сразу.
Ваш обычный чекпойнт для картинок для этого не подходит, видеомодель скачивается
дополнительно.
Почему лицо меняется по ходу ролика?
Чем дальше кадр от исходного, тем сильнее модель отклоняется. Помогает более
короткий ролик и меньшая сила движения, а связность серии решается на этапе
генерации исходных кадров.
Что лучше, из текста или из картинки?
Для предсказуемого результата почти всегда из картинки. Вы фиксируете
персонажа и композицию заранее, и модели остаётся только движение.
Как сделать ролик длиннее?
Сначала попробуйте снизить частоту воспроизведения, это бесплатно. Увеличение
количества кадров упирается в память гораздо быстрее.



