Свой видеогенератор: что реалистично на имеющемся ПК
Проверка 09.09.2026. Сессия №5 дневного совета. Это исследование осуществимости, не установленный генератор и не доказательство дохода. Веса не скачивались, генерации не запускались, кредиты не расходовались.
Вывод для Михаила
Свой управляемый видеоконвейер реалистичен: сценарии → задания готовой модели → отбор дублей → монтаж. Обучать аналог Seedance с нуля для этого не требуется. На RTX 4060 Ti 8 ГБ разумный первый локальный кандидат — Wan2.2 TI2V-5B через штатный ComfyUI. Для более тяжёлых моделей остаются платный API или арендованный GPU; это альтернативы, а не обязательные покупки.
Не нужно сначала строить SaaS: сначала измерить выпуск собственных роликов. Но и отсутствие немедленной монетизации не мешает проверять полезность небольшого SaaS. Внутренний инструмент и публичный сервис имеют разные требования к лицензии, безопасности и затратам.
Оборудование: источник и границы
Сессия №1 передала результаты текущих read-only проверок, №5 не повторяла инвентаризацию:
| Устройство | Подтверждено №1 | Значение для решения №5 |
|---|---|---|
| ПК | RTX 4060 Ti, 8188 MiB VRAM; в момент чтения свободно 5801 MiB; Ryzen 5 7500F, 6/12; RAM 31.7 GiB | 8 ГБ — полная ёмкость, не постоянно доступный остаток. Нужен замер при реальном запуске |
| Диски ПК | C: 142 GiB, D: 543 GiB свободно | Место есть для ограниченного теста, но это не разрешение загружать модели |
| Имеющийся сервер | 2 CPU; RAM 3916 MiB; доступно 2255 MiB; swap 2047 MiB, занято 1031 MiB; диск около 27G свободно | Вычислительный GPU не обнаружен проверкой №1; найден виртуальный Cirrus VGA. Не планировать его как видеорендер-узел |
Сервер может обслуживать небольшую очередь/интерфейс при проверке существующей нагрузки. Его текущий объём RAM не подходит для размещения рассматриваемых моделей с CPU-offload. Вычисления можно отделить от веб-приложения. Ничего на сервере не менялось.
Модели и конкретные способы запуска
| Вариант | Что говорит первичный источник | Решение для ПК 8 ГБ |
|---|---|---|
| Wan2.2 TI2V-5B, исходный Python pipeline | Пример 1280×704 с offload и T5 на CPU: от 24 ГБ VRAM; 14B примеры: от 80 ГБ. Wan README | Эти числа нельзя переносить на ComfyUI |
| Та же 5B-модель, native ComfyUI | Документация прямо указывает возможность разместить 5B на 8 ГБ с native offloading. FP16 diffusion + FP8 UMT5 + отдельный VAE. ComfyUI Wan | Первый кандидат. Совместимость по документации, не измеренная производительность. Единый минимум RAM для этого режима не указан |
| LTX-2.5, стандартный путь | Официальные требования: VRAM 32 ГБ+, RAM 32 ГБ, диск 100 ГБ; рекомендация A100/H100, RAM 64 ГБ+, SSD 200 ГБ+. LTX requirements | Тезис из приложенного ChatGPT про 32 ГБ подтверждён именно для стандартного пути |
| LTX Desktop, текущая beta | Локально Windows/Linux от 16 ГБ VRAM; Windows 16 ГБ RAM, 32 рекомендовано, 160 ГБ диска. На Windows с 8 ГБ — API-only. LTX 2.5 Fast локальный, Pro — API. Desktop README | Не устанавливать в ожидании локальной генерации на 8 ГБ |
| LTX-2.5 через Python/ComfyUI с оптимизациями | Python quick start: около 66 GiB весов; есть fp8-cast и CPU/disk offload. Python README. Есть native ComfyUI workflow, но гарантированный порог 8 ГБ там не указан. ComfyUI 2.5 | Возможность экспериментального запуска не исключена. Стабильные скорость, RAM и качество на 4060 Ti не установлены |
| LTX-2.0 через WanGP, отдельная реализация | Автор WanGP в changelog 13.01.2026 заявляет 720p/10 с на 8 ГБ. Changelog. Это ранняя LTX-2, не автоматическое доказательство для 2.5 | Резервный эксперимент, не обещание 2.5 на нашем ПК |
| HunyuanVideo-1.5, исходный pipeline | 8.3B; минимум 14 ГБ VRAM с offloading; Linux. README отдельно ссылается на сторонний WanGP от 6 ГБ. Tencent README | Ни штатный минимум, ни ускорение на 4090 не доказывают скорость на 4060 Ti. Для глобального канала важнее ограничение лицензии ниже |
Что означает offload: части модели перемещаются между RAM и GPU. Снижение VRAM не отменяет RAM, передачу данных и время. Квантизация, число кадров, разрешение, декодер и число шагов меняют результат. «Запустилось» и «можно ежедневно выпускать ролики» — разные проверки. Ни одной модели здесь не присвоен рейтинг качества без одинакового теста.
Лицензии: готовый ролик не равен продаже генератора
Это чтение условий конкретных проектов, не юридическое заключение для всех стран.
- Wan2.2: Apache-2.0 у оригинала и проверенной перепаковки Comfy-Org. Сохранять необходимые уведомления при распространении; лицензия модели не даёт прав на чужое лицо, музыку или референс. Оригинальная лицензия, карточка пакета.
- LTX: нельзя называть все версии Apache. Лицензия от 11.08.2026 относится к LTX-2.5 и дальнейшим выпускам под ней; для старых 2/2.3 указан отдельный документ. В новой лицензии от $10 млн годовой выручки организации требуется платное соглашение для соответствующего использования; ниже порога тоже действуют ограничения. Нельзя удалять встроенные средства происхождения/маркировки. Перед SaaS проверить передачу производных моделей и экспортные условия. Применимость версий, условия 2.x.
- HunyuanVideo-1.5: Territory исключает ЕС, Великобританию и Южную Корею. §5(c) прямо охватывает использование, распространение и показ Output, а не только весов. Поэтому глобальный YouTube/Instagram нельзя объявлять безусловно допустимым применением. Практический выбор — другая модель либо предварительное разъяснение правообладателя для целевых территорий. Tencent License, §1(l), §5(c).
- WanGP: это отдельная оболочка, не автор Wan. Текущая Community License разрешает внутреннее использование/создание результатов, но платные API/SaaS/white-label требуют отдельной лицензии. Определение Restricted Commercialization шире краткого резюме; даже бесплатный публичный hosted-продукт не считать автоматически разрешённым без проверки. Лицензии подключённых моделей сохраняются. WanGP License.
- ComfyUI: код под GPL-3.0; права на модели и custom nodes проверяются отдельно. Перед распространением собственного приложения нужна проверка состава и обязательств, а не предположение «GUI бесплатный, значит всё разрешено». ComfyUI LICENSE.
Минимальная загрузка Wan 5B
Прочитаны только текстовые LFS-указатели, не веса. Точные имена, SHA256 и размеры сохранены в wan5b-manifest.json. Всего 18 144 966 705 байт = 18.145 GB = 16.899 GiB, плюс ComfyUI/PyTorch, кэш и выходные файлы. Для первого теста предлагаю резервировать 35 GiB свободного места — это наш запас, не официальный полный размер установки. Не скачивать весь репозиторий с десятками вариантов.
Проверенный T2V workflow JSON имеет 12 узлов: 1280×704, 41 кадр, 24 fps, 30 шагов, CFG 5, uni_pc/simple, shift около 8. Это около 1.71 с вывода. Примечание внутри рекомендует 121 кадр; это не фактическое значение текущего JSON. Экспорт — WebM и animated WebP, не готовый MP4 со звуком. Workflow не выполнялся.
Что именно можно автоматизировать
Есть и готовый кандидат оболочки: ограниченная проверка VocaVid (локальный исходник). Он может сэкономить разработку раскадровки/очереди, но его штатный путь основан на LTX 2.3 и не проверен на нашем ПК. Не подменять им тест Wan и не считать готовым SaaS.
В ComfyUI есть документированный интерфейс: отправка workflow через POST /prompt, получение prompt_id, очередь, /history/{prompt_id}, события WebSocket. Это позволяет собственной программе ставить задания и получать результаты без повторных кликов. Server API.
Предлагаемая архитектура, ещё не реализованная:
Сценарий/план сцены → очередь с лимитом попыток → ComfyUI на ПК ИЛИ внешний API
↓
клип + параметры + расходы + статус
↓
отбор → озвучка/титры/монтаж → ручной допуск
Очередь не публикует ничего автоматически. Для SaaS добавить аутентификацию, квоты, изоляцию файлов, ограничение размера/длительности, отмену, лимит расходов и срок удаления. ComfyUI не открывать напрямую в интернет. Сначала один локальный оператор, один проверенный workflow и один job за раз на GPU.
Управление CapCut/Premiere/After Effects в этой проверке не демонстрировалось: native computer API текущей сессии недоступен. CLI/проектный импорт/сценарии монтажа — отдельный проверяемый путь, не доказательство управления любым редактором. ffmpeg, ffprobe, python не найдены в PATH этим shell; это не полная инвентаризация установок. Поддельный «успешный рендер» на синтетике не создавался.
Следующий тест и стоимость
Формат, длительность и объём выпуска — результат общего исследования, а не обязательные вводные от Михаила. Для выбора метода нужны как минимум два честно различающихся варианта: полный AI-видеоряд и смешанный ролик с монтажом. У второго может быть меньше генерируемых секунд, но это уже иной визуальный продукт; равную привлекательность и популярность не предполагаем.
Пример учёта, не прогноз и не тариф: 30 секунд полного AI-видеоряда из шести клипов по 5 секунд при трёх попытках на каждый требуют генерации 90 секунд. Монтаж этих клипов не отменяет стоимость 18 попыток. Если часть хронометража заменить изображениями, титрами или другими разрешёнными исходниками, отдельно указать эту замену и оценить итог; не выдавать её за тот же полный AI-видеоряд по меньшей цене.
Готов протокол первого теста. На этом исследовательском этапе установка не выполнялась. Переход к тесту означает выбор отдельного окружения и каталога, загрузку примерно 18.1 GB весов и нагрузку на ПК; эти параметры нужно учитывать при выборе следующего шага. Это не универсальное требование разрешения для любого обратимого локального действия. Действующие ограничения файловой системы сохраняются; платный API-тест требует выбранного сервиса и явного лимита расходов. Генераций и покупок пока ноль.
Общая себестоимость локально = подготовка + отбраковка + монтаж + электричество + доля оборудования/поддержки. При уже купленной видеокарте её покупку не нужно повторно оплачивать ради теста, но её загрузка и износ не бесплатны. API = оплаченные секунды/кредиты всех попыток, а не только выбранных дублей. На арендном GPU считать также запуск окружения, простой, хранение и передачу. Цены/доступность платных генераторов проверяет ветка №3; №5 не подставляет неподтверждённый тариф.
Свой фундаментальный видеогенератор с нуля не выбран: даже официальное дообучение LTX использует существенно более тяжёлые GPU-конфигурации, а обучение с нуля требует собственного датасета, прав, обучения и оценки. Это вывод о масштабе, не придуманная оценка в долларах. LTX Trainer.
Что осталось неизвестным
Скорость/пик RAM/VRAM/доля годных дублей на 4060 Ti; совместимость актуальных зависимостей в отдельной установке Windows; доступность конкретного платного аккаунта и его экспорт; предпочтительный формат канала. Доход Артёма, его посредник, выплаты и спрос на наш SaaS этим исследованием не установлены. Контент/продвижение/платежи интегрирует №1 с остальными ветками.