← Контент и SaaSДиалог совета

Материал дневного этапа · 9 сентября 2026 · снимок авторского отчёта

Свой видеогенератор: что реалистично на имеющемся ПК

Проверка 09.09.2026. Сессия №5 дневного совета. Это исследование осуществимости, не установленный генератор и не доказательство дохода. Веса не скачивались, генерации не запускались, кредиты не расходовались.

Вывод для Михаила

Свой управляемый видеоконвейер реалистичен: сценарии → задания готовой модели → отбор дублей → монтаж. Обучать аналог Seedance с нуля для этого не требуется. На RTX 4060 Ti 8 ГБ разумный первый локальный кандидат — Wan2.2 TI2V-5B через штатный ComfyUI. Для более тяжёлых моделей остаются платный API или арендованный GPU; это альтернативы, а не обязательные покупки.

Не нужно сначала строить SaaS: сначала измерить выпуск собственных роликов. Но и отсутствие немедленной монетизации не мешает проверять полезность небольшого SaaS. Внутренний инструмент и публичный сервис имеют разные требования к лицензии, безопасности и затратам.

Оборудование: источник и границы

Сессия №1 передала результаты текущих read-only проверок, №5 не повторяла инвентаризацию:

Устройство Подтверждено №1 Значение для решения №5
ПК RTX 4060 Ti, 8188 MiB VRAM; в момент чтения свободно 5801 MiB; Ryzen 5 7500F, 6/12; RAM 31.7 GiB 8 ГБ — полная ёмкость, не постоянно доступный остаток. Нужен замер при реальном запуске
Диски ПК C: 142 GiB, D: 543 GiB свободно Место есть для ограниченного теста, но это не разрешение загружать модели
Имеющийся сервер 2 CPU; RAM 3916 MiB; доступно 2255 MiB; swap 2047 MiB, занято 1031 MiB; диск около 27G свободно Вычислительный GPU не обнаружен проверкой №1; найден виртуальный Cirrus VGA. Не планировать его как видеорендер-узел

Сервер может обслуживать небольшую очередь/интерфейс при проверке существующей нагрузки. Его текущий объём RAM не подходит для размещения рассматриваемых моделей с CPU-offload. Вычисления можно отделить от веб-приложения. Ничего на сервере не менялось.

Модели и конкретные способы запуска

Вариант Что говорит первичный источник Решение для ПК 8 ГБ
Wan2.2 TI2V-5B, исходный Python pipeline Пример 1280×704 с offload и T5 на CPU: от 24 ГБ VRAM; 14B примеры: от 80 ГБ. Wan README Эти числа нельзя переносить на ComfyUI
Та же 5B-модель, native ComfyUI Документация прямо указывает возможность разместить 5B на 8 ГБ с native offloading. FP16 diffusion + FP8 UMT5 + отдельный VAE. ComfyUI Wan Первый кандидат. Совместимость по документации, не измеренная производительность. Единый минимум RAM для этого режима не указан
LTX-2.5, стандартный путь Официальные требования: VRAM 32 ГБ+, RAM 32 ГБ, диск 100 ГБ; рекомендация A100/H100, RAM 64 ГБ+, SSD 200 ГБ+. LTX requirements Тезис из приложенного ChatGPT про 32 ГБ подтверждён именно для стандартного пути
LTX Desktop, текущая beta Локально Windows/Linux от 16 ГБ VRAM; Windows 16 ГБ RAM, 32 рекомендовано, 160 ГБ диска. На Windows с 8 ГБ — API-only. LTX 2.5 Fast локальный, Pro — API. Desktop README Не устанавливать в ожидании локальной генерации на 8 ГБ
LTX-2.5 через Python/ComfyUI с оптимизациями Python quick start: около 66 GiB весов; есть fp8-cast и CPU/disk offload. Python README. Есть native ComfyUI workflow, но гарантированный порог 8 ГБ там не указан. ComfyUI 2.5 Возможность экспериментального запуска не исключена. Стабильные скорость, RAM и качество на 4060 Ti не установлены
LTX-2.0 через WanGP, отдельная реализация Автор WanGP в changelog 13.01.2026 заявляет 720p/10 с на 8 ГБ. Changelog. Это ранняя LTX-2, не автоматическое доказательство для 2.5 Резервный эксперимент, не обещание 2.5 на нашем ПК
HunyuanVideo-1.5, исходный pipeline 8.3B; минимум 14 ГБ VRAM с offloading; Linux. README отдельно ссылается на сторонний WanGP от 6 ГБ. Tencent README Ни штатный минимум, ни ускорение на 4090 не доказывают скорость на 4060 Ti. Для глобального канала важнее ограничение лицензии ниже

Что означает offload: части модели перемещаются между RAM и GPU. Снижение VRAM не отменяет RAM, передачу данных и время. Квантизация, число кадров, разрешение, декодер и число шагов меняют результат. «Запустилось» и «можно ежедневно выпускать ролики» — разные проверки. Ни одной модели здесь не присвоен рейтинг качества без одинакового теста.

Лицензии: готовый ролик не равен продаже генератора

Это чтение условий конкретных проектов, не юридическое заключение для всех стран.

Минимальная загрузка Wan 5B

Прочитаны только текстовые LFS-указатели, не веса. Точные имена, SHA256 и размеры сохранены в wan5b-manifest.json. Всего 18 144 966 705 байт = 18.145 GB = 16.899 GiB, плюс ComfyUI/PyTorch, кэш и выходные файлы. Для первого теста предлагаю резервировать 35 GiB свободного места — это наш запас, не официальный полный размер установки. Не скачивать весь репозиторий с десятками вариантов.

Проверенный T2V workflow JSON имеет 12 узлов: 1280×704, 41 кадр, 24 fps, 30 шагов, CFG 5, uni_pc/simple, shift около 8. Это около 1.71 с вывода. Примечание внутри рекомендует 121 кадр; это не фактическое значение текущего JSON. Экспорт — WebM и animated WebP, не готовый MP4 со звуком. Workflow не выполнялся.

Что именно можно автоматизировать

Есть и готовый кандидат оболочки: ограниченная проверка VocaVid (локальный исходник). Он может сэкономить разработку раскадровки/очереди, но его штатный путь основан на LTX 2.3 и не проверен на нашем ПК. Не подменять им тест Wan и не считать готовым SaaS.

В ComfyUI есть документированный интерфейс: отправка workflow через POST /prompt, получение prompt_id, очередь, /history/{prompt_id}, события WebSocket. Это позволяет собственной программе ставить задания и получать результаты без повторных кликов. Server API.

Предлагаемая архитектура, ещё не реализованная:

Сценарий/план сцены → очередь с лимитом попыток → ComfyUI на ПК ИЛИ внешний API
                                                ↓
                                  клип + параметры + расходы + статус
                                                ↓
                               отбор → озвучка/титры/монтаж → ручной допуск

Очередь не публикует ничего автоматически. Для SaaS добавить аутентификацию, квоты, изоляцию файлов, ограничение размера/длительности, отмену, лимит расходов и срок удаления. ComfyUI не открывать напрямую в интернет. Сначала один локальный оператор, один проверенный workflow и один job за раз на GPU.

Управление CapCut/Premiere/After Effects в этой проверке не демонстрировалось: native computer API текущей сессии недоступен. CLI/проектный импорт/сценарии монтажа — отдельный проверяемый путь, не доказательство управления любым редактором. ffmpeg, ffprobe, python не найдены в PATH этим shell; это не полная инвентаризация установок. Поддельный «успешный рендер» на синтетике не создавался.

Следующий тест и стоимость

Формат, длительность и объём выпуска — результат общего исследования, а не обязательные вводные от Михаила. Для выбора метода нужны как минимум два честно различающихся варианта: полный AI-видеоряд и смешанный ролик с монтажом. У второго может быть меньше генерируемых секунд, но это уже иной визуальный продукт; равную привлекательность и популярность не предполагаем.

Пример учёта, не прогноз и не тариф: 30 секунд полного AI-видеоряда из шести клипов по 5 секунд при трёх попытках на каждый требуют генерации 90 секунд. Монтаж этих клипов не отменяет стоимость 18 попыток. Если часть хронометража заменить изображениями, титрами или другими разрешёнными исходниками, отдельно указать эту замену и оценить итог; не выдавать её за тот же полный AI-видеоряд по меньшей цене.

Готов протокол первого теста. На этом исследовательском этапе установка не выполнялась. Переход к тесту означает выбор отдельного окружения и каталога, загрузку примерно 18.1 GB весов и нагрузку на ПК; эти параметры нужно учитывать при выборе следующего шага. Это не универсальное требование разрешения для любого обратимого локального действия. Действующие ограничения файловой системы сохраняются; платный API-тест требует выбранного сервиса и явного лимита расходов. Генераций и покупок пока ноль.

Общая себестоимость локально = подготовка + отбраковка + монтаж + электричество + доля оборудования/поддержки. При уже купленной видеокарте её покупку не нужно повторно оплачивать ради теста, но её загрузка и износ не бесплатны. API = оплаченные секунды/кредиты всех попыток, а не только выбранных дублей. На арендном GPU считать также запуск окружения, простой, хранение и передачу. Цены/доступность платных генераторов проверяет ветка №3; №5 не подставляет неподтверждённый тариф.

Свой фундаментальный видеогенератор с нуля не выбран: даже официальное дообучение LTX использует существенно более тяжёлые GPU-конфигурации, а обучение с нуля требует собственного датасета, прав, обучения и оценки. Это вывод о масштабе, не придуманная оценка в долларах. LTX Trainer.

Что осталось неизвестным

Скорость/пик RAM/VRAM/доля годных дублей на 4060 Ti; совместимость актуальных зависимостей в отдельной установке Windows; доступность конкретного платного аккаунта и его экспорт; предпочтительный формат канала. Доход Артёма, его посредник, выплаты и спрос на наш SaaS этим исследованием не установлены. Контент/продвижение/платежи интегрирует №1 с остальными ветками.