Тридцать секунд одним куском
Ролик генерируется целиком, а не собирается из пятисекундных отрезков. Внутри одного клипа помещается завязка, действие и финал, и между ними нет стыков, которые надо прятать монтажом.
Модель Alibaba Cloud, которая выдаёт ролик длиной до 30 секунд одним куском, генерирует звук в том же проходе и умеет писать буквами внутри картинки. Веса поколения Wan 2.2 лежат в открытом доступе.
Поколение 3.0 сместило границу в четырёх местах сразу: длина ролика, звук, объём входных данных и правка уже готового видео.
Ролик генерируется целиком, а не собирается из пятисекундных отрезков. Внутри одного клипа помещается завязка, действие и финал, и между ними нет стыков, которые надо прятать монтажом.
Дорожка рождается вместе с картинкой, а не подкладывается следом. Шаги совпадают с шагами в кадре, а речь — с движением губ, потому что модель считает то и другое одновременно.
Режим Omni-Creation принимает изображения, документы и веб-страницы: до 20 референсов за раз. Бренд-гайд страницей и три кадра мудборда задают гамму и стиль сразу, без описания их словами.
Готовое видео меняется текстовой инструкцией: заменить предмет в кадре, поправить план, убрать деталь. Сцена не перегенерируется с нуля, поэтому остальная часть кадра остаётся прежней.
Wan 3.0 выдаёт до 30 секунд нативно, без склейки коротких фрагментов. Сюжет умещается целиком: завязка, действие, финал.
Режим Omni-Creation принимает изображения, документы и веб-страницы и собирает из них одну сцену. Разбор документа и страницы — часть входа, а не отдельный шаг.
Модель генерирует звуковую дорожку в одном проходе с изображением, а не подкладывает её после.
Готовое видео меняется текстовой инструкцией: заменить объект, поправить план, убрать деталь. Перегенерировать сцену с нуля не нужно.
Портретный режим правит костную структуру, форму глаз и мелкие черты — лицо персонажа собирается под задачу, а не выбирается из готовых.
Длинные надписи, графики, формулы и инфографика рисуются как текст, а не как узор, похожий на буквы.
Распределение цвета в кадре задаётся отдельно от сюжета — картинка попадает в нужную гамму с первого раза.
Многокадровое редактирование собирает до девяти картинок в один результат по текстовой инструкции.
Последовательная раскадровка держит стиль и героя от кадра к кадру — годится под раскадровку и комикс.
Четыре кадра показывают четыре разных умения модели: длину непрерывного плана, микродеталь лица, удержание героя между склейками и рисованную манеру.
У Wan три ступени. Бесплатная работает без оплаты и без карты, платные считаются в кредитах: кредит тратится на генерацию, видео стоит дороже картинки.
Цены на сайте Wan указаны в долларах, оплата российской картой там не проходит. Рублёвый доступ и сравнение обоих путей — на странице тарифов.
Wan — генератор видео и изображений от Alibaba Cloud. Одна модель делает и ролик по описанию, и картинку, и правку готового материала. Флагман линейки — Wan 3.0.
До 30 секунд одним куском. Это нативная длина модели, а не склейка коротких фрагментов.
Да, тариф Free стоит $0: одно видео и одно изображение в работе одновременно, шесть стилей, кредиты за ежедневный вход. Выгрузка на нём идёт с водяным знаком.
Интерфейса на русском у самого wan.video нет. Описание сцены на русском модель понимает; русский интерфейс и оплата рублями есть у сервиса-посредника.
Да. Веса моделей выложены на GitHub и HuggingFace, запуск идёт через ComfyUI. Ограничение здесь не в лицензии, а в объёме видеопамяти.
Wan 3.0 добавил нативные 30 секунд, звук в одном проходе с картинкой, до 20 референсов на вход и правку готового ролика по инструкции. Wan 2.2 остаётся тем поколением, чьи веса лежат в открытом доступе.
Сервис-посредник даёт русский интерфейс, оплату рублями и работу без VPN. Модель та же самая.