Модели Wan и открытые веса

Под именем Wan скрывается не одна модель, а семейство: у каждой задачи своя сборка со своим весом и своими требованиями к железу. Имя файла читается по частям и сразу говорит, что модель делает.

Как читается имя модели

Имя собирается из трёх частей: поколение, задача, размер. Wan2.2-I2V-A14B — это поколение 2.2, задача «картинка в видео», размер 14 миллиардов параметров. Разобравшись один раз, дальше вы понимаете назначение файла, не открывая описание.

ОбозначениеЧто означает
T2VText to video — ролик по текстовому описанию
I2VImage to video — ролик из готового изображения
TI2VИ текст, и картинка на входе одновременно
S2VSound to video — ролик по звуковой дорожке
FLF2VFirst-last frame to video — достраивание перехода между двумя кадрами
VACEРедактирование готового ролика
14B / 5B / 1.3BКоличество параметров в миллиардах — чем больше, тем больше нужно видеопамяти
A14BАрхитектура со смесью экспертов: 14 миллиардов активных параметров на шаг
480P / 720PРазрешение, под которое обучалась сборка
DiffusersТа же модель, упакованная под библиотеку diffusers

Что выложено открыто

Открытая линейка охватывает два поколения — 2.1 и 2.2 — плюс отдельную модель под танцевальное движение. Весов поколений 2.5 и 3.0 в репозиториях бренда нет: эти поколения работают через сервис.

МодельПоколениеЗадачаЧто важно знать
Wan2.2-T2V-A14B 2.2 Текст в видео Основная модель поколения 2.2 для генерации ролика по описанию.
Wan2.2-I2V-A14B 2.2 Картинка в видео Оживление готового изображения: снимок задаёт первый кадр.
Wan2.2-TI2V-5B 2.2 Текст и картинка в видео Лёгкая модель на 5 миллиардов параметров — заводится там, где 14B не помещается в видеопамять.
Wan2.2-S2V-14B 2.2 Звук в видео Ролик собирается по звуковой дорожке: движение и мимика идут за речью.
Wan2.2-Animate-14B 2.2 Перенос движения Мимика и пластика с видео-референса переносятся на другого персонажа.
Wan2.2-Animate-2-14B 2.2 Перенос движения, второй выпуск Обновление Animate; рядом лежит облегчённая дистиллированная сборка.
Wan2.1-T2V-14B 2.1 Текст в видео Полновесная модель первого открытого поколения.
Wan2.1-T2V-1.3B 2.1 Текст в видео Самая лёгкая модель линейки — 1,3 миллиарда параметров.
Wan2.1-I2V-14B-720P 2.1 Картинка в видео, 720p Рядом лежит вариант 480P для машин послабее — разрешение прямо в имени.
Wan2.1-FLF2V-14B-720P 2.1 Первый и последний кадр в видео На вход идут два кадра, модель достраивает переход между ними.
Wan2.1-VACE-14B 2.1 Редактирование видео Правка готового ролика; есть облегчённый вариант на 1,3 миллиарда параметров.
Wan-Dancer-14B Танцевальное движение Отдельная модель под пластику всего тела.

Какую брать под свою задачу

Если у вас 24 гигабайта видеопамяти и вы хотите лучшее качество — Wan2.2-T2V-A14B для генерации с нуля и Wan2.2-I2V-A14B для оживления снимка. Если видеопамяти меньше — Wan2.2-TI2V-5B принимает и текст, и картинку и весит втрое меньше.

Под движение персонажа берут Wan2.2-Animate-2-14B, под ролик с речью — Wan2.2-S2V-14B, под правку готового видео — Wan2.1-VACE-14B. Самая лёгкая в линейке, Wan2.1-T2V-1.3B, заводится на видеокартах, где остальные не помещаются, — ценой детализации.

Работать без скачивания весов

Те же модели доступны в браузере — видеокарта и сборка окружения не нужны.