Модели Wan и открытые веса
Под именем Wan скрывается не одна модель, а семейство: у каждой задачи своя сборка со своим весом и своими требованиями к железу. Имя файла читается по частям и сразу говорит, что модель делает.
Как читается имя модели
Имя собирается из трёх частей: поколение, задача, размер. Wan2.2-I2V-A14B — это поколение 2.2, задача «картинка в видео», размер 14 миллиардов параметров. Разобравшись один раз, дальше вы понимаете назначение файла, не открывая описание.
| Обозначение | Что означает |
|---|---|
| T2V | Text to video — ролик по текстовому описанию |
| I2V | Image to video — ролик из готового изображения |
| TI2V | И текст, и картинка на входе одновременно |
| S2V | Sound to video — ролик по звуковой дорожке |
| FLF2V | First-last frame to video — достраивание перехода между двумя кадрами |
| VACE | Редактирование готового ролика |
| 14B / 5B / 1.3B | Количество параметров в миллиардах — чем больше, тем больше нужно видеопамяти |
| A14B | Архитектура со смесью экспертов: 14 миллиардов активных параметров на шаг |
| 480P / 720P | Разрешение, под которое обучалась сборка |
| Diffusers | Та же модель, упакованная под библиотеку diffusers |
Что выложено открыто
Открытая линейка охватывает два поколения — 2.1 и 2.2 — плюс отдельную модель под танцевальное движение. Весов поколений 2.5 и 3.0 в репозиториях бренда нет: эти поколения работают через сервис.
| Модель | Поколение | Задача | Что важно знать |
|---|---|---|---|
| Wan2.2-T2V-A14B | 2.2 | Текст в видео | Основная модель поколения 2.2 для генерации ролика по описанию. |
| Wan2.2-I2V-A14B | 2.2 | Картинка в видео | Оживление готового изображения: снимок задаёт первый кадр. |
| Wan2.2-TI2V-5B | 2.2 | Текст и картинка в видео | Лёгкая модель на 5 миллиардов параметров — заводится там, где 14B не помещается в видеопамять. |
| Wan2.2-S2V-14B | 2.2 | Звук в видео | Ролик собирается по звуковой дорожке: движение и мимика идут за речью. |
| Wan2.2-Animate-14B | 2.2 | Перенос движения | Мимика и пластика с видео-референса переносятся на другого персонажа. |
| Wan2.2-Animate-2-14B | 2.2 | Перенос движения, второй выпуск | Обновление Animate; рядом лежит облегчённая дистиллированная сборка. |
| Wan2.1-T2V-14B | 2.1 | Текст в видео | Полновесная модель первого открытого поколения. |
| Wan2.1-T2V-1.3B | 2.1 | Текст в видео | Самая лёгкая модель линейки — 1,3 миллиарда параметров. |
| Wan2.1-I2V-14B-720P | 2.1 | Картинка в видео, 720p | Рядом лежит вариант 480P для машин послабее — разрешение прямо в имени. |
| Wan2.1-FLF2V-14B-720P | 2.1 | Первый и последний кадр в видео | На вход идут два кадра, модель достраивает переход между ними. |
| Wan2.1-VACE-14B | 2.1 | Редактирование видео | Правка готового ролика; есть облегчённый вариант на 1,3 миллиарда параметров. |
| Wan-Dancer-14B | — | Танцевальное движение | Отдельная модель под пластику всего тела. |
Какую брать под свою задачу
Если у вас 24 гигабайта видеопамяти и вы хотите лучшее качество — Wan2.2-T2V-A14B для генерации с нуля и Wan2.2-I2V-A14B для оживления снимка. Если видеопамяти меньше — Wan2.2-TI2V-5B принимает и текст, и картинку и весит втрое меньше.
Под движение персонажа берут Wan2.2-Animate-2-14B, под ролик с речью — Wan2.2-S2V-14B, под правку готового видео — Wan2.1-VACE-14B. Самая лёгкая в линейке, Wan2.1-T2V-1.3B, заводится на видеокартах, где остальные не помещаются, — ценой детализации.
Работать без скачивания весов
Те же модели доступны в браузере — видеокарта и сборка окружения не нужны.