Wan image to video — фотография превращается в ролик
Снимок задаёт первый кадр, а дальше модель достраивает движение: человек поворачивает голову, ткань шевелится, камера едет. Внешность и композиция при этом остаются теми же.
Чем это отличается от генерации с нуля
При генерации по описанию модель придумывает и сцену, и героя. При оживлении снимка героя и сцену задаёте вы, а модели остаётся только движение. Качество результата поэтому определяет исходный файл, а не длина описания.
Какие модели за это отвечают
| Модель | Что делает | Когда брать |
|---|---|---|
| Wan2.2-I2V-A14B | Оживляет одно изображение | Обычный случай: один снимок, нужно движение |
| Wan2.2-TI2V-5B | Принимает и картинку, и описание движения | Когда движение надо задать словами, а карта слабая |
| Wan2.1-FLF2V-14B-720P | Достраивает переход между двумя кадрами | Есть начало и конец, нужен путь между ними |
| Wan2.2-Animate-2-14B | Переносит движение с видео-референса | Нужна конкретная пластика, а не произвольная |
Разбор имён и полный список — на странице про модели Wan.
Какой снимок подходит
- Резкое лицо. Смазанный или пересжатый оригинал модель достраивает по-своему, и человек перестаёт быть похожим на себя.
- Видимый силуэт. Если руки обрезаны краем кадра, движение им взять неоткуда, и они появляются из ниоткуда.
- Один смысловой центр. На групповом снимке модель распределяет движение между всеми, и кто-то обязательно шевельнётся неестественно.
- Разрешение не ниже целевого. Увеличение при генерации не добавляет деталей, которых нет в оригинале.
Как задавать движение
Описание работает лучше, когда называет одно действие и его направление: «медленно поворачивает голову влево», «камера отъезжает назад», «ветер шевелит волосы справа». Перечисление трёх движений сразу даёт кашу: модель пытается уместить их в короткий отрезок и смазывает каждое.
Отдельно стоит сказать про камеру. Движение камеры и движение героя — разные вещи, и если не указать, что именно должно двигаться, модель решит сама.
Где ломается
Руки — первое место. Пальцы в движении собираются неправильно чаще остального, и лечится это укорачиванием отрезка. Второе — очки и украшения: тонкие оправы плывут вместе с лицом. Третье — надписи на одежде и вывесках: буквы на исходнике при движении превращаются в узор.
Со старыми снимками добавляется своё: зерно плёнки модель принимает за фактуру и усиливает его в движении. Помогает предварительная чистка снимка, а не более подробное описание.