Как оживлять фото в WAN: полная инструкция для России, доступ без VPN

от автора

WAN 2.7 из одного фото теперь собирает не проходное покачивание головой в кадре, а полноценную мини-историю из нескольких сцен с синхронным звуком и точно сохранённым лицом человека. Разбираем, что это значит на практике и чем реально можно пользоваться уже сейчас.

Что такое WAN

WAN, или Wanxiang, — семейство видеомоделей от Alibaba Tongyi Lab. Часть версий линейки распространяется открыто и бесплатно для использования, включая коммерческое, — это заметно отличает WAN от большинства закрытых конкурентов, где даже базовый доступ строго лимитирован платной подпиской. Важная оговорка: открытые веса есть у более ранних версий (2.1, 2.2), а актуальная 2.7 распространяется только через API — официальных открытых весов для неё на момент этой статьи нет. Версии выходят быстро и с существенным приростом качества, а не мелкими косметическими патчами: версия 2.2 вышла в июле 2025 года, 2.6 — в декабре 2025-го, а 2.7 — 3 апреля 2026 года. У сторонних источников иногда встречается упоминание промежуточной версии 2.5 — нумерация между разными медиа расходится в деталях, но общей линии развития модели это не противоречит, просто разные площадки по-разному считают промежуточные релизы.

Reference-to-Video: одно фото — новый персонаж в новых сценах

Главное, что отличает WAN 2.7 от привычной идеи «оживить фото», — это режим Reference-to-Video. Загружаете референсное фото, и модель генерирует совершенно новые сцены, при этом почти точно сохраняя лицо, одежду и пропорции человека на исходном снимке. Это принципиально другой уровень задачи по сравнению с лёгким покачиванием головой или моргания на статичном фоне — здесь получаются полноценно новые кадры, в которых персонаж оказывается в другой обстановке, с другим освещением и другим действием, но остаётся узнаваемым.

Практический пример: у вас есть старое семейное фото — человек стоит у окна. С Reference-to-Video из этого же лица можно собрать короткую сцену, где человек идёт по улице осенним вечером, поворачивается к камере, а свет и фон меняются в соответствии с описанным сценарием — при этом лицо и одежда остаются теми же, что и на исходном фото. Раньше для такого результата пришлось бы либо снимать заново, либо тратить часы на ручной монтаж — модель делает это за одну генерацию.

Multi-shot: из одной идеи — мини-фильм

Ещё одна функция, которая заметно меняет расклад, — режим Multi-shot. Вместо того чтобы генерировать один статичный ролик, модель сама делит одну творческую идею на несколько планов — например, крупный план лица, затем общий план сцены, — и удерживает детали одинаковыми между этими кадрами: тот же человек, та же одежда, та же цветовая палитра. По сути, из одного фото и одного текстового описания получается не один зацикленный ролик, а короткая история с монтажной логикой, похожая на настоящий видеоряд, а не на анимированную гифку.

Звук теперь встроен, а не приклеен отдельно

Отдельного упоминания заслуживает нативная синхронизация звука — модель генерирует звуковую дорожку вместе с видео за один проход, а не как отдельный постпродакшн-этап. На практике это означает, что не нужно отдельно записывать озвучку, подбирать шумы или музыку под уже готовый ролик — звук (голоса, эффекты окружения, музыкальное сопровождение) рождается синхронно с картинкой и сразу соответствует происходящему в кадре.

WAN 2.7: разрешение и длительность

По техническим характеристикам WAN 2.7 генерирует видео нативно в 1080p — это по-прежнему потолок разрешения модели, для 4K нужен сторонний апскейл после генерации. Длительность ролика — до 15 секунд, как и в предыдущей версии 2.6 (для режима Reference-to-Video — до 10 секунд, для first-and-last-frame — фиксированные 5 секунд). Удвоение длительности до 30 секунд произошло уже в следующей модели линейки, Wan 3.0, вышедшей в августе 2026 года.

Как это выглядит на практике пошагово

  1. Загрузить референсное фото — именно оно задаёт лицо, одежду и пропорции персонажа для всех последующих сцен.

  2. Описать сцену и действие через текстовый промпт — чем конкретнее описание, тем точнее результат.

  3. Включить, если нужно, режим Multi-shot для истории из нескольких планов вместо одного статичного кадра.

  4. Указать, нужен ли синхронный звук, — голос, окружающие шумы, музыка.

  5. Дождаться генерации и скачать готовый результат.

Пример рабочего промпта на английском:

preserve facial identity and clothing from reference image, natural head turn, cinematic multi-shot sequence: close-up then wide shot, synchronized ambient sound, no distortion

Работает ли WAN в России без VPN

Прямой доступ к WAN — включая открытые каналы вроде HuggingFace Spaces и другие открытые площадки — работает из России без VPN. Это касается именно доступа к самой модели и генерации: сайт и открытые инструменты не заблокированы по IP. Барьер находится не на уровне доступа, а на уровне оплаты: официальная платёжная система Alibaba Cloud не принимает российские карты для платных тарифов на create.wan.video.

Доступ и оплата из России

Прямой доступ к WAN, в том числе через открытые каналы вроде HuggingFace Spaces, работает без VPN — с этим сложностей нет. Барьер в другом: официальная платёжная система Alibaba Cloud не принимает российские карты для оплаты платных тарифов на create.wan.video. Для оплаты без иностранной карты подойдёт SpeShu.AI — оплата в рублях, без смены региона аккаунта.

Частые вопросы

Чем Reference-to-Video отличается от обычного image-to-video?
Обычный image-to-video обычно ограничивается лёгкой анимацией исходного кадра — покачивание головой, моргание, лёгкое движение фона. Reference-to-Video генерирует полностью новые сцены с другим окружением и действием, при этом сохраняя лицо, одежду и пропорции человека с референсного фото.

Что такое multi-shot режим?
Это функция, при которой модель сама делит одну творческую идею на несколько планов — например, крупный и общий, — удерживая персонажа и детали одинаковыми между ними. В результате получается мини-история с монтажной структурой, а не один статичный ролик.

Нужен ли VPN для доступа к WAN?
Нет, прямой доступ к модели, включая открытые каналы вроде HuggingFace Spaces, работает без VPN. Основная сложность — оплата платных тарифов официальной платёжной системой, которая не принимает российские карты.

Какое разрешение и длительность видео у WAN 2.7?
Нативное разрешение — 1080p, это максимум для самой модели; 4K достижим только через сторонний апскейл после генерации. Длительность — до 15 секунд, как и в версии 2.6 (для Reference-to-Video — до 10 секунд, для first-and-last-frame — 5 секунд фиксированно). Удвоение длительности до 30 секунд появилось уже в следующей модели линейки, Wan 3.0 (август 2026).

Заключение

WAN 2.7 — это уже не просто «оживить фото», а возможность собрать из одной фотографии полноценную мини-историю с сохранённым персонажем, несколькими планами и синхронным звуком. Для оплаты без иностранной карты — SpeShu.AI, доступ в рублях и без смены региона. При пополнении баланса промокод HABRSPESHUAI даёт +15% к сумме пополнения.

ссылка на оригинал статьи https://habr.com/ru/articles/1074076/