Оживить фото — значит превратить статичный снимок в короткое видео, где человек моргает, поворачивает голову или улыбается естественным движением. WAN (Wanxiang) — семейство видеомоделей от Alibaba Tongyi Lab, которое подходит для этой задачи лучше многих закрытых конкурентов по одной простой причине: часть версий модели открыты и бесплатны для использования, включая коммерческое.
WAN — не одна модель, а линейка: 2.2 вышла в июле 2025 года, 2.6 — в декабре 2025-го, а 2.7 — 3 апреля 2026 года, и каждая версия дает существенный прирост качества, а не мелкий патч. Важно понимать: когда в каком-то сервисе видите просто «WAN» без указания версии, это может быть любая из них, и результат будет заметно отличаться.
Разбираем, чем отличаются версии, как реально оживлять фото нейросетью с рабочими промптами и как получить доступ из России — в том числе полностью бесплатно, без VPN.

WAN без VPN
Если хочется оживить фото онлайн без разбора с картами, VPN и очередями на бесплатных серверах — проще всего через SpeShu.AI: своя точка доступа, оплата в рублях, без иностранной карты. У SpeShu.AI есть аналоговые модели: SpeShu Claude, SpeShu Gemini, SpeShu ChatGPT. Они не уступают официальным моделям и при этом работают без VPN, оплачиваются картой банков РФ и стоят дешевле.

Что умеет каждая версия WAN
WAN 2.2, вышедшая в июле 2025 года, стала первой видеодиффузионной моделью с архитектурой Mixture-of-Experts — это означает, что модель разделяет работу между «экспертами»: одни отвечают за общую композицию кадра, другие за мелкие детали и текстуры. Она поддерживает Image-to-Video для анимации фотографии и Last Frame conditioning — можно задать финальный кадр и контролировать, чем именно заканчивается ролик. Разрешение — до 720p, промпты принимаются на английском и китайском, а веса модели публично доступны на HuggingFace с нативной поддержкой ComfyUI.
WAN 2.6, вышедшая в декабре 2025 года, добавила то, чего не было ни у одного конкурента: сразу четыре режима генерации — текст-в-видео, фото-в-видео, генерация по референсу и аудио-в-видео. Именно режим Reference-to-Video особенно важен для тех, кто хочет оживить фото и сохранить персонажа консистентным: загружаете референсное изображение — модель генерирует новые сцены, почти точно сохраняя черты лица, одежду и пропорции. Видео здесь может длиться до 15 секунд, а при включенном multi-shot режиме модель сама делит идею на несколько планов, удерживая детали одинаковыми между ними. Появилась и нативная синхронизация звука с видео за один проход, без отдельной записи озвучки, с разрешением 720p и 1080p.
WAN 2.7, вышедшая 3 апреля 2026 года, дает нативное 1080p, а в продвинутых режимах — до 4K, с длительностью от 15 до 30 секунд — вдвое больше, чем у 2.6. Добавлены управляемый контроль движения, задание первого и последнего кадра и синхронизация звука. Цена через API составляет $0,15 за секунду на 1080p.
Доступность из России без VPN
Здесь есть хорошие новости. WAN 2.2 и WAN 2.6 в режиме Image-to-Video доступны прямо через браузер на HuggingFace Spaces — без регистрации, без VPN и полностью бесплатно. Минус в том, что в пиковые часы приходится ждать очередь на GPU, иногда 5–15 минут, но это работает и не требует ни карты, ни аккаунта.
Для тех, кто не хочет разбираться с локальной настройкой, есть агрегаторы, которые включают WAN среди доступных инструментов, с оплатой по СБП в рублях и без VPN — это удобнее локальной установки для нетехнических пользователей. Прямой доступ через API можно получить через SpeShu.AI

Как работает оживление фото в WAN
Вы загружаете изображение, пишете промпт, и модель анализирует исходный кадр как трехмерную сцену, а не просто накладывает анимацию поверх плоской картинки — генерация учитывает освещение, глубину и физику движения, поэтому результат выглядит естественно, а не как мультяшный трюк. Движение получается плавным, с хорошей временной консистентностью — объекты и персонажи двигаются реалистично, без дерганья между кадрами.
Уникальная функция Last Frame conditioning, доступная с версии 2.2, позволяет задать не только исходный, но и финальный кадр — модель сгенерирует переход между ними, то есть для оживления фото это дает контроль не только над начальной позой, но и над тем, чем заканчивается видео. А функция prompt extend в версии 2.6 автоматически дополняет короткие или нечеткие промпты деталями — освещением, углом камеры, описанием окружения, — что удобно для тех, кто не знает, как писать подробные запросы.

Промпты, которые реально работают
WAN принимает промпты на английском в первую очередь, на китайском, и с частичной поддержкой других языков через prompt extend — для русскоязычной аудитории лучше писать именно на английском, качество результата заметно выше.
Структура промпта для оживления фото такая: движение субъекта, движение камеры, атмосфера или стиль, технические параметры.
1. Мягкое оживление портрета The person gently turns their head slightly to the right, blinks naturally once, a soft smile appears. Warm studio lighting. Cinematic, photorealistic. Subtle breathing visible.
2. Архивное черно-белое фото The subject slowly looks up from a downward gaze, natural blinking, gentle head movement. Preserve the original black and white aesthetic, film grain texture, 1940s photographic style.

3. Групповое семейное фото People in the photo breathe naturally, slight body movements, gentle smiles appear on their faces. Camera holds still. Warm ambient light, nostalgic atmosphere.
4. Портрет на природе Hair moves gently in a soft breeze, leaves in the background sway lightly, the person blinks naturally and looks slightly to the side. Golden hour lighting, depth of field.
5. Детское фото Child looks around curiously, eyes wide and blinking, a slight smile. Natural playful movement. Soft diffused lighting, warm tones.
6. Контроль поворота головы через Last Frame Для начального кадра, где лицо смотрит прямо, и финального кадра в профиль: Natural head turn from forward facing to three-quarter profile. Smooth continuous motion. Maintain facial identity throughout.
7. Пейзаж с людьми People in the foreground make subtle natural movements, background trees sway gently, clouds drift slowly across the sky. Cinematic wide shot, natural lighting.
8. Профессиональный портрет для контента Subject maintains a professional composure, a slight confident nod, natural blink, a micro-expression of calm authority. Clean background, professional lighting unchanged.
9. Оживить фото домашнего питомца The cat’s ears perk up and rotate slightly, whiskers twitch, eyes blink slowly, the tail tip curls gently. Natural fur texture, warm ambient light.
10. Multi-shot сцена для WAN 2.6 Shot one, first three seconds: wide shot, person sitting at a table, looks up from a book. Shot two, three to eight seconds: medium shot, person smiles, closes the book gently. Shot three, eight to twelve seconds: close-up, eyes meet the camera, warm expression. Camera: smooth transitions between shots. Lighting: warm afternoon indoor light.
Технические ограничения
Для локального запуска WAN 2.2 в текстово-видео режиме на 14 миллиардах параметров нужно от 16 ГБ видеопамяти для комфортной работы, хотя есть облегченные варианты от 8 ГБ с потерей качества. WAN 2.6 в режиме Image-to-Video требует от 12 до 16 ГБ, и на потребительских видеокартах вроде RTX 3060 с 12 ГБ модель работает, но с ограничениями.
По скорости на HuggingFace Spaces генерация занимает от 3 до 15 минут в зависимости от очереди, а локально на RTX 3090 пятисекундный клип обрабатывается за 2–4 минуты. Как и у всех моделей класса Image-to-Video, на клипах длиннее 10 секунд лица могут начать «плыть» — для стабильности стоит использовать Last Frame conditioning или делать несколько коротких клипов и склеивать их. Промпты на русском языке технически работают через prompt extend, но точность следования им ниже, чем на английском, особенно для важных деталей.

Чем WAN отличается от Kling и Hailuo
Kling и Hailuo — закрытые модели без доступа к весам, с оплатой по подписке или токенам. WAN, напротив, открыт под лицензией Apache 2.0, и часть версий можно запускать локально без какой-либо оплаты — для пользователя без иностранной карты это принципиально: HuggingFace Spaces не требует ни карты, ни VPN, ни даже регистрации.
Есть и практическая разница: бесплатная версия Kling 3.0 ставит водяной знак на результат, тогда как WAN на HuggingFace Spaces по умолчанию работает без водяного знака — это важно для публикации в соцсетях. А режим Reference-to-Video у WAN 2.6 дает возможность удерживать одного и того же персонажа консистентным сразу в нескольких клипах — у Kling и Hailuo в бесплатных версиях такой функции нет, и для серийного контента это серьезное преимущество WAN.
Частые вопросы
Можно ли оживить фото бесплатно? Да, через HuggingFace Spaces — без регистрации, без VPN и полностью бесплатно, хотя иногда приходится подождать очередь на GPU.
Какая версия WAN лучше для оживления фото? WAN 2.6 — благодаря режиму Reference-to-Video, который сохраняет черты лица и одежду персонажа между сценами, и multi-shot режиму для более сложных роликов.
Нужен ли VPN для доступа к WAN из России? Нет — ни для HuggingFace Spaces, ни для локального запуска через ComfyUI, ни для доступа через агрегатор VPN не требуется.
Почему видео получается с искажением лица? Это известное ограничение всех моделей класса Image-to-Video на клипах длиннее 10 секунд — помогает использование Last Frame conditioning или склейка нескольких коротких клипов.
На каком языке лучше писать промпты? На английском — WAN лучше всего следует именно английским формулировкам, хотя частично понимает русский через функцию prompt extend.
Заключение
WAN выделяется среди инструментов для оживления фото тем, что часть версий можно использовать полностью бесплатно и без VPN — через HuggingFace Spaces или локальный запуск, — а платный доступ через SpeShu.AI закрывает вопрос оплаты в рублях для тех, кому не хочется разбираться с настройкой.
Промокод HABRSPESHUAI дает дополнительный бонус к первому пополнению.
ссылка на оригинал статьи https://habr.com/ru/articles/1068576/