Wan 3.0 из России в 2026: 30 секунд видео со звуком из PDF и презентации
Alibaba выпустила Wan 3.0: до 30 секунд видео за один проход, звук генерируется сразу, а на вход можно подать PDF, презентацию, таблицу или ссылку на страницу. Разбираем, как зайти из России, сколько это стоит в рублях и где модель ломается.
18 мин чтения
Wan 3.0 генерирует до 30 секунд видео за один проход, со звуком и в разрешении до 1080p, а на вход принимает не только промпт и картинку, но и документ: PDF, презентацию, таблицу, Markdown или ссылку на публичную страницу. Alibaba выкатила модель 24 августа 2026 после трёх недель публичной беты. Из России домены открываются, но заплатить картой российского банка не выйдет.
Раньше видеомодели закрывали задачу «сделай красивый пятисекундный кадр». Wan 3.0 замахивается на другую: «сделай законченную сцену». Тридцать секунд с генерируемой звуковой дорожкой и несколькими персонажами в кадре меняют список задач: под такую длину уже влезает Reels целиком, короткое видео-КП по презентации или объяснялка на карточку товара. Ниже разберём, что модель реально умеет, как в неё попасть из России, сколько это стоит в рублях и на чём она спотыкается.
Wan 3.0 от Alibaba вышла 24 августа 2026: до 30 секунд видео за проход, 30 кадров в секунду, 480p/720p/1080p, звук считается вместе с картинкой. На вход идут текст, до 10 изображений, до 5 видео, до 5 аудио, документ до 50 страниц и 100 МБ или ссылка на страницу. Доступ только по API через Alibaba Cloud Model Studio в статусе preview, открытых весов нет. Цена посекундная: $0.05, $0.10 и $0.20 за секунду по разрешениям, то есть 30-секундный ролик в 1080p стоит около 506 ₽.
Словарик: 6 терминов, которые встретятся дальше
- Wan - линейка видеомоделей Alibaba, третье поколение вышло в августе 2026.
- Model Studio - облачная платформа Alibaba Cloud, через которую модель отдают по API.
- Preview - режим раннего доступа: работает, но с ограничениями и без гарантий стабильности.
- Document-to-video - генерация видеоряда прямо из файла документа, без ручного сценария.
- Нативный звук - дорожка считается той же моделью в том же проходе, без подкладывания постфактум.
- Открытые веса - файлы модели, которые можно скачать и запустить на своём железе.
максимум за один проход, вдвое больше, чем у Wan 2.7 с её 15 секундами
частота на выходе, разрешение до 1080p, 4K модель не отдаёт
потолок входного документа, по объёму файла лимит 100 МБ
цена 1080p, полминуты выходит примерно в 506 ₽ по курсу ЦБ
Что нового в Wan 3.0 против прошлых версий
Линейка Wan росла по очевидной схеме: сначала качество кадра, потом длина, потом звук. Третье поколение делает шаг в сторону.
Первое изменение простое и считается в секундах. Wan 2.7 упиралась в 15 секунд, Wan 3.0 держит 30. Удвоение звучит скромно, пока не посмотришь, что в эти секунды влезает. Пять секунд это один кадр с одним движением. Пятнадцать секунд это сцена с одной сменой плана. Тридцать секунд это уже маленькая история: завязка, действие, финал.
Второе изменение важнее. Звук генерируется в том же проходе, что и картинка, включая речь и попадание артикуляции в звук. То есть на выходе получается сразу озвученный клип. Немой ролик, к которому потом руками подбирают дорожку из библиотеки, отпадает как этап.
Третье изменение и есть главный инфоповод. На вход можно подать документ. Именно сам файл: pdf, doc, ppt, xls, txt, md, плюс форматы Apple key, pages и numbers. Или ссылку на публичную страницу. Модель сама разбирает содержимое и строит по нему видеоряд, пересказывать файл в промпте руками уже не нужно.
Wan 3.0 закрытая. Файлов модели для самостоятельного запуска на 26 августа 2026 в открытом доступе нет, работает только API. Последний открытый флагман линейки это Wan 2.2 под Apache 2.0 из 2025 года. Схема стандартная для отрасли: старое поколение отдают в опенсорс, новое держат в облаке.
Что можно подать на вход за один запрос
Лимиты Alibaba опубликовала вместе с релизом, и они щедрее, чем у большинства конкурентов:
- текстовый промпт;
- до 10 изображений-референсов;
- до 5 видеоклипов;
- до 5 звуковых дорожек;
- один документ до 50 страниц и до 100 МБ;
- ссылка на публичную веб-страницу.
Аудио на выходе включено по умолчанию. Отдельно заявлены продление готового ролика, редактирование без полной перегенерации и автоподбор длительности под содержимое: модель сама решает, что тут хватит двенадцати секунд, а тут нужны все тридцать.
Отдельная строка про консистентность. Модель держит одного и того же персонажа, объект, пространство и стиль внутри ролика. Именно это делает возможной сцену с несколькими героями: раньше при попытке показать двух людей в тридцатисекундном кадре у одного из них к концу менялось лицо.
Чего тут НЕТ
- 4K на выходе, потолок 1080p
- открытых весов и локального запуска
- готового ролика из презентации без правок
- надёжного текста на экране, надписи плывут
- оплаты картой российского банка
Что реально даёт
- 30 секунд за проход вместо 5-15 у большинства
- звук и речь в том же проходе
- черновик видеоряда прямо из PDF или PPTX
- несколько персонажей без развала лиц
- 1080p дешевле Sora 2 Pro в 3.5 раза
Видеомодель это только один инструмент в цепочке, а ролик собирается из сценария, кадра, звука и монтажа. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.
Пройти мини-курс →Работает ли Wan 3.0 из России
Сначала честная рамка. Проверял доступность доменов 26 августа 2026 с зарубежного сервера, поэтому за российский IP отвечать на сто процентов не могу. Но по китайским видеосервисам картина последние два года устойчивая: гео-блокировок на российские адреса Alibaba, Kuaishou и MiniMax не ставят, в отличие от OpenAI и Google. Домены wan.video, tongyi.aliyun.com и консоль Model Studio отдают код 200 и логин-стеной на входе не встречают.
Проблема лежит не в блокировке. Она лежит в двери. Wan 3.0 живёт в Alibaba Cloud Model Studio в статусе preview, и туда нужен аккаунт Alibaba Cloud с заполненными данными, а для разработчиков ещё и одобрение доступа с ключами того региона, где модель развёрнута. Дальше упираешься в оплату: пополнить баланс Alibaba Cloud картой российского банка нельзя.
Путь 1: аккаунт Alibaba Cloud и API
Самый прямой и самый муторный вариант. По шагам это выглядит так.
Регистрация ≈ 10 мин
- завести аккаунт Alibaba Cloud на международном контуре
- выбрать регион Сингапур, там живёт международная версия Model Studio
- активировать Model Studio и принять условия
Бесплатная квота ≈ 5 мин
- новым аккаунтам квота начисляется автоматически на 90 дней
- считается отдельно по каждой модели
- на превью-моделях её может не быть, смотри в консоли до оплаты
Доступ к модели от часов до суток
- найти в каталоге модель wan3.0-video
- запросить доступ, статус preview значит ручное одобрение
- получить API-ключ региона, ключ другого региона не подойдёт
Оплата главный барьер
- карта российского банка не пройдёт
- нужна зарубежная карта или посредник
- списание идёт постфактум по секундам сгенерированного видео
Про бесплатную квоту важная деталь. Alibaba даёт новым аккаунтам лимит на 90 дней с момента активации Model Studio, начисляется он сам, вручную ничего требовать не нужно, и на старте платёжные данные не обязательны. Но квота независимая по каждой модели, и на свежую preview-модель она может не распространяться. Проверять это надо в консоли на своей учётке. Чужие обзоры тут врут регулярно.
Если решишь идти этим путём и упрёшься именно в оплату, задачу закрывает сервис оплаты подписок (реферальная ссылка: тебе тот же прайс, мне небольшой процент). Он про то, как заплатить зарубежному сервису и получить личный аккаунт, где ключи и история генераций твои.
Путь 2: потребительские приложения Alibaba
Кроме API модель раскатали в китайских потребительских продуктах: приложение Qwen и IF Studio. Тут развилка неприятная. Китайский контур обычно просит китайский номер телефона, а международный chat.qwen.ai набор моделей повторяет не полностью и по видео отстаёт от консоли.
Вывод простой: если у тебя нет китайского номера, рассчитывать на потребительский вход в Wan 3.0 в августе 2026 не стоит. Это временная история, международную раскатку китайцы обычно делают через месяц-два после домашней, но сейчас дверь узкая.
Путь 3: агрегаторы за рубли
Российские агрегаторы моделей подтягивают новинки с задержкой в недели. В каталоге Syntx (реферальная ссылка: тебе тот же прайс, мне небольшой процент) на 26 августа 2026 видеомодель называется просто Wan Video, без номера версии. Это значит ровно одно: рассчитывать, что там уже лежит именно 3.0, вышедшая двумя днями раньше, не надо. Уточняй версию в боте перед покупкой токенов.
Зачем тогда агрегатор в этой статье. Он закрывает другую развилку: как вообще обойтись без зарубежного аккаунта и карты. Оплата рублями и через СБП, доступ к десятку видеомоделей в одном окне, включая Kling, Veo, Sora, Seedance и Runway. Пока Wan 3.0 туда не приехал, ролик со звуком можно собрать на соседней модели из того же списка.
Про подписку в агрегаторах: списание идёт автопродлением, отключается в профиле сервиса вручную, и без активной подписки уже купленные токены тратить нельзя. Проверь дату следующего списания сразу после оплаты, иначе деньги уйдут за месяц, в который ты не сгенерировал ни одного ролика.
Сколько Wan 3.0 стоит в рублях
Тарификация посекундная и зависит только от разрешения. Курс ЦБ на 27 августа 2026: 84.28 ₽ за доллар.
| Разрешение | Цена за секунду | 10 секунд | 30 секунд | Минута |
|---|---|---|---|---|
| 480p | $0.05 (≈ 4.2 ₽) | ≈ 42 ₽ | ≈ 126 ₽ | ≈ 253 ₽ |
| 720p | $0.10 (≈ 8.4 ₽) | ≈ 84 ₽ | ≈ 253 ₽ | ≈ 506 ₽ |
| 1080p | $0.20 (≈ 16.9 ₽) | ≈ 169 ₽ | ≈ 506 ₽ | ≈ 1011 ₽ |
Сразу практический вывод. Черновики гоняй в 480p: полминуты за 126 ₽ позволяют проверить десяток промптов и не разориться. В 1080p уходи только на финальном варианте, когда промпт вылизан и понятно, что модель отдаёт нужный кадр. Разница между черновиком и чистовиком тут четырёхкратная, и на серии из двадцати попыток это уже ощутимые деньги.
Считай стоимость до генерации. Тридцать секунд в 1080p это 506 ₽ за один проход, и если промпт кривой, эти деньги сгорают целиком: посекундной оплаты «за удачные кадры» не бывает. Дисциплина простая: три-четыре итерации в 480p, один финал в 1080p.
Wan 3.0 против Sora 2, Veo 3.1 и Kling: цены и длина
Цифры ниже это официальные прайсы вендоров на август 2026, без наценки перепродавцов. У реселлеров те же модели стоят обычно в 2-3 раза дороже.
| Модель | Цена за секунду | Разрешение | Длина за проход | Звук |
|---|---|---|---|---|
| Wan 3.0 | $0.10 / $0.20 | 720p / 1080p | до 30 сек | в том же проходе |
| Sora 2 | $0.10 | 720p | до 25 сек | нативный |
| Sora 2 Pro | $0.70 | 1080p | до 25 сек | нативный |
| Veo 3.1 | $0.40 | 720p-1080p | 8 сек | всегда включён |
| Veo 3.1 Lite | $0.05 / $0.08 | 720p / 1080p | 8 сек | всегда включён |
| Kling 3.0 Turbo | ≈ $0.11 | 720p | 5-10 сек | отдельно |
| MiniMax H3 | $0.14 | 2K | 4-15 сек | встроенный |
Читается таблица так. В 1080p Wan 3.0 дешевле Sora 2 Pro в 3.5 раза и дешевле полноразмерной Veo 3.1 вдвое, при этом отдаёт кадр вдвое длиннее Sora и почти вчетверо длиннее Veo. Дешевле Wan только Veo 3.1 Lite, но у неё жёсткие 8 секунд за проход, и собрать из восьмисекундных кусков связную тридцатисекундную сцену куда тяжелее, чем сгенерировать её целиком.
Про доступ из России расклад другой. Sora и Veo требуют VPN и зарубежного аккаунта, и по Sora у нас есть отдельный разбор про то, как получить доступ из России. Китайские модели в этом смысле проще: Kling и MiniMax H3 открываются напрямую, у Wan 3.0 то же самое с доменами, но дверь заперта на стороне оплаты и preview-доступа. Полное сравнение живых видеогенераторов с лимитами лежит в гайде про нейросети для генерации видео 2026.
Формула: Wan 3.0 выигрывает длиной за проход и ценой связной сцены, качество кадра тут второй аргумент. Тридцать секунд одним куском дешевле, чем склейка из четырёх восьмисекундных кусков у конкурента.
Три промпта, с которых стоит начать
Wan понимает русский, но структуру всё равно любит слоями: сцена, действие, камера, свет, звук. Промпт одним абзацем модель усредняет и отдаёт вялый кадр.
Промпт под вертикальный Reels на 20 секунд:
Вертикальный кадр 9:16, 20 секунд. Сцена: небольшая городская кофейня утром, окна на солнечную сторону, тёплый свет, пар над чашкой. Герой: женщина 30 лет в бежевом свитере, сидит за столиком у окна, перед ней ноутбук. Действие: она поднимает взгляд от экрана, улыбается, делает глоток кофе, ставит чашку, продолжает печатать. Камера: медленный наезд от общего плана к среднему, лёгкое движение по дуге вправо. Свет: естественный, контровой из окна, мягкие тени. Звук: приглушённый гул кофейни, шипение кофемашины на фоне, стук клавиш, без музыки. Стиль: документальный, без глянца, реалистичная кожа и ткань.
Промпт под сцену с двумя персонажами, где важна консистентность:
Горизонтальный кадр 16:9, 30 секунд. Сцена: переговорка в офисе, белые стены, большой экран на стене выключен. Герои: мужчина 40 лет в тёмно-синей рубашке и женщина 35 лет в сером пиджаке, сидят напротив друг друга. Действие: мужчина показывает рукой на распечатку на столе и что-то объясняет, женщина кивает, берёт лист, поворачивает к себе, отвечает одной фразой. Требование: внешность обоих героев не меняется на протяжении всего ролика, одежда и причёски постоянные. Камера: статичный средний план первые 15 секунд, затем медленный переход на восьмёрку через плечо. Свет: ровный офисный, без резких теней. Звук: спокойная деловая речь на русском, тихий фон вентиляции, шелест бумаги.
Промпт под видео из документа, когда на входе презентация:
Задача: собрать видеоряд по приложенному файлу презентации. Формат: горизонтальный 16:9, длительность подобрать под содержимое, потолок 30 секунд. Логика: один смысловой блок презентации это один план, порядок как в файле. Визуал: предметные и обстановочные кадры по смыслу блока, живые сцены вместо схем и графиков. Запрет: не выводить на экран текст, заголовки, цифры и подписи, надписей в кадре быть не должно. Камера: спокойные движения, лёгкий наезд или проезд, без резких склеек внутри одного блока. Звук: закадровый голос на русском по содержанию блоков, ровный темп, нейтральный фон без музыки.
Обрати внимание на запрет надписей в третьем промпте. Это обход известной слабости модели, про которую ниже.
Где Wan 3.0 ломается
Тут важно не пересказывать пресс-релиз. Alibaba в релизе сама назвала два слабых места: текстура звука и точность надписей на экране требуют доработки. Для document-to-video вторая проблема принципиальная: люди понесут в модель именно презентации с цифрами и заголовками, а надписи она рисует нестабильно.
Внешние тесты добавляют третью. При проверке в Atlas Cloud модель ставила лишние склейки там, где кадр должен был идти непрерывно. То есть заявленные тридцать секунд иногда приезжают нарезкой, которую ты не заказывал.
Из этого следуют три рабочих правила.
Не проси надписи в кадре. Текст, заголовки, цифры и логотипы выводи потом в монтажке, где ты контролируешь шрифт и не зависишь от настроения модели.
Формулируй непрерывность явно. Если нужен один непрерывный план, пиши это в промпте отдельной строкой и проверяй результат покадрово в начале, середине и конце.
Считай document-to-video черновиком. Модель хорошо разбирает структуру файла и предлагает раскадровку, но принимать результат без правок нельзя. Полезнее использовать её как генератор идей: получил видеоряд, увидел логику, переписал промпт под нужные планы.
Preview значит именно то, что написано. Модель в раннем доступе меняется без предупреждения: цены, лимиты, имя модели в API и поведение на одном и том же промпте. Строить на wan3.0-video продакшен-пайплайн в августе 2026 рано, для теста и разовых задач нормально.
Кому это реально нужно: четыре сценария
Reels и Shorts целиком. Тридцать секунд закрывают короткий ролик без склейки из кусков. Сценарий при этом всё равно писать: как это делать быстро, разобрано в гайде про сценарии Reels нейросетью.
Видео-КП по презентации. У тебя есть готовая презентация клиенту, и нужна короткая видеоверсия для мессенджера. Document-to-video даёт черновик за один проход вместо часа в монтажке. Сама презентация при этом собирается тоже нейросетью, про это есть отдельный разбор про презентацию из текста.
Карточки товара и предметка. Тридцать секунд с генерируемым звуком хватает, чтобы показать товар с трёх ракурсов и проговорить оффер. В 480p черновик стоит 126 ₽, что дешевле любой съёмки.
Обучающие вставки. Короткие объяснялки внутри курса или статьи, где от картинки нужна понятная сцена и внятный закадровый голос, киношность тут лишняя.
Чего в этот список не входит: всё, где нужна абсолютная точность кадра, узнаваемое лицо конкретного человека или надписи на экране. Тут модель пока подводит.
Чек-лист: что у тебя теперь есть
- Понимание, что Wan 3.0 это 30 секунд за проход, 30 кадров в секунду, до 1080p и звук в том же проходе.
- Полный список того, что принимается на вход, включая документ до 50 страниц и 100 МБ.
- Три пути доступа из России и честная картина по каждому: API с зарубежной картой, китайские приложения с китайским номером, агрегаторы с задержкой в недели.
- Таблица цен в рублях по курсу ЦБ и правило «черновик в 480p, финал в 1080p».
- Сравнение с Sora 2, Veo 3.1, Kling и MiniMax H3 по цене за секунду и длине кадра.
- Три готовых промпта: вертикальный Reels, сцена с двумя героями, видео из презентации.
- Список известных слабых мест и три правила, как их обойти.
Начни с одного тридцатисекундного черновика в 480p по третьему промпту, на своей реальной презентации. Этого хватит, чтобы понять, экономит тебе document-to-video время или проще собрать ролик привычным способом. Если аккаунта Alibaba нет и заводить его ради теста не хочется, тот же сценарий можно прогнать на соседней видеомодели через Syntx: пробных токенов там хватает на несколько коротких генераций, и станет видно, твоя это история или нет.
По материалам разбора Wan 3.0 на Habr в блоге Open Data Science, характеристики и лимиты - карточка модели wan3.0-video в Alibaba Cloud Model Studio, цены конкурентов - сводка официальных прайсов invideo за август 2026, тесты на лишние склейки - Atlas Cloud. Курс доллара - ЦБ РФ на 27 августа 2026. Проверено 26 августа 2026.
Частые вопросы
Что умеет Wan 3.0 и чем отличается от прошлых версий?
Wan 3.0 генерирует до 30 секунд видео за один проход в 480p, 720p или 1080p при 30 кадрах в секунду, со звуком, который считается одновременно с картинкой. Предыдущая версия Wan 2.7 выдавала максимум 15 секунд. Главное новшество: на вход можно подать документ (PDF, DOCX, PPTX, XLSX, Markdown) или ссылку на публичную страницу, и модель соберёт из содержимого видеоряд.
Работает ли Wan 3.0 из России и нужен ли VPN?
Домены Alibaba Cloud и wan.video с блокировками по географии не воюют, гео-замка на российские IP у китайских видеосервисов обычно нет. Реальный барьер другой: доступ к модели идёт через Alibaba Cloud Model Studio в режиме preview, там нужен аккаунт с подтверждёнными данными и зарубежная карта. Карты российских банков на пополнении не проходят.
Сколько стоит Wan 3.0 в рублях?
Цена считается посекундно: $0.05 за секунду в 480p, $0.10 в 720p и $0.20 в 1080p. По курсу ЦБ на 27 августа 2026 (84.28 ₽ за доллар) тридцатисекундный ролик обходится примерно в 126 ₽ в 480p, 253 ₽ в 720p и 506 ₽ в 1080p. Минута в 1080p стоит около 1010 ₽.
Можно ли скачать веса Wan 3.0 и запустить у себя?
Нет. Wan 3.0 доступна только по API, файлов модели в открытом доступе на 26 августа 2026 нет. Последний открытый флагман линейки это Wan 2.2 под лицензией Apache 2.0, выложенный в 2025 году. Если нужна именно локальная видеомодель, смотреть надо на Wan 2.2 или на открытые веса MiniMax H3.
Правда ли Wan 3.0 сделает ролик из моей презентации сам?
Модель принимает документ до 50 страниц и до 100 МБ и строит по нему видеоряд, но на выходе получается черновик. Alibaba сама признаёт, что текстура звука и точность надписей на экране требуют доработки, а внешние тесты фиксируют лишние склейки там, где кадр должен быть непрерывным. Рабочая схема: взять раскадровку модели за основу и довести планы руками.