
Wan 3.0 Video от Alibaba, ролик на 30 секунд прямо из презентации
Alibaba выпустила Wan 3.0, первую модель, которая умеет делать видео прямо из презентации, таблицы или PDF-файла. Разбираемся, что она умеет, чем отличается от конкурентов и как с ней работать в интерфейсе unitool.ai.
Видео прямо из презентации
У всех генераторов видео последние пару лет была одна общая черта. Ты описываешь сцену словами или прикладываешь картинку, и модель рисует ролик. Wan 3.0 от Alibaba добавила к этому то, чего пока нет ни у кого из конкурентов. Модель читает документы.
Речь про обычные рабочие файлы, презентации, таблицы, текстовые документы, PDF и даже ссылки на веб-страницы. Ты загружаешь брендбук кафе, добавляешь одно предложение с пожеланием, и на выходе получаешь готовый рекламный ролик.
Открытое тестирование началось 6 августа 2026 года, а 24 августа Alibaba официально выпустила модель для всех. Второе важное изменение, это длина. Ролик теперь получается до 30 секунд за одну генерацию, вдвое больше, чем у предыдущей версии Wan 2.7.
Тридцать секунд одним дублем вместо нарезки
Большинство генераторов выдают несколько секунд, то есть один кадр, а не историю. Alibaba сформулировала переход так, раньше модель генерировала кадр, теперь рассказывает целую историю.
Разница тут не только в цифре. Тридцать секунд дают место для темпа повествования, непрерывных движений камеры и сложных приёмов вроде съёмки одним дублем. Ролик не нужно склеивать из коротких кусков, а значит и стыки не будут заметны.
Помогают этому две дополнительные функции. Умный подбор длительности анализирует твой запрос и сам предлагает подходящую длину, чтобы простая сцена не растягивалась до тридцати секунд, а замысел посложнее не обрывался на полуслове. Продление видео позволяет добавлять продолжение к уже готовому ролику, чтобы история развивалась дальше.
Документы превращаются в видео
Это главная особенность релиза, и аналогов у неё пока нет. Помимо текста, картинок, звука и видео, Wan 3.0 принимает на вход файлы форматов doc, xls, ppt, pdf, txt, md, а также key, pages и numbers, то есть форматы офисных программ Apple. Ограничение простое, один файл или одна ссылка за раз, размером до 100 мегабайт и объёмом до 50 страниц.
Вот что из этого получается на практике:
Презентация продукта превращается в рекламный ролик или брендовый фильм
Обучающая презентация становится видеокурсом
Данные из таблицы превращаются в анимированные графики
Отчёт для руководства становится видеосводкой с закадровым голосом
Работает это за счёт того, что модель воспринимает твой запрос как центр управления. Он объясняет, как трактовать загруженный файл, что из него взять и в каком виде подать. Именно поэтому из совершенно разных исходников получается связное видео, а не набор слайдов с анимацией.
Живые лица и стабильные персонажи
У сгенерированных людей есть узнаваемая проблема, все они выглядят как один и тот же глянцевый человек. Alibaba взялась именно за это. Модель обучали делать разнообразные и правдоподобные лица, аккуратнее прорабатывать черты и кожу, держать выражение эмоций естественными и сдержанными, а также связывать мимику с языком тела. Даже в групповых сценах у разных персонажей получаются свои оттенки эмоций.
Вторая половина работы касается стабильности, и для продакшна это важнее всего. В режиме работы по референсам модель удерживает без изменений сразу четыре вещи,
Персонажей, включая черты лица, причёску, цвет волос, телосложение, одежду и аксессуары
Предметы, их вид с разных сторон, конструкцию, логотипы и материалы
Пространство, то есть расстановку героев и ракурс камеры в правильных отношениях друг к другу
Стиль, где кинематографическая подача передаётся точно, а в проектах с несколькими стилями они не перетекают друг в друга
Ещё одна возможность перешла из версии Wan 2.7 и работает дальше. Готовое видео можно редактировать, меняя картинку, сюжет и реплики персонажей, не пересоздавая ролик с нуля. Правка становится правкой, а не переделкой.
Как устроен Wan 3.0 Video в интерфейсе unitool.ai
Теперь про практику. На нашем сайте модель работает в трёх режимах, и нужный выбирается автоматически по тому, что ты приложил к запросу.
Текст в видео. Только промпт, сцена собирается с нуля.
Первый кадр в видео. Прикладываешь фотографию, и модель оживляет именно этот кадр. К нему можно добавить и последний кадр, тогда модель построит переход от одного к другому. Требования к изображению такие, форматы jpeg, png, webp или bmp, стороны от 240 до 8000 пикселей, соотношение не круче восьми к одному, размер до 20 мегабайт. Прозрачность в png не поддерживается.
Референсы в видео. До десяти изображений, где персонажи и стиль держатся стабильно весь ролик. В промпте на них ссылаешься как Image1, Image2 и так далее.

Важное ограничение, первый кадр и референс-изображения нельзя использовать одновременно, нужно выбрать один сценарий. Из настроек доступны разрешение 480p, 720p или 1080p, соотношение сторон, длительность от 2 до 30 секунд и отдельный тумблер звука. Модель озвучивает ролик речью, шумами и музыкой по смыслу промпта, а если звук не нужен, тумблер просто выключается.
Референс-видео и референс-аудио
Помимо картинок модель принимает готовые ролики и звуковые дорожки в качестве образцов.
По видео ограничения такие, до пяти клипов в форматах mp4 или mov, каждый длиной от 1 до 15 секунд, суммарно не больше 15 секунд, размером до 100 мегабайт каждый, со сторонами от 240 до 4096 пикселей. В промпте ссылаешься на них как Video1, Video2.
По звуку похожая схема, до пяти файлов wav или mp3, каждый от 1 до 15 секунд, суммарно не больше 15 секунд, до 15 мегабайт. Обращение в промпте как Audio1, Audio2. Тут есть нюанс, аудио нельзя использовать как единственное вложение, к нему нужно добавить картинку или видео.
Важный момент про оплату. Если ты используешь референс-видео, тарифицируются секунды входных клипов плюс секунды результата, а их сумма не должна превышать 30 секунд. Это стоит держать в голове при планировании бюджета.
Сколько стоит генерация
У Alibaba цена считается за секунду готового видео и зависит от разрешения. Получается 0,05 доллара за секунду в 480p, 0,10 доллара в 720p и 0,20 доллара в 1080p. То есть полноценный тридцатисекундный ролик в максимальном качестве обойдётся в 6 долларов, а черновой вариант в 480p всего в 1,5 доллара.
Отсюда простой рабочий совет, который подходит и для нашего интерфейса. Черновики делайте на 480p или 720p, подбирая формулировку и композицию, а финальный вариант делай в 1080p. Разница в цене за секунду между низшим и высшим качеством четырёхкратная, поэтому на этапе подбора экономия получается ощутимая.
В интерфейсе unitool.ai стоимость считается в токенах и показывается прямо под окном ввода до запуска генерации, так что никаких сюрпризов не будет. Например, пятисекундный ролик в 720p обходится в 61 токен.
Что Alibaba признаёт слабым местом
Компания честно назвала два направления, над которыми ещё предстоит работать.
Первое, это качество звука. Он генерируется, но текстура звучания пока не на том уровне, которого хотят сами разработчики.
Второе, и для русскоязычных пользователей более значимое, это точность отрисовки текста в кадре. Если тебе нужны читаемые вывески, подписи или логотипы внутри видео, результат может подвести. Здесь стоит либо закладывать несколько попыток, либо добавлять текст уже потом, при монтаже.
Оба направления Alibaba называет активно дорабатываемыми, так что в следующих версиях ситуация должна улучшиться.
Из документа в готовый ролик
Wan 3.0 закрывает задачу, которую до неё никто не решал. Превратить рабочий файл, будь то презентация, таблица или отчёт, сразу в видео, без сценариста и монтажёра. Плюс тридцать секунд одним дублем, стабильные персонажи по референсам и правки готового ролика без пересоздания.
При этом слабые места честно названы самой Alibaba, это звук и текст в кадре. Так что для роликов с читаемыми надписями другие модели пока справятся лучше, а вот там, где нужна длинная связная сцена или видео из офисного документа, у Wan 3.0 конкурентов почти нет.
Как всегда, универсальной модели не существует. Понять, какая справится именно с твоей задачей, можно только на практике, прогнав один замысел через несколько генераторов и сравнив результат своими глазами.
Именно для этого работает unitool.ai. Wan 3.0 Video уже доступна вместе с десятками других нейросетей для видео, изображений и звука, по одной подписке и без отдельной регистрации на каждой платформе. Начни с чернового ролика на 480p, подбери формулировку, а финальный вариант сделай в максимальном качестве.