Создаёт видео по тексту, референсам, кадрам, документу или содержимому публичной страницы. Цена зависит от разрешения: 480P - 5 ₽/сек., 720P - 10 ₽/сек., 1080P - 20 ₽/сек.
Wan 3.0 - нейросеть для генерации видео из разных типов входных данных: обычного текста, набора референсов, первого кадра, первого и конечного кадра, документа или публичной страницы. Это развитие линейки Wan от Alibaba, рассчитанное на сценарии, где нужно не просто “снять” ролик по описанию, а собрать его из уже готовых материалов и идей.
По заявлениям создателей и описаниям публичного запуска, Wan 3.0 делает упор на мультимодальный подход: модель умеет опираться сразу на изображения, короткие видеофрагменты, аудио, документы и веб-страницы. Отдельный акцент сделан на более длинных роликах - в интерфейсе можно задавать длительность до 30 секунд, а итоговое видео доступно в 480P, 720P или 1080P.
Разработчики линейки Wan раньше отдельно подчёркивали сильные стороны семейства модели: хорошее понимание текстовых инструкций, генерацию движения по стартовому и конечному кадру и работу с несколькими типами входа в одном процессе. Для обычного пользователя это значит простую вещь: можно не начинать с нуля, а загрузить фото, кусок звука, документ или страницу и объяснить, что именно нужно превратить в ролик.
Схема простая: вы даёте модели исходник и коротко объясняете задачу, а она собирает видео по этим подсказкам. В одном случае основой будет текстовое описание сцены, в другом - первое изображение, из которого нужно “оживить” движение, в третьем - документ или статья, из которых надо сделать короткое объясняющее видео.
Режим с референсами особенно полезен, когда важен не общий стиль, а конкретные детали. Можно опираться на картинку для внешнего вида, на короткий видеоклип для движения и на аудио для характера подачи. А режим с первым и конечным кадром нужен, когда вы уже понимаете, с чего сцена начинается и чем должна закончиться, но не хотите вручную собирать переход между ними.
Лучше всего Wan 3.0 подходит для коротких роликов. Длинные истории с большим количеством действий, сложной логикой сцен и точным контролем каждого движения всё ещё могут требовать нескольких прогонов и ручной доработки.
Режимы с документом и публичной страницей хороши для быстрого черновика, но не гарантируют, что результат сам по себе получится логичным и аккуратно смонтированным. Иногда модели нужно дополнительно подсказать структуру: что показать сначала, где сделать акцент, какой тон выбрать.
С референсами тоже есть практический предел: короткие аудио- и видеовходы лучше задают направление, чем полностью управляют итогом. То есть модель может уловить стиль, героя или настроение, но не обязана дословно повторять каждый жест, ракурс или интонацию.
Главное отличие Wan 3.0 - упор не на один режим “текст в видео”, а на смешанный сценарий работы. Здесь можно строить ролик из описания, картинок, кадров, документов и страниц, а не выбирать что-то одно.
Ещё одна заметная особенность - акцент на референсный режим. У многих видеомоделей основной сценарий сводится к тексту или одной картинке, а тут идея шире: взять разные источники и собрать из них единое видео. Для людей без опыта это бывает понятнее, потому что легче показать пример, чем долго объяснять словами, что именно хочется получить.