Alibaba выпустила Tongyi Wan-Animate-2 с открытым исходным кодом, достигнув качества коммерческих решений
Подробнее
Pandaily
pandaily.com

Alibaba выпустила Tongyi Wan-Animate-2 с открытым исходным кодом, достигнув качества коммерческих решений

Команда Tongyi Wan из Alibaba представила Wan-Animate-2, фреймворк для анимации персонажей, который теперь доступен в открытом доступе. Архитектура этой системы полностью исключает необходимость извлечения скелетной позы и сжатия движущих характеристик, напрямую подавая видеосигнал в диффузионный Трансформер. В результате была создана система, способная работать со скоростью 24 кадра в секунду, и в прямых сравнениях демонстрирует результаты, сопоставимые с закрытыми коммерческими лидерами, такими как Dreamina от ByteDance и KLING MotionControl от Kuaishou.

Ключевое новшество Wan-Animate-2 заключается в том, чего он избегает. Предыдущие методы требовали промежуточного этапа оценки позы, который преобразовывал исходное видео в скелетный каркас. Этот процесс как сжимал информацию, так и вносил критические сбои при отказе каркаса. Wan-Animate-2 сохраняет управляющий сигнал в виде сырых пикселей, позволяя диффузионному Трансформеру самостоятельно изучить соответствие, что приводит к заметно более чистому искажению рук и уменьшению артефактов конечностей при сложных движениях.

Возможности фреймворка выходят за рамки анимации одного персонажа; он поддерживает сценарии с несколькими персонажами и множеством камер. Один управляющий видеоролик может одновременно управлять несколькими целевыми персонажами, а одну и ту же анимацию можно отрисовать с разных заданных положений камеры без необходимости повторного обучения. Система также стабильно справляется с нестандартными соотношениями сторон и различными типами телосложения персонажей, устраняя хрупкость, которая долгое время преследовала большинство проектов по анимации персонажей с открытым исходным кодом.

Практическое значение этого достижения структурно. Анимация персонажей долгое время являлась узким местом в создании видео высокого коммерческого уровня. Модели генерации могли создавать сцены, композитинг мог размещать персонажей, однако получение стилизованного персонажа, выполняющего произвольное движение с сохранением своей идентичности, почти всегда перекладывалось на ручную покадровую анимацию. Wan-Animate-2 устраняет этот пробел, предоставляя веса, которые любой разработчик может запустить локально.

Более широкие планы Alibaba в рамках семейства Tongyi Wan становятся яснее. Wan 3.0, выпущенный ранее в августе, обеспечил генерацию видео с вводом документов для корпоративного использования. Wan-Animate-2 открывает возможности анимации персонажей для сообщества разработчиков и создателей. Эти два выпуска вместе охватывают оба конца производственного цикла. Для экосистемы видео с открытым исходным кодом более важным вопросом перестало быть, смогут ли китайские лаборатории соответствовать качеству закрытых коммерческих продуктов — они уже это сделали. Вопрос теперь заключается в скорости интеграции новой модели в инструменты последующей обработки.

Похожие сюжеты

Alibaba представила Qwen-UI-Agent: модель, способная взаимодействовать со всеми типами экранов
Подробнее
pandaily.com

Alibaba представила Qwen-UI-Agent: модель, способная взаимодействовать со всеми типами экранов

Компания Alibaba Qwen выпустила Qwen-UI-Agent 20 августа. Эта модель представляет собой агент на основе графического интерфейса (GUI), который охватывает работу на телефонах, настольных компьютерах, в вебе и при глубоком поиске. Основная идея модели заключается в понимании пользовательского интерфейса, имитации человеческих действий, таких как клики, ввод данных и свайпы, чтобы выполнять задачи.

Поскольку большинство программного обеспечения не предусматривает открытие API, графический интерфейс рассматривается как наиболее универсальный вход. Qwen-UI-Agent делает ставку на то, что экран является самым крупным интерфейсом, выступая универсальным исполнителем, который использует одну модель для четырех различных сред.

Ключевой сложностью для этой модели является работа с реальными устройствами, поскольку многие GUI-агенты обучаются в симуляторах и демонстрируют сбои на настоящем оборудовании. Alibaba разработала мобильную среду, включающую более 100 реальных телефонов и свыше 150 приложений, для обучения и оценки на физических устройствах, а также создала бенчмарк из 400 задач под названием MobileWorld-Real.

На мобильных устройствах MobileWorld показал результат в 82,1 процента, превзойдя такие модели, как GPT-5.6 Sol, Claude Opus 4.8 и Seed 2.1 Pro. MobileWorld-Real продемонстрировал лучшие результаты среди флагманских устройств, включая Gemini 3.1 Pro, а AndroidDaily достиг 97,5 процента. На настольных компьютерах OSWorld-Verified получил 79,5 процента, а в браузере WebArena занял первое место с показателем 73,6 процента; при использовании OSWorld-v2 количество шагов выполнения было сокращено на 58 процентов. Демонстрации показали возможность поиска через Amap, составления резюме из Xiaohongshu и бронирования в DingTalk в пяти или шести приложениях.

Модель, которая взаимодействует с экранами, сталкивается с более серьезными проблемами безопасности, чем с проблемами производительности. Qwen-UI-Agent интегрирует оценку безопасности непосредственно в процесс выполнения задачи: при получении незаконных или высокорискованных запросов агент отказывается от операции, завершая работу. При столкновении с конфиденциальными сценариями, такими как отправка красных конвертов, удаление файлов или запрос на авторизацию конфиденциальности, он останавливается и ожидает подтверждения. Например, при задании «отправить маме 500 юаней через Alipay», агент заполняет сумму и примечание, после чего останавливается на этапе оплаты для получения подтверждения. Если отсутствуют такие детали, как даты полета или класс салона, он сначала запрашивает эту информацию.

Пространство действий модели является смешанным: помимо GUI, она способна выполнять команды командной строки (CLI), причем действия CLI составляют почти половину всех действий на рабочем столе. В рамках задачи, состоящей из 170 шагов, агент проверил финансовые данные, запустил аналитические скрипты, создал отчеты в форматах Excel, PPT и Word, а также скорректировал макет с помощью визуальной проверки. При этом GUI отвечал за получение информации из веба, а CLI — за анализ. Обучение проводится агрессивно: онлайн-обучение с подкреплением поддерживает траектории длиной более 100 шагов с использованием около 10 000 параллельных сред. Агент также предлагает проактивные услуги: например, при уведомлении об отмене рейса он предлагает план перебронирования, а задачи могут передаваться между телефоном и настольным компьютером, например, получение чека из фотобиблиотеки и последующее создание сводной таблицы в Excel на рабочем столе. Таким образом, агент переходит от ожидания инструкций к заботе о пользователе.

Мир за пределами API значительно обширнее мира внутри них. Qwen-UI-Agent выбрал прямой подход: не стремиться изменить мир, а научиться использовать его в существующем виде, при этом технический отчет, страница проекта и код были опубликованы. Для рядовых пользователей актуальным вопросом остается, когда эти возможности будут интегрированы в повседневные телефонные помощники для решения тривиальных и сложных задач.

Alibaba выпустила модель Qwen3.8-27B с открытым исходным кодом, демонстрирующую высокие результаты в кодировании и работе агентов
Подробнее
pandaily.com

Alibaba выпустила модель Qwen3.8-27B с открытым исходным кодом, демонстрирующую высокие результаты в кодировании и работе агентов

Команда Alibaba представила модель Qwen3.8-27B с открытым исходным кодом. За два дня модель возглавила глобальный тренд на платформе Hugging Face и превысила миллион загрузок, включая версию FP8; квантованная версия Unsloth приблизилась к трем миллионам. Разработчики, проводившие тестирование, окрестили ее «локальным Опусом 4.6», поскольку эта модель с параметрами менее 30 миллиардов превосходит все модели, выпущенные четыре месяца назад, включая Opus 4.6, которая сравнивалась с DeepSeek V4-Pro и GPT 5.6 Luna, став первой локальной моделью, достигшей уровня передовых разработок. В квантованном виде она функционирует при использовании 17 ГБ оперативной памяти.

Модель является нативно мультимодальной плотной моделью, способной понимать изображения и видео. Она обладает нативным контекстом в 262K, который расширяется до 1 миллиона, и распространяется под лицензией Apache 2.0, что позволяет использовать ее в коммерческих целях.

При оценке навыков кодирования и работы агентов, Qwen3.8-27B показала результат SWE-bench Pro в 61.7 против 53.4 у Opus 4.6 Max. В тесте DeepSWE 1.1 она набрала 42.2, что примерно в три раза выше показателя ее предшественника в 13.3. Результаты в задачах офисной работы и работы агентов также высоки: CoWorkBench показал 70.7 по сравнению с 68.2 у Opus 4.6 Max, а JobBench — 33.4. Показатель Pass@1 для экзаменов агентов составил 20.4, почти вдвое больше, чем у предыдущей версии (10.6). Кроме того, IFBench получил 79.5, а LiveCodeBench v6 — 90.3, что является наивысшим показателем в таблице.

Мультимодальность реализована нативно в архитектуре, позволяя обрабатывать изображения и видео, начиная от графиков STEM и заканчивая часовыми видео. При проверке компьютерных операций по стандарту OSWorld, модель набрала 84.3, что на 11.6 пункта выше, чем у Opus 4.6 Max. Операции с телефоном по AndroidWorld оцениваются в 81.9, а браузерные операции, проверенные WebArena, достигли 64.8, что на 9.5 пункта выше, чем у ее предшественника. В области визуального рассуждения без использования инструментов, MathVision показала 90.0 против 65.5, BabyVision — 65.7 против 12.6, а анализ графиков CharXiv — 83.7 против 66.0. Сочетание способности читать скриншоты, нажимать кнопки, заполнять формы, управлять браузерами и телефонами, а также кодировочных навыков формирует полный цикл агента для выполнения компьютерных операций.

Размер 27B является наиболее востребованным сообществом, так как он позволяет разместить модель на ноутбуках после квантования с использованием потребительских графических процессоров. Версия Unsloth работает при 17 ГБ оперативной памяти, а сжатие Atomic Dynamic GGUF снижает объем с 28.9 ГБ при 8-битном формате до 8.5 ГБ при 1-битном. В тот же день появились такие инструменты, как SGLang, Ollama и vLLM. Разработчики отмечают удивительную возможность наличия неограниченных, бесплатных сверхинтеллектуальных устройств прямо на рабочих столах: при наличии только RTX 5090 можно получить интеллект, эквивалентный Opus 4.8. Саймон Уиллисон поделился, что давно не испытывал такого удовольствия от работы с локальной моделью. Он отметил, что режим мышления по умолчанию включен и может быть отключен по запросу, а настройка глубины рассуждений (reasoning_effort) позволяет регулировать этот процесс; Уиллисон обнаружил, что значение xhigh заставляет модель думать слишком много, и посоветовал начинать с низкого или отсутствующего уровня рассуждений.

Таким образом, Qwen3.8-27B поднимает показатели в кодировании и работе агентов до уровня Opus, предоставляя контроль над весами, глубиной мышления и безопасностью данных.

Alibaba выпустила обновление приложения Qwen и запустила Wan 3.0 в публичный тест для корпоративных клиентов
Подробнее
pandaily.com

Alibaba выпустила обновление приложения Qwen и запустила Wan 3.0 в публичный тест для корпоративных клиентов

На этой неделе Alibaba представила два обновления в сфере искусственного интеллекта, намеренно разделив аудитории потребителей и предприятий. 7 августа приложение Qwen получило пять новых функций: исследовательский анализ, запланированные задачи, помощника рабочего пространства, площадь агентов и голосовые вызовы. Все эти функции работают на флагманской модели Qwen3.8-MAX и предоставляются бесплатно.

6 августа Alibaba Cloud открыла публичное тестирование Wan 3.0, третьей генерации видеомодели Tongyi. Доступ к ней предоставляется через Alibaba Cloud Bailian, портал Wanxiang и клиент Qwen PC.

Изменения в приложении Qwen представляют собой более значимое событие для потребителей. Новый помощник рабочего пространства способен разбивать поставленные цели, использовать инструменты и выдавать результаты как на телефоне, так и на ПК, что придает приложению черты легкого агента, а не просто чат-бота. Предоставление бесплатного доступа является целенаправленной стратегией захвата рынка: Alibaba сначала стремится к масштабу и доминированию в качестве точки входа, оставляя платные квоты для профессиональных пользователей рабочего пространства на потом.

Отличительной особенностью Wan 3.0 является возможность принимать различные типы входных данных. Впервые в этой линейке модель принимает стандартные документы — файлы doc, xls, ppt, pdf и md — в качестве прямого ввода. Пользователь может загрузить презентацию и запросить в ответ 30-секундное видео. Генерация за один проход длится до 30 секунд на клип. Цены на API установлены на уровне 0.3 юаня за секунду при разрешении 480p, 0.6 юаня при 720p и 1.2 юаня при 1080p, что является сознательной попыткой привлечь бюджеты малых и средних предприятий, а не конкурировать с премиум-студиями.

Совместная ставка компании носит структурный характер. Поскольку возможности моделей сходятся, следующим конкурентным преимуществом становится скорость, с которой сырые возможности упаковываются и внедряются в повседневное использование. Стратегия Alibaba сочетает бесплатный вход для потребителей с системой оплаты по мере использования для предприятий, позволяя доходам от потребителей в конечном итоге субсидировать корпоративный сегмент. Приложение Qwen управляет воронкой, а Wan 3.0 и API Bailian отвечают за выставление счета.

Успех этой стратегии зависит от трех факторов: насколько быстро Wan 3.0 покинет бета-тестирование, сохранит ли помощник рабочего пространства Qwen профессиональных пользователей после первых 13 бесплатных запросов, и смогут ли Doubao от ByteDance и WorkBuddy от Tencent достичь аналогичной способности обработки видео из документов до стабилизации API Wan 3.0. На данный момент Alibaba является первым китайским гиперскейлером, выпустившим модель видео с поддержкой документального ввода по ценам для МСП, однако это окно возможностей не будет открыто долго.

Популярное