Leiphone сравнил модели Seedance 2.5 и Kling VIDEO 3.0 как режиссеры коротких видео
Подробнее
Pandaily
pandaily.com

Leiphone сравнил модели Seedance 2.5 и Kling VIDEO 3.0 как режиссеры коротких видео

Китайский технологический ресурс Leiphone провел сравнительное тестирование двух ведущих китайских моделей искусственного интеллекта для создания видео — Seedance 2.5 от ByteDance и Kling VIDEO 3.0 от Kuaishou. Целью теста было определение того, насколько хорошо каждая модель может функционировать в роли режиссера коротких видео. Согласно отчету Leiphone от 30 сентября, различия между моделями теперь меньше связаны с качеством изображения, а больше — с рабочим процессом, поскольку каждая модель лучше подходит для выполнения разных задач.

Leiphone поручил обеим моделям выполнить два задания продолжительностью 15 секунд. Первое задание заключалось в создании научно-популярного объясняющего ролика, где антропоморфный рак-краб представлял рабочий агентский интерфейс OpenClaw 2.0. Сценарий включал последовательность кадров: вступление, раскрытие рабочего пространства, командное взаимодействие, навыки, предупреждения о разрешениях и песочнице, а также заключительную фразу. Второе задание требовало от каждой модели переписать трагический снежный финал популярной китайской исторической драмы в счастливый, используя опорный кадр.

Результаты тестирования объясняющих роликов

В рамках объясняющего ролика Leiphone отметил, что Seedance 2.5 создала более отполированный клип. Он продемонстрировал стабильного персонажа-ведущего, полноценный студийный сет и плавные движения камеры, напоминающие рекламный ролик продукта. Однако иконки в интерфейсе Seedance 2.5 были общими, что затрудняло понимание зрителями того, что именно изменяет OpenClaw 2.0, а надписи на экране оставались ненадежными. Kling VIDEO 3.0 следовал раскадровке более точно, выводя название продукта на экран в первую секунду и выполняя каждый запрошенный момент. Хотя ведущий в Kling выглядел более мультяшно, слово «Skill» отобразилось с искаженными символами, а финальный кадр показался разрозненным. Также Leiphone сообщил, что Seedance ждала меньшее время ожидания в этом раунде.

Сравнение при работе с драматическим контентом

Тест с драмой выявил наиболее очевидные различия. На платформе Jimeng AI, разработанной ByteDance, Seedance 2.5 отклонила опорное изображение, предположив, что оно может напоминать публичную личность. Даже после того, как Leiphone удалил изображение и оставил только текст, система продолжала останавливаться, указывая на наличие элементов, защищенных авторским правом. Kling VIDEO 3.0, напротив, сгенерировал полный клип, сохранивший снег, костюмы и взаимоотношения персонажей, переходя от спасения к восстановлению и заканчиваясь закатом всего за 15 секунд. Leiphone подчеркнул, что чем точнее модель воспроизводит исходный материал, тем больше пользователей должны заранее подтверждать права.

Стратегическое позиционирование продуктов

Ресурс связал полученные результаты с дизайном каждого продукта. ByteDance позиционирует Seedance 2.5 для более длительного редактирования производства, позволяя генерировать до 30 секунд за один раз, использовать до 30 опорных изображений, 10 видеоклипов и 10 аудиоклипов, а также обеспечивая редактирование на уровне временных меток. В свою очередь, Kling VIDEO 3.0 от Kuaishou ориентирован на клипы продолжительностью от 3 до 15 секунд, поддерживает нативный звук, генерацию с несколькими кадрами и диалоги с участием нескольких персонажей.

Заключительный вердикт Leiphone состоял в том, что Kling VIDEO 3.0 подходит для быстрых черновиков технических объяснений, тогда как Seedance 2.5 лучше подходит для отполированных брендовых фильмов и предлагает более безопасные ограничения для контента, связанного с реальными людьми или киноматериалами. Кроме того, в конце сентября Kling AI анонсировала предварительный просмотр своей модели следующего поколения — Kling 4.0.

Похожие сюжеты

Исследователи из Peking University, Tsinghua и Alibaba представили SparkDiffusion для ускорения генерации видео Wan до 265 раз
Подробнее
pandaily.com

Исследователи из Peking University, Tsinghua и Alibaba представили SparkDiffusion для ускорения генерации видео Wan до 265 раз

Исследователи из Peking University, Tsinghua University и Alibaba опубликовали SparkDiffusion — фреймворк для ускорения диффузионно-трансформерных видеомоделей. Этот фреймворк разработан специально для моделей Wan 2.1 и Wan 2.2 от Alibaba.

В ходе тестирования команда продемонстрировала значительное повышение скорости: генерация видео с 81 кадром, продолжительностью около пяти секунд и разрешением 720P с использованием Wan2.1-T2V-14B сократилась с 4769 секунд до 18 секунд на одной видеокарте RTX 5090. Это обеспечило 265-кратное ускорение по сравнению с базовой моделью с плотным обучением и безсмещенным направлением классификатора. При использовании ускорителя H100 та же задача была выполнена за 8 секунд вместо 1757 секунд, что составляет 220-кратный прирост скорости.

Работа началась с проблемы, которую авторы назвали «ловушкой высокой разреженности». При увеличении разреженности внимания с 90% до 97% оставалось всего 3% блоков внимания. На этом уровне потери при обучении продолжали снижаться, однако видео получали нарушенную структуру, дрейфующие фоны и нестабильное движение. Более длительное обучение, включавшее около 30 000 обучающих видео и более крупные компенсационные ветви, не решило эту проблему.

Решение было найдено путем замены прогнозов плотного учителя только на пяти самых шумных шагах выборки, что устранило большую часть конечных ошибок и указало на важность ранних этапов формирования структуры. Таким образом, SparkDiffusion работает в три этапа: сначала адаптирует разреженную модель в грубый априор, затем корректирует распределение конечного вывода.

Первый этап включает короткую предварительную настройку модели к 97% разреженности с помощью RoLA — модуля внимания, который объединяет блочно-разреженную ветвь с линейной ветвью низкого ранга для сохранения глобального контекста. Далее, CrossDistill создает трехступенчатого студента, которому не требуется безсмещенное направление классификатора. Он использует один шаг согласованности при высоком шуме и два шага согласования распределения при низком шуме. При 97% разреженности модель показала результаты 83.15 на VBench и 58.05 на VBench-2.0, превосходя оба метода по отдельности.

Завершающим этапом является квантование линейных проекций до FP8 с использованием объединенных ядер, что обеспечивает теоретическую экономию, которая проявляется в реальной задержке GPU. Среди других достигнутых результатов: Wan2.1-T2V-1.3B при разрешении 480P сократил время с 182 секунд до 1.3 секунды на RTX 5090, а Wan2.2-T2V-A14B при 720P увеличил скорость с 4545 секунд до 25.1 секунд, что является 181-кратным улучшением.

Код доступен на GitHub под названием AlibabaResearch с лицензией Apache 2.0, а контрольные точки для преобразования текста в видео и изображения в видео в разрешениях 480P и 720P были выпущены на Hugging Face 25 сентября. Команда планирует расширить этот подход для генерации мультимодального контента с более высоким разрешением, авторегрессионного видео и мировых моделей, где более длинные последовательности делают ранние структурные ошибки более затратными.

В Биндхе (Мадхья-Прадеш) 15-футовый питон проглотил шакала, после чего его спасли сотрудники лесной службы
Подробнее
www.aajtak.in

В Биндхе (Мадхья-Прадеш) 15-футовый питон проглотил шакала, после чего его спасли сотрудники лесной службы

В деревне Кашипура, входящей в район Биндх штата Мадхья-Прадеш, произошло шокирующее событие. В течение последних двух дней наблюдался огромный питон длиной около 15 футов, который в воскресенье утром был замечен агрессивным образом на поле.

Питон атаковал шакала, крепко схватил его своим массивным телом и проглотил целиком на глазах у местных жителей. Этот инцидент произошел в деревне Кашипура, которая находится в округе Раун.

Присутствующие на месте событий жители были потрясены этим ужасающим зрелищем, что вызвало сильный страх среди населения всей деревни из-за присутствия змеи.

После того как питон проглотил шакала, он стал вялым из-за тяжести своего тела и оставался неподвижным на месте. Жители незамедлительно сообщили об этом в команду лесного ведомства.

Получив информацию, спасательная группа лесного ведомства прибыла на место. После примерно получасовых усилий и осторожной операции команда смогла безопасно захватить 15-футового питона и поместить его в мешок.

Затем змею отнесли подальше от деревни и выпустили в густой природный лес, после чего жители почувствовали облегчение.

Популярное