Компания Сбер анонсировала выпуск семейства генеративных моделей Kandinsky WM 1.0, которые предназначены для производства видеоматериалов, обладающих высокой степенью физической правдоподобности. Эти видеоролики необходимы для тренировки систем Physical AI, включая беспилотный транспорт и различных роботов.
Согласно пресс-релизу, полученному редакцией N + 1, код и веса этих моделей были опубликованы под лицензией MIT, что делает их бесплатными для использования разработчиками.
Системы Physical AI определяются как интеллектуальные системы, способные взаимодействовать с реальным физическим окружением, включая пешеходов, автомобили, промышленное оборудование и других роботов. Основу обучения таких систем составляют обширные наборы видеоданных. Однако сбор таких данных часто является затратным и трудоемким, а запись некоторых критических сценариев, вроде аварий, отказов техники или экстремальных погодных явлений, в реальных условиях невозможна.
Кроме того, дообучение роботов, например, погрузчиков или беспилотных такси, непосредственно в рабочем процессе представляет собой не только высокую стоимость, но и потенциальную опасность.
Ранее использование видео, сгенерированных нейросетями для обучения Physical AI, сталкивалось с трудностями из-за множества артефактов: искажений геометрии, проблем с перспективой и появлением объектов с неестественной, «мягкой» деформацией. Разработчики Сбера, под руководством Дениса Димитрова, решили эту проблему, создав специализированное семейство моделей для генерации физически достоверных видеосцен.
Новые модели базируются на Kandinsky 5.0 Video Lite, но прошли дополнительное обучение на миллионах видеозаписей, собранных с камер роботов, беспилотных автомобилей и в ходе промышленных процессов. По утверждению разработчиков, это позволило существенно снизить распространенные ошибки при генерации видео.
Благодаря этим моделям Kandinsky WM научилась создавать физически корректные видеоклипы продолжительностью около пяти секунд. Эти ролики могут демонстрировать различные действия и ситуации, такие как манипуляции с объектами, дорожные сцены или этапы производственных циклов. Полученные материалы полезны для обучения систем компьютерного зрения и симуляторов для беспилотного транспорта.
Для повышения качества автомобильных сцен была внедрена дополнительная стадия обучения с подкреплением: Kandinsky WM генерировал видео, а другие нейросети выступали в роли оценщиков, проверяя сохранение формы объектов, геометрическую точность сцены и естественность движений, предоставляя обратную связь.
Модели Kandinsky WM 1.0 уже доступны в открытом репозитории проекта Kandinsky. В пресс-релизе отмечается, что институт AIRI использует эти модели в своем дорожном симуляторе, а Центр робототехники Сбера применяет их для обучения собственных роботов.
В другой части материала упоминается, что концерн Airbus представил макет U145 — беспилотную версию вертолета H145. В этой модификации кабину пилотов заменили на набор датчиков с ИИ-системой управления, а вместо кабины установлены двери с откидным столом для погрузки. Первый полет планируется на конец 2026 года, а полный ввод в эксплуатацию ожидается в начале следующего десятилетия.



