Alibaba представила модель Qwen3.8-Omni-Flash с поддержкой 1-миллионного контекстного окна
Подробнее
Pandaily
pandaily.com

Alibaba представила модель Qwen3.8-Omni-Flash с поддержкой 1-миллионного контекстного окна

Команда Qwen от Alibaba выпустила Qwen3.8-Omni-Flash — нативную мультимодальную модель, которая способна одновременно обрабатывать текст, изображения, аудио и видео, используя окно контекста объемом в один миллион токенов. Эта модель доступна на платформе Qwen AI с 18 сентября и позиционируется не столько как демонстрация возможностей создания подписей, сколько как набор агентов для длительных рабочих процессов с аудио и видео, включая планирование задач, вызов инструментов и предоставление готовых медиаматериалов.

При тестировании на наборе из около 30 публичных и внутренних бенчмарков, Qwen3.8-Omni-Flash показала средний прирост производительности более чем на 26% по сравнению с предыдущей версией Qwen3.5-Omni-Plus. Наиболее значительные улучшения наблюдались в задачах, связанных с агентным пониманием аудио и видео, а также в задачах с большим горизонтом: WildClawBench-MM увеличился на 36,5 пункта, AgenticVBench — на 22,3 пункта, а UniClawBench достиг 69,6.

Кроме того, улучшилось базовое восприятие: LongAudioSpan повысился на 8,3 пункта, а OmniVideoBench — на 9,6 пунктов. При этом частота ошибок диаризации в AliMeeting и частота ошибок при конкатенации слов снизились с 88,11/89,61 до 3,35/17,18 соответственно.

Практическое применение включает понимание длинных видеороликов в режиме агента. Вместо анализа каждого кадра, модель самостоятельно определяет, какие части нужно просматривать и слушать, концентрируя токены на наиболее релевантных сегментах. В режиме агента на OmniVideoBench точность возросла с 63,4 до 67,8, при этом потребление токенов уменьшилось примерно на 45,7%, составив около 79 117 вместо 145 736.

Рабочие процессы для совещаний поддерживают ввод аудио- и видеоматериалов продолжительностью до одного часа для разделения спикеров, транскрибирования, составления протоколов и выполнения последующих действий, таких как отправка электронной почты или кодирование через инструменты. Для поддержки этих конвейеров Alibaba расширила Qwen-MM-Plugins и открыла Qwen-Live Harness для непрерывного мультимодального взаимодействия в реальном времени. Специальная версия Realtime SKU обеспечивает потоковую передачу с низкой задержкой, практику речи с учетом акцента и пространственные аудиоподсказки, оценивающие направление и расстояние звука. Компания сообщила, что API-цены за почасовой аудиоввод были снижены более чем на 98%, а за почасовой аудио-видеоввод — более чем на 93%, представляя выпуск как скачок в возможностях и более экономичный путь для производственных мультимодальных агентов.

Популярное