Платформа openJiuwen от Huawei предоставляет WorkSwarm полнодуплексный голосовой и видеоинтерфейс для работы на Ascend NPUs
Подробнее
Pandaily
pandaily.com

Платформа openJiuwen от Huawei предоставляет WorkSwarm полнодуплексный голосовой и видеоинтерфейс для работы на Ascend NPUs

OpenJiuwen, платформа с открытым исходным кодом для ИИ-агентов, разработанная совместно лабораториями Huawei 2012, Huawei Cloud и командами по устройствам и вычислениям компании, а также университетами и другими разработчиками, внедрила в WorkSwarm — свой открытый рабочий стол для офисных и кодинговых задач — возможность мультимодального взаимодействия с полной дуплексной связью.

Обновление, анонсированное 1 октября, позволяет пользователям общаться с агентом так же, как при обычном телефонном звонке, в то время как другой агент продолжает выполнять более длительные задачи в фоновом режиме.

Принцип работы полнодуплексного взаимодействия

Полнодуплексная связь означает, что помощник способен одновременно слушать и говорить. В отличие от традиционных голосовых помощников, работающих по принципу рации, где пользователь вынужден ждать завершения ответа ИИ, теперь пользователь может прервать ответ в середине, например, попросив пропустить фон и перейти к выводам.

Когда WorkSwarm обнаруживает новую действительную голосовую команду, он останавливает текущий ответ и обрабатывает новое указание; при этом ранее сгенерированный текст сохраняется в записи задачи. Для минимизации ложных прерываний от фоновых шумов используются функции обнаружения голосовой активности и шумоподавления.

Архитектура разделения задач

Конструкция разделяет работу на два потока. Модель реального времени следит за видеопотоком, быстро реагирует и отвечает, тогда как Основной Агент занимается декомпозицией задач, вызовом инструментов и продвижением процесса вперед. Пользователь может направить камеру на продукт, спросить о его бренде, а затем поручить WorkSwarm провести исследование и составить документ. Поиск выполняется в фоновом режиме, пока продолжается разговор, а интерфейс отображает статус задачи, записи вызова инструментов, полученные результаты и созданные файлы.

После завершения фоновой задачи WorkSwarm сначала публикует письменное резюме и ожидает окончания текущего устного диалога, прежде чем озвучить только ключевые моменты. Последующие запросы ставятся в очередь, и пользователи могут менять порядок задач, перемещать одну на первое место или останавливать ожидающие или выполняющиеся задачи. Прерывание разговора не отменяет инструментальные задачи, которые необходимо останавливать отдельно, а закрытие аудио- и видеосессии не прекращает работу, уже переданную Основному Агенту. Результаты возвращаются в исходный диалог.

В настоящее время WorkSwarm поддерживает два протокола моделей: Qwen Omni в режиме реального времени через WebSocket, который может использовать официальную конечную точку или локальное развертывание, и JoyAI, который связывает отдельные модели распознавания речи, языка и синтеза речи через официальные API или другие платформы. Мультимодальные модели с полной дуплексной связью также могут быть развернуты на Ascend NPUs через платформу ModelArts от Huawei Cloud с использованием фреймворка инференса vLLM-Omni. WorkSwarm предлагает установщики для Windows, Mac и HarmonyOS, а также пакеты pip, а его репозиторий на GitHub лицензирован под Apache-2.0. Последний помеченный релиз проекта, v0.2.7 от 30 сентября, добавил Сервис Проактивного Контекста и межагентные сессии.

Популярное