Модель AgiBot WITA-Omni Full-Modal получила высокий балл 85.21 в рамках бенчмарка DailyOmni. При этом модель продемонстрировала первенство по шести из восьми показателей, опередив такие системы, как Alibaba Qwen, Google Gemini, ByteDance Doubao и NVIDIA.
Тестирование и возможности модели
Бенчмарк оценивает способность модели одновременно обрабатывать аудио- и визуальные сигналы в условиях реального мира. Среди протестированных параметров были согласованность аудиовизуальных данных (86.13), временное рассуждение о событиях (84.64), комплексное кросс-модальное рассуждение (85.06), а также высокие результаты в задачах понимания видео продолжительностью 30 и 60 секунд.
Архитектурное новшество WITA-Omni
В отличие от универсальных мультимодальных моделей, оптимизированных для взаимодействия с цифровым контентом, WITA-Omni изначально разрабатывалась для воплощенного взаимодействия. Это означает, что роботы, использующие эту модель, должны понимать, реагировать и действовать в физической среде в режиме реального времени.
Инновация заключается в парадигме Thinker-Talker-Actor, которая заменяет традиционный последовательный конвейер. Стандартные процессы взаимодействия роботов выполняют распознавание речи, семантическое понимание, генерацию ответа, синтез речи и вывод действия как отдельные, последовательные этапы, что приводит к накоплению задержек. WITA-Omni же запускает ядро многомодального рассуждения Thinker, потоковую генерацию речи Talker и модули действия и выражения Actor параллельно на единой временной шкале.
Механизмы синхронизации
Модуль Actor принимает на вход не только семантическое состояние Thinker, но и латентные переменные аудио от Talker. Это позволяет жестам и мимике синхронизироваться с ритмом речи, паузами, акцентами и эмоциональным тоном, устраняя рассогласование между тем, что говорит робот, и тем, как он двигается. Архитектура расширяет парадигму Thinker-Talker, ранее созданную для разговорного ИИ, добавляя модуль Actor как полноценный выходной канал наряду с речью.
Thinker объединяет текстовые, изобразительные, аудио- и видеовходы через специализированные кодировщики и легкие проекционные слои в единое пространство представления для принятия решений о взаимодействии и кросс-модального рассуждения. Talker генерирует естественную речь, обусловленную скрытыми состояниями Thinker. Actor управляет головой действий и головой выражения, используя как семантическое состояние Thinker, так и аудиопризнаки Talker. Механизм синхронизации между потоками гарантирует, что движения робота реагируют на изменения скорости речи, сдвиги в выражении, а физические действия сохраняют временную согласованность с вербальным общением.
Позиционирование в индустрии
Этот результат следует за достижением AgiBot world model Genie Envisioner-Sim 2.0, который ранее занял первое место на WorldArena. Эти два достижения формируют трехстолпную структуру возможностей ИИ: WITA-Omni для взаимодействия, world model для понимания физического мира и аппаратное обеспечение робота для действий в нем. Победа в рейтинге подтверждает, что компании, занимающиеся воплощенным ИИ, могут достигать превосходных общих возможностей, оптимизируясь под ограничения реального мира, а не адаптируя универсальные модели.
По мере перехода роботов из контролируемых заводских сред в неструктурированные социальные пространства, способность синхронно обрабатывать множественные сенсорные потоки и реагировать скоординированными вербальными и физическими действиями становится ключевым отличием. AgiBot определяет синхронное полномодальное взаимодействие как новое конкурентное измерение в индустрии воплощенного ИИ, отдельное от конкуренции чисто по качеству моделей, доминирующей в сфере общего ИИ.