Компания Tencent Robotics представила три воплощенные фундаментальные модели в рамках мероприятия WAIC 2026. Эти модели включают VLM для понимания сцены, когнитивную модель RxBrain для планирования с учетом визуальных состояний и VLA для непрерывных действий с частотой 500–1000 Гц.
Архитектура трех слоев
Главный научный сотрудник доктор Чжан Чжэньйоу представил эту архитектуру как решение фундаментальной проблемы, которую недостаточно освещают текущие подходы VLA. Он отметил, что различные типы роботизированного интеллекта должны функционировать на разных частотах, поскольку сам физический мир оперирует на множестве временных масштабов.
Понимание этой проблемы возникло после неудачного эксперимента по переносу возможностей робота в OpenClaw, который вызвал задержку в десятки секунд, неприемлемую для физических роботов, где даже когнитивная задержка в 2–3 секунды является проблемой.
Принцип разделения частот
Трехслойная архитектура решает эту проблему путем разделения частот. Модель Hy-Embodied-VLM отвечает за пространственное понимание на более низкой частоте, интерпретируя визуальные сцены и взаимосвязи объектов. Hy-Embodied-RxBrain представляет собой значительное новшество в когнитивной архитектуре: она не только генерирует шаги задачи на языке, но и визуализирует, как должен выглядеть физический мир после завершения каждой подзадачи, используя представления визуального состояния вместо текстовых описаний.
Это устраняет основное ограничение систем планирования, основанных только на языке, поскольку текстовые описания не могут эффективно передавать пространственные отношения и физические ограничения, которые можно мгновенно передать через зрение. Модель Hy-Embodied-VLA работает на самой высокой частоте, преобразуя высокоуровневые цели в непрерывные низкоуровневые команды действий со скоростью, достаточной для взаимодействия с физическим миром в реальном времени.
Промышленное тестирование и преимущества
Tencent сообщила, что Hy-Embodied-VLA прошла производственное тестирование на химическом заводе. Модель справляется с высокосмешанными, малосерийными, интенсивными по SKU сборочными линиями, обеспечивая время цикла одной детали менее 6 секунд. Кроме того, модель способна адаптироваться к новым SKU всего за 8 часов сбора данных и тонкой настройки.
Условия тестирования существенно отличаются от лабораторных демонстраций: объекты располагаются случайным образом, освещение меняется, происходят перебои в производстве, и робот должен достигать почти нулевого уровня отказов. Доктор Чжан подчеркнул, что демонстрация, набравшая 80–90 баллов без фактического внедрения, фактически не имеет ценности, и заводское тестирование отражает приверженность измеримой промышленной производительности, а не показателям бенчмаркинга.
Улучшение логики и экосистема
Когнитивная модель RxBrain решает вторую сложную задачу — узкое место языка в роботизированном рассуждении. Предыдущие системы Tairos полагались на текст для межмозгового общения, однако описание пространственных отношений объектов словами бывает многословным и неоднозначным. Инкорпорируя визуальное представление состояния в цикл планирования, RxBrain обеспечивает более высокую пропускную способность передачи информации между восприятием и действием.
Модель описывается как модель когнитивного мира воплощенного, а не как полная модель мира, поскольку в данной области еще не достигнута консенсусная архитектура единой модели мира. Вместе три модели и платформа Tairos формируют полный стек воплощенного интеллекта Tencent, доступный любому разработчику или производителю для использования. Таким образом, сообщество робототехники теперь может строить на той же архитектуре, чувствительной к частоте, которую разработала Tencent благодаря реальным сбоям и итеративному совершенствованию.