WeChat начал проводить серую проверку Xiaowei — нативного помощника на базе искусственного интеллекта, интегрированного непосредственно в приложение. Этот помощник отличается от отдельных приложений ИИ, таких как Yuanbao. Пользователи могут обращаться к Xiaowei через точку входа в верхнем левом углу главной страницы WeChat, используя текстовые или голосовые команды. После этого Xiaowei задействует функции и сервисы WeChat для выполнения поставленных задач. Он функционирует скорее как потребительский агент, встроенный в экосистему WeChat, нежели как обычный чат-бот.
В основе работы Xiaowei лежит модель WeLM, которую разрабатывала команда ИИ WeChat на протяжении многих лет. Эта модель не является новой: в 2022 году команда ИИ WeChat представила WeLM — китайскую предварительно обученную языковую модель с 10 миллиардами параметров. Тогда она демонстрировала высокие результаты в 18 китайских задачах, сравниваясь или превосходя более крупные модели в некоторых тестах.
Версия WeLM, используемая в Xiaowei сегодня, прошла через ряд обновлений. Команда перевела WeLM на архитектуру разреженной смеси экспертов (sparse mixture-of-experts). Модель WeLM-80B имеет общий объем в 80 миллиардов параметров, однако активирует лишь около 3 миллиардов на каждый токен. Она была обучена на менее чем 14 триллионах токенов и обладает возможностями рассуждения, многоязычного понимания и контекстным окном размером 128K. Для продукта с масштабом пользователей WeChat, который ежедневно обрабатывает огромные объемы запросов, это критически важно, поскольку WeChat нуждается не в крупной модели, используемой время от времени, а в инфраструктуре ИИ, к которой обращаются сотни миллионов, а возможно, и миллиарды пользователей с высокой частотой.
Команда не остановилась на уровне 80 миллиардов параметров. Появилась версия WeLM-617B, обладающая общим количеством параметров в 617 миллиардов и активирующей 23 миллиарда на токен, также построенная по принципу MoE. Вместо простого увеличения числа параметров, команда WeChat изучает иной метод масштабирования, называемый Hidden Decoding. Традиционное масштабирование либо увеличивает размер модели, либо позволяет ей дольше думать перед ответом. Hidden Decoding сохраняет структуру основной части модели примерно неизменной, но выполняет больше вычислений на каждый токен внутренне, расширяя один токен в несколько потоков вдоль размерности последовательности. Это позволяет модели использовать дополнительные скрытые вычисления для улучшения рассуждений без добавления слоев Трансформера или увеличения ширины.
Для контроля вычислительных затрат команда разработала механизм Stream-Factorized Attention, который снижает накладные расходы внимания с квадратичного до почти линейного роста по мере увеличения числа потоков. Эти механизмы идеально подходят для огромной пользовательской базы WeChat. Таким образом, Xiaowei в сочетании с WeLM намекает на то, что WeChat, возможно, не будет нуждаться в создании еще одного супер-приложения на базе ИИ; он может интегрировать ИИ непосредственно в операционный слой самого WeChat.

