Компания China Telecom Artificial Intelligence Technology Co., Ltd. сделала доступной модель Xing4.0-29B-A4B, которая является последней разработкой в серии Xing (ранее известной как TeleChat). Веса и конфигурационные файлы этой модели размещены на платформах Hugging Face и ModelScope под организацией XingChen-AGI. Официально модель позиционируется как China Telecom / XingChen / Xing4.0.
Модель представлена как агентская реализация Mixture-of-Experts (MoE), оптимизированная для платформы Ascend, а не просто как общий релиз большой языковой модели. Согласно материалам компании, это первая модель такого масштаба, полностью обученная на ускорителях Ascend NPUs с использованием фреймворка MindSpore и специально настроенная для сложных инженерных задач и рабочих нагрузок агентов.
Согласно данным Hugging Face, модель имеет общее количество параметров в 29 миллиардов, при этом активируется около 4 миллиардов параметров на каждый токен. Она поддерживает нативную длину контекста в 256K, которую можно расширить до 512K, имеет 40 слоев, использует внимание MLA и включает 64 маршрутизированных эксперта, из которых на каждый токен активируются четыре эксперта плюс один общий эксперт. Архитектурные заметки указывают на стек mHC + MLA + MTP, предназначенный для многоэтапного планирования, вызова инструментов и поддержания связности в длинном контексте.
Сообщается, что совместная оптимизация обучения на кластерах Ascend 910C через MindSpore/MindFormers, включая объединенные операторы mHC и настройку связи MoE, повысила пропускную способность обучения примерно на 96% по сравнению с базовыми настройками, что является данными, предоставленными вендором.
Для использования предусмотрены различные пути обслуживания, такие как Transformers, vLLM, SGLang и KTransformers. Также доступна поддержка тонкой настройки с помощью LLaMA-Factory и MindFormers, а также форматирование для систем агентов, включая OpenCode, Claude Code, OpenClaw и Hermes. Кроме того, Phoenix Tech отмечает, что покрытие вторичных ИТ-тем показывает результаты агентов SuperCLUE, сравнимые с ведущими моделями Qwen, и утверждает, что квантование в 4 бита может снизить потребление памяти до 15 ГБ для локального запуска с длинным контекстом, однако эти заявления пока являются сторонними или заявленными компанией до независимой проверки.
Для команд, работающих на стеках Huawei Ascend, предоставляются загружаемые веса Xing4.0-29B-A4B с явным происхождением обучения на MindSpore и открытыми интерфейсами для инференса в экосистеме Apache. Таким образом, это агентская MoE от China Telecom в формате OSS, а не закрытое объявление, основанное только на API.
