Компания XPower Technology представила чипы архитектуры RPP AE7100E на мероприятии WAIC. Эти микросхемы размером с ноготь способны поддерживать модели с параметрами от 400 миллиардов до 1,6 триллиона благодаря использованию распределенных вычислений, обеспечивая при этом минимальную стоимость токена.
Вызов доминированию больших чипов
XPower Technology зарекомендовала себя как значимый игрок на внутреннем рынке AI-вычислений на WAIC 2026. Компания продемонстрировала свою матрицу ускорителей искусственного интеллекта, основанную на собственной архитектуре реконфигурируемого параллельного процессора RPP. Эта архитектура охватывает сценарии облачных, граничных и конечных вычислений. Основная идея компании напрямую оспаривает общепринятую доктрину индустрии о необходимости использования гигантских чипов.
Технологическое преимущество RPP
Чипы AE7100E, которые имеют размер около ногтя, могут быть интегрированы в количестве 12 штук на одну карту ускорителя. Такая конфигурация позволяет запускать большие языковые модели с 400 миллиардами до 1,6 триллиона параметров посредством распределенных вычислений, достигая оптимальной для отрасли эффективности затрат на токены. Генеральный директор XPower, Ли Юань, отметил, что переход от вычислений, ориентированных на обучение, к вычислениям, ориентированным на инференс, является ключевым трендом. Он подчеркнул, что AI-программирование стало критически важным случаем использования для инференса, поскольку опыт компании показал, что AI теперь способен выполнять разработку компиляторов ЦП, которая ранее требовала профессиональной команды годами, и эту способность можно масштабировать для быстрого применения в различных задачах.
Экономическая целесообразность и архитектура
Поскольку 55% запросов к моделям в глобальных центрах обработки данных приходится на рынок моделей с открытым исходным кодом, рынок инференса доступен не только нескольким гигантам, но и любому предприятию, что создает огромный спрос на экономически эффективную инфраструктуру для инференса. Ключевое наблюдение заключается в неэффективности больших чипов при инференсе: декодирование требует соотношения вычислений к данным 1:1, тогда как графические процессоры (GPU) обеспечивают соотношение 1000:1, что приводит к потере пропускной способности. Архитектура RPP от XPower использует распределенные небольшие чипы, обеспечивая тонкую специализацию в пределах одного сервера. Кроме того, подход XPower заменяет дорогостоящую технологию HBM на более зрелую LPDDR, утверждая, что для AI-инференса фундаментально необходимы три элемента: большая емкость, достаточная пропускная способность и низкая стоимость. Технология LPDDR удовлетворяет всем этим требованиям при значительно меньшей стоимости по сравнению с HBM. Конфигурация из 12 чипов на карту позволяет осуществлять детальное разделение памяти и параллельную обработку данных между чипами в рамках одного форм-фактора сервера. Эта распределенная серверная архитектура отличает XPower от подхода NVIDIA Groq, который также использует распределенные многочиповые конструкции, но в гораздо большем кластерном масштабе. Встроенная гибкость архитектуры RPP, балансирующая между общими и специфичными для предметной области вычислениями, позволяет использовать один чип для сценариев развертывания в облаке, на границе и на конечном устройстве.
Стратегическое видение рынка
Во время WAIC компания продемонстрировала свою продукционную линейку, начиная от чипа AE7100E и заканчивая высокоплотными серверными шкафами на 8 карт. Переход компании от граничных вычислений к облачным является стратегической ставкой на то, что рынок инференса, который XPower оценивает в 10 раз выше, чем рынок обучения по общей адресуемой стоимости, будет завоеван не самой большой вычислительной мощностью одного чипа, а наиболее экономически эффективными распределенными системами. Хотя подтверждение этой гипотезы будет зависеть от результатов реального внедрения, архитектура RPP представляет собой один из самых самобытных отечественных подходов к вычислениям, который бросает вызов консенсусу о больших чипах, утверждая, что будущее AI-инференса принадлежит не единым монолитным процессорам, а скоплениям скоординированных небольших чипов.