Технический отчет Kimi K3 раскрывает детали инфраструктуры, включая MoonEP, KDA и AttnRes. Однако истинным отличием остается инженерный опыт, стоящий за реализацией MFU, экспертного параллелизма и общих экспертов.
Технический отчет Kimi K3 раскрывает детали инфраструктуры, включая MoonEP, KDA и AttnRes. Однако истинным отличием остается инженерный опыт, стоящий за реализацией MFU, экспертного параллелизма и общих экспертов.
Инфраструктура искусственного интеллекта выступает в роли операционной системы, связывающей аппаратное обеспечение и приложения. Когда разработчики используют собственные модели, затраты оказываются значительно ниже, чем при использовании сторонних решений, что обусловлено разрывом в опыте работы с инфраструктурой. Инженер OpenAI Weng Jiayi отметил, что основная проблема в обучении связана именно с инфраструктурой, и инженеры в основном занимаются устранением ошибок в этой области.
По мере того как архитектуры сходятся, а дистилляция снижает барьеры воспроизведения, именно инфраструктурная инженерия определяет стоимость обучения, эффективность развертывания и стабильность. Сто компаний, использующих Kimi K3, могут достичь сто различных уровней эффективности. Ошибки инфраструктуры включают как традиционные недочеты, влияющие на корректность и стабильность, так и системные проблемы, которые не нарушают математическую точность, но приводят к простою GPU, потере памяти, блокировке коммуникаций и снижению пропускной способности.
Коэффициент использования FLOPs модели измеряет эффективность обучения как отношение наблюдаемой пропускной способности к теоретическому максимуму. Публично проверяемые крупномасштабные случаи обучения демонстрируют, что ByteDance MegaScale достиг показателя MFU в 55,2%, что является одним из самых высоких зарегистрированных результатов. В качестве крайнего контраргумента приводится информация о том, что xAI, используя около 550 000 GPU H100, сообщил о показателе MFU всего в 11% согласно внутренним меморандумам, что значительно ниже отраслевого стандарта в 35–45% и показателей конкурентов Meta (43%) и Google (46%). Более высокая эффективность обучения напрямую ведет к сокращению циклов обучения, снижению расходов, увеличению числа экспериментов и масштабированию данных или моделей.
Распределенная система Kimi K3 использует классические методы параллелизации, такие как конвейерный параллелизм, экспертный параллелизм и шардинг ZeRO. Конвейерный параллелизм распределяет слои модели между GPU с использованием микропакетной обработки для уменьшения времени простоя из-за «пузырей» конвейера. Тензорный параллелизм разделяет матрицы весов и операции между GPU, требуя высокой пропускной способности межсоединений GPU. Важная деталь заключается в том, что слои MoE используют общих экспертов, реплицированных по рангам EP, что означает, что каждый GPU содержит идентичные общие эксперты плюс различные маршрутизированные эксперты, позволяя общим экспертам усваивать общие признаки в данных. Архитектурные механизмы KDA и AttnRes сочетаются с соответствующим дизайном инфраструктуры, а MoonEP решает уникальные задачи экспертного параллелизма в архитектурах MoE. При работе с более крупными моделями проявляются проблемы, незаметные в малых моделях, поскольку ранее неосознанные вычислительные процессы или объекты памяти становятся значимыми относительно емкости GPU при масштабировании.
Открытый доступ к весам демократизирует использование моделей, но не компетенции в области инфраструктуры. Различия в стоимости развертывания, составляющие несколько порядков, создают структурное преимущество для разработчика в экономике обучения и инференса. Данный отчет служит одновременно обменом знаниями и сигналом о конкурентных возможностях: архитектуру можно изучить, но инженерный опыт в масштабе 2,8 триллиона не может быть передан через документацию. Возможности модели становятся все более товаром, в то время как совершенство инфраструктуры превращается в долгосрочное защитное преимущество.
Компания Moonshot AI официально выпустила модель Kimi K3 с открытым исходным кодом. Эта модель обладает 2,8 триллионами параметров MoE, включает 896 маршрутизированных экспертов и поддерживает 16 активных экспертов на токен, а также имеет окно контекста в 1 миллион токенов. Кроме того, были выпущены инфраструктурные инструменты MoonEP, FlashKDA и AgentEnv.
Выпуск Kimi K3 состоялся 27 июля. Модель стала крупнейшей в мире среди моделей с открытыми весами. По сравнению с предыдущим поколением K2.5, масштаб параметров K3 увеличился примерно в три раза, а вычислительная эффективность возросла в 2,5 раза благодаря использованию технологий Kimi Delta Attention, Attention Residuals и MoonEP, что позволяет работать в условиях ограниченных вычислительных ресурсов.
Технический отчет раскрывает ряд архитектурных новшеств. Гибридная структура внимания KDA в сочетании с Gated MLA объединяет линейное внимание для эффективной обработки длинного контекста и вентилированное многоголовое латентное внимание для получения высококачественного локального представления. Механизм маршрутизации Stable LatentMoE решает проблему коллапса экспертов, часто встречающуюся при обучении больших моделей MoE, стабилизируя динамику градиента маршрутизатора. Кроме того, схема обучения кодировщика зрения MoonViT-V2 обеспечивает нативную мультимодальную интерпретацию без необходимости использования отдельных адаптеров зрения и языка. Модель была обучена и протестирована на задачах универсального рассуждения, агентов и кодинга, демонстрируя широту возможностей K3 за пределами чисто языковых задач.
Помимо самой модели, были открыты три инструмента инфраструктуры. MoonEP представляет собой библиотеку связи высокой производительности, предназначенную для крупномасштабного обучения MoE, которая устраняет узкое место коммуникации типа все-ко всем, ограничивающее масштабируемость MoE. FlashKDA предоставляет высокопроизводительное ядро вычислений для Kimi Delta Attention; согласно бенчмаркам, на GPU H20 он обеспечивает улучшение скорости предварительного заполнения от 1,72 до 2,22 раз по сравнению с базовым вариантом flash-linear-attention. AgentEnv — это система песочницы для агентов, разработанная с использованием KVCache.ai, которая поддерживает быстрые функции создания снимков, восстановления и форка для сред крупномасштабного обучения агентов. Эти релизы инфраструктуры снижают барьер для воспроизведения и дальнейшего развития моделей класса K3.
Выпуск с открытым исходным кодом имеет значительные последствия для экосистемы. K3 соответствует или превосходит закрытые передовые модели, такие как GPT-5.6 и Claude Fable 5, по ряду специфических тестов, особенно в генерации кода для фронтенда. При этом стоимость использования K3 через API оказывается на 40% ниже, чем у Claude, и на 70% ниже, чем у Fable. Лицензия с открытыми весами позволяет осуществлять локальное развертывание и разрабатывать собственные приложения без зависимости от API. Тем не менее, из-за масштаба в 2,8 триллиона параметров, даже локальное внедрение требует значительного оборудования — как минимум, GPU класса 10 GB300 только для загрузки модели, что делает затраты на инфраструктуру инференса основным фактором при развертывании, а не плата за API.
Этот релиз вызвал цепную реакцию в экосистеме. Платформа Qianwen AI от Alibaba Cloud объявила о доступности K3. Huawei анонсировала адаптацию Ascend 0-day для K3, что стало первым случаем запуска модели уровня 3 триллионов на отечественном оборудовании. Сообщество с открытым исходным кодом получило доступ к весам модели, которые ранее требовали инвестиций в сотни миллионов для воспроизведения. Moonshot AI заявила, что инициатива по открытому исходному коду направлена на продвижение экосистемы моделей с открытыми весами, снижая барьеры для разработки и развертывания для более широкого сообщества ИИ. Однако вскоре после этого было объявлено, что K3 приостановила новые подписки пользователей из-за ограничений вычислительной мощности, что подчеркнуло противоречие между идеалами открытого исходного кода и реальностью обслуживания модели с 2,8 триллионами параметров в масштабе.
Модель Kimi K3 от Moonshot AI продемонстрировала значительный технический прогресс, заняв третье место в мировом рейтинге искусственного анализа, однако ее путь к моменту прорыва, подобному тому, что был у DeepSeek, осложняется вопросами ценообразования, ограничений вычислительной мощности и зрелости экосистемы.
Kimi K3 возглавила мировые бенчмарки по кодированию и занимает третье место в общем зачете, уступая лишь Fable 5 и GPT-5.6. Модель достигла уровня, которого ранее не достигали китайские большие модели, заняв третье место в рейтинге искусственного анализа, опередив даже Fable 5 в бенчмарке по фронтенд-кодированию Arena 2026. Илон Маск назвал этот результат впечатляющим, а мировые СМИ окрестили это «Вторым шоком DeepSeek».
На платформе Artificial Analysis модель K3 занимает третью мировую позицию. Она построена на основе архитектуры Mixture-of-Experts с 896 экспертами, имеет 2,8 триллиона параметров, поддерживает нативную контекстную длину в 1 миллион токенов и использует механизм внимания KDA. Модель показывает высокую эффективность в задачах, связанных с кодированием, работой агентов и рассуждениями с длинным контекстом, что имеет прямое коммерческое применение. Тем не менее, по сравнению с ведущими моделями закрытого исходного кода, K3 все еще демонстрирует измеримые пробелы в сложных рассуждениях и мультимодальных задачах.
Существенным препятствием является ценообразование: K3 стоит в 3–15 раз дороже DeepSeek за миллион токенов. Хотя это подтверждает способность китайского ИИ устанавливать премиальные цены, это ограничивает вирусный рост экосистемы, который DeepSeek обеспечил благодаря ультранизкой стоимости доступа и массовому внедрению.
Наиболее критичным узким местом являются вычислительные ограничения. Несмотря на то, что K3 была обучена с удивительно эффективным использованием ресурсов, вскоре после выпуска Kimi была вынуждена приостановить новые потребительские подписки из-за огромного спроса на инференс. Один запрос K3 требует приблизительно 1,4 ТБ памяти даже после квантизации с низкой точностью. Moonshot AI активно работает над наращиванием вычислительных мощностей, но разрыв между потребностью и доступной инфраструктурой остается главным фактором, отделяющим K3 от устойчивого влияния на рынке. Эти ограничения также мешают коммерческому развертыванию, поскольку корпоративные клиенты требуют гарантированной пропускной способности инференса, которую Moonshot AI пока не может обеспечить в масштабе.
Ключевое отличие момента прорыва DeepSeek заключалось не только в качестве самой модели, но и в создании самоподдерживающегося цикла: массовое принятие пользователями стимулировало рост экосистемы разработчиков, что, в свою очередь, улучшало возможности модели и вело к дальнейшему росту принятия. Kimi K3 достигла технического предпосылки, но еще не запустила этот «маховик экосистемы». Ближайшие недели определят, сможет ли Moonshot AI преодолеть вычислительный барьер, превратить техническое восхищение в стабильные коммерческие отношения и создать экосистему разработчиков, которая преобразует отличную модель в полноценную платформу. Инженерные возможности доказаны, однако бизнес-модель и стратегия инфраструктуры все еще находятся в стадии разработки.