В 47-страничном техническом отчете Kimi K3 компания Moonshot AI демонстрирует, что она ставит перед индустрией задачи, а не просто следует существующим решениям. Основной тезис отчета заключается в существовании двух ключевых осей масштабирования искусственного интеллекта: вычислительные ресурсы до развертывания для более крупных моделей и вычислительные ресурсы после развертывания для инференса.
Масштабирование и производительность
Отчет K3 показывает, что открытый исходный код преуспевает во втором аспекте, но сталкивается со стагнацией в первом, поскольку большинство моделей достигают уровня в 1 триллион. K3 продвигает обе оси, достигая общего объема в 2.78 триллиона с 104.2 миллиардами активных параметров на токен, что более чем вдвое превышает показатели DeepSeek V4 Pro.
Архитектурные инновации K3
Хотя K3 использует некоторые новшества DeepSeek, он также устанавливает собственные проблемы, такие как исследование случая ядра DSA и математически доказанное идеальное равновесие экспертов, которые улучшают версию V3. Отчет сигнализирует о том, что выбранное направление было верным, но теперь требуется лучшее исполнение. Три архитектурных новшества касаются измерений последовательности, глубины и ширины масштабирования модели.
Для работы с последовательностью K3 заменяет 75% слоев внимания линейным вниманием KDA, которое поддерживает буфер состояния фиксированного размера для линейно масштабируемых вычислений. При этом сохраняется один слой MLA на каждые три слоя KDA для обеспечения глобального рецептивного поля. Важное улучшение заключается в добавлении нижней границы скорости затухания KDA, что позволяет проводить все вычисления на быстрых тензорных ядрах GPU, вместо того чтобы требовать специального пути. Кроме того, KDA полностью исключает позиционное кодирование, позволяя обрабатывать нативно токены размером 100K без необходимости инженерной интерполяции.
Улучшения глубины и ширины
Что касается глубины, механизм AttnRes предоставляет каждому слою параметры извлечения, позволяющие напрямую обращаться к выходным данным любого предыдущего слоя среди 93 слоев, организованных в 9 сжатых блоков. Это решает проблему разбавления признаков, которую создают стандартные остаточные соединения при масштабировании. Для ширины используется Stable LatentMoE с 896 экспертами и 16 активными на токен. Он применяет балансировку нагрузки на основе квантилей, которая вычисляет предпочтения планирования, полученные из распределения, за один проход. Математически доказано, что это обеспечивает идеальное равновесие без нестабильных вспомогательных штрафов.
Инфраструктура обучения и результаты
Инфраструктура обучения демонстрирует масштаб проекта. Библиотека межпроцессного взаимодействия MoonEP, оптимизированная для экспертного параллелизма, математически доказана как требующая лишь минимальное количество избыточных экспертов для гарантированного сбалансированного распределения при любой нагрузке, при этом обучение никогда не прерывается. Песочница обучения с подкреплением, основанная на легковесных виртуальных машинах, создала 51.2 миллиона экземпляров во время обучения и оценки, с временем снимка состояния 133 мс и временем восстановления 49 мс. После обучения используются девять саморазработанных учителей в общих, агентских и программных доменах, по три уровня сложности рассуждений каждый, которые затем дистиллируются в единую модель.
Результаты показывают, что подход, учитывающий обе оси, дает ощутимые результаты: показатель BrowseComp составляет 91.2% при половине стоимости GPT-5.6 Sol, а балл Kimi Code Bench на 4 пункта ниже, чем у Claude Fable 5, при 38% его стоимости.
Заключение отчета K3
Отчет K3 побуждает DeepSeek реагировать на архитектурные изменения, а не только на ценообразование. Документ выполняет двойную функцию: он является документацией и одновременно провокацией, утверждая Moonshot AI как определителя архитектуры, а не ее последователя. Дебаты между K3 и V4 определяют следующий этап развития.


