Компания Moonshot AI официально выпустила модель Kimi K3 с открытым исходным кодом. Эта модель обладает 2,8 триллионами параметров MoE, включает 896 маршрутизированных экспертов и поддерживает 16 активных экспертов на токен, а также имеет окно контекста в 1 миллион токенов. Кроме того, были выпущены инфраструктурные инструменты MoonEP, FlashKDA и AgentEnv.
Технические характеристики и улучшения модели
Выпуск Kimi K3 состоялся 27 июля. Модель стала крупнейшей в мире среди моделей с открытыми весами. По сравнению с предыдущим поколением K2.5, масштаб параметров K3 увеличился примерно в три раза, а вычислительная эффективность возросла в 2,5 раза благодаря использованию технологий Kimi Delta Attention, Attention Residuals и MoonEP, что позволяет работать в условиях ограниченных вычислительных ресурсов.
Архитектурные инновации
Технический отчет раскрывает ряд архитектурных новшеств. Гибридная структура внимания KDA в сочетании с Gated MLA объединяет линейное внимание для эффективной обработки длинного контекста и вентилированное многоголовое латентное внимание для получения высококачественного локального представления. Механизм маршрутизации Stable LatentMoE решает проблему коллапса экспертов, часто встречающуюся при обучении больших моделей MoE, стабилизируя динамику градиента маршрутизатора. Кроме того, схема обучения кодировщика зрения MoonViT-V2 обеспечивает нативную мультимодальную интерпретацию без необходимости использования отдельных адаптеров зрения и языка. Модель была обучена и протестирована на задачах универсального рассуждения, агентов и кодинга, демонстрируя широту возможностей K3 за пределами чисто языковых задач.
Инфраструктурные решения
Помимо самой модели, были открыты три инструмента инфраструктуры. MoonEP представляет собой библиотеку связи высокой производительности, предназначенную для крупномасштабного обучения MoE, которая устраняет узкое место коммуникации типа все-ко всем, ограничивающее масштабируемость MoE. FlashKDA предоставляет высокопроизводительное ядро вычислений для Kimi Delta Attention; согласно бенчмаркам, на GPU H20 он обеспечивает улучшение скорости предварительного заполнения от 1,72 до 2,22 раз по сравнению с базовым вариантом flash-linear-attention. AgentEnv — это система песочницы для агентов, разработанная с использованием KVCache.ai, которая поддерживает быстрые функции создания снимков, восстановления и форка для сред крупномасштабного обучения агентов. Эти релизы инфраструктуры снижают барьер для воспроизведения и дальнейшего развития моделей класса K3.
Экосистемные последствия выпуска
Выпуск с открытым исходным кодом имеет значительные последствия для экосистемы. K3 соответствует или превосходит закрытые передовые модели, такие как GPT-5.6 и Claude Fable 5, по ряду специфических тестов, особенно в генерации кода для фронтенда. При этом стоимость использования K3 через API оказывается на 40% ниже, чем у Claude, и на 70% ниже, чем у Fable. Лицензия с открытыми весами позволяет осуществлять локальное развертывание и разрабатывать собственные приложения без зависимости от API. Тем не менее, из-за масштаба в 2,8 триллиона параметров, даже локальное внедрение требует значительного оборудования — как минимум, GPU класса 10 GB300 только для загрузки модели, что делает затраты на инфраструктуру инференса основным фактором при развертывании, а не плата за API.
Реакция рынка и ограничения
Этот релиз вызвал цепную реакцию в экосистеме. Платформа Qianwen AI от Alibaba Cloud объявила о доступности K3. Huawei анонсировала адаптацию Ascend 0-day для K3, что стало первым случаем запуска модели уровня 3 триллионов на отечественном оборудовании. Сообщество с открытым исходным кодом получило доступ к весам модели, которые ранее требовали инвестиций в сотни миллионов для воспроизведения. Moonshot AI заявила, что инициатива по открытому исходному коду направлена на продвижение экосистемы моделей с открытыми весами, снижая барьеры для разработки и развертывания для более широкого сообщества ИИ. Однако вскоре после этого было объявлено, что K3 приостановила новые подписки пользователей из-за ограничений вычислительной мощности, что подчеркнуло противоречие между идеалами открытого исходного кода и реальностью обслуживания модели с 2,8 триллионами параметров в масштабе.