Вечером 27 июля Moonshot AI опубликовала полные веса Kimi K3 и технический отчёт, одновременно открыв исходники MoonEP, FlashKDA и AgentEnv — первой в мире полностью открытой модели класса 3 триллиона параметров. Веса на Hugging Face (~ 1,56 ТБ) за 30 минут вышли на первое место в трендах. Для разработчиков, которым важны лицензия open weight, инновации MoE и возможность self-hosting, материал охватывает: 11-дневную хронологию от API до полного релиза весов, архитектуру KDA/AttnRes/Per-Head Muon, три open source Infra-компонента, сравнение SWE-bench и AA Index, два коммерческих порога лицензии, цены API и реальность self-hosting на 64 GPU, шестишаговый чеклист и FAQ. Главный вывод: K3 — потолок возможностей open weight, но не лучший выбор по цене; Moonshot последовательно говорит об open weight, а не об open source.
Три главных вопроса: 16/7 API уже был — что изменилось 27/7? В чём разница «open source» и «open weight»? Сколько GPU нужно для self-hosting? Ниже — хронология.
| Дата | Событие |
|---|---|
| 16/7, вечер | Запуск Kimi K3 на kimi.com, Kimi Work, Kimi Code и API — веса ещё закрыты |
| 17/7 | Синьхua называет модель «крупнейшей open source в мире»; отрасль разбирает архитектуру |
| 22–23/7 | США обвиняют Moonshot в «промышленной дистилляции» Anthropic Fable и угрожают санкциями |
| 27/7, 23:00 | Полные веса и технический отчёт; MoonEP и AgentEnv в open source (FlashKDA ранее) |
| 28/7 | Минкомторг КНР отвечает на спор США–Китай в AI; медиа пишут о деталях open weight |
Риск неверного прочтения лицензии: пресса пишет «open source», Moonshot не использует open source — custom-лицензия с порогами MaaS и обязательным отображением
Иллюзия self-hosting: 1,56 ТБ + MoE 896 экспертов — потребительские GPU не справятся; слепая закупка железа — главная скрытая статья расходов
Злоупотребление бенчмарками: большой разрыв между цифрами вендора и независимыми ретестами — приоритет Vals AI, Artificial Analysis
Ловушка цен кэша: в прайсе вход $3/M, но Mooncake даёт >90% hit rate в coding — фактическая стоимость ближе к $0,30/M
Геополитический compliance: спор о «дистилляции моделей» США–Китай + окно WAIC 2026 — открытые веса не означают аудируемый процесс обучения
Среда для Agent: длинные coding-сессии требуют стабильных вычислений и toolchain — ноутбук или слабый VPS не тянут production-пайплайны
| Параметр | Значение |
|---|---|
| Всего параметров | 2,8 триллиона (2,8T) |
| Активных параметров | ~ 104 млрд |
| Архитектура | Mixture of Experts (MoE), 896 routing-экспертов, 16 активных на токен |
| Attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (Gated MLA) |
| Контекст | 1 млн токенов |
| Мультимодальность | Нативное зрение (ViT-V2, 27 слоёв) |
| Формат весов | MXFP4 веса + MXFP8 активации (quantization-aware training) |
| Объём весов | ~ 1,56 ТБ (Hugging Face) |
| Лицензия | Custom (официально: open weight, не open source) |
Классический Gated DeltaNet использует скалярные gates забывания; KDA переходит на поканальное gating — каждое измерение признака затухает независимо. Chunkwise DPLR даёт линейную рекурсию, чередуясь с Gated MLA: контекст 1M при минимальном KV cache.
Классические residual равномерно суммируют выходы слоёв — глубокие слои размывают раннюю информацию. AttnRes агрегирует динамически от входа; на слой — только RMSNorm и один pseudo-query. ~25% прирост эффективности обучения, overhead <2% параметров.
Per-Head Muon оптимизирует каждую attention-голову отдельно; MoE выбирает 16 из 896 экспертов (разреженность ~1,8%). Quantile Balancing и MoonEP доказывают верхнюю границу избыточных экспертов и решают дисбаланс нагрузки MoE.
Moonshot переосмыслила attention, residual-связи и оптимизатор — в этом суть K3, а не просто масштаб 2,8T.
Релиз — не только веса: открыты три ключевые инфраструктуры эффективности обучения K3 — за это сообщество и высоко оценивает релиз.
| Технология | Роль | Ключевая возможность |
|---|---|---|
| MoonEP | MoE-коммуникация fine-grain сверхмасштаба | Временная репликация перегруженных экспертов; равное число токенов на узел; теоретическая верхняя граница избыточных экспертов |
| FlashKDA | Высокопроизводительный KDA-оператор на CUTLASS | Prefill на H20 быстрее baseline в 1,72–2,22×; прямая замена backend chunk_kda |
| AgentEnv | Sandbox агента на Firecracker microVM | Checkpoint 133 ms, recovery 49 ms, memory overcommit до 6,5× (официальные данные) |
Выбрать путь использования: большинству команд — API (`https://api.moonshot.ai/v1`, model ID `kimi-k3`); self-hosting только при data residency, fine-tuning или hyperscale inference
Прочитать LICENSE построчно: порог MaaS $20M годового дохода и обязанность отображения при MAU 100M / месячном доходе $20M
Проверить целостность Hugging Face: ~1,56 ТБ, формат MXFP4 и список shards
Оценить порог железа: официально supernode 64+ GPU — не планировать на consumer GPU
Подключить FlashKDA: flash-linear-attention может бесшовно переключить backend chunk_kda
Сверить независимые бенчмарки: Vals AI SWE-bench Verified (K3 93,4%) и AA Index (~57, 3-е место в мире) — не только цифры вендора
| Модель | Оценка | Дата |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96,2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93,4% | 2026-07-16 |
| GLM-5.2 (бывший #1 open weight) | — | AA Index 51 |
| Измерение | Kimi K3 | Claude Fable 5 | GLM-5.2 |
|---|---|---|---|
| AA Intelligence Index | ~57 (3-е в мире, #1 open weight) | 60 | 51 |
| Стоимость задачи | ~$0,95 | ~$2,4 | ~$0,47 |
| Контекст | 1M токенов | короче | короче |
| Веса для скачивания | Да (1,56 ТБ) | Нет | Да |
| Позиционирование | Потолок open weight | Closed source топ-класс | Лучшее соотношение цена/качество open weight |
Два коммерческих порога лицензии (в эпоху K2 их не было): ① MaaS с доходом >$20M за 12 месяцев подряд — отдельное соглашение с Moonshot; ② MAU >100M или месячный доход >$20M — заметное отображение «Kimi K3» в UI. Для большинства SMB не критично; при прямой конкуренции с kimi.com — юридическая проверка.
| Тип токена | Цена |
|---|---|
| Вход (cache hit) | $0,30 |
| Вход (cache miss) | $3,00 |
| Выход (с reasoning) | $15,00 |
Релиз Kimi K3 совпал с WAIC 2026 и эскалацией спора США–Китай о «дистилляции моделей»: Вашингтон обвиняет Moonshot в промышленной дистилляции Anthropic Fable и угрожает санкциями; Минкомторг КНР 28 июля ответил критикой «AI-гегемонии». Полная публикация весов, отчёта и трёх Infra — демонстрация технологической независимости через инженерные детали. Через три дня Alibaba анонсировала Qwen3.8-Max-Preview (24T параметров) — китайская гонка foundation models вступила в фазу «клуба 3T».
Если вы планируете интеграцию K3 в длинные Agent-сессии типа Kimi Code или iOS CI, на ноутбуке или нестабильном Linux VPS CLI Agent часто упирается в нехватку памяти, обрывы сессий и отсутствие Xcode/Metal toolchain. Для production с стабильными длинными SSH-сессиями, кэшем DerivedData и автоматизацией iOS CI/CD аренда Mac Mini в облаке NodeMini обычно оптимальнее — выделенный узел, провизионирование за секунды, Agent и сборки на одном реальном Mac. Подробнее: цены аренды Mac Mini.
Строго говоря, нет. Это модель open weight: веса, технический отчёт и часть Infra публичны, но обучающие данные и полный код обучения — нет; не соответствует определению OSI. Moonshot в официальных материалах не использует термин open source.
В большинстве коммерческих сценариев без ограничений. При MaaS с годовым доходом >$20M или MAU >100M / месячным доходом >$20M действуют дополнительные условия. Среда развёртывания: цены аренды Mac Mini.
Официально — supernode-кластер от 64 GPU. Для частных лиц и большинства компаний реалистичнее API или сторонние платформы вроде OpenRouter (сейчас 7 провайдеров).
#1 open weight по совокупным возможностям: AA Index 3-е место в мире после Claude Fable 5 и GPT-5.6 Sol. Дороже GLM-5.2 — максимальный потолок, не лучшее соотношение цена/качество. Другие вопросы: центр помощи.
K3 примерно в 3 раза больше K2.5, добавлены Attention Residuals и Per-Head Muon, значительно выросли контекст и мультимодальность. Лицензия сменилась с Modified MIT на custom с порогом MaaS-дохода.