2026년 7월 27일 밤, Moonshot AI(월지암면)는 Kimi K3 완전 모델 가중치와 기술 보고서를 공개하고 MoonEP, FlashKDA, AgentEnv 3대 핵심 인프라를 동시에 오픈소스화했습니다. 세계 최초로 완전 공개된 3조 파라미터급 모델이며, Hugging Face 가중치는 약 1.56TB로 공개 30분 만에 트렌드 1위를 차지했습니다. 본 글은 오픈웨이트 라이선스, MoE 아키텍처 혁신, 자체 배포 가능성에 관심 있는 개발자를 위해 API 최초 공개부터 11일 만에 가중치 전면 공개까지의 타임라인, KDA/AttnRes/Per-Head Muon 아키텍처 분석, 3대 Infra 오픈소스 역량, SWE-bench와 AA Index 벤치마크 비교, 라이선스 2가지 상업 임계값, API 가격과 64 GPU 자체 배포 현실, 6단계 평가·연동 체크리스트와 FAQ를 다룹니다. 핵심 결론: K3는 오픈웨이트 진영 능력 상한이지만 가성비 최적은 아닙니다. 공식은 한 번도 「오픈소스」라고 부르지 않고 open weight(오픈웨이트) 표현을 일관되게 사용합니다.
개발자가 가장 혼란스러워하는 3가지: 7/16에 이미 API를 쓸 수 있었는데 7/27에는 무엇이 달라졌나? 「오픈소스」와 「오픈웨이트」의 차이는? 자체 배포에 GPU가 몇 장 필요한가? 아래 타임라인으로 정리합니다.
| 날짜 | 사건 |
|---|---|
| 7/16 밤 | Kimi K3가 kimi.com, Kimi Work, Kimi Code, API에서 최초 공개. 가중치는 미공개 |
| 7/17 | 신화사가 「현재 세계 최대 파라미터 오픈소스 모델」로 보도. 업계가 아키텍처 분석 |
| 7/22–23 | 미국이 Moonshot AI의 Anthropic Fable 모델 「산업 규모 증류」를 비난하고 제재 위협 |
| 7/27 23:00 | 완전 가중치·기술 보고서 공개. MoonEP, AgentEnv 오픈소스(FlashKDA는 선행 공개) |
| 7/28 | 중국 상무부가 미중 AI 분쟁에 대응. 국내 언론이 오픈소스 세부사항 보도 |
라이선스 오해 위험: 언론은 「오픈소스」라 쓰지만 공식은 open source를 사용하지 않으며, MaaS 수입과 규모 표시 2가지 임계값이 있는 커스텀 라이선스
자체 배포 환상: 1.56TB 가중치 + 896 전문가 MoE는 소비자급 GPU로 불가능. 맹목적 하드웨어 구매가 최대 숨은 비용
벤치마크 오용: 벤더 자체 보고와 제3자 재검증 차이가 큼. Vals AI, Artificial Analysis 등 독립 데이터를 우선 인용해야 함
캐시 가격 함정: 표기 입력 $3/M이지만 Mooncake 아키텍처에서 코딩 워크로드 캐시 적중률 90% 초과, 실제 비용은 $0.30/M에 가까움
지정학적 컴플라이언스: 미중 「모델 증류」분쟁과 WAIC 2026 시점이 겹침. 가중치 공개가 학습 과정 감사 가능을 의미하지 않음
Agent 실행 환경: 장시간 세션 코딩 Agent는 안정적 연산과 툴체인 필요. 노트북이나 저사양 VPS로는 프로덕션 파이프라인 지원 어려움
| 항목 | 사양 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) |
| 활성 파라미터 | 약 1040억 |
| 아키텍처 | 혼합 전문가(MoE), 896 라우팅 전문가, 토큰당 16개 활성화 |
| 어텐션 | Kimi Delta Attention(KDA) + 게이팅 다중 헤드 잠재 어텐션(Gated MLA) |
| 컨텍스트 | 100만 토큰 |
| 멀티모달 | 네이티브 시각 이해(ViT-V2, 27층) |
| 가중치 형식 | MXFP4 가중치 + MXFP8 활성화(양자화 인식 학습) |
| 가중치 용량 | 약 1.56TB(Hugging Face) |
| 라이선스 | 커스텀 라이선스(공식 표현: open weight, open source 아님) |
기존 Gated DeltaNet은 스칼라 망각 게이트를 사용하지만, KDA는 채널별 게이팅으로 변경합니다. 각 특징 차원이 독립적으로 감쇠하며 chunkwise DPLR 공식으로 선형 시간 재귀를 구현합니다. 소수의 Gated MLA 층과 교대 혼합하여 100만 토큰 컨텍스트를 지원하면서 KV Cache를 극소화합니다.
기존 잔차 연결은 각 층 출력을 균등 누적하여 깊은 층에서 초기 정보가 희석되기 쉽습니다. AttnRes는 입력 의존적 동적 집계로 변경하며, 층마다 RMSNorm과 의사 쿼리 벡터 1개만 추가합니다. 학습 효율 약 25% 향상, 파라미터 오버헤드 2% 미만입니다.
Per-Head Muon은 각 어텐션 헤드가 독립적 수렴 경로를 최적화합니다. MoE 층은 896개 중 16개 선택(희소도 약 1.8%). Quantile Balancing과 MoonEP가 중복 전문가 수의 이론적 상한을 증명하여 대규모 MoE 부하 불균형을 해결합니다.
Moonshot AI는 어텐션, 잔차 연결, 옵티마이저 3대 전통 컴포넌트를 재설계했습니다. 이것이 K3가 「단순 파라미터 적층」과 다른 핵심이며, 2.8T 규모만이 아닙니다.
이번 릴리스는 가중치 공개에 그치지 않고 K3 학습 효율을 뒷받침하는 3가지 핵심 인프라도 함께 오픈소스화했습니다. 개발자 커뮤니티가 높이 평가하는 이유입니다.
| 기술 | 역할 | 핵심 역량 |
|---|---|---|
| MoonEP | 초대규모 세밀 MoE 통신 라이브러리 | 과부하 전문가 임시 복제로 노드당 토큰 수 균등화. 중복 전문가 수 이론적 상한 증명 |
| FlashKDA | CUTLASS 기반 KDA 고성능 연산자 | H20에서 prefill이 베이스라인 대비 1.72–2.22배 빠름. chunk_kda 직접 대체 백엔드 |
| AgentEnv | Firecracker microVM 에이전트 샌드박스 | checkpoint 지연 133ms, 복구 49ms, 메모리 오버커밋 최대 6.5배(공식 데이터) |
이용 경로 확인: 대부분 팀은 API(`https://api.moonshot.ai/v1`, 모델 ID `kimi-k3`) 사용. 데이터 레지던시/파인튜닝/초대규모 추론만 자체 배포 검토
LICENSE 정독: MaaS 연매출 2천만 달러 임계값과 MAU 1억/월매출 2천만 달러 표시 의무 확인
Hugging Face 가중치 무결성 검증: 약 1.56TB, MXFP4 형식과 샤드 목록 확인
하드웨어 요건 평가: 공식 권장 64장 이상 슈퍼노드. 소비자급 GPU로 계획하지 말 것
FlashKDA 연동: 기존 flash-linear-attention 프로젝트에서 chunk_kda 백엔드 원활 전환 가능
독립 벤치마크 대조: Vals AI SWE-bench Verified(K3 93.4%)와 AA Index(약 57, 세계 3위)를 선정 기준으로. 벤더 자체 보고만 보지 말 것
| 모델 | 점수 | 출시일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| GLM-5.2(이전 오픈웨이트 1위) | — | AA Index 51 |
| 차원 | Kimi K3 | Claude Fable 5 | GLM-5.2 |
|---|---|---|---|
| AA Intelligence Index | 약 57(세계 3위, 오픈웨이트 1위) | 60 | 51 |
| 단일 태스크 비용 | 약 $0.95 | 약 $2.4 | 약 $0.47 |
| 컨텍스트 | 100만 토큰 | 짧음 | 짧음 |
| 가중치 다운로드 | 가능(1.56TB) | 불가 | 가능 |
| 포지셔닝 | 오픈웨이트 능력 상한 | 클로즈드소스 종합 최강급 | 오픈웨이트 가성비 최적 |
라이선스 2가지 상업 임계값(K2 시대에는 없었음): ① MaaS 사업 연속 12개월 수입 2천만 달러 초과 시 Moonshot AI와 별도 상업 계약 필요; ② MAU 1억 또는 월매출 2천만 달러 초과 시 UI에 「Kimi K3」표시 의무. 대부분 중소 팀에는 영향 없음. kimi.com과 직접 경쟁하는 모델 서비스 계획 시 법무 검토 필수.
| 토큰 유형 | 가격 |
|---|---|
| 입력(캐시 적중) | $0.30 |
| 입력(캐시 미적중) | $3.00 |
| 출력(추론 과정 포함) | $15.00 |
Kimi K3 오픈웨이트 공개는 WAIC 2026 시점과 겹치며, 격화되는 미중 「모델 증류」분쟁 속에서 이루어졌습니다. 미국은 Moonshot AI가 Anthropic Fable을 산업 규모로 증류해 K3를 학습했다고 비난하고 제재를 위협했습니다. 중국 상무부는 7월 28일 「AI 패권주의」를 비판하며 대응했습니다. 이 맥락에서 가중치, 기술 보고서, 3대 Infra를 전면 공개한 것은 엔지니어링 세부사항으로 기술 경로의 독립성을 입증하려는 태도입니다. 3일 후 알리바바가 24조 파라미터 Qwen3.8-Max-Preview를 발표하며 중국 대규모 모델 경쟁은 「3T 클럽」 단계에 진입했습니다.
Kimi Code형 장시간 세션 Agent나 iOS CI 파이프라인에 K3를 연동할 계획이라면, 노트북이나 불안정한 Linux VPS에서 CLI Agent를 실행할 때 메모리 부족, 세션 중단, Xcode/Metal 툴체인 부재에 직면하기 쉽습니다. 안정적 SSH 장시간 세션, DerivedData 캐시, iOS CI/CD 자동화가 필요한 프로덕션 환경에서는 NodeMini Mac Mini 클라우드 대여가 일반적으로 더 나은 선택입니다. 전용 노드, 초 단위 프로비저닝으로 Agent와 빌드 태스크를 동일한 실제 Mac에서 지속 실행합니다. 자세한 내용은 Mac Mini 대여 가격을 참고하세요.
엄밀히 말하면 아닙니다. 오픈웨이트(open weight) 모델로, 가중치, 기술 보고서, 일부 Infra 도구는 공개되었지만 학습 데이터와 전체 학습 코드는 비공개이며 OSI 「오픈소스」정의에 해당하지 않습니다. Moonshot AI 공식 자료는 open source라는 표현을 사용하지 않습니다.
대부분의 상업 시나리오에서 제한이 없습니다. 다만 MaaS 사업 연매출 2천만 달러 초과, 또는 MAU 1억 초과/월매출 2천만 달러 초과 시 라이선스 특정 조항을 충족해야 합니다. 배포 환경은 Mac Mini 대여 가격을 참고하세요.
공식 권장은 64장 이상 슈퍼노드 클러스터입니다. 개인과 대부분의 기업은 공식 API 또는 OpenRouter 등 서드파티 플랫폼(현재 7개 업체 운영) 호출이 현실적입니다.
오픈웨이트 진영 종합 능력 1위: AA Index 세계 3위로 Claude Fable 5, GPT-5.6 Sol에 이어집니다. 다만 GLM-5.2보다 비용이 높아 「상한은 최고, 가성비 최적은 아님」. 기타 운영 문의는 도움말 센터를 참고하세요.
K3는 K2.5의 약 3배 파라미터이며 Attention Residuals와 Per-Head Muon을 새로 추가했습니다. 컨텍스트와 멀티모달도 대폭 향상. 라이선스는 K2의 Modified MIT에서 커스텀 파일로 변경되어 MaaS 수입 임계값이 추가되었습니다.