2026년 7월 27일 완전 가중치 공개까지 5일 남았습니다. Moonshot AI(月之暗面)는 Hugging Face에서 Modified MIT 라이선스의 2.8조 파라미터 Kimi K3 가중치를 공개합니다——세계 최초 3T급 오픈 가중치 모델입니다. 본 글은 K3 가중치 다운로드, 로컬 배포 가능성, 폐쇄형 모델 프리미엄에 관심 있는 개발자를 위해 7/16 API 출시 vs 7/27 가중치 공개 2단계 타임라인, 모델 사양과 벤치마크 비교, API 가격과 캐시 실제 비용, open weights와 open source 구분, 1.4TB 자체 배포 현실, 공개일 6단계 체크리스트, 업계 의미, FAQ를 다룹니다. 핵심 결론: K3는 「Fable 5 킬러」가 아닙니다——종합 지능은 3위이지만, 약 1/3 비용으로 최전선에 근접한 능력을 제공하며, 폐쇄형 모델이 줄 수 없는 두 가지——오픈 가중치 + 100만 토큰 컨텍스트——를 갖추고 있습니다.
현재 가장 큰 검색 혼란은 「K3는 이미 쓸 수 있는데 7월 27일에 무엇이 공개되나?」입니다——답은 7월 16일에 출시된 것은 API와 Kimi 제품군이며, 7월 27일에 공개되는 것은 다운로드 가능한 완전 모델 가중치와 기술 보고서입니다.
| 날짜 | 이벤트 |
|---|---|
| 2026-07-16 | Kimi K3가 API, Kimi App, Kimi Work, Kimi Code로 출시; Artificial Analysis가 동일일 독립 평가 발표 |
| 2026-07-17 | 상하이 세계 AI 대회(WAIC) 개막; 신화통신이 K3 공개를 「국가적 이정표」로 규정 |
| 2026-07-27 | 완전 가중치 공개 다운로드(Hugging Face, Modified MIT 라이선스) + 기술 보고서(아키텍처, 학습, 평가 상세) |
| 항목 | 데이터 |
|---|---|
| 총 파라미터 | 2.8조(2.8T), 역대 최대 오픈 가중치 모델 |
| 아키텍처 | 희소 MoE: Stable LatentMoE, 896 전문가 중 토큰당 16개 활성화 |
| 어텐션 | Kimi Delta Attention(KDA) + Attention Residuals(AttnRes) + Gated MLA |
| 컨텍스트 | 1,048,576 토큰(약 100만) |
| 모달리티 | 네이티브 시각 이해(텍스트 + 이미지, 제품 측 동영상 지원), 출력은 텍스트 |
| 가중치 형식 | MXFP4 가중치 + MXFP8 활성화(4-bit 양자화로 학습 정밀도에 근접) |
| 스케일 효율 | K2 대비 약 2.5배 향상(동일 연산으로 더 많은 지능) |
| 학습 안정성 | Quantile Balancing, Per-Head Muon 옵티마이저, SiTU 활성화 함수 |
| 장컨텍스트 디코딩 | KDA로 100만 토큰 컨텍스트에서 최대 6.3배 디코딩 가속 |
K3는 「Fable 5 킬러」가 아닙니다——종합 지능은 여전히 3위이지만, 약 1/3 비용으로 「최전선에 근접한」 능력을 제공하며, 폐쇄형 모델이 줄 수 없는 두 가지를 갖추고 있습니다: 오픈 가중치 + 100만 토큰 컨텍스트.
데이터 레지던시: 엄격한 컴플라이언스 환경에서는 API 호출이 아닌 가중치 온프레미스 배치가 필요합니다
파인튜닝: 자사 데이터로 지속 학습하려면 완전 가중치가 필수입니다
초대규모 호출: 추론량이 극단적으로 클 때 자체 인프라가 더 경제적일 수 있습니다
생태계 정렬:vLLM의 KDA / prefix caching 지원은 가중치 공개와 연동됩니다
양자화 후속:Ollama, GGUF 버전은 K2 시리즈처럼 순차 등장이 예상됩니다
라이선스 확인:Modified MIT 원문은 공개일에 확인해야 하며, 조항을 사전에 가정하면 안 됩니다
Artificial Analysis Intelligence Index(7월 16일 독립 평가) 종합 순위는 다음과 같습니다.
| 모델 | AA Intelligence Index | 순위 |
|---|---|---|
| Claude Fable 5 | 59.9 | 1위 |
| GPT-5.6 Sol | 58.9 | 2위 |
| Kimi K3 | 57.1 | 3위 / 189 |
공식의 솔직한 태도(인용 가치 있음): Moonshot AI는 드물게 종합 성능이 Fable 5와 GPT-5.6 Sol에 뒤처진다고 스스로 인정하며, harness에서 반환되는 추론 내용에 과민, 의도가 모호할 때 과도한 능동성 등 알려진 약점을 나열했습니다. 각 모델은 서로 다른 추론 harness를 사용하며, 독립적 제3자 재현 검증은 진행 중입니다.
| 항목 | 가격(100만 토큰당) |
|---|---|
| 입력(캐시 미스) | $3.00 |
| 입력(캐시 히트, 자동 캐시) | $0.30 |
| 출력 | $15.00 |
K3 가격은 의도적으로 서구 표준에 맞춰져 있습니다(「저가 중심」이 아닌 「품질 중심」). 중국 대모델 벤더 중 최고 수준의 API 가격이지만, Claude Opus 4.8 단일 작업 비용보다는 여전히 크게 낮습니다. Artificial Analysis 실측 단일 작업 비용 $0.94: GPT-5.6 Sol보다 9.4% 낮고, Claude Fable 5보다 65.8% 낮습니다. 코딩 워크로드에서 캐시 히트율이 90% 초과라고 하며, 실제 비용은 표면 단가를 크게 하회합니다.
| 방식 | 대상 | 7/27 이전 | 7/27 이후 |
|---|---|---|---|
| API($3/$15) | 대다수 개발자와 기업 | 이용 가능 | 계속 권장 |
| 자체 배포(64+ 가속기) | 데이터 레지던시 / 파인튜닝 / 초대규모 호출 | 가중치 미공개 | 3가지 시나리오만 성립 |
| 소비자용 로컬 GPU | 개인 실험 | 불가 | 불가(4-bit 약 1.4TB) |
영어권에서는 open weights(가중치만 공개)와 open source(학습 코드/데이터 포함)를 엄격히 구분합니다. Kimi K3는 전자에 해당합니다——7월 27일 공개되는 것은 완전한 모델 가중치(Modified MIT 라이선스, 구체 조항은 공개일 확인)이며, 학습 코드와 데이터셋의 풀스택 오픈소스가 아닙니다.
자체 배포 현실(「로컬에서 대형 모델」 유형의 낚시 제목에 속지 마세요):4-bit 가중치는 약 1.4TB, 공식 권장은 64+ 가속기 「슈퍼노드」 배포이며, 전문가 병렬 + 텐서 병렬 분산 추론이 필요합니다. 참고: 이전 세대 1T 파라미터 K2.7 Code도 INT4에서 약 577GB VRAM 필요; K3는 그 2.8배입니다. 대다수에게 정답은 API($3/$15)입니다.
HF 저장소 파일 완전성:Moonshot Hugging Face 조직의 완전 파일 목록 확인
LICENSE 원문:Modified MIT 구체 조항을 조항별 확인, 상업·재배포 제한 파악
양자화 버전:MXFP4/NVFP4 등 공식 또는 커뮤니티 양자화 패키지 주시
vLLM / SGLang 실행 명령:KDA와 prefix caching 공식 예제 확인
최소 실행 가능 하드웨어:기술 보고서의 분산 추론 요건과 대조, 소비자용 GPU로 계획하지 않기
독립 장컨텍스트 재검증:커뮤니티 초기 독립 벤치마크와 r/LocalLLaMA 재현 논의 주시
오픈과 폐쇄의 능력 격차가 최전선에서 거의 닫혔습니다:격차가 「수백 점」에서 「2~3점」으로 축소되어, 폐쇄형 벤더는 능력만으로 프리미엄을 정당화하기 어려워졌습니다
지정학적 배경:공개는 WAIC 직전에 맞춰짐; 한 달 전 미 정부가 Anthropic Fable/Mythos 모델을 일시적으로 제거(7월 1일 복구)——「규제는 폐쇄형 모델을 막을 수 있지만, 공개된 오픈 가중치는 막을 수 없다」가 새 논거가 되었습니다
중국 벤더 집단적 접근:Z.ai GLM-5.2(코딩 Opus 4.8 수준, 가격 1/5), DeepSeek V4 Pro(1.6T), MiniMax 등, K3는 이 파도의 정점입니다
Moonshot AI의 반격:2025년 초 DeepSeek R1 충격으로 국내 7위로 후퇴 후, K2(2025-07) → K2.5(2026-01) → K3 오픈경로로 지위를 재구축했습니다
출처:공식 kimi.com 기술 블로그, platform.kimi.ai; 독립 평가 Artificial Analysis(7월 16일); 심층 보도 VentureBeat, Northflank; 커뮤니티 r/LocalLLaMA, Hacker News. 아키텍처 상세는 당사 Kimi K3 심층 리뷰도 참고하세요.
7/27 이후 K3를 Kimi Code류 장기 세션 Agent나 iOS CI 파이프라인에 연동할 계획이라면, 노트북이나 불안정한 Linux VPS에서 CLI Agent를 실행할 때 메모리 부족, 세션 중단, Xcode/Metal 툴체인 부재 문제가 자주 발생합니다. 안정적 SSH 장기 세션, DerivedData 캐시, iOS CI/CD 자동화가 필요한 프로덕션 환경에서는 NodeMini Mac Mini 클라우드 대여가 일반적으로 더 나은 선택입니다——전용 노드와 초 단위 프로비저닝으로 Agent와 빌드 작업이 동일한 실제 Mac에서 지속 실행됩니다. 자세한 내용은 Mac Mini 대여 가격을 참고하세요.
완전 2.8T 가중치는 2026년 7월 27일 Moonshot Hugging Face 조직에 공개되며, 기술 보고서도 동시에 발행됩니다. API와 Kimi 제품군은 7월 16일에 이미 출시되었습니다.
정확히는 open weights(오픈 가중치)이며 fully open source가 아닙니다. 종합 지능은 K3가 우위(2.8T vs DeepSeek V4 Pro 1.6T, 1M vs 128K 컨텍스트)이지만, DeepSeek 출력은 $3.48/M만으로 비용이 크게 낮습니다. 비용 민감하면 DeepSeek, 장코드/문서 이해는 K3를 선택하세요.
kimi.com 무료 계정으로 K3를 이용할 수 있습니다. API는 $3/$15 per 1M tokens, 캐시 히트 $0.30/M입니다. 안정적인 Agent 실행 환경이 필요하면 Mac Mini 대여 가격을 참고하세요.
4-bit 가중치는 약 1.4TB, 공식 권장은 64+ 가속기 슈퍼노드이며 소비자용 GPU로는 실행 불가합니다. 자체 배포는 데이터 레지던시, 파인튜닝, 초대규모 호출 3가지 시나리오만 성립합니다. 그 외에는 API를 이용하세요.
종합 지능은 K3가 3위(57.1), Fable 5(59.9)와 GPT-5.6 Sol(58.9)에 뒤집니다. K3는 Frontend Code Arena, SWE Marathon, BrowseComp 등 코딩 벤치마크에서 앞서지만, 장기 추론과 환각 제어는 최상위 폐쇄형 모델에 뒤집니다. 운영 관련 자세한 내용은 헬프 센터를 참고하세요.
Modified MIT 라이선스입니다. 구체적 조항은 7월 27일 공개일에 원문을 확인하세요. 공개일에는 LICENSE 파일을 조항별로 확인하는 것이 중요합니다.