Kimi K3 완전 오픈웨이트 공개
2.8T MoE, 100만 컨텍스트, Moonshot AI의 승부수

2026년 7월 27일 밤, Moonshot AI(월지암면)는 Kimi K3 완전 모델 가중치와 기술 보고서를 공개하고 MoonEP, FlashKDA, AgentEnv 3대 핵심 인프라를 동시에 오픈소스화했습니다. 세계 최초로 완전 공개된 3조 파라미터급 모델이며, Hugging Face 가중치는 약 1.56TB로 공개 30분 만에 트렌드 1위를 차지했습니다. 본 글은 오픈웨이트 라이선스, MoE 아키텍처 혁신, 자체 배포 가능성에 관심 있는 개발자를 위해 API 최초 공개부터 11일 만에 가중치 전면 공개까지의 타임라인, KDA/AttnRes/Per-Head Muon 아키텍처 분석, 3대 Infra 오픈소스 역량, SWE-bench와 AA Index 벤치마크 비교, 라이선스 2가지 상업 임계값, API 가격과 64 GPU 자체 배포 현실, 6단계 평가·연동 체크리스트FAQ를 다룹니다. 핵심 결론: K3는 오픈웨이트 진영 능력 상한이지만 가성비 최적은 아닙니다. 공식은 한 번도 「오픈소스」라고 부르지 않고 open weight(오픈웨이트) 표현을 일관되게 사용합니다.

01

API 최초 공개부터 전면 오픈까지 11일: Kimi K3 배경과 개발자의 고민

개발자가 가장 혼란스러워하는 3가지: 7/16에 이미 API를 쓸 수 있었는데 7/27에는 무엇이 달라졌나? 「오픈소스」와 「오픈웨이트」의 차이는? 자체 배포에 GPU가 몇 장 필요한가? 아래 타임라인으로 정리합니다.

날짜사건
7/16 밤Kimi K3가 kimi.com, Kimi Work, Kimi Code, API에서 최초 공개. 가중치는 미공개
7/17신화사가 「현재 세계 최대 파라미터 오픈소스 모델」로 보도. 업계가 아키텍처 분석
7/22–23미국이 Moonshot AI의 Anthropic Fable 모델 「산업 규모 증류」를 비난하고 제재 위협
7/27 23:00완전 가중치·기술 보고서 공개. MoonEP, AgentEnv 오픈소스(FlashKDA는 선행 공개)
7/28중국 상무부가 미중 AI 분쟁에 대응. 국내 언론이 오픈소스 세부사항 보도

기업이 주목해야 할 6가지 숨은 비용

  1. 01

    라이선스 오해 위험: 언론은 「오픈소스」라 쓰지만 공식은 open source를 사용하지 않으며, MaaS 수입과 규모 표시 2가지 임계값이 있는 커스텀 라이선스

  2. 02

    자체 배포 환상: 1.56TB 가중치 + 896 전문가 MoE는 소비자급 GPU로 불가능. 맹목적 하드웨어 구매가 최대 숨은 비용

  3. 03

    벤치마크 오용: 벤더 자체 보고와 제3자 재검증 차이가 큼. Vals AI, Artificial Analysis 등 독립 데이터를 우선 인용해야 함

  4. 04

    캐시 가격 함정: 표기 입력 $3/M이지만 Mooncake 아키텍처에서 코딩 워크로드 캐시 적중률 90% 초과, 실제 비용은 $0.30/M에 가까움

  5. 05

    지정학적 컴플라이언스: 미중 「모델 증류」분쟁과 WAIC 2026 시점이 겹침. 가중치 공개가 학습 과정 감사 가능을 의미하지 않음

  6. 06

    Agent 실행 환경: 장시간 세션 코딩 Agent는 안정적 연산과 툴체인 필요. 노트북이나 저사양 VPS로는 프로덕션 파이프라인 지원 어려움

02

Kimi K3 핵심 사양과 아키텍처 혁신: KDA, AttnRes, Stable LatentMoE

항목사양
총 파라미터2.8조(2.8T)
활성 파라미터약 1040억
아키텍처혼합 전문가(MoE), 896 라우팅 전문가, 토큰당 16개 활성화
어텐션Kimi Delta Attention(KDA) + 게이팅 다중 헤드 잠재 어텐션(Gated MLA)
컨텍스트100만 토큰
멀티모달네이티브 시각 이해(ViT-V2, 27층)
가중치 형식MXFP4 가중치 + MXFP8 활성화(양자화 인식 학습)
가중치 용량약 1.56TB(Hugging Face)
라이선스커스텀 라이선스(공식 표현: open weight, open source 아님)

Kimi Delta Attention(KDA): 채널별 정밀 망각

기존 Gated DeltaNet은 스칼라 망각 게이트를 사용하지만, KDA는 채널별 게이팅으로 변경합니다. 각 특징 차원이 독립적으로 감쇠하며 chunkwise DPLR 공식으로 선형 시간 재귀를 구현합니다. 소수의 Gated MLA 층과 교대 혼합하여 100만 토큰 컨텍스트를 지원하면서 KV Cache를 극소화합니다.

Attention Residuals(AttnRes): 선택적 잔차 집계

기존 잔차 연결은 각 층 출력을 균등 누적하여 깊은 층에서 초기 정보가 희석되기 쉽습니다. AttnRes는 입력 의존적 동적 집계로 변경하며, 층마다 RMSNorm과 의사 쿼리 벡터 1개만 추가합니다. 학습 효율 약 25% 향상, 파라미터 오버헤드 2% 미만입니다.

Per-Head Muon과 Stable LatentMoE

Per-Head Muon은 각 어텐션 헤드가 독립적 수렴 경로를 최적화합니다. MoE 층은 896개 중 16개 선택(희소도 약 1.8%). Quantile Balancing과 MoonEP가 중복 전문가 수의 이론적 상한을 증명하여 대규모 MoE 부하 불균형을 해결합니다.

Moonshot AI는 어텐션, 잔차 연결, 옵티마이저 3대 전통 컴포넌트를 재설계했습니다. 이것이 K3가 「단순 파라미터 적층」과 다른 핵심이며, 2.8T 규모만이 아닙니다.

03

MoonEP, FlashKDA, AgentEnv: 3대 Infra 오픈소스와 6단계 연동 가이드

이번 릴리스는 가중치 공개에 그치지 않고 K3 학습 효율을 뒷받침하는 3가지 핵심 인프라도 함께 오픈소스화했습니다. 개발자 커뮤니티가 높이 평가하는 이유입니다.

기술역할핵심 역량
MoonEP초대규모 세밀 MoE 통신 라이브러리과부하 전문가 임시 복제로 노드당 토큰 수 균등화. 중복 전문가 수 이론적 상한 증명
FlashKDACUTLASS 기반 KDA 고성능 연산자H20에서 prefill이 베이스라인 대비 1.72–2.22배 빠름. chunk_kda 직접 대체 백엔드
AgentEnvFirecracker microVM 에이전트 샌드박스checkpoint 지연 133ms, 복구 49ms, 메모리 오버커밋 최대 6.5배(공식 데이터)

6단계 평가·연동 실무 체크리스트

  1. 01

    이용 경로 확인: 대부분 팀은 API(`https://api.moonshot.ai/v1`, 모델 ID `kimi-k3`) 사용. 데이터 레지던시/파인튜닝/초대규모 추론만 자체 배포 검토

  2. 02

    LICENSE 정독: MaaS 연매출 2천만 달러 임계값과 MAU 1억/월매출 2천만 달러 표시 의무 확인

  3. 03

    Hugging Face 가중치 무결성 검증: 약 1.56TB, MXFP4 형식과 샤드 목록 확인

  4. 04

    하드웨어 요건 평가: 공식 권장 64장 이상 슈퍼노드. 소비자급 GPU로 계획하지 말 것

  5. 05

    FlashKDA 연동: 기존 flash-linear-attention 프로젝트에서 chunk_kda 백엔드 원활 전환 가능

  6. 06

    독립 벤치마크 대조: Vals AI SWE-bench Verified(K3 93.4%)와 AA Index(약 57, 세계 3위)를 선정 기준으로. 벤더 자체 보고만 보지 말 것

python
from openai import OpenAI
client = OpenAI(
    api_key="YOUR_MOONSHOT_KEY",
    base_url="https://api.moonshot.ai/v1"
)
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(resp.choices[0].message.content)
04

벤치마크 비교와 라이선스 임계값: K3 vs GPT-5.6, Claude, GLM-5.2 선택법

SWE-bench Verified(Vals AI 독립 재검증, 2026년 7월)

모델점수출시일
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
GLM-5.2(이전 오픈웨이트 1위)AA Index 51

비용·능력 의사결정 매트릭스

차원Kimi K3Claude Fable 5GLM-5.2
AA Intelligence Index약 57(세계 3위, 오픈웨이트 1위)6051
단일 태스크 비용약 $0.95약 $2.4약 $0.47
컨텍스트100만 토큰짧음짧음
가중치 다운로드가능(1.56TB)불가가능
포지셔닝오픈웨이트 능력 상한클로즈드소스 종합 최강급오픈웨이트 가성비 최적
warning

라이선스 2가지 상업 임계값(K2 시대에는 없었음): ① MaaS 사업 연속 12개월 수입 2천만 달러 초과 시 Moonshot AI와 별도 상업 계약 필요; ② MAU 1억 또는 월매출 2천만 달러 초과 시 UI에 「Kimi K3」표시 의무. 대부분 중소 팀에는 영향 없음. kimi.com과 직접 경쟁하는 모델 서비스 계획 시 법무 검토 필수.

API 가격(100만 토큰당)

토큰 유형가격
입력(캐시 적중)$0.30
입력(캐시 미적중)$3.00
출력(추론 과정 포함)$15.00
05

미중 AI 경쟁 맥락과 인용 가능 데이터: K3 오픈웨이트가 보내는 신호

Kimi K3 오픈웨이트 공개는 WAIC 2026 시점과 겹치며, 격화되는 미중 「모델 증류」분쟁 속에서 이루어졌습니다. 미국은 Moonshot AI가 Anthropic Fable을 산업 규모로 증류해 K3를 학습했다고 비난하고 제재를 위협했습니다. 중국 상무부는 7월 28일 「AI 패권주의」를 비판하며 대응했습니다. 이 맥락에서 가중치, 기술 보고서, 3대 Infra를 전면 공개한 것은 엔지니어링 세부사항으로 기술 경로의 독립성을 입증하려는 태도입니다. 3일 후 알리바바가 24조 파라미터 Qwen3.8-Max-Preview를 발표하며 중국 대규모 모델 경쟁은 「3T 클럽」 단계에 진입했습니다.

인용 가능 핵심 데이터

  • 규모: 2.8T 총 파라미터, 896 전문가 중 16개 활성화, 활성 약 1040억, 1M 토큰 컨텍스트
  • 벤치마크: SWE-bench Verified 93.4%(Vals AI). AA Index 약 57, 세계 3위·오픈웨이트 1위
  • 비용: 단일 태스크 약 $0.95. Fable 5보다 약 60% 저렴하나 GLM-5.2($0.47)보다 비쌈
  • 코딩: Frontend Code Arena 1위. Mooncake 캐시 적중률 코딩 워크로드 90% 초과
  • 자체 배포: 1.56TB 가중치, 공식 권장 64+ GPU 슈퍼노드. OpenRouter 등 7개 서드파티 호스팅
  • 라이선스: 커스텀 open weight 라이선스, OSI 오픈소스 아님. MaaS 수입·규모 표시 2가지 임계값 포함

Kimi Code형 장시간 세션 Agent나 iOS CI 파이프라인에 K3를 연동할 계획이라면, 노트북이나 불안정한 Linux VPS에서 CLI Agent를 실행할 때 메모리 부족, 세션 중단, Xcode/Metal 툴체인 부재에 직면하기 쉽습니다. 안정적 SSH 장시간 세션, DerivedData 캐시, iOS CI/CD 자동화가 필요한 프로덕션 환경에서는 NodeMini Mac Mini 클라우드 대여가 일반적으로 더 나은 선택입니다. 전용 노드, 초 단위 프로비저닝으로 Agent와 빌드 태스크를 동일한 실제 Mac에서 지속 실행합니다. 자세한 내용은 Mac Mini 대여 가격을 참고하세요.

FAQ

자주 묻는 질문

엄밀히 말하면 아닙니다. 오픈웨이트(open weight) 모델로, 가중치, 기술 보고서, 일부 Infra 도구는 공개되었지만 학습 데이터와 전체 학습 코드는 비공개이며 OSI 「오픈소스」정의에 해당하지 않습니다. Moonshot AI 공식 자료는 open source라는 표현을 사용하지 않습니다.

대부분의 상업 시나리오에서 제한이 없습니다. 다만 MaaS 사업 연매출 2천만 달러 초과, 또는 MAU 1억 초과/월매출 2천만 달러 초과 시 라이선스 특정 조항을 충족해야 합니다. 배포 환경은 Mac Mini 대여 가격을 참고하세요.

공식 권장은 64장 이상 슈퍼노드 클러스터입니다. 개인과 대부분의 기업은 공식 API 또는 OpenRouter 등 서드파티 플랫폼(현재 7개 업체 운영) 호출이 현실적입니다.

오픈웨이트 진영 종합 능력 1위: AA Index 세계 3위로 Claude Fable 5, GPT-5.6 Sol에 이어집니다. 다만 GLM-5.2보다 비용이 높아 「상한은 최고, 가성비 최적은 아님」. 기타 운영 문의는 도움말 센터를 참고하세요.

K3는 K2.5의 약 3배 파라미터이며 Attention Residuals와 Per-Head Muon을 새로 추가했습니다. 컨텍스트와 멀티모달도 대폭 향상. 라이선스는 K2의 Modified MIT에서 커스텀 파일로 변경되어 MaaS 수입 임계값이 추가되었습니다.