닷새 사이에 중국 주요 AI 랩 3곳이 겉보기에는 모순된 수를 뒀습니다. DeepSeek는 일부 구간에서 API를 최대 1100% 올렸습니다. 알리바바는 한 번도 공개하지 않았던 2.4조 파라미터 플래그십을 오픈웨이트로 풀었습니다. 지푸는 GLM-5.3을 내놓아, 같은 기반 모델로 재학습 없이 코딩 벤치마크를 약 6배로 끌어올렸습니다. 이 글은 개발자와 구매 담당자에게 타임라인, 요금표, 세 가지 전략, 직접 비교, 쟁점, 자주 묻는 질문을 순서대로 정리합니다. 공통 신호는 분명합니다. 중국 랩은 가격만의 경쟁에서 가격 결정력 경쟁으로 옮기고 있습니다.
가장 흔한 실수는 「1100%」를 청구서 전체로 읽는 것입니다. 날짜를 먼저 잡고, 과금 차원·라이선스 유형·벤치마크 출처를 분리해 읽으십시오.
| 날짜 | 사건 |
|---|---|
| 2026년 7월 16일 | Moonshot AI가 Kimi K3(2.8T 파라미터)를 오픈웨이트 공개, 미국 안보 당국의 주목을 받음 |
| 2026년 8월 2–3일 | 알리바바가 Qwen3.8-Max를 프리뷰한 뒤 호스티드 API로 정식 출시 |
| 2026년 8월 10일 | Meta가 Muse Glimmer(30B, Apache 2.0)를 공개하고 플래그십 Muse Spark 1.2 오픈웨이트를 예고 |
| 2026년 8월 12일 | 알리바바가 Qwen3.8-2.4T-A95B 오픈웨이트를 Hugging Face / ModelScope에 공개. xAI가 Grok 4.6 출시 |
| 2026년 8월 13일 | DeepSeek-V4-Pro GA 및 8월 17일 발효 인상 발표. Google이 할인 Gemini 3.7 Flash 출시 |
| 2026년 8월 14일 | 지푸가 GLM-5.2의 743B 베이스를 재사용한 GLM-5.3 출시 |
| 2026년 8월 17일 00:00 베이징 시간 | DeepSeek 신규 요금 발효 |
시야를 넓히면, 7월 30일 OpenAI는 최저가 구간(GPT-5.6 Luna, 80% 인하)을 깎았고, 8월 6–7일에는 Luna를 무료 기본값으로 두고 텍스트 채팅을 무제한으로 열었습니다. 중국 랩이 인상하고 플래그십 웨이트를 여는 같은 시점에, 미국 랩은 가격을 내리고 소비자 층을 무료로 밀었습니다. 같은 가격 전쟁의 양면입니다.
1100%를 청구서 전체로 본다. 그 숫자는 피크 시간 캐시 히트 입력이며, 원래 거의 공짜에 가깝던 구간입니다.
베이징 피크 창을 무시한다. 피크는 베이징 시간 9시–12시, 14시–18시입니다. 발표는 부하를 옮기라고 요구합니다.
모든 오픈 체크포인트를 Apache 2.0이라 부른다. Qwen3.8-Max는 맞춤 라이선스입니다. Muse Glimmer는 다른 베팅입니다.
지역 금지 소문을 반복한다. 공개 라이선스에 미국 / EU / 영국 / 한국 영토 조항은 없습니다.
GLM-5.3을 새 기반 모델로 읽는다. 베이스는 5.2와 같은 743B입니다. 도약은 후학습 RL 규모입니다.
중국 모델이 여전히 최저가라고 가정한다. 오프피크 DeepSeek는 여전히 Claude Opus 5를 밑돕니다. Luna와 Qwen 국제 요금은 이제 DeepSeek를 밑돕니다.
아래 요금은 DeepSeek 공식 발표를 기준으로 Wall Street CN, IT Home, V2EX와 대조했습니다. GLM 점수는 지푸 자체 보고입니다. 제3자 독립 재측정은 이 글을 쓰는 시점에 공개되지 않았습니다.
발효는 2026년 8월 17일 00:00 베이징 시간. 피크는 베이징 시간 9시–12시, 14시–18시. 단위는 100만 토큰당입니다.
| 과금 항목 | 기존 요금 | 신규 오프피크 | 신규 피크 | 피크 인상 |
|---|---|---|---|---|
| V4-Flash 캐시 히트(입력) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash 캐시 미스(입력) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash 출력 | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro 캐시 히트(입력) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro 캐시 미스(입력) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro 출력 | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
맥락: 헤드라인 1100%는 피크 시간 캐시 히트 입력에만 해당합니다. 실제 청구의 대부분을 차지하는 출력 요금은 350% 올랐습니다. 독립 비용 모형에서는 현실적인 고사용 부하(약 84M 토큰/월, 대부분 오프피크, 히트율 절반)의 청구 증가가 1.8x 전후입니다.
| 사양 | 내용 |
|---|---|
| 파라미터 | 총 2.4T, 토큰당 활성 95B(MoE, 512 전문가, 라우팅 10+공유 1) |
| 컨텍스트 창 | 네이티브 262,144 토큰(오픈 체크포인트), 약 1.01M까지 확장 가능. 호스티드 Max 기본값은 1M |
| 공개 흐름 | 8월 2일 프리뷰 → 8월 3일 API 공개 → 8월 12일 오픈웨이트 |
| API 요금(국제) | 입력 $2/M, 출력 $6/M |
| 라이선스 | Apache 2.0 아님 — 맞춤 Qwen3.8-Max License |
| 의미 | 알리바바가 Max급 플래그십을 오픈웨이트로 푼 것은 처음. Qwen3.5 / 3.6 / 3.7 Max는 API 전용이었음 |
| 벤치마크 | GLM-5.2 | GLM-5.3 | 변화 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
주의: 지푸 자체 보고 수치입니다. GLM-5.3은 Terminal-Bench 3.0에서 GPT-5.6 Sol(34.6%)과 Claude Fable 5(33.7%)에 아직 못 미칩니다. 오픈웨이트 상위 결과이지, 프런티어 단독 승리는 아닙니다.
랩 셋. 수 셋. 밑바닥 질문은 하나입니다. 사용량이 GPU를 앞서고 사전학습 수확이 평평해질 때, 가격 결정력을 쥐는 쪽은 누구인가.
가장 쉬운 오독은 「중국 최저가 모델이 결국 마진 압력에 굴복했다」입니다. 요금표 구조는 반대로 읽힙니다. 연산 제약을 가격에 드러낸 회사입니다. 항상 싼 정액은 GPU 용량이 수요를 따라잡는 동안 고객 획득 도구로 작동했습니다. 사용이 지수적으로 늘고 용량이 못 따라가면, 무언가를 명시해야 합니다. 「더 유연한 워크로드 스케줄링을 장려한다」는 기업 용어로 「피크 시간 연산이 이제 희소하니, 부하는 직접 옮기십시오」입니다.
해외 보도가 거의 놓친 지점이 있습니다. 피크 시간에는 DeepSeek 공식 API 단가가 여러 제3자 재판매(GMI Cloud, Novita 등. 현재 V4 Pro를 DeepSeek 신규 피크보다 낮게 게시)보다 높습니다. 공식 API가 DeepSeek를 돌리는 가장 싼 경로라는 전제는 처음으로 깨졌습니다.
알리바바는 동시에 두 가지를 했습니다. 2.4T 파라미터 체크포인트 전체를 무료 다운로드로 공개하고, 소형 Qwen에 쓰던 관대한 Apache 2.0이 아니라 맞춤 라이선스를 붙였습니다. 연속 12개월 매출이 $50M을 넘는 Model-as-a-Service 또는 AI Work Assistant 사업은 별도 상용 라이선스를 협상해야 합니다. 월간 활성 사용자 100M 이상 또는 월 매출 $20M 이상 제품은 모델명을 눈에 띄게 표시해야 합니다.
웨이트를 풀어 개발자 마인드셰어, 특히 해외 마인드셰어를 가져갑니다. 그 위에 경쟁 추론 사업을 세울 수 있는 소수 기업에는 가격 협상력을 남깁니다. 제한 없는 Apache 2.0으로 나가는 Meta Muse Glimmer와는 질적으로 다른 베팅입니다.
죽일 소문: 알리바바 라이선스가 미국, EU, 영국, 한국의 다운로드를 금지한다는 주장은 거짓입니다. 공개 라이선스 본문에 지리적·영토 조항은 없습니다. 발표 스레드가 아니라 LICENSE 파일을 확인하십시오.
가장 흥미로운 사실은 방법입니다. GLM-5.2와 같은 743B 파라미터 베이스, 재학습 없음, 후학습에서 강화학습 환경을 키운 것만으로 Terminal-Bench 3.0이 약 6배(4.6% → 28.3%)입니다. 사전학습 스케일링 법칙이 수확 체감을 보이는 지금, 후학습 RL 규모는 새 기반 모델을 다시 학습하는 것보다 훨씬 낮은 비용 바닥으로 작동하는 독립 성능 레버가 되고 있습니다. OpenAI급 연산 예산이 없는 중위 랩도 에이전트·코딩 벤치마크에서는 격차를 좁힐 수 있습니다.
중국 AI 랩은 가격만의 경쟁에서 가격 결정력 자체의 경쟁으로 옮기고 있습니다.
위안–달러 환산은 약 ¥7.15/$1입니다. 공식 발표와 어긋나면 공식을 우선합니다.
| 모델 | 입력(100만 토큰당) | 출력(100만 토큰당) | 오픈웨이트? |
|---|---|---|---|
| DeepSeek V4-Pro(피크) | ¥9.0(약 $1.26) | ¥27.0(약 $3.78) | 아니오 |
| DeepSeek V4-Pro(오프피크) | ¥4.5(약 $0.63) | ¥13.5(약 $1.89) | 아니오 |
| Qwen3.8-Max(국제 API) | $2.00 | $6.00 | 예(맞춤 라이선스) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | 아니오 |
| Claude Opus 5(알리바바 비교 비율의 시사값) | 약 $5.00 | 약 $25.00 | 아니오 |
짧은 답은 아닙니다. DeepSeek V4-Pro 오프피크는 여전히 Claude Opus 5를 크게 밑돌지만, 단독 최저가는 아닙니다. Qwen3.8-Max 국제 요금과 OpenAI Luna가 DeepSeek 오프피크를 밑돕니다. 「중국 모델 = 최저가 모델」은 2025년 대부분과 2026년 초까지는 맞았습니다. 이제는 안전한 가정이 아닙니다.
청구서를 세 열로 나눕니다. 캐시 히트 입력, 캐시 미스 입력, 출력. 1100% 헤드라인 하나로 예산을 잡지 마십시오.
작업을 베이징 피크에 대응시킵니다. 9시–12시, 14시–18시(베이징)는 피크 과금입니다. 가능한 배치는 나머지 17시간으로 돌리십시오.
캐시 히트율을 측정합니다. 모형화한 고부하(약 84M 토큰/월, 대부분 오프피크, 히트 절반)는 12배가 아니라 1.8x 전후입니다.
공식 피크와 재판매를 비교합니다. GMI Cloud와 Novita는 현재 V4 Pro를 DeepSeek 신규 피크보다 낮게 게시합니다. 공식이 자동으로 최저가가 아닙니다.
상용 전에 LICENSE 파일을 읽습니다. Qwen 발동 조건은 MaaS / AI Work Assistant 매출 $50M, 출처 표기용 100M MAU 또는 월 매출 $20M입니다. 지역 금지는 없습니다.
GLM-5.3을 후학습 레버로 받아들입니다. 공식 Terminal-Bench 3.0은 28.3% 대 4.6%. Sol 34.6%, Fable 5 33.7%에는 못 미칩니다. 그 기준으로 검증하십시오.
# DeepSeek V4-Pro 출력(100만 토큰당, 공식 요금표) 기존 정액: ¥6.0 신규 오프피크: ¥13.5 (기존 대비 +125%; 피크의 절반) 신규 피크: ¥27.0 (기존 대비 +350%) # 헤드라인 인용 전 세 질문 1) 캐시 히트 입력, 캐시 미스 입력, 출력 중 무엇인가? 2) 피크인가 오프피크인가? 3) 실제 캐시 히트율은 얼마인가?
대략 지난 한 달, 중국 주요 랩은 국내 금융 매체가 「一周三更」(주 3회 모델 갱신)이라 부르기 시작한 속도로 대형 릴리스를 쏟았습니다. DeepSeek, 알리바바, 지푸에 더해 Moonshot Kimi K3(7월 16일 오픈웨이트, 2.8T 파라미터)와 MiniMax H3입니다. 중국 보도는 대체로 중국 오픈웨이트 공개가 글로벌 AI 산업의 재가격 책정을 강제한다고 프레임합니다.
미국 랩은 소비자 층에서 반대 수를 둡니다. OpenAI는 최저가 구간을 80% 인하한 뒤(7월 30일) 일주일 만에 그 모델을 무료·무제한으로 만들었습니다(8월 6–7일). Google은 3주 전 전작의 절반 가격으로 코딩 특화 모델을 냈습니다(8월 13일). 중국 랩은 플래그십을 오픈웨이트로 풀고, 연산이 부족한 최상단에는 단계적이고 더 높은 요금을 넣습니다. 미국 랩은 소비자 끝에서 무료와 저가로 달립니다.
지정학 층도 신중히 이름을 붙일 가치가 있습니다. Moonshot Kimi K3 오픈웨이트는 7월에 이미 미국 안보 당국의 주목을 받았습니다. 알리바바가 이 창에 2.4T 플래그십을 오픈웨이트로 푼 것을, 일부 분석가는 규제 강화 전에 해외 마인드셰어와 「기술 대등」 서사를 고정하려는 움직임으로 읽습니다. 근거 있는 해석이지 확인된 사실은 아닙니다. 영어 제품 게시만 읽으면 놓치기 쉽습니다.
출처: DeepSeek 공식 요금 발표(Wall Street CN, IT Home, AIGC.cn, V2EX 대조). 알리바바 공식 Qwen 저장소(Hugging Face / ModelScope)와 라이선스 조항의 South China Morning Post. 지푸(Z.ai) GLM-5.3 기술 페이지, VentureBeat와 StableLearn. Meta AI Research 공식 블로그. 공개 속도에 관한 중국 금융 매체(Yicai, Sohu Finance). 재게시 전에 최신 공식 요금과 라이선스 조항을 확인하십시오. 위에서 미확인으로 표시한 세부는 독립 확인되지 않았습니다.
피크/오프피크 API 요금은 「상시 가동 플래그십 추론」을 더 비싸고 예측하기 어렵게 만듭니다. 2.4T MoE를 자체 호스팅하는 일은 데이터센터 문제이지 노트북 문제가 아닙니다. 재판매는 피크 단가를 깎을 수 있지만, 프로덕션 에이전트, Xcode 빌드, 장시간 세션을 공유 추론 큐에 두면 격리는 약합니다. iOS CI/CD와 AI 에이전트 자동화에 맞는 더 안정적인 프로덕션 환경이라면 NodeMini Mac Mini 클라우드 임대가 보통 더 낫습니다. 전용 Apple Silicon, 노드 단위 과금, 같은 GPU 청구서를 베이징 피크 시간과 다툴 필요가 없습니다.
오프피크 요금은 여전히 Claude Opus 5보다 저렴하지만, 전체에서 가장 싼 선택지는 아닙니다. OpenAI GPT-5.6 Luna(100만 토큰당 $0.20/$1.20)와 알리바바 국제 Qwen3.8-Max 요금($2/$6)이 적어도 한 차원에서 DeepSeek의 새 오프피크 요금을 밑돕니다. 공유 피크 시간 큐에서 코딩 에이전트를 빼고 싶다면 Mac Mini 임대 가격을 비교하십시오.
대부분의 용도에서는 가능합니다. 개인 프로젝트와 사내 이용은 영향이 없습니다. 예외는 연속 12개월 매출이 $50M을 넘는 Model-as-a-Service 또는 AI Work Assistant 사업을 운영하는 경우뿐입니다. 그 구간은 알리바바와의 별도 상용 라이선스가 필요합니다.
아닙니다. 온라인에 퍼진 그 주장은 거짓입니다. 공개 라이선스에 지리적 제한은 없습니다. 제한은 매출 기준이며(서비스가 얼마나 버느냐에 묶입니다), 이용자나 사용자의 소재지와 무관합니다.
기반 모델 수준에서는 차이가 없습니다. 둘 다 동일한 7430억 파라미터 기반 모델을 씁니다. 성능 향상(Terminal-Bench 3.0에서 약 6배)은 후학습에서 강화학습을 확대한 데에서만 나오며, 기반 모델 재학습은 없습니다.
아직 아닙니다. Muse Glimmer는 30B 증류 모델이며 Meta의 본래 플래그십이 아닙니다. CEO Mark Zuckerberg는 더 크고 비공개인 Muse Spark 1.2의 오픈웨이트가 「곧」 나온다고 말했습니다. 이 글을 쓰는 시점에 그 공개는 이뤄지지 않았습니다. 밝힌 의도이지 확인된 사실이 아닙니다. 격리와 접근 안내는 도움말 센터에 있습니다.