알리 Qwen3.8-Max 출시:
2.4조 파라미터 Arena 전 세계 5위, 다음 주 오픈소스

2026년 8월 3일 알리바바는 차세대 플래그십 대형 모델 천문 Qwen3.8-Max(총 파라미터 2.4조, 활성 950억, 100만 토큰 컨텍스트)를 정식 출시하고 Agent 제품 「천문 오피스」를 동시에 공개했습니다. 본문은 대형 모델 선정Agent 워크플로 비용에 관심 있는 개발자를 위해 7–8월 출시 타임라인, 핵심 벤치마크·가격표, MoE 아키텍처 심층 분석, Kimi K3 / DeepSeek V4 / Claude 횡단 비교, 「오픈소스」 라벨 논쟁, 업계 배경, 6단계 평가 체크리스트, FAQ를 포괄합니다. 핵심은 Arena 텍스트 경기장 5위(1496점, Preliminary)가 현재 유일하게 인용 가능한 제3자 신호라는 점이며, 나머지 벤치마크는 알리 자체 측정이고 가중치 오픈소스 약속은 「다음 주」 기준 아직 이행되지 않았습니다.

01

타임라인: 프리뷰에서 정식 출시까지 2주 만에 빠른 속도

2026년 7–8월은 중국 대형 모델의 「조 파라미터」 집중 출시 기간입니다. 아래 타임라인은 확인된 사건과 공식 발언을 정리해 Kimi K3, DeepSeek V4-Flash, Qwen3.8-Max 간 기준점을 잡는 데 도움이 됩니다.

날짜사건
7월 16일월지암면(Moonshot AI)이 Kimi K3를 출시합니다. 2.8조 파라미터(896개 전문가 중 16개 활성), 독립 평가와 투명한 기술 보고서를 내세웁니다.
7월 19일Qwen3.8-Max 「프리뷰」가 공개됩니다. Token Plan / Qoder / QoderWork에 연결되며 가격은 정식가의 10% 수준입니다. 활성 파라미터·벤치마크표는 미공개였고, 이용약관은 자동화 프로덕션 환경 호출을 금지합니다.
7월 27일Kimi K3가 약속대로 가중치를 오픈소스화하고 Hugging Face에 공개합니다. 어텐션 커널, MoE 통신 라이브러리 등 인프라도 함께 공개합니다.
7월 31일DeepSeek가 V4-Flash 정식판을 출시합니다. 파라미터 규모는 동일하나 Agent·코드 벤치마크에서 자사 V4-Pro 프리뷰를 크게 앞섭니다.
8월 3일Qwen3.8-Max 정식 GA가 이루어집니다. 전체 벤치마크표가 공개되고 「천문 오피스」 Agent가 동시에 출시됩니다. 알리 홍콩 주가는 당일 약 7%, 미국 주가는 약 4.5% 상승합니다.
8월 10일 전후(예상)Qwen3.8-Max 및 경량판 Qwen3.8-27B 가중치가 Hugging Face·ModelScope에 올라올 예정입니다. 기고 시점 기준 구체적 날짜와 오픈소스 라이선스는 아직 발표되지 않았습니다.

개발자가 가장 경계해야 할 6가지 「정보 함정」

  1. 01

    「Open-Source」 라벨을 이미 오픈소스로 착각: GA 당일 공식 사이트에 오픈소스 표기가 붙었으나 Hugging Face / ModelScope에는 저장소·라이선스가 없습니다.

  2. 02

    총 파라미터 ≠ 활성 비용: 2.4T 총 파라미터 아래 실제 활성은 950억이며, 추론 비용은 1000억급 모델에 더 가깝습니다.

  3. 03

    벤치마크표 대부분이 자체 측정: PaperBench, RecreationBench 등은 알리 자체 벤치마크이며 제3자가 GA 버전을 아직 재현하지 않았습니다.

  4. 04

    Arena 순위는 Preliminary: 1496점·텍스트 경기장 5위는 「예비」 표기이며 최종 결론이 아닙니다.

  5. 05

    프리뷰 단계 투명성 부족: 7월 프리뷰 기간에는 활성 파라미터, 모델 카드, 안전 평가가 공개되지 않아 여러 기관이 프로덕션 이전을 권하지 않았습니다.

  6. 06

    경쟁사 각주에 논쟁 여지: 비교표 각주는 Fable 5 점수에 fallback이 개입했을 수 있다고 시사하지만, 알리 자체 방법론도 완전히 공개되지는 않았습니다.

warning

확인 안내: 본문 데이터는 2026년 8월 4일 기준입니다. 오픈소스 가중치 공개 시점, Arena 정식 순위, 제3자 재측정 결과는 언제든 갱신될 수 있으므로 프로덕션 이전 전 알리 공식 공지와 독립 평가를 반드시 확인하세요.

02

핵심 데이터: Qwen3.8-Max 공식 사양·벤치마크표

항목Qwen3.8-Max
출시일2026년 8월 3일(GA)
총 파라미터 / 활성 파라미터2.4조 / 950억
아키텍처Qwen3.5 기반 희소 MoE + 혼합 어텐션
컨텍스트 윈도100만 토큰(사고 모드 약 98.3만, 출력 상한 13.1만)
입력 모달리티텍스트 / 이미지 / 비디오
API 가격입력 $2/백만 토큰, 출력 $6/백만 토큰(암시적 캐시 히트 $0.25, 명시적 캐시 쓰기 $2.5·읽기 $0.17)
중국 내 가격입력 12위안/백만 토큰, 출력 36위안/백만 토큰, 캐시 히트 최저 1.5위안
Arena 텍스트 경기장(8/1 스냅샷)5위, 1496점(Preliminary); 상위 8위 중 유일한 Anthropic 외 모델
Arena 비전 경기장2위, Claude Fable 5에 이어 2위
PaperBench(알리 자체 측정)93.0(전 세대 대비 +28.2)
OSWorld-Verified(알리 자체 측정)86.1
SWE-bench Pro(알리 자체 측정)67.7(Fable 5 80.0에 뒤처짐)
HLE(알리 자체 측정)43.6(플래그십 중 최저, Fable 5 53.3)
가중치 오픈소스 상태「다음 주」 약속, 기고 시점 미공개

※ 「알리 자체 측정」 표기 데이터는 공식 발표 자료 출처이며, Artificial Analysis·Arena.ai 등의 GA 버전 독립 재현은 아직 없습니다.

03

심층 분석: 2.4조 파라미터 뒤에 알리가 풀려는 문제

왜 단순 스케일업이 아니라 MoE + 혼합 어텐션인가?

Qwen3.8-Max는 Qwen3.5 아키텍처 노선을 이어 희소 MoE로 총 파라미터를 2.4조까지 늘리면서 실제 활성량은 950억으로 제어합니다. 추론 비용은 2.4조 전체를 호출하는 것이 아니라 1000억급 모델에 가깝습니다. API 가격이 $2/$6까지 낮출 수 있는 핵심 이유(Claude Opus 5 $5/$25, Fable 5 $10/$50 대비)도 여기에 있습니다. 아키텍처 효율로 가격 경쟁력을 확보하는 전략입니다.

reasoning_effort 3단계: 비용을 통제하는 표준 설계

모델은 low / medium / xhigh 3단계 추론 강도(기본 xhigh)를 제공합니다. 개발자는 작업 복잡도에 따라 속도와 깊이를 조절할 수 있으며, enable_thinking 파라미터 또는 Anthropic 호환 인터페이스의 reasoning.effort 필드를 지원합니다.

장기 자율 작업: 강점과 검증 방법

알리 사례에는 16일간 무인 개입 자율 코딩 프로젝트, 500단계를 넘는 칩 설계 최적화, RecreationBench(블랙박스 환경에서 상호작용·시각 피드백만으로 실제 앱을 복원) 등이 포함됩니다. 일부 과정은 GitHub qwen-code-dev-bot/oh-my-cli에서 확인할 수 있으나 완전한 제3자 감사는 아닙니다.

생태계 포지셔닝: 모델에서 Agent 제품까지 일원화

Qwen3.8-Max는 「천문 오피스」와 동시에 연결되며 API는 OpenAI·Anthropic 두 프로토콜과 호환됩니다. Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw 등 주류 Agent 툴체인에 바로 붙일 수 있어 이전 비용이 낮습니다.

도입 전 6단계 평가 체크리스트(실무용)

  1. 01

    API와 가중치를 구분: 현재 QwenCloud API 호출은 가능합니다. 로컬 배포가 필요하면 Qwen3.8-27B 오픈소스 또는 Max 가중치 라이선스 공개를 기다리세요.

  2. 02

    비용 기준선 수립: $2/$6와 캐시 히트 $0.25 기준으로 월간 토큰 비용을 추정하고 Kimi K3($3/$15)와 대조하세요.

  3. 03

    reasoning_effort 설정: 지연에 민감한 작업은 medium/low부터 시작하고, 복잡한 Agent 작업에서 xhigh를 켜세요.

  4. 04

    실제 업무 A/B 테스트: 공식 벤치마크만으로 이전하지 마세요. 자체 코드베이스로 Kimi K3와 블라인드 비교하세요.

  5. 05

    제3자 재측정 추적: Artificial Analysis, Arena 정식 순위, Hugging Face 가중치 공개 공지를 모니터링하세요.

  6. 06

    컴플라이언스·데이터 반출 검토: 기업 환경에서는 알리 클라우드 이용약관, 로그 보존, 모델 출력 감사 요건을 평가하세요.

04

횡단 비교: Qwen3.8-Max, Kimi K3, DeepSeek V4, Claude

모델제조사총/활성 파라미터컨텍스트가격(입력/출력, 백만 토큰당)가중치 오픈소스독립 평가
Qwen3.8-Max알리바바2.4T / 950억100만$2 / $6미공개(약속 중)없음
Kimi K3월지암면2.8T / 약 500억약 104.8만$3 / $15오픈(7/27)AA Index ≈ 57.11
DeepSeek V4-ProDeepSeek1.6T / 490억100만전체표 미공개오픈SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek변동 없음100만전체표 미공개오픈Agent·코드 9개 벤치마크 V4-Pro 초과
Claude Opus 5Anthropic미공개100만$5 / $25폐쇄Arena 상위권
Claude Fable 5Anthropic미공개100만$10 / $50폐쇄Arena 텍스트 1위

놓치기 쉬운 디테일: Kimi K3와 DeepSeek는 활성 파라미터를 일찍 공개했으나 알리는 GA까지 「950억」을 밝히지 않았습니다. 7월 프리뷰 단계 투명성 부족이 독립 평가 기관 비판의 한 원인입니다. 유일하게 비교 가능한 독립 블라인드 테스트(269개 파일의 실제 프로젝트 아키텍처 작업)에서는 Kimi K3 83점, Qwen3.8-Max 프리뷰 80점으로 동급·승패가 갈리는 결과였습니다.

「글로벌 1티어 진입」「GPT-5.6 Sol·Fable 5를 안정적으로 앞선다」는 주장은 아직 알리 측 일방적 서술에 가깝습니다. 오픈소스 가중치 공개와 제3자 벤치마크가 나와야 진짜 검증이 가능합니다.

05

논쟁점과 업계 배경: 「오픈소스」 라벨이 가중치보다 먼저 붙었다

  • 공식 사이트는 Open-Source, 가중치는 미공개: GA 당일 표기가 붙었으나 Hugging Face / ModelScope에 저장소·라이선스·확정 일정이 없습니다.
  • 벤치마크는 자체 프레임워크 출처: QwenSWEBench, CoWorkBench, RecreationBench 등이며 중립 플랫폼의 GA 재현은 없습니다.
  • 각주로 경쟁사 의심: 「Fable 5 결과에 fallback 개입 가능성」을 시사하나 기술 근거는 부족하고, 알리 방법론도 완전 공개되지 않았습니다.
  • 프리뷰 단계 프로덕션 호출 금지: 7월 19일 프리뷰 ToS는 자동화 프로덕션 환경을 명시적으로 제한했고 모델 카드·안전 평가도 없었습니다.

2026년 조 파라미터 경쟁의 새 국면

  • 파라미터 경쟁 vs 아키텍처 효율: DeepSeek V4-Flash는 스케일업 없이도 Agent 능력을 크게 끌어올렸고, Qwen3.8-Max의 「대용량·저활성」은 같은 서사의 연장선입니다.
  • 알리의 오픈소스 회귀: Max급 가중치 오픈소스를 처음 약속하며 Kimi K3, DeepSeek와 함께 국산 헤드라인 「집단 개방」 구도를 형성합니다.
  • 소비자 단말 적용: Qwen을 압축해 중국판 Apple Intelligence 핵심 엔진으로 쓰며 수억 대 iPhone 시스템 AI까지 확장합니다.
  • 자본시장 반응: 출시일 홍콩 주가 약 7%, 미국 주가 약 4.5% 상승.
  • 미·중 규제 대조: 같은 시기 백악관이 OpenAI·Anthropic 등과 Agent 사이버보안 테스트 프레임워크를 논의하는 한편, 한쪽은 오픈소스를 가속하고 다른 쪽은 Agent 심사를 강화합니다.

인용 가능한 핵심 수치 요약

  • 사양: 2.4T 총 파라미터 / 950억 활성 / 1M 컨텍스트 / 멀티모달 입력
  • 가격: API $2/$6; 중국 내 12/36위안(백만 토큰당)
  • Arena: 텍스트 5위(1496, Preliminary); 비전 2위
  • 독립 블라인드 테스트: Kimi K3 83 vs Qwen 프리뷰 80(아키텍처 설계 작업)
  • 오픈소스 약속: Qwen3.8-Max + Qwen3.8-27B, 8월 10일 전후 예상

Qwen3.8-Max를 Claude Code, Qoder, OpenClaw 등 장시간 Agent에 연결할 계획이라면 노트북이나 불안정한 Linux VPS에서 CLI를 돌릴 때 메모리 부족, 세션 끊김, Xcode/Metal 툴체인 부재 문제가 자주 발생합니다. 안정적인 SSH 장세션, DerivedData 캐시, iOS CI/CD 자동화가 필요한 프로덕션 환경에서는 로컬 Mac 성능이 부족할 때 NodeMini Mac Mini 클라우드 대여가 더 나은 선택입니다. 전용 노드와 초 단위 프로비저닝으로 Agent와 빌드 작업을 같은 실제 Mac에서 지속 실행할 수 있습니다. 자세한 내용은 Mac Mini 대여 가격을 참고하세요.

출처: 알리 클라우드 공식 블로그·보도자료, Arena.ai 랭킹(2026-08-01 스냅샷), Apidog / Yotta Labs / TechNode 등 독립 분석, 중국판 Apple Intelligence 관련 보도. 배포 전 최신 공식 공지를 확인하세요.

FAQ

자주 묻는 질문

API는 QwenCloud를 통해 호출할 수 있으며 OpenAI·Anthropic 프로토콜과 호환됩니다. 가중치는 아직 공개되지 않았고, 공식 사이트에는 Open-Source 표기가 있으나 Hugging Face / ModelScope 저장소와 라이선스는 「다음 주」(8월 10일 전후 예상) 공지를 기다려야 합니다. 연동 환경은 Mac Mini 대여 가격을 참고하세요.

권위 있는 통합 벤치마크는 아직 없습니다. 유일한 독립 블라인드 테스트에서는 점수가 매우 근접합니다(Kimi K3 83점, Qwen 프리뷰 80점). 동급·승패가 갈립니다. Kimi K3는 이미 오픈소스이고 제3자 데이터가 있습니다. Qwen3.8-Max는 API 가격이 더 낮고 멀티모달 범위가 넓습니다.

총 파라미터와 활성 파라미터를 구분해야 합니다. 실제 활성은 950억이며 API 비용은 1000억급 모델과 비슷합니다. 전체 버전 로컬 프라이빗 배포는 다중 노드 데이터센터가 필요하며, 일반 개발자에게 현실적인 선택은 Qwen3.8-27B 오픈소스를 기다리는 것입니다.

참고는 가능하나 결론으로 삼기는 어렵습니다. 데이터는 알리 자체 프레임워크 출처이며 중립 플랫폼의 GA 재현은 없습니다. 독립 평가 재측정을 주시하거나 실제 업무에서 A/B 테스트를 권장합니다.

더 저렴한 플래그십 API 외에, 중국판 Apple Intelligence의 생성형 AI는 압축된 Qwen 모델을 로컬에서 구동하므로 국내 iPhone 사용자도 시스템 레벨에서 직접 혜택을 받습니다. 추가 문의는 헬프 센터를 참고하세요.