DeepSeek V4 풀 버전 정식 출시
피크·오프피크 과금 × SWE-bench 80.6% × 7월 24일 API 마이그레이션 마감(2026)

deepseek-chat을 사용 중이거나 DeepSeek V4 풀 버전 전환을 검토 중이라면——2026년 7월 20일 GA 정식 버전이 출시되어 피크·오프피크 과금, SWE-bench Verified 80.6%(오픈소스 최고), 1M token 컨텍스트를 제공하지만 7월 24일 구 API가 영구 종료됩니다. 본문은 원본 문서의 모든 핵심을 다룹니다: 4/24 프리뷰부터 7/20 GA까지 타임라인, V4-Pro/Flash 아키텍처(CSA+HCA+mHC+Muon), GPT-5.6 / Claude Fable 5 벤치마크 비교, 피크·오프피크 가격 전체 표, 6단계 API 마이그레이션 코드 예제, 그리고 과제 분석·비용 절감 전략·FAQ.최종 업데이트: 2026-07-20

01

DeepSeek V4 GA 출시: 개발자가 직면하는 5가지 과제

3개월을 기다린 끝에 V4 프리뷰가 드디어 풀 버전으로 「졸업」했습니다. 성능 향상은 흥미롭지만, 상용화와 API 변경도 실질적인 마찰을 가져왔습니다——다음 5가지가 통합 팀에서 가장 많이 보고되는 문제입니다:

  1. 01

    구 API 카운트다운: deepseek-chatdeepseek-reasoner7월 24일 15:59 UTC(베이징 시간 23:59)에 영구 종료되며, 마이그레이션하지 않은 프로덕션 트래픽은 바로 404가 됩니다.

  2. 02

    피크·오프피크 과금 복잡도: GA에서 처음으로 시간대별 요금이 도입되어 평일 09–12시·14–18시(베이징 시간) 요금이 2배가 되고, 24/7 Agent 파이프라인 청구 예측이 어려워집니다.

  3. 03

    폐쇄형 플래그십이 최난도 벤치마크에서 여전히 선두: Claude Fable 5는 SWE-bench Pro에서 80.3%, V4-Pro는 55.4%에 그칩니다——극한의 다중 파일 저장소 수정에는 유료 플래그십이 여전히 필요합니다.

  4. 04

    셀프호스팅 하드웨어 장벽: V4-Pro(1.6T/49B 활성)는 개인 노트북에서 실행 불가. V4-Flash는 로컬 추론 가능하지만 96GB+ 통합 메모리가 필요합니다(antirez ds4 + Mac 96GB 실측 참조).

  5. 05

    3가지 추론 모드 선택: Non-think / Think High / Think Max는 작업에 맞게 선택해야 하며, Think Max 오용 시 384K+ 컨텍스트 할당량을 소모해 비용과 지연이 급증합니다.

  6. 06

    「거의 무료」에서 「규칙 있는 상용 플랫폼」으로: 6월 영구 75% 인하 후에도 피크·오프피크 메커니즘은 스케줄링 전략을 새로운 핵심 경쟁력으로 만듭니다.

프리뷰에서 풀 버전까지: 완전 타임라인

시간이벤트
2026-04-24V4 프리뷰 출시 + 오픈소스(MIT), V4-Pro(1.6T)와 V4-Flash(284B) 포함
2026-05V4-Flash와 V4-Pro 프로덕션 튜닝 버전 출시, API 정식 이용 가능
2026-06V4-Pro 가격 영구 75% 인하(출력가 $0.87/M tokens)
2026-06-29DeepSeek이 전체 API 사용자에 이메일 발송, 7월 중순 GA 출시와 피크·오프피크 과금 최초 공개
2026-07-19다수 개발자가 GA 그레이 내부 테스트 자격 획득, 언론은 「풀 버전 내일 출시 가능」 보도
2026-07-20GA 정식 버전 출시(본문 게시일)
2026-07-24구 API deepseek-chat / deepseek-reasoner 영구 종료

「V4 프리뷰는 이미 강력했고, 풀 버전은 Agent·수학 추론·코드 생성에서 전문적으로 강화되었으며 정식 상용 과금 체계를 갖추었습니다.」

02

V4-Pro와 V4-Flash 아키텍처: CSA + HCA가 100만 token을 지탱하는 방식

DeepSeek V4는 V2/V3의 MLA(다중 헤드 잠재 주의)를 폐기하고 CSA + HCA 하이브리드 주의, mHC 잔차, Muon 옵티마이저를 채택해 1M 컨텍스트를 엔지니어링적으로 실서비스 가능하게 만들었습니다.

사양V4-ProV4-Flash
총 파라미터1.6조(1.6T)2840억(284B)
토큰당 활성490억(49B)130억(13B)
Transformer 레이어61층43층
컨텍스트 윈도우1,000,000 tokens1,000,000 tokens
최대 출력384K tokens384K tokens
정밀도FP4(전문가 가중치) + FP8(기타)FP4 + FP8 혼합
사전학습 데이터량33T+ tokens32T+ tokens
오픈소스 라이선스MITMIT

① 압축 희소 주의(CSA)

  • KV 시퀀스를 Softmax 게이트 풀링으로 4배 압축
  • FP4 정밀도 「라이트닝 인덱서」로 top-k 희소 선택: V4-Pro top-1024, V4-Flash top-512
  • 최근 128 token 슬라이딩 윈도우 유지
  • 1M 컨텍스트에서 추론 FLOPs는 V3.2의 27%에 불과

② 고밀도 압축 주의(HCA)

  • 토큰을 128배 압축 후 글로벌 밀집 주의로 장거리 의존성 포착
  • V4-Flash는 처음 2층이 HCA, 이후 CSA/HCA 교차 배치. V4-Pro도 유사 구조
  • KV Cache 메모리는 V3.2의 10%(V4-Flash는 7%까지 감소)

③ mHC와 Muon

  • mHC(다양체 제약 하이퍼커넥션): 4채널 잔차 스트림, 이중확률 행렬 제약(Birkhoff 다면체)을 만족하는 혼합 행렬로 61층 심층 네트워크 신호 전파 안정화
  • Muon 옵티마이저: 뉴턴-슐르츠 직교화 그래디언트로 AdamW 대체, 수렴이 빠르고 학습이 안정적

3가지 추론 모드와 샘플링 파라미터

모드특징적용 시나리오
Non-think사고 체인 없음, 초고속 응답간단한 Q&A, 라우팅
Think High명시적 추론(<redacted_thinking> 태그)중간 복잡도 작업, 코드 디버깅
Think Max최대 추론 강도, 384K+ 컨텍스트 필요복잡한 수학, 긴 체인 Agent

공식 권장 샘플링 파라미터(전 모드 공통): temperature=1.0, top_p=1.0

03

벤치마크 점수: SWE-bench 80.6%와 116배 가성비 격차

V4-Pro는 여러 벤치마크에서 오픈소스 모델 기록을 갱신했지만 폐쇄형 플래그십과의 격차는 여전합니다——핵심은 작업당 비용입니다.

벤치마크DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% ★ 오픈소스 최고96.0%별도 미공개~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified는 「실제 GitHub 저장소 버그 수정」을 테스트하며, V4-Pro 80.6%는 Gemini 3.1 Pro와 공동 오픈소스 1위입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5가 80.3%로 선두입니다.

Artificial Analysis 가성비 비교

  • Claude Fable 5: Strategy & Ops 지수 작업당 $3.48, 점수 50점
  • DeepSeek V4-Pro: 동종 작업당 $0.03, 점수 38점
  • DeepSeek V4-Flash: 6개 지수 작업 모두 $0.04 미만
  • 비용 배수: Fable 5 비용은 V4-Pro의 116배, 점수는 약 12점(31%)만 높음
info

출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace 모델 페이지, Artificial Analysis, LLMReference.

04

GPT-5.6 Sol·Claude Fable 5 대비: 선택 결정 매트릭스

차원DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
오픈소스✅ MIT 라이선스❌ 폐쇄형❌ 폐쇄형
셀프호스팅✅ 지원
컨텍스트 윈도우1M tokens미공개1M tokens
코드 능력매우 강함(Fable 5에 근접)매우 강함최강
API 출력가(오프피크)$0.87/M tokens~$15/M$50/M
피크 출력가$1.74/M tokens
Agent 능력강함, 다중 Agent 오케스트레이션 지원강함최강
데이터 프라이버시✅ 프라이빗 배포 가능
  • 예산 제한 / 고빈도 호출 / 프라이빗 배포: V4-Pro 또는 V4-Flash 우선
  • 극한 코드 능력, 비용 무관: Claude Fable 5(SWE-bench Pro 최고)
  • 복잡한 알고리즘 + 수학 추론: GPT-5.6 Sol / Ultra
  • 초대규모 로그/문서(저비용): V4-Flash 캐시 히트 입력 $0.0028/M

피크·오프피크 과금 완전 가격표(CNY + USD)

GA 버전에서 가장 주목되는 변화: 피크 시간대(베이징 시간) 평일 09:00–12:00과 14:00–18:00에 요금이 2배입니다.

모델과금 항목오프피크(Off-Peak)피크(Peak)
V4-Pro입력(캐시 히트)¥0.025 / $0.0035 / 1M tokens2배
입력(캐시 미스)¥3.00 / $0.435 / 1M tokens¥6.00 / $0.87
출력¥6.00 / $0.87 / 1M tokens¥12.00 / $1.74
V4-Flash입력(캐시 히트)¥0.02 / $0.0028 / 1M tokens2배
입력(캐시 미스)¥1.00 / $0.14 / 1M tokens¥2.00 / $0.28
출력¥2.00 / $0.28 / 1M tokens¥4.00 / $0.56

4가지 비용 절감 전략

  1. 01

    비실시간 작업을 오프피크로: 배치 문서 처리, 데이터 라벨링, 코드 리뷰를 18:00 이후 또는 09:00 이전에 실행합니다.

  2. 02

    캐시 히트 활용: 반복 System Prompt로 Prompt Cache 구축. V4-Flash 캐시 히트는 $0.0028/M으로 거의 무료입니다.

  3. 03

    Flash로 라우팅: 간단한 의도 인식·라우팅 판단은 V4-Flash, 복잡한 추론은 V4-Pro로. 추론 비용 60–80% 절감 가능합니다.

  4. 04

    청구 이메일 확인: DeepSeek은 과금 변경 24시간 전 이메일 알림을 약속합니다. 계정 이메일 수신 가능 여부를 확인하세요.

피크 시간에도 V4-Pro 출력가($1.74/M)는 Claude Opus 4.8($15/M)과 GPT-5.6 Sol(~$15/M)보다 8.6배 저렴합니다.

05

API 마이그레이션 6단계 가이드: 7월 24일 마감 전 필수 체크리스트

warning

중요 경고: 구 모델명 deepseek-chatdeepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 접근이 중단됩니다.

구 모델명신규 모델명비고
deepseek-chatdeepseek-v4-flash(비사고 모드)빠름, 경량 작업에 적합
deepseek-reasonerdeepseek-v4-flash(사고 모드) 또는 deepseek-v4-proPro 업그레이드로 더 강한 추론
  1. 01

    전체 저장소에서 구 모델명 검색: 코드베이스에서 deepseek-chatdeepseek-reasoner를 검색합니다. 환경 변수와 CI 설정 포함.

  2. 02

    마이그레이션 매핑 결정: 경량 대화 → deepseek-v4-flash. 기존 reasoner 워크플로 → Flash 사고 모드 또는 deepseek-v4-pro.

  3. 03

    OpenAI SDK 호출 업데이트: model 파라미터만 변경. 사고 모드는 extra_body로 활성화(아래 코드 참조).

  4. 04

    Anthropic SDK 호환성 검증: base_urlhttps://api.deepseek.com 유지, model만 업데이트.

  5. 05

    Staging 회귀 테스트: 7월 24일 전 스테이징 환경에서 핵심 Agent / RAG 파이프라인을 실행하고 피크·오프피크 청구가 예상과 일치하는지 확인합니다.

  6. 06

    프로덕션 그레이 전환: 트래픽 비율로 단계적으로 신규 모델명으로 전환하고 마감일 전까지 롤백 스위치를 유지합니다.

  7. 07

    Think Max 컨텍스트 확인: Think Max 활성화 시 컨텍스트 윈도우를 384K+로 설정해 추론 잘림을 방지합니다.

python
# ❌ 구写法(7월24일 이후 무효)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# ✅ 신写法
client.chat.completions.create(
    model="deepseek-v4-pro",          # 또는 deepseek-v4-flash
    messages=[...],
    # 사고 모드 제어:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
python
# Anthropic SDK 연동
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

인용 가능한 핵심 데이터(EEAT)

  • KV Cache 압축: 1M 컨텍스트에서 V4-Pro KV 메모리는 V3.2의 10%, V4-Flash 7%
  • 추론 FLOPs: CSA로 1M 시나리오 FLOPs는 V3.2의 27%로 감소
  • 6월 영구 인하: V4-Pro 출력은 원가에서 $0.87/M(75% off)로, 이후 피크·오프피크 메커니즘 추가
  • 동시 실행 상한: V4-Pro 기본 500 동시 실행, 중형 Agent 클러스터는 엔터프라이즈 영업 불필요

DeepSeek V4 GA로 클라우드 API 비용이 크게 낮아졌지만, 로컬에서 V4-Flash를 실행하려면 96GB 통합 메모리 Mac이 필요하고 저가 Linux VPS에서는 xcodebuild, notarytool 등 macOS 툴체인을 실행할 수 없습니다. 팀이 클라우드 DeepSeek API 호출iOS CI/CD / CLI Agent 장세션을 동시에 운영한다면 macOS 고부하 작업을 전용 원격 노드에 두는 것이 로컬 하드웨어에 의존하는 것보다 안정적입니다——API 가격이 아무리 낮아도 Keychain 격리와 SSH 세션 안정성 문제는 해결되지 않습니다. 안정적인 SSH 장세션과 예측 가능한 대역폭이 필요한 프로덕션 환경에서는 NodeMini Mac Mini 클라우드 대여가 일반적으로 최적입니다. V4 피크·오프피크 가격이 어떻게 변동해도 실행 계층 노드는 동일합니다. 사양은 Mac Mini 대여 가격, 온보딩은 헬프 센터를 참조하세요. 로컬 Flash 추론은 antirez ds4 + 96GB Mac 대여 실측을 참조하세요.

최종 업데이트: 2026-07-20. 7월 24일 전에 API 마이그레이션을 완료하세요.

FAQ

자주 묻는 질문

아키텍처는 동일하며 GA 버전은 Agent·수학 추론·코드 생성에서 전문적으로 강화되었고 피크·오프피크 과금이 처음 도입되었습니다. 구 모델명은 7월 24일에 종료됩니다. 마이그레이션 기간에는 Mac Mini 대여 가격을 참고해 Agent 실행 계층 예산을 계획하세요.

베이징 시간 평일 09:00–12:0014:00–18:00이 피크(요금 2배)입니다. 비실시간 작업은 18:00 이후 또는 09:00 이전에, Prompt Cache를 활용하고 간단한 작업은 V4-Flash로 라우팅하세요.

deepseek-chatdeepseek-v4-flash(비사고). deepseek-reasoner → Flash 사고 모드 또는 deepseek-v4-pro. 마감 7월 24일 23:59 베이징 시간.

SWE-bench Verified에서 V4-Pro 80.6%는 오픈소스 최고이지만 Claude Fable 5는 96%입니다. 비용과 셀프호스팅을 중시한다면 V4-Pro 출력 $0.87/M은 GPT-5.6 Sol의 약 1/17입니다. 극한 다중 파일 수정을 원한다면 Fable 5가 여전히 선두입니다. 원격 개발 환경은 헬프 센터를 참조하세요.

가능합니다. ds4는 96GB 통합 메모리 Mac에서 V4-Flash(284B/13B 활성)를 실행합니다. V4-Pro(1.6T)는 클라우드 vLLM/SGLang이 필요합니다. 자세히는 antirez ds4 Mac 대여 실측을 참조하세요.

간단한 Q&A는 Non-think. 코드 디버깅은 Think High. 복잡한 수학과 긴 체인 Agent는 Think Max(384K+ 컨텍스트 필요). 전 모드 권장 temperature=1.0, top_p=1.0.