deepseek-chat을 사용 중이거나 DeepSeek V4 풀 버전 전환을 검토 중이라면——2026년 7월 20일 GA 정식 버전이 출시되어 피크·오프피크 과금, SWE-bench Verified 80.6%(오픈소스 최고), 1M token 컨텍스트를 제공하지만 7월 24일 구 API가 영구 종료됩니다. 본문은 원본 문서의 모든 핵심을 다룹니다: 4/24 프리뷰부터 7/20 GA까지 타임라인, V4-Pro/Flash 아키텍처(CSA+HCA+mHC+Muon), GPT-5.6 / Claude Fable 5 벤치마크 비교, 피크·오프피크 가격 전체 표, 6단계 API 마이그레이션 코드 예제, 그리고 과제 분석·비용 절감 전략·FAQ.최종 업데이트: 2026-07-20
3개월을 기다린 끝에 V4 프리뷰가 드디어 풀 버전으로 「졸업」했습니다. 성능 향상은 흥미롭지만, 상용화와 API 변경도 실질적인 마찰을 가져왔습니다——다음 5가지가 통합 팀에서 가장 많이 보고되는 문제입니다:
구 API 카운트다운: deepseek-chat과 deepseek-reasoner는 7월 24일 15:59 UTC(베이징 시간 23:59)에 영구 종료되며, 마이그레이션하지 않은 프로덕션 트래픽은 바로 404가 됩니다.
피크·오프피크 과금 복잡도: GA에서 처음으로 시간대별 요금이 도입되어 평일 09–12시·14–18시(베이징 시간) 요금이 2배가 되고, 24/7 Agent 파이프라인 청구 예측이 어려워집니다.
폐쇄형 플래그십이 최난도 벤치마크에서 여전히 선두: Claude Fable 5는 SWE-bench Pro에서 80.3%, V4-Pro는 55.4%에 그칩니다——극한의 다중 파일 저장소 수정에는 유료 플래그십이 여전히 필요합니다.
셀프호스팅 하드웨어 장벽: V4-Pro(1.6T/49B 활성)는 개인 노트북에서 실행 불가. V4-Flash는 로컬 추론 가능하지만 96GB+ 통합 메모리가 필요합니다(antirez ds4 + Mac 96GB 실측 참조).
3가지 추론 모드 선택: Non-think / Think High / Think Max는 작업에 맞게 선택해야 하며, Think Max 오용 시 384K+ 컨텍스트 할당량을 소모해 비용과 지연이 급증합니다.
「거의 무료」에서 「규칙 있는 상용 플랫폼」으로: 6월 영구 75% 인하 후에도 피크·오프피크 메커니즘은 스케줄링 전략을 새로운 핵심 경쟁력으로 만듭니다.
| 시간 | 이벤트 |
|---|---|
| 2026-04-24 | V4 프리뷰 출시 + 오픈소스(MIT), V4-Pro(1.6T)와 V4-Flash(284B) 포함 |
| 2026-05 | V4-Flash와 V4-Pro 프로덕션 튜닝 버전 출시, API 정식 이용 가능 |
| 2026-06 | V4-Pro 가격 영구 75% 인하(출력가 $0.87/M tokens) |
| 2026-06-29 | DeepSeek이 전체 API 사용자에 이메일 발송, 7월 중순 GA 출시와 피크·오프피크 과금 최초 공개 |
| 2026-07-19 | 다수 개발자가 GA 그레이 내부 테스트 자격 획득, 언론은 「풀 버전 내일 출시 가능」 보도 |
| 2026-07-20 | GA 정식 버전 출시(본문 게시일) |
| 2026-07-24 | 구 API deepseek-chat / deepseek-reasoner 영구 종료 |
「V4 프리뷰는 이미 강력했고, 풀 버전은 Agent·수학 추론·코드 생성에서 전문적으로 강화되었으며 정식 상용 과금 체계를 갖추었습니다.」
DeepSeek V4는 V2/V3의 MLA(다중 헤드 잠재 주의)를 폐기하고 CSA + HCA 하이브리드 주의, mHC 잔차, Muon 옵티마이저를 채택해 1M 컨텍스트를 엔지니어링적으로 실서비스 가능하게 만들었습니다.
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2840억(284B) |
| 토큰당 활성 | 490억(49B) | 130억(13B) |
| Transformer 레이어 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가 가중치) + FP8(기타) | FP4 + FP8 혼합 |
| 사전학습 데이터량 | 33T+ tokens | 32T+ tokens |
| 오픈소스 라이선스 | MIT | MIT |
| 모드 | 특징 | 적용 시나리오 |
|---|---|---|
| Non-think | 사고 체인 없음, 초고속 응답 | 간단한 Q&A, 라우팅 |
| Think High | 명시적 추론(<redacted_thinking> 태그) | 중간 복잡도 작업, 코드 디버깅 |
| Think Max | 최대 추론 강도, 384K+ 컨텍스트 필요 | 복잡한 수학, 긴 체인 Agent |
공식 권장 샘플링 파라미터(전 모드 공통): temperature=1.0, top_p=1.0
V4-Pro는 여러 벤치마크에서 오픈소스 모델 기록을 갱신했지만 폐쇄형 플래그십과의 격차는 여전합니다——핵심은 작업당 비용입니다.
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 오픈소스 최고 | 96.0% | 별도 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified는 「실제 GitHub 저장소 버그 수정」을 테스트하며, V4-Pro 80.6%는 Gemini 3.1 Pro와 공동 오픈소스 1위입니다. SWE-bench Pro는 더 엄격하며 Claude Fable 5가 80.3%로 선두입니다.
출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace 모델 페이지, Artificial Analysis, LLMReference.
| 차원 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스 | ✅ MIT 라이선스 | ❌ 폐쇄형 | ❌ 폐쇄형 |
| 셀프호스팅 | ✅ 지원 | ❌ | ❌ |
| 컨텍스트 윈도우 | 1M tokens | 미공개 | 1M tokens |
| 코드 능력 | 매우 강함(Fable 5에 근접) | 매우 강함 | 최강 |
| API 출력가(오프피크) | $0.87/M tokens | ~$15/M | $50/M |
| 피크 출력가 | $1.74/M tokens | — | — |
| Agent 능력 | 강함, 다중 Agent 오케스트레이션 지원 | 강함 | 최강 |
| 데이터 프라이버시 | ✅ 프라이빗 배포 가능 | ❌ | ❌ |
GA 버전에서 가장 주목되는 변화: 피크 시간대(베이징 시간) 평일 09:00–12:00과 14:00–18:00에 요금이 2배입니다.
| 모델 | 과금 항목 | 오프피크(Off-Peak) | 피크(Peak) |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 / 1M tokens | 2배 |
| 입력(캐시 미스) | ¥3.00 / $0.435 / 1M tokens | ¥6.00 / $0.87 | |
| 출력 | ¥6.00 / $0.87 / 1M tokens | ¥12.00 / $1.74 | |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 / 1M tokens | 2배 |
| 입력(캐시 미스) | ¥1.00 / $0.14 / 1M tokens | ¥2.00 / $0.28 | |
| 출력 | ¥2.00 / $0.28 / 1M tokens | ¥4.00 / $0.56 |
비실시간 작업을 오프피크로: 배치 문서 처리, 데이터 라벨링, 코드 리뷰를 18:00 이후 또는 09:00 이전에 실행합니다.
캐시 히트 활용: 반복 System Prompt로 Prompt Cache 구축. V4-Flash 캐시 히트는 $0.0028/M으로 거의 무료입니다.
Flash로 라우팅: 간단한 의도 인식·라우팅 판단은 V4-Flash, 복잡한 추론은 V4-Pro로. 추론 비용 60–80% 절감 가능합니다.
청구 이메일 확인: DeepSeek은 과금 변경 24시간 전 이메일 알림을 약속합니다. 계정 이메일 수신 가능 여부를 확인하세요.
피크 시간에도 V4-Pro 출력가($1.74/M)는 Claude Opus 4.8($15/M)과 GPT-5.6 Sol(~$15/M)보다 8.6배 저렴합니다.
중요 경고: 구 모델명 deepseek-chat과 deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 시간 7월 24일 23:59)에 영구 접근이 중단됩니다.
| 구 모델명 | 신규 모델명 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(비사고 모드) | 빠름, 경량 작업에 적합 |
deepseek-reasoner | deepseek-v4-flash(사고 모드) 또는 deepseek-v4-pro | Pro 업그레이드로 더 강한 추론 |
전체 저장소에서 구 모델명 검색: 코드베이스에서 deepseek-chat과 deepseek-reasoner를 검색합니다. 환경 변수와 CI 설정 포함.
마이그레이션 매핑 결정: 경량 대화 → deepseek-v4-flash. 기존 reasoner 워크플로 → Flash 사고 모드 또는 deepseek-v4-pro.
OpenAI SDK 호출 업데이트: model 파라미터만 변경. 사고 모드는 extra_body로 활성화(아래 코드 참조).
Anthropic SDK 호환성 검증: base_url은 https://api.deepseek.com 유지, model만 업데이트.
Staging 회귀 테스트: 7월 24일 전 스테이징 환경에서 핵심 Agent / RAG 파이프라인을 실행하고 피크·오프피크 청구가 예상과 일치하는지 확인합니다.
프로덕션 그레이 전환: 트래픽 비율로 단계적으로 신규 모델명으로 전환하고 마감일 전까지 롤백 스위치를 유지합니다.
Think Max 컨텍스트 확인: Think Max 활성화 시 컨텍스트 윈도우를 384K+로 설정해 추론 잘림을 방지합니다.
# ❌ 구写法(7월24일 이후 무효)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# ✅ 신写法
client.chat.completions.create(
model="deepseek-v4-pro", # 또는 deepseek-v4-flash
messages=[...],
# 사고 모드 제어:
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# Anthropic SDK 연동
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
DeepSeek V4 GA로 클라우드 API 비용이 크게 낮아졌지만, 로컬에서 V4-Flash를 실행하려면 96GB 통합 메모리 Mac이 필요하고 저가 Linux VPS에서는 xcodebuild, notarytool 등 macOS 툴체인을 실행할 수 없습니다. 팀이 클라우드 DeepSeek API 호출과 iOS CI/CD / CLI Agent 장세션을 동시에 운영한다면 macOS 고부하 작업을 전용 원격 노드에 두는 것이 로컬 하드웨어에 의존하는 것보다 안정적입니다——API 가격이 아무리 낮아도 Keychain 격리와 SSH 세션 안정성 문제는 해결되지 않습니다. 안정적인 SSH 장세션과 예측 가능한 대역폭이 필요한 프로덕션 환경에서는 NodeMini Mac Mini 클라우드 대여가 일반적으로 최적입니다. V4 피크·오프피크 가격이 어떻게 변동해도 실행 계층 노드는 동일합니다. 사양은 Mac Mini 대여 가격, 온보딩은 헬프 센터를 참조하세요. 로컬 Flash 추론은 antirez ds4 + 96GB Mac 대여 실측을 참조하세요.
최종 업데이트: 2026-07-20. 7월 24일 전에 API 마이그레이션을 완료하세요.
아키텍처는 동일하며 GA 버전은 Agent·수학 추론·코드 생성에서 전문적으로 강화되었고 피크·오프피크 과금이 처음 도입되었습니다. 구 모델명은 7월 24일에 종료됩니다. 마이그레이션 기간에는 Mac Mini 대여 가격을 참고해 Agent 실행 계층 예산을 계획하세요.
베이징 시간 평일 09:00–12:00과 14:00–18:00이 피크(요금 2배)입니다. 비실시간 작업은 18:00 이후 또는 09:00 이전에, Prompt Cache를 활용하고 간단한 작업은 V4-Flash로 라우팅하세요.
deepseek-chat → deepseek-v4-flash(비사고). deepseek-reasoner → Flash 사고 모드 또는 deepseek-v4-pro. 마감 7월 24일 23:59 베이징 시간.
SWE-bench Verified에서 V4-Pro 80.6%는 오픈소스 최고이지만 Claude Fable 5는 96%입니다. 비용과 셀프호스팅을 중시한다면 V4-Pro 출력 $0.87/M은 GPT-5.6 Sol의 약 1/17입니다. 극한 다중 파일 수정을 원한다면 Fable 5가 여전히 선두입니다. 원격 개발 환경은 헬프 센터를 참조하세요.
가능합니다. ds4는 96GB 통합 메모리 Mac에서 V4-Flash(284B/13B 활성)를 실행합니다. V4-Pro(1.6T)는 클라우드 vLLM/SGLang이 필요합니다. 자세히는 antirez ds4 Mac 대여 실측을 참조하세요.
간단한 Q&A는 Non-think. 코드 디버깅은 Think High. 복잡한 수학과 긴 체인 Agent는 Think Max(384K+ 컨텍스트 필요). 전 모드 권장 temperature=1.0, top_p=1.0.