2026년 7월 31일 DeepSeek은 V4-Flash-0731 공식판을 API 공개 베타로 출시했습니다. 파라미터 규모(총 2840억, 활성 130억)와 아키텍처는 4월 프리뷰와 동일하며, 성능 향상은 후훈련(post-training) 재실행에서만 나왔습니다. Agent 벤치마크에서는 자사 V4-Pro 프리뷰를 앞서며, Claude Opus 4.8 대비 수십 배 저렴한 가격을 유지합니다. 본문은 4월 프리뷰부터 7/31 공식판까지 타임라인, 핵심 가격·벤치마크표, CSA+HCA·mHC·Muon 아키텍처, 자체 Agent 프레임워크 Harness, Kimi K3 / GLM-5.2 / Qwen3.8-Max 횡단 비교, 벤치마크·Harness 논쟁, 「킬 라인(kill line)」 개념, 6단계 도입 체크리스트, FAQ를 포괄합니다. 플래그십 V4-Pro 공식판과 Harness는 아직 「가능한 한 빨리」 출시 예정이며, 이번 업데이트는 API 전용입니다.
DeepSeek V4의 이번 업데이트는 단발 이벤트가 아니라 3개월 이상 이어진 연속 동작입니다. 아래 타임라인은 확인된 사건과 공식 발언을 정리해 Kimi K3, Qwen3.8-Max, V4-Flash-0731 간 기준점을 잡는 데 도움이 됩니다.
| 날짜 | 사건 |
|---|---|
| 4월 24일 | DeepSeek-V4 프리뷰 최초 출시 및 오픈소스(MIT). V4-Pro(1.6T/490억 활성)와 V4-Flash(284B/130억 활성) 포함, 100만 토큰 컨텍스트. |
| 7월 20일 | V4 풀 버전 GA 출시, 피크·오프피크 과금 도입. 자세한 내용은 V4 GA 가격·벤치마크 해설을 참고하세요. |
| 7월 24일 | 구 모델명 deepseek-chat·deepseek-reasoner 영구 종료, 전체 트래픽이 V4 시리즈 명칭으로 전환됩니다. |
| 7월 27일 | 월지암면(Moonshot AI)이 Kimi K3(2.8T) 가중치를 Hugging Face에 오픈소스화합니다. 당시 최대 규모 오픈소스 가중치 중 하나로 DeepSeek에 경쟁 압력을 가합니다. |
| 7월 31일 | V4-Flash-0731 공식판 API 공개 베타 시작. 동일 아키텍처·후훈련만 갱신, Hugging Face 가중치 동기 업로드. changelog에서 자체 Agent 프레임워크 Harness를 최초 공개하며 「곧 출시」 예고. API 전용이며 앱·웹은 미갱신. |
| 8월 3일 | 알리바바 Qwen3.8-Max 정식 GA. 중국 대형 모델 「조 파라미터」 출시 경쟁이 정점에 달합니다. |
| 8월 5일(기고 시점) | V4-Pro 공식판은 여전히 「가능한 한 빨리」 출시 예정. 「8월 10–20일 GA」 등 구체 일정은 DeepSeek 공식 미확인 루머입니다. |
「공식판」이 새 모델 출시를 뜻하지 않음: V4-Flash-0731은 파라미터·구조가 4월과 동일하며, 성능 향상은 후훈련에서만 나왔습니다.
Agent 벤치마크는 Harness 의존: Terminal Bench 2.0 등 공식 Agent 점수는 아직 공개되지 않은 Harness 「미니멀 모드」로 측정되었습니다.
API만 갱신, 소비자 앱은 구버전: 이번 업데이트는 API 전용이며 앱·웹 채팅은 아직 이전 빌드입니다.
V4-Pro·Harness 출시일은 루머와 공식 발언을 구분: changelog 원문은 「가능한 한 빨리」뿐이며, 「8월 10–20일」 등은 미확인 보도입니다.
확인 안내: 본문 데이터는 2026년 8월 5일 기준입니다. V4-Pro 공식판 출시, Harness 공개, 피크·오프피크 과금 시행일, 제3자 벤치마크 재현은 언제든 갱신될 수 있으므로 프로덕션 이전 전 DeepSeek 공식 changelog를 반드시 확인하세요.
| 모델 | 상태 | 총/활성 파라미터 | 컨텍스트 | 입력가(캐시 미스/히트, 백만 토큰당) | 출력가(백만 토큰당) | 라이선스 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 공식판(7/31) | 284B / 13B | 100만 | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 프리뷰(4/24, 공식판 미출시) | 1.6T / 49B | 100만 | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 가중치 오픈(7/27) | 2.8T / 약 104B(커뮤니티 추정) | 약 105만 | $3.00 / $0.30 | $15.00 | 수정 MIT |
| GLM-5.2 | 오픈(2026년 6월) | 약 744B / 약 40B | 100만 | 본문 미확인 | 본문 미확인 | MIT |
| Qwen3.8-Max | API GA(8/3), 가중치 대기 | 2.4T / 950억 | 100만 | $2.00 / $0.17–0.25 | $6.00 | 오픈 약속 |
※ 위 가격은 DeepSeek·Moonshot·알리 등 공식 공개 요율(벤더 자보)입니다. DeepSeek은 향후 베이징 시간 평일 09:00–12:00·14:00–18:00 피크 시간대 2배 요금을 예고했으나 기고 시점 기준 시행일은 미공개입니다.
| 벤치마크 | V4-Flash-0731 | V4-Pro 프리뷰 | 비고 |
|---|---|---|---|
| Terminal Bench 2.0 | 82.7 | 67.9 | Harness 미니멀 모드, max 추론 강도 |
| SWE-bench Verified | 공식표 별도 항목 | 80.6% | 제3자 방법론, 상대적 신뢰도 높음 |
| Toolathlon 등 | V4-Pro 초과 | — | Harness 기반 자체 측정 |
| Artificial Analysis Intelligence Index | 50 | — | 제3자 독립 평가 |
| AA 단일 작업 평균 비용 | $0.03 | — | Kimi K3 $0.86, Fable 5 $3.15 대비 |
※ 「자체 측정」 표기는 DeepSeek changelog·기술 보고서 출처이며, Artificial Analysis 수치는 제3자 독립 평가입니다. 두 데이터셋의 방법론·가중치가 다르므로 직접 합산 비교하지 마세요.
「더 강하다 = 더 크다」는 2026년 하반기 대형 모델 경쟁에서 더 이상 성립하지 않습니다. 284B Flash가 1.6T Pro 프리뷰를 Agent 벤치마크에서 앞선 것은 후훈련 데이터·방법의 중요성이 파라미터 스케일에 필적하고 있음을 보여 줍니다.
V4-Flash-0731에서 가장 쉽게 놓치지만 핵심인 점은 파라미터 규모와 모델 구조가 4월 프리뷰와 완전히 동일하다는 것입니다. DeepSeek은 성능 향상이 「모델 확대」가 아니라 후훈련 재실행에서만 나왔다고 명시합니다. 2840억 총 파라미터·130억 활성 Flash가 1.6조·490억 활성 Pro 프리뷰를 여러 Agent 벤치마크에서 앞서는 것은, 2026년 하반기 대형 모델 경쟁에서 후훈련 품질이 파라미터 스케일에 필적하고 있음을 시사합니다.
기술 보고서 《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》에 따르면 V4 시리즈는 세 가지 핵심 아키텍처 변경을 유지합니다.
DeepSeek 공식 수치에 따르면 100만 토큰 시나리오에서 V4-Pro의 토큰당 FLOPs는 V3.2의 27%, KV Cache는 10%에 불과합니다. 이는 벤더 자보이며 독립 제3자 재현은 아직 없지만, 사실이라면 「100만 토큰」이 마케팅 수치가 아니라 상용 가능한 비용 구조로 다가올 수 있음을 의미합니다.
7월 31일 changelog에서 DeepSeek Harness가 최초로 공식 언급되었습니다. 파일 읽기·쓰기, 도구 호출, 명령 실행, 엔드투엔드 엔지니어링 작업을 수행하는 Agent 실행 프레임워크로, Claude Code에 대응하는 자체 제품입니다. 그전까지 DeepSeek 모델은 Claude Code, OpenCode 등 제3자 Agent 도구에 의존해 유사 작업을 수행했습니다.
주목할 점은 V4-Flash-0731의 Agent 벤치마크(Terminal Bench 2.0, Toolathlon 등)가 아직 공개되지 않은 Harness 「미니멀 모드」로 측정되었다는 것입니다. 설정은 max 추론 강도, top_p=0.95, temperature=1.0입니다. DeepSeek changelog 원문은 「Agent 점수는 harness(실행 프레임워크) 선택에 매우 민감하며, 모델 자체 능력 향상과 동일시해서는 안 된다」고 명시합니다. 이 경고는 숫자만 보고 판단하지 말라는 신호로 읽어야 합니다.
구 모델명 전환 확인: deepseek-chat·deepseek-reasoner가 7월 24일 이후 종료되었습니다. 코드베이스·CI·환경 변수에서 deepseek-v4-flash 또는 deepseek-v4-pro로 전환했는지 검색하세요.
API vs 로컬 배포 구분: 클라우드 API는 즉시 V4-Flash-0731을 가리킵니다. 로컬 추론은 antirez ds4 + 96GB Mac 실측 경로를 참고하세요.
비용 기준선 수립: 캐시 히트 $0.0028/M, 출력 $0.28/M 기준으로 월간 토큰 비용을 추정하고 Kimi K3($15/M 출력)와 대조하세요.
실제 업무 A/B 테스트: Harness 기반 공식 벤치마크만으로 이전하지 마세요. 자체 코드베이스로 Claude Code·Cursor 등에서 블라인드 비교하세요.
Harness·V4-Pro 출시 추적: DeepSeek changelog, Hugging Face, Artificial Analysis 재측정을 모니터링하세요.
캐시·안전 분류기 이슈 점검: 해외 개발자 커뮤니티에서 입력 캐시 히트율 저하, 안전 분류기 타임아웃이 보고되었습니다. 프로덕션 전 자체 워크로드로 지연·실패율을 측정하세요.
V4-Flash-0731 출시는 중국 오픈소스 대형 모델이 가장 밀집한 출시 창구에 해당합니다. Artificial Analysis 제3자 데이터와 DeepSeek 자체 벤치마크를 분리해 보면 그림이 더 선명해집니다.
| 모델 | 연구소 | 출시/가중치 | 총 파라미터 | AA Intelligence Index | AA 단일 작업 비용 |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 7/31 공식판 | 284B | 50 | $0.03 |
| Kimi K3 | 월지암면 | 7/16 프리뷰 / 7/27 가중치 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | 2026년 6월 오픈 | 약 744B | V4-Flash보다 약 1점 높음 | 본문 미확인 |
| Qwen3.8-Max | 알리바바 | 8/3 GA, 가중치 대기 | 2.4T | 본문 미확인 | 본문 미확인 |
| GPT-5.6 Sol | OpenAI | 폐쇄 | 미공개 | V4-Flash보다 9점+ 높음 | $1.86 |
| Claude Fable 5 | Anthropic | 폐쇄 | 미공개 | V4-Flash보다 9점+ 높음 | $3.15 |
역설적 대비: Artificial Analysis 제3자 종합 지수에서는 V4-Flash가 Kimi K3·GLM-5.2보다 낮습니다. 그러나 단일 작업 비용은 Kimi K3의 약 1/29, GPT-5.6 Sol의 약 1/62, Claude Fable 5의 약 1/105 수준입니다. DeepSeek은 「점수 1위」가 아니라 「충분한 지능 + 극단적 가격」을 노립니다. V4-Flash 프리뷰가 OpenRouter 호출량 1위를 7주 연속 유지한 이유도 여기에 있습니다.
Claude Opus 4.8 대비 공식 요율 기준 캐시 미스 입력은 약 36배, 캐시 히트 입력은 약 179배, 출력은 약 89배 저렴하다는 보도가 있습니다(벤더 정가 기준, 독립 감사 아님). Agent·배치 작업처럼 절대 지능 상한이 덜 중요한 시나리오에서 V4-Flash-0731의 포지셔닝이 명확해집니다.
중국 개발자 커뮤니티에서 유통되는 「斩杀线(zhǎn shā xiàn)」, 즉 「킬 라인」은 DeepSeek의 「충분한 성능 + 극단적 저가」 조합이 시장에 설정한 문턱을 가리킵니다. 경쟁사 모델이 DeepSeek을 능력에서 뚜렷이 앞서지 못하면서 가격도 밑돌 수 없다면, 시장에서 존재감을 잃을 수 있다는 프레임입니다. 같은 시기 GPT-5.6 Luna 저가판 80% 인하 등 가격 전쟁이 격화된 배경과 맞물립니다.
V4-Flash-0731 출시 전에는 V4-Pro 「7월 중순 전량 출시」 기대가 미뤄지면서 창업자 양문봉(梁文锋)을 「梁白开(양백개, 공약 불이행)」로 부르던 커뮤니티 풍자가 있었습니다. 공식 Flash판이 기대를 넘기자 「梁圣(양성, 현인)」으로 되돌아갔다는 에피소드는 중국 AI 커뮤니티 감정이 얼마나 빠르게 전환되는지 보여 줍니다. 한 AI 창업 인큐베이터 관계자는 「모든 대형 모델 회사가 양문봉 앞에서 달리고 있으며, 어떤 방식으로든 DeepSeek 앞에 서야 생존할 수 있다」고 평했습니다(21세기 경제보도 인용).
DeepSeek은 「가장 강한 모델」 경쟁이 아니라 「대규모 호출에 충분한 지능 + 아무도 따라올 수 없는 가격」 경쟁을 택했습니다. 킬 라인은 그 전략이 시장에 남긴 문턱의 이름입니다.
V4-Flash-0731을 Claude Code, OpenClaw 등 장시간 Agent에 연결할 계획이라면 노트북이나 불안정한 Linux VPS에서 CLI를 돌릴 때 메모리 부족, 세션 끊김, Xcode/Metal 툴체인 부재 문제가 자주 발생합니다. API 비용이 낮아도 안정적인 SSH 장세션, DerivedData 캐시, iOS CI/CD 자동화가 필요한 프로덕션 환경에서는 로컬 Mac 성능이 부족할 때 NodeMini Mac Mini 클라우드 대여가 더 나은 선택입니다. 로컬 Flash 추론은 antirez ds4 + 96GB Mac 실측을, 사양·요금은 Mac Mini 대여 가격, 온보딩은 헬프 센터를 참고하세요.
출처: DeepSeek 공식 API 문서·changelog, 기술 보고서《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》, Hugging Face 모델 카드, Artificial Analysis(경제매체 인용), 21세기 경제보도, Moonshot AI·智谱·알리 공식 발표. 배포 전 최신 공식 공지를 확인하세요.
가장 직접적인 차이는 100만 토큰 컨텍스트 네이티브 지원과 장문 시나리오에서의 연산·메모리 효율 향상입니다(공식: V4-Pro FLOPs 27%, KV Cache 10%). V4 시리즈는 Agent 능력에 특화되어 Claude Code, OpenCode 등과 호환됩니다.
일반 대화, 단순 작업, 대규모·저비용 호출에는 V4-Flash-0731 공식판이 가성비가 높습니다. Agent 벤치마크도 V4-Pro 프리뷰를 앞섰습니다. 더 깊은 추론이 필요하고 예산이 여유롭다면 V4-Pro 프리뷰를 쓰고 공식판 출시 후 전환을 평가하세요. 비용 비교는 Mac Mini 대여 가격과 함께 검토하세요.
기고 시점(2026년 8월 5일) 기준 불가능합니다. 공식 출시된 것은 V4-Flash-0731뿐이며 API 전용입니다. V4-Pro 공식판과 Harness는 「가능한 한 빨리」 출시 예정이나 확정 일정은 없습니다. 「8월 10–20일」은 미확인 루머입니다.
구분해서 봐야 합니다. SWE-bench Verified 등 제3자 벤치마크는 상대적으로 신뢰할 수 있습니다. Terminal Bench 2.0 등 Agent 점수는 미공개 Harness 미니멀 모드 결과이며, DeepSeek도 harness 선택에 매우 민감하다고 명시했습니다. Claude Code, Cursor 등에서 독립 재현을 기다리거나 실제 업무에서 A/B 테스트하세요.
OpenAI·Anthropic 형식 API로 DeepSeek을 쓰고 있다면 deepseek-v4-flash가 자동으로 새 공식판을 가리킵니다. 폐기된 deepseek-chat·deepseek-reasoner는 신규 명칭으로 전환해야 합니다. 로컬 추론은 ds4 Mac 실측을, 원격 Mac 노드는 헬프 센터를 참고하세요.