deepseek-chat を使っている、または DeepSeek V4 フル版 への切り替えを検討している方へ——2026 年 7 月 20 日に GA 正式版がリリースされ、ピーク・オフピーク課金、SWE-bench Verified 80.6%(オープンソース最高)、1M token コンテキストが追加されましたが、7 月 24 日に旧 API が永久廃止されます。本記事はソース資料の要点をすべて網羅します:4/24 プレビューから 7/20 GA までのタイムライン、V4-Pro/Flash アーキテクチャ(CSA+HCA+mHC+Muon)、GPT-5.6 / Claude Fable 5 とのベンチマーク比較、ピーク・オフピーク料金の完全表、6 ステップ API 移行コード例、および課題の整理、コスト削減戦略、FAQ。最終更新:2026-07-20
3 か月の待機の末、V4 プレビュー版がついにフル版として「卒業」しました。性能向上は魅力的ですが、商業化と API 変更にも実際の摩擦が伴います——以下 5 点が統合チームから最も多く報告されている問題です:
旧 API のカウントダウン:deepseek-chat と deepseek-reasoner は 7 月 24 日 15:59 UTC(北京時間 23:59) に永久廃止され、移行していない本番トラフィックは直接 404 になります。
ピーク・オフピーク課金の複雑さ:GA で初めて時間帯別料金が導入され、平日 09–12 時と 14–18 時(北京時間)の料金が2 倍になり、24/7 Agent パイプラインの請求予測が難しくなります。
クローズドソース旗艦が最難ベンチマークで依然リード:Claude Fable 5 は SWE-bench Pro で 80.3%、V4-Pro は 55.4% のみ——極限のマルチファイルリポジトリ修正には有料旗艦が依然必要です。
セルフホストのハードウェア要件:V4-Pro(1.6T/49B アクティブ)は個人ノート PC では実行不可。V4-Flash はローカル推論可能ですが 96GB+ 統一メモリが必要です(antirez ds4 + Mac 96GB 実測 参照)。
3 つの推論モードの選定:Non-think / Think High / Think Max はタスクに合わせて選択が必要で、Think Max の誤用は 384K+ コンテキスト枠を消費し、コストとレイテンシが急増します。
「ほぼ無料」から「ルールのある商業プラットフォーム」へ:6 月の永久 75% 値下げ後も、ピーク・オフピーク機構によりスケジューリング戦略が新たな核心競争力となり、単純な価格比較だけでは済みません。
| 日時 | イベント |
|---|---|
| 2026-04-24 | V4 プレビュー版リリース + オープンソース(MIT)、V4-Pro(1.6T)と V4-Flash(284B)を含む |
| 2026-05 | V4-Flash と V4-Pro の本番チューニング版リリース、API 正式利用可能 |
| 2026-06 | V4-Pro 価格を永久 75% 値下げ(出力 $0.87/M tokens) |
| 2026-06-29 | DeepSeek が全 API ユーザーにメール送信、7 月中旬 GA リリースとピーク・オフピーク課金を初公開 |
| 2026-07-19 | 複数の開発者が GA グレー内測資格を取得、メディアは「フル版は明日リリースの可能性」と報道 |
| 2026-07-20 | GA 正式版リリース(本記事公開日) |
| 2026-07-24 | 旧 API deepseek-chat / deepseek-reasoner 永久廃止 |
「V4 プレビュー版はすでに強力でしたが、フル版は Agent・数学推論・コード生成における専門的な強化と、正式な商業化課金体系を伴います。」
DeepSeek V4 は V2/V3 の MLA(多頭潜在注意)を廃止し、CSA + HCA ハイブリッド注意、mHC 残差、Muon オプティマイザを採用し、1M コンテキストをエンジニアリング上実用可能にしました。
| 仕様 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6 兆(1.6T) | 2840 億(284B) |
| トークンあたりアクティブ | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート重み)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ量 | 33T+ tokens | 32T+ tokens |
| オープンソースライセンス | MIT | MIT |
| モード | 特徴 | 適用シーン |
|---|---|---|
| Non-think | 思考チェーンなし、超高速応答 | 簡単な Q&A、ルーティング |
| Think High | 明示的推論(<redacted_thinking> タグ) | 中程度の複雑タスク、コードデバッグ |
| Think Max | 最大推論強度、384K+ コンテキスト必要 | 複雑な数学、長チェーン Agent |
公式推奨サンプリングパラメータ(全モード共通):temperature=1.0, top_p=1.0
V4-Pro は複数のベンチマークでオープンソースモデルの記録を更新しましたが、クローズドソース旗艦との差は依然あります——鍵はタスクあたりのコストです。
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ オープンソース最高 | 96.0% | 個別未公表 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified は「実際の GitHub リポジトリのバグ修正」をテストし、V4-Pro の 80.6% は Gemini 3.1 Pro と並んでオープンソース第 1 位です。SWE-bench Pro はより厳格で、Claude Fable 5 が 80.3% でリードしています。
出典:DeepSeek 公式ドキュメント、arXiv:2606.19348、HuggingFace モデルページ、Artificial Analysis、LLMReference。
| 次元 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース | ✅ MIT ライセンス | ❌ クローズド | ❌ クローズド |
| セルフホスト可能 | ✅ 対応 | ❌ | ❌ |
| コンテキストウィンドウ | 1M tokens | 未公開 | 1M tokens |
| コード能力 | 極めて強い(Fable 5 に近い) | 極めて強い | 最強 |
| API 出力単価(オフピーク) | $0.87/M tokens | ~$15/M | $50/M |
| ピーク出力単価 | $1.74/M tokens | — | — |
| Agent 能力 | 強い、マルチ Agent オーケストレーション対応 | 強い | 最強 |
| データプライバシー | ✅ プライベートデプロイ可能 | ❌ | ❌ |
GA 版で最も注目される変更:ピーク時間帯(北京時間)平日 09:00–12:00 と 14:00–18:00で料金が 2 倍になります。
| モデル | 課金項目 | オフピーク(Off-Peak) | ピーク(Peak) |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 / 1M tokens | 2 倍 |
| 入力(キャッシュミス) | ¥3.00 / $0.435 / 1M tokens | ¥6.00 / $0.87 | |
| 出力 | ¥6.00 / $0.87 / 1M tokens | ¥12.00 / $1.74 | |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 / 1M tokens | 2 倍 |
| 入力(キャッシュミス) | ¥1.00 / $0.14 / 1M tokens | ¥2.00 / $0.28 | |
| 出力 | ¥2.00 / $0.28 / 1M tokens | ¥4.00 / $0.56 |
非リアルタイムタスクをオフピークに:バッチ文書処理、データアノテーション、コードレビューを 18:00 以降または 09:00 以前に実行。
キャッシュヒットを活用:繰り返し System Prompt で Prompt Cache を構築。V4-Flash キャッシュヒットは $0.0028/M でほぼ無料。
Flash でルーティング:簡単な意図認識・ルーティング判断は V4-Flash、複雑な推論は V4-Pro へ。推論コストを 60–80% 削減可能。
請求メールに注意:DeepSeek は課金変更の 24 時間前にメール通知を約束。アカウントメールが受信可能か確認。
ピーク時でも V4-Pro 出力単価($1.74/M)は Claude Opus 4.8($15/M)と GPT-5.6 Sol(~$15/M)より 8.6 倍安いです。
重要な警告:旧モデル名 deepseek-chat と deepseek-reasoner は 2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59) に永久アクセス停止します。
| 旧モデル名 | 新モデル名 | 備考 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考モード) | 高速、軽量タスク向け |
deepseek-reasoner | deepseek-v4-flash(思考モード)または deepseek-v4-pro | Pro にアップグレードでより強い推論 |
リポジトリ全体で旧モデル名を検索:コードベースで deepseek-chat と deepseek-reasoner を検索。環境変数と CI 設定も含む。
移行マッピングを決定:軽量対話 → deepseek-v4-flash。旧 reasoner ワークフロー → Flash 思考モードまたは deepseek-v4-pro。
OpenAI SDK 呼び出しを更新:model パラメータのみ変更。思考モードは extra_body で有効化(下記コード参照)。
Anthropic SDK 互換性を検証:base_url は https://api.deepseek.com のまま、model を更新するだけ。
Staging 回帰テスト:7 月 24 日までにステージング環境でコア Agent / RAG パイプラインを実行し、ピーク・オフピークの請求が想定通りか確認。
本番グレーデプロイ:トラフィック比率で段階的に新モデル名へ切り替え、期限前までロールバックスイッチを保持。
Think Max コンテキスト確認:Think Max を有効にする場合、コンテキストウィンドウを 384K+ に設定し、推論の切り捨てを回避。
# ❌ 旧写法(7月24日以降無効)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# ✅ 新写法
client.chat.completions.create(
model="deepseek-v4-pro", # または deepseek-v4-flash
messages=[...],
# 思考モードの制御:
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
# Anthropic SDK 接続
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
DeepSeek V4 GA によりクラウド API コストは大幅に低下しましたが、ローカルで V4-Flash を実行するには 96GB 統一メモリ Macが必要で、安価な Linux VPS では xcodebuild、notarytool などの macOS ツールチェーンを実行できません。チームがクラウド DeepSeek API 呼び出しとiOS CI/CD / CLI Agent 長セッションを同時に運用する場合、macOS の重いワークロードを専有リモートノードに置く方がローカルハードウェアに賭けるより安定します——API 料金がいくら安くても Keychain 分離と SSH セッション安定性の問題は解決しません。安定した SSH 長セッションと予測可能な帯域が必要な本番環境では、NodeMini の Mac Mini クラウドレンタルが通常最適解です。V4 のピーク・オフピーク価格がどう変動しても、実行層ノードは変わりません。仕様は レンタル料金、オンボーディングは ヘルプセンター を参照。ローカル Flash 推論は antirez ds4 + 96GB Mac レンタル実測 を参照。
最終更新:2026-07-20。7 月 24 日までに API 移行を完了してください。
アーキテクチャは変わらず、GA 版は Agent・数学推論・コード生成で専門的に強化され、初めてピーク・オフピーク課金を導入しました。旧モデル名は 7 月 24 日に廃止されます。移行期間中は レンタル料金 を参照して Agent 実行層の予算を計画できます。
北京時間の平日 09:00–12:00 と 14:00–18:00 がピーク(料金 2 倍)。非リアルタイムタスクは 18:00 以降または 09:00 以前に、Prompt Cache を活用し、簡単なタスクは V4-Flash でルーティング。
deepseek-chat → deepseek-v4-flash(非思考)。deepseek-reasoner → Flash 思考モードまたは deepseek-v4-pro。期限は 7 月 24 日 23:59 北京時間。
SWE-bench Verified で V4-Pro の 80.6% はオープンソース最高ですが、Claude Fable 5 は 96% です。コストとセルフホストを重視するなら、V4-Pro 出力 $0.87/M は GPT-5.6 Sol の約 1/17。究極のマルチファイル修正を求めるなら Fable 5 が依然リード。リモート開発環境の詳細は ヘルプセンター を参照。
可能です。ds4 は 96GB 統一メモリ Mac 上で V4-Flash(284B/13B アクティブ)を実行できます。V4-Pro(1.6T)はクラウド vLLM/SGLang が必要。詳細は antirez ds4 Mac レンタル実測 を参照。
簡単な Q&A は Non-think。コードデバッグは Think High。複雑な数学と長チェーン Agent は Think Max(384K+ コンテキスト必要)。全モード推奨 temperature=1.0, top_p=1.0。