DeepSeek V4 フル版正式リリース
ピーク・オフピーク課金 × SWE-bench 80.6% × 7月24日 API 移行期限(2026)

deepseek-chat を使っている、または DeepSeek V4 フル版 への切り替えを検討している方へ——2026 年 7 月 20 日に GA 正式版がリリースされ、ピーク・オフピーク課金SWE-bench Verified 80.6%(オープンソース最高)、1M token コンテキストが追加されましたが、7 月 24 日に旧 API が永久廃止されます。本記事はソース資料の要点をすべて網羅します:4/24 プレビューから 7/20 GA までのタイムライン、V4-Pro/Flash アーキテクチャ(CSA+HCA+mHC+Muon)、GPT-5.6 / Claude Fable 5 とのベンチマーク比較、ピーク・オフピーク料金の完全表、6 ステップ API 移行コード例、および課題の整理、コスト削減戦略、FAQ最終更新:2026-07-20

01

DeepSeek V4 GA リリース:開発者が直面する 5 つの課題

3 か月の待機の末、V4 プレビュー版がついにフル版として「卒業」しました。性能向上は魅力的ですが、商業化と API 変更にも実際の摩擦が伴います——以下 5 点が統合チームから最も多く報告されている問題です:

  1. 01

    旧 API のカウントダウン:deepseek-chatdeepseek-reasoner7 月 24 日 15:59 UTC(北京時間 23:59) に永久廃止され、移行していない本番トラフィックは直接 404 になります。

  2. 02

    ピーク・オフピーク課金の複雑さ:GA で初めて時間帯別料金が導入され、平日 09–12 時と 14–18 時(北京時間)の料金が2 倍になり、24/7 Agent パイプラインの請求予測が難しくなります。

  3. 03

    クローズドソース旗艦が最難ベンチマークで依然リード:Claude Fable 5 は SWE-bench Pro で 80.3%、V4-Pro は 55.4% のみ——極限のマルチファイルリポジトリ修正には有料旗艦が依然必要です。

  4. 04

    セルフホストのハードウェア要件:V4-Pro(1.6T/49B アクティブ)は個人ノート PC では実行不可。V4-Flash はローカル推論可能ですが 96GB+ 統一メモリが必要です(antirez ds4 + Mac 96GB 実測 参照)。

  5. 05

    3 つの推論モードの選定:Non-think / Think High / Think Max はタスクに合わせて選択が必要で、Think Max の誤用は 384K+ コンテキスト枠を消費し、コストとレイテンシが急増します。

  6. 06

    「ほぼ無料」から「ルールのある商業プラットフォーム」へ:6 月の永久 75% 値下げ後も、ピーク・オフピーク機構によりスケジューリング戦略が新たな核心競争力となり、単純な価格比較だけでは済みません。

プレビュー版からフル版へ:完全タイムライン

日時イベント
2026-04-24V4 プレビュー版リリース + オープンソース(MIT)、V4-Pro(1.6T)と V4-Flash(284B)を含む
2026-05V4-Flash と V4-Pro の本番チューニング版リリース、API 正式利用可能
2026-06V4-Pro 価格を永久 75% 値下げ(出力 $0.87/M tokens)
2026-06-29DeepSeek が全 API ユーザーにメール送信、7 月中旬 GA リリースとピーク・オフピーク課金を初公開
2026-07-19複数の開発者が GA グレー内測資格を取得、メディアは「フル版は明日リリースの可能性」と報道
2026-07-20GA 正式版リリース(本記事公開日)
2026-07-24旧 API deepseek-chat / deepseek-reasoner 永久廃止

「V4 プレビュー版はすでに強力でしたが、フル版は Agent・数学推論・コード生成における専門的な強化と、正式な商業化課金体系を伴います。」

02

V4-Pro と V4-Flash アーキテクチャ:CSA + HCA が 100 万 token を支える仕組み

DeepSeek V4 は V2/V3 の MLA(多頭潜在注意)を廃止し、CSA + HCA ハイブリッド注意mHC 残差Muon オプティマイザを採用し、1M コンテキストをエンジニアリング上実用可能にしました。

仕様V4-ProV4-Flash
総パラメータ数1.6 兆(1.6T)2840 億(284B)
トークンあたりアクティブ490 億(49B)130 億(13B)
Transformer 層数61 層43 層
コンテキストウィンドウ1,000,000 tokens1,000,000 tokens
最大出力384K tokens384K tokens
精度FP4(エキスパート重み)+ FP8(その他)FP4 + FP8 混合
事前学習データ量33T+ tokens32T+ tokens
オープンソースライセンスMITMIT

① 圧縮スパース注意(CSA)

  • KV シーケンスを Softmax ゲート付きプーリングで 4 倍圧縮
  • FP4 精度の「ライトニングインデクサー」で top-k スパース選択:V4-Pro top-1024、V4-Flash top-512
  • 直近 128 token のスライディングウィンドウを保持
  • 1M コンテキストでの推論 FLOPs は V3.2 の 27% のみ

② 高密度圧縮注意(HCA)

  • トークンを 128 倍圧縮後にグローバル密注意で長距離依存を捕捉
  • V4-Flash は最初の 2 層が HCA、その後 CSA/HCA を交互配置。V4-Pro も同様の構造
  • KV Cache メモリは V3.2 の 10% のみ(V4-Flash は 7% まで低減)

③ mHC と Muon

  • mHC(多様体制約ハイパーコネクション):4 チャネル残差ストリーム、二重確率行列制約(Birkhoff 多面体)を満たす混合行列で 61 層深ネットワークの信号伝播を安定化
  • Muon オプティマイザ:ニュートン-シュルツ直交化勾配で AdamW を置換、収束が速く訓練が安定

3 つの推論モードとサンプリングパラメータ

モード特徴適用シーン
Non-think思考チェーンなし、超高速応答簡単な Q&A、ルーティング
Think High明示的推論(<redacted_thinking> タグ)中程度の複雑タスク、コードデバッグ
Think Max最大推論強度、384K+ コンテキスト必要複雑な数学、長チェーン Agent

公式推奨サンプリングパラメータ(全モード共通):temperature=1.0, top_p=1.0

03

ベンチマークスコア:SWE-bench 80.6% と 116 倍のコスパ差

V4-Pro は複数のベンチマークでオープンソースモデルの記録を更新しましたが、クローズドソース旗艦との差は依然あります——鍵はタスクあたりのコストです。

ベンチマークDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% ★ オープンソース最高96.0%個別未公表~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified は「実際の GitHub リポジトリのバグ修正」をテストし、V4-Pro の 80.6% は Gemini 3.1 Pro と並んでオープンソース第 1 位です。SWE-bench Pro はより厳格で、Claude Fable 5 が 80.3% でリードしています。

Artificial Analysis コスパ比較

  • Claude Fable 5:Strategy & Ops 指数タスクあたり $3.48、スコア 50 点
  • DeepSeek V4-Pro:同種タスクあたり $0.03、スコア 38 点
  • DeepSeek V4-Flash:6 カテゴリの指数タスクすべて $0.04 未満
  • コスト倍率:Fable 5 のコストは V4-Pro の 116 倍、スコアは約 12 点(31%)のみ高い
info

出典:DeepSeek 公式ドキュメント、arXiv:2606.19348、HuggingFace モデルページ、Artificial Analysis、LLMReference。

04

GPT-5.6 Sol と Claude Fable 5 との比較:選定決定マトリクス

次元DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
オープンソース✅ MIT ライセンス❌ クローズド❌ クローズド
セルフホスト可能✅ 対応
コンテキストウィンドウ1M tokens未公開1M tokens
コード能力極めて強い(Fable 5 に近い)極めて強い最強
API 出力単価(オフピーク)$0.87/M tokens~$15/M$50/M
ピーク出力単価$1.74/M tokens
Agent 能力強い、マルチ Agent オーケストレーション対応強い最強
データプライバシー✅ プライベートデプロイ可能
  • 予算重視 / 高頻度呼び出し / プライベートデプロイ:V4-Pro または V4-Flash を第一選択
  • 究極のコード能力、コスト不問:Claude Fable 5(SWE-bench Pro 最高)
  • 複雑なアルゴリズム + 数学推論:GPT-5.6 Sol / Ultra
  • 超大規模ログ/ドキュメント(低コスト):V4-Flash キャッシュヒット入力は $0.0028/M のみ

ピーク・オフピーク課金の完全価格表(CNY + USD)

GA 版で最も注目される変更:ピーク時間帯(北京時間)平日 09:00–12:00 と 14:00–18:00で料金が 2 倍になります。

モデル課金項目オフピーク(Off-Peak)ピーク(Peak)
V4-Pro入力(キャッシュヒット)¥0.025 / $0.0035 / 1M tokens2 倍
入力(キャッシュミス)¥3.00 / $0.435 / 1M tokens¥6.00 / $0.87
出力¥6.00 / $0.87 / 1M tokens¥12.00 / $1.74
V4-Flash入力(キャッシュヒット)¥0.02 / $0.0028 / 1M tokens2 倍
入力(キャッシュミス)¥1.00 / $0.14 / 1M tokens¥2.00 / $0.28
出力¥2.00 / $0.28 / 1M tokens¥4.00 / $0.56

4 つのコスト削減戦略

  1. 01

    非リアルタイムタスクをオフピークに:バッチ文書処理、データアノテーション、コードレビューを 18:00 以降または 09:00 以前に実行。

  2. 02

    キャッシュヒットを活用:繰り返し System Prompt で Prompt Cache を構築。V4-Flash キャッシュヒットは $0.0028/M でほぼ無料。

  3. 03

    Flash でルーティング:簡単な意図認識・ルーティング判断は V4-Flash、複雑な推論は V4-Pro へ。推論コストを 60–80% 削減可能。

  4. 04

    請求メールに注意:DeepSeek は課金変更の 24 時間前にメール通知を約束。アカウントメールが受信可能か確認。

ピーク時でも V4-Pro 出力単価($1.74/M)は Claude Opus 4.8($15/M)と GPT-5.6 Sol(~$15/M)より 8.6 倍安いです。

05

API 移行 6 ステップガイド:7 月 24 日期限前の必須チェックリスト

warning

重要な警告:旧モデル名 deepseek-chatdeepseek-reasoner2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59) に永久アクセス停止します。

旧モデル名新モデル名備考
deepseek-chatdeepseek-v4-flash(非思考モード)高速、軽量タスク向け
deepseek-reasonerdeepseek-v4-flash(思考モード)または deepseek-v4-proPro にアップグレードでより強い推論
  1. 01

    リポジトリ全体で旧モデル名を検索:コードベースで deepseek-chatdeepseek-reasoner を検索。環境変数と CI 設定も含む。

  2. 02

    移行マッピングを決定:軽量対話 → deepseek-v4-flash。旧 reasoner ワークフロー → Flash 思考モードまたは deepseek-v4-pro

  3. 03

    OpenAI SDK 呼び出しを更新:model パラメータのみ変更。思考モードは extra_body で有効化(下記コード参照)。

  4. 04

    Anthropic SDK 互換性を検証:base_urlhttps://api.deepseek.com のまま、model を更新するだけ。

  5. 05

    Staging 回帰テスト:7 月 24 日までにステージング環境でコア Agent / RAG パイプラインを実行し、ピーク・オフピークの請求が想定通りか確認。

  6. 06

    本番グレーデプロイ:トラフィック比率で段階的に新モデル名へ切り替え、期限前までロールバックスイッチを保持。

  7. 07

    Think Max コンテキスト確認:Think Max を有効にする場合、コンテキストウィンドウを 384K+ に設定し、推論の切り捨てを回避。

python
# ❌ 旧写法(7月24日以降無効)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# ✅ 新写法
client.chat.completions.create(
    model="deepseek-v4-pro",          # または deepseek-v4-flash
    messages=[...],
    # 思考モードの制御:
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
python
# Anthropic SDK 接続
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

引用可能なハードデータ(EEAT)

  • KV Cache 圧縮:1M コンテキストで V4-Pro の KV メモリは V3.2 の 10%、V4-Flash は 7%
  • 推論 FLOPs:CSA により 1M シナリオの FLOPs は V3.2 の 27% に低減
  • 6 月永久値下げ:V4-Pro 出力は原価から $0.87/M(75% off)に、その後ピーク・オフピーク機構を追加
  • 同時実行上限:V4-Pro デフォルト 500 同時実行、中規模 Agent クラスターはエンタープライズ営業不要

DeepSeek V4 GA によりクラウド API コストは大幅に低下しましたが、ローカルで V4-Flash を実行するには 96GB 統一メモリ Macが必要で、安価な Linux VPS では xcodebuild、notarytool などの macOS ツールチェーンを実行できません。チームがクラウド DeepSeek API 呼び出しiOS CI/CD / CLI Agent 長セッションを同時に運用する場合、macOS の重いワークロードを専有リモートノードに置く方がローカルハードウェアに賭けるより安定します——API 料金がいくら安くても Keychain 分離と SSH セッション安定性の問題は解決しません。安定した SSH 長セッションと予測可能な帯域が必要な本番環境では、NodeMini の Mac Mini クラウドレンタルが通常最適解です。V4 のピーク・オフピーク価格がどう変動しても、実行層ノードは変わりません。仕様は レンタル料金、オンボーディングは ヘルプセンター を参照。ローカル Flash 推論は antirez ds4 + 96GB Mac レンタル実測 を参照。

最終更新:2026-07-20。7 月 24 日までに API 移行を完了してください。

FAQ

よくある質問

アーキテクチャは変わらず、GA 版は Agent・数学推論・コード生成で専門的に強化され、初めてピーク・オフピーク課金を導入しました。旧モデル名は 7 月 24 日に廃止されます。移行期間中は レンタル料金 を参照して Agent 実行層の予算を計画できます。

北京時間の平日 09:00–12:0014:00–18:00 がピーク(料金 2 倍)。非リアルタイムタスクは 18:00 以降または 09:00 以前に、Prompt Cache を活用し、簡単なタスクは V4-Flash でルーティング。

deepseek-chatdeepseek-v4-flash(非思考)。deepseek-reasoner → Flash 思考モードまたは deepseek-v4-pro。期限は 7 月 24 日 23:59 北京時間

SWE-bench Verified で V4-Pro の 80.6% はオープンソース最高ですが、Claude Fable 5 は 96% です。コストとセルフホストを重視するなら、V4-Pro 出力 $0.87/M は GPT-5.6 Sol の約 1/17。究極のマルチファイル修正を求めるなら Fable 5 が依然リード。リモート開発環境の詳細は ヘルプセンター を参照。

可能です。ds4 は 96GB 統一メモリ Mac 上で V4-Flash(284B/13B アクティブ)を実行できます。V4-Pro(1.6T)はクラウド vLLM/SGLang が必要。詳細は antirez ds4 Mac レンタル実測 を参照。

簡単な Q&A は Non-think。コードデバッグは Think High。複雑な数学と長チェーン Agent は Think Max(384K+ コンテキスト必要)。全モード推奨 temperature=1.0, top_p=1.0