2026年7月31日、DeepSeek は V4-Flash-0731 を公式版として API 公開しました。新モデルではなく、4月プレビュー版と同一の284B総パラメータ・13B活性化に対し、後訓練(post-training)のみを刷新したアップデートです。Agent系ベンチマークでは自社 V4-Pro プレビュー版を大幅に上回り、Claude Opus 4.8 と比較して入力単価は最大約179倍、出力は約89倍安いと報じられています。本記事はAgent選定とAPIコスト最適化に関心のある開発者向けに、4月から7月までのタイムライン、公式ベンチマークと価格表、自研Agentフレームワーク Harness、Artificial Analysis 第三者データ、Kimi K3 / Qwen3.8-Max との横断比較、ベンチマーク論争と「斬殺線」背景、6ステップ評価チェックリストと FAQ を網羅します。核心ポイント:公式Agentスコアは未公開の Harness minimal mode で測定されており、公式自身もハーネス依存性を明記しています。V4-Pro 公式版と Harness の公開日は未確定です。
DeepSeek V4 の展開は単発リリースではなく、3か月以上にわたる連続アップデートです。Kimi K3 や Qwen3.8-Max との競合文脈で整理すると、以下の流れが見えてきます。
| 日付 | イベント |
|---|---|
| 4月24日 | DeepSeek-V4 プレビュー版を MIT ライセンスでオープンソース公開。V4-Pro(1.6T/49B活性化)と V4-Flash(284B/13B活性化)、いずれも100万Tokenコンテキスト |
| 5〜6月 | 本番チューニング版リリース、V4-Pro 価格を永久75%値下げ(出力 $0.87/M)。詳細は V4 フル版 GA 解説 を参照 |
| 7月20日 | V4 フル版 GA。ピーク・オフピーク課金を初導入 |
| 7月24日 | 旧モデル名 deepseek-chat と deepseek-reasoner を永久廃止。全トラフィックを V4 系列へ移行 |
| 7月27日 | 月之暗面が Kimi K3(2.8T)のウェイトを Hugging Face に公開。DeepSeek に競争圧力 |
| 7月31日 | V4-Flash-0731 公式版を API 公開ベータとして投入。同一アーキテクチャ・同一パラメータで後訓練のみ刷新。Hugging Face に MIT ウェイト同期。changelog で自研 Agent フレームワーク Harness を初披露(「近日公開」)。API のみで App・Web は未更新 |
| 8月5日(執筆時) | V4-Pro 公式版は「できるだけ早く公開」のみ。8月10〜20日 GA という報道は未確認の噂 |
deepseek-chat への呼び出しは 404 になります確認のお願い:本記事のデータは2026年8月5日時点のものです。V4-Pro 公式版の公開時期、Harness のリリース、第三者再テスト結果は随時更新される可能性があります。本番移行前は DeepSeek 公式 changelog と独立評価を必ずご確認ください。
| 項目 | V4-Flash-0731 |
|---|---|
| 公開日 | 2026年7月31日(公式版 API ベータ) |
| 総パラメータ / 活性化 | 284B / 13B(4月プレビュー版と同一) |
| アーキテクチャ変更 | なし。性能向上は後訓練のみ |
| コンテキストウィンドウ | 100万Token(最大出力 384K) |
| ライセンス | MIT(Hugging Face でウェイト公開済み) |
| 入力価格(キャッシュミス / ヒット) | $0.14 / $0.0028(100万Tokenあたり、オフピーク) |
| 出力価格 | $0.28 / 100万Token(オフピーク) |
| 国内価格(オフピーク) | 入力 1元 / 0.02元、出力 2元(100万Tokenあたり) |
| Terminal Bench 2.0(DeepSeek自社テスト) | 82.7(V4-Pro プレビュー版 67.9 を大幅に上回る) |
| SWE-bench Verified(DeepSeek自社テスト) | 公式表に記載。第三者再現は進行中 |
| 測定ハーネス | 自研 Harness minimal mode(未公開)。max推論・top_p=0.95・temperature=1.0 |
| Artificial Analysis Intelligence Index | 50(第三者独立評価) |
| Artificial Analysis 単タスク平均コスト | $0.03 |
注:「DeepSeek自社テスト」と記載のデータは changelog と公式発表に基づきます。Artificial Analysis の Intelligence Index と単タスクコストは第三者機関のデータで、評価方法と重みが異なるため直接加算比較はできません。
21世紀経済報道などの報道によれば、V4-Flash-0731 の公式価格は Claude Opus 4.8 と比較して、キャッシュミス入力で約36倍、キャッシュヒット入力で約179倍、出力で約89倍安いとされています。いずれもベンダー公表のリスト価格であり、独立監査ではありません。
今回最も見落とされがちな点は、V4-Flash-0731 が4月プレビュー版とパラメータ規模・モデル構造が完全に同一であることです。DeepSeek は性能向上が「後訓練の再実施のみ」に由来すると明言しており、これは「より強い=より大きい」という業界の常識に逆行します。284B/13B の Flash が、同ファミリーの 1.6T/49B V4-Pro プレビュー版を複数の Agent ベンチマークで上回った事実は、2026年後半の大規模言語モデル競争において後訓練データ品質と手法の重要性がパラメータ規模に迫っていることを示しています。
技術報告書『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』に基づくアーキテクチャ要素は4月から据え置きです。
これらは効率化の基盤であり、0731 の性能ジャンプの直接原因ではありません。直接原因は後訓練パイプラインの刷新です。
7月31日の changelog で初めて DeepSeek Harness が公式に名指しされました。ファイル読み書き、ツール呼び出し、コマンド実行、エンドツーエンドのエンジニアリングタスクを担う Agent 実行フレームワークで、Claude Code に対抗する位置づけです。これまで DeepSeek のモデルは Claude Code や OpenCode など第三者 Agent ツールに依存してきました。
重要なのは、V4-Flash-0731 の Agent 系ベンチマーク(Terminal Bench 2.0、Toolathlon など)がすべて未公開の Harness minimal mode で測定されたことです。公式 changelog には「Agent スコアはハーネス(実行フレームワーク)の選択に極めて敏感であり、モデル能力の向上と単純に同一視できない」と明記されています。この一文は、見出し数字だけを鵜呑みにしないよう読者に注意を促しています。
「パラメータを積まなくても Agent 能力を大幅に引き上げられる」——V4-Flash-0731 はこの命題の実証例です。ただし、その実証は自社ハーネス上での結果であり、Claude Code や Cursor での再現はまだ待たれる段階です。
旧モデル名の残存を確認する:コードベース全体で deepseek-chat と deepseek-reasoner を検索してください。7月24日以降、これらは 404 を返します
API とローカル推論を区別する:API は deepseek-v4-flash が自動的に 0731 公式版を指します。ローカル展開には ds4 + 96GB Mac などの環境が必要です
コスト基準線を設定する:オフピーク $0.14/$0.28 とキャッシュヒット $0.0028 で月間Token請求を試算し、Kimi K3($3/$15)や Qwen3.8-Max($2/$6)と対照してください
自社業務でA/Bテストを行う:公式ベンチマークだけで移行しないでください。実際のコードベースと Agent ワークフローで現行モデルとブラインド比較を実施してください
Harness 公開と第三者再現を追跡する:DeepSeek Harness の公開、Artificial Analysis の更新、コミュニティによる Claude Code / Cursor での再テスト結果を注視してください
ピーク課金とキャッシュ戦略を設計する:北京時間ピーク帯(09:00–12:00、14:00–18:00)の2倍料金と、入力キャッシュヒット率の実測値をモニタリングしてください。海外開発者からはキャッシュヒット率が低いとの報告もあります
V4-Flash-0731 の更新は、中国オープンソース大規模言語モデル最密集の公開ウィンドウに位置します。Artificial Analysis の第三者データと DeepSeek 自社ベンチマークを分けて整理します。
| モデル | ベンダー | 総パラメータ | AA Intelligence Index | AA 単タスクコスト | ウェイト |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 284B | 50 | $0.03 | MIT 公開済み |
| Kimi K3 | 月之暗面 | 2.8T | 57 | $0.86 | 7/27 公開 |
| GLM-5.2 | 智谱/Z.ai | ~744B | V4-Flash より約1点高 | 未確認 | MIT 公開 |
| Qwen3.8-Max | アリババ | 2.4T / 950億活性化 | 未確認 | 未確認 | 未公開(約束中) |
| GPT-5.6 Sol | OpenAI | 非公開 | V4-Flash より9点以上高 | $1.86 | クローズド |
| Claude Fable 5 | Anthropic | 非公開 | V4-Flash より9点以上高 | $3.15 | クローズド |
興味深い逆説:Artificial Analysis の独立指数では、V4-Flash は Kimi K3(57点)や GLM-5.2 よりスコアが低い場合があります。しかし単タスクコストは Kimi K3 の約1/29、GPT-5.6 Sol の約1/62、Claude Fable 5 の約1/105です。DeepSeek が狙っているのは「ベンチマーク1位」ではなく、十分な知能+極端な低価格の組み合わせです。これがプレビュー版が OpenRouter で7週連続トップの呼び出し量を記録した背景でもあります。
データ出典の区別:Intelligence Index と単タスクコストは Artificial Analysis(第三者)のデータです。Terminal Bench 2.0 の 82.7 点などは DeepSeek 自社 Harness 上のベンダー自報です。混同しないよう、選定判断では両方を別軸で扱ってください。
中国の AI 開発者コミュニティで流通する「斬殺線」という概念は、DeepSeek の「十分な性能+極端な低価格」の組み合わせが、競合にとっての生存閾値を引き上げたという認識を表します。性能が DeepSeek を明確に上回らず、かつ価格でも下回れないモデルは、市場での存在感を失うリスクがある——という読み方です。
V4-Flash-0731 公開前、V4-Pro の「7月中旬全量公開」が遅延したことで、創業者の梁文鋒氏を「梁白開」(空約束の谐音)と揶揄する声がありました。公式版の実績が期待を上回った後、「梁圣」(聖人の谐音)と呼び返すコミュニティの反転も、中国 AI 界の感情の速さを示す面白い指標です。
この文脈で、同期に GPT-5.6 Luna 廉価版の80%値下げや、Kimi K3・Qwen3.8-Max の密集公開が起きていることも理解しやすくなります。21世紀経済報道が引用した AI 起業インキュベータ関係者の言葉——「すべての大模型企業は梁文鋒の前を走らなければならない。どんな方法でも、DeepSeek の前に立たなければ生き残れない」——は誇張に聞こえますが、2026年夏の価格戦の実感とは一致する部分があります。
7月31日の V4-Flash 公式版公開当日、NVIDIA・Broadcom・AMD などの算力チップ株に大きな変動はありませんでした。2025年初頭の DeepSeek-R1 公開時に世界の AI チップ株が急落した場面とは対照的です。市場は「より少ない算力で同等の効果」という DeepSeek 式の効率化叙事を、もはや異常事態ではなく通常のエンジニアリング進歩として受け止め始めている——とも読めます。
V4-Flash-0731 を Claude Code や OpenClaw などの長セッション Agent に接続する場合、ノートPCや不安定な Linux VPS 上で CLI を動かすと、メモリ不足やセッション中断に直面しがちです。API コストがいくら安くても、iOS CI/CD や Xcode ツールチェーンの要件は変わりません。ローカルで Flash を推論する場合は 96GB 以上の統一メモリ Mac が必要で、antirez ds4 + 96GB Mac レンタル実測 が参考になります。安定した SSH 長セッションと macOS ネイティブツールチェーンが必要な本番環境では、NodeMini の Mac Mini クラウドレンタルがより適した選択となることが多いです。詳細は Mac Mini レンタル料金 をご覧ください。接続方法は ヘルプセンター を参照してください。
データ出典:DeepSeek 公式 API ドキュメントと changelog、技術報告書『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』、Hugging Face モデルカード、Artificial Analysis、21世紀経済報道、Moonshot AI・智谱・アリババ公式発表。公開前に最新の公式発表をご確認ください。
ネイティブ100万Tokenコンテキストと、長コンテキスト時の計算・メモリコストの大幅削減(公式:V4-ProはV3.2比でFLOPs 27%、KV Cache 10%)が最大の違いです。加えてV4シリーズはAgent能力を重点強化し、Claude CodeやOpenCodeなど主要Agentツールに対応しています。
通常の対話、単純タスク、大規模・低コスト呼び出しには V4-Flash-0731 のコスパが高く、AgentベンチマークでもV4-Proプレビュー版を上回っています。より深い推論が必要で予算に余裕がある場合は、V4-Pro公式版の公開を待つか、プレビュー版で先行評価してください。ローカル推論の環境構築は ds4 + 96GB Mac ガイド を参照できます。
2026年8月5日時点では利用できません。公式版として公開されているのはV4-Flash-0731のみで、API限定です。AppとWebチャットは旧バージョンのままです。V4-Pro公式版と自研Harnessは「できるだけ早く公開」との公式表現のみで、8月10〜20日 GA などの具体的日付は未確認の噂です。
SWE-bench Verifiedなど広く採用されたベンチマークは参考になりますが、Terminal Bench 2.0などのAgent系スコアは未公開の自社Harness minimal modeで測定されています。公式自身もハーネス選択に極めて敏感であると注意喚起しており、Claude CodeやCursorでの独立再現を待つか、自社業務でA/Bテストすることをお勧めします。
OpenAI ChatCompletionsやAnthropic形式で既に接続している場合、コード変更なしで deepseek-v4-flash が新公式版を指します。旧名称は7月24日に廃止済みのため、未移行の本番トラフィックは早急な切り替えが必要です。Agent実行環境の構築については Mac Mini レンタル料金 と ヘルプセンター をご参照ください。