DeepSeek V4 Flash 0731 正式公開|ProをAgentベンチで超えた仕組みと限界
「月1000ドルかけていたClaudeのワークロードが、同じ品質で47ドルになった」
Hacker Newsのスレッドにそんなコメントが流れたのは2026年7月31日の深夜のことだ(出典: Hacker News、2026年7月31日)。その日、DeepSeekはV4 Flash APIのパブリックベータを静かに公開した。
リリースノートに派手さはなかった。変わったのは再ポストトレーニングのみ。アーキテクチャも規模も同じ284Bパラメータのまま。しかしベンチマーク数値は激変し、フラッグシップの「Pro」モデルを9つのエージェントベンチすべてで上回った(出典: TechTimes、2026年7月31日)。
価格は変わらず、入力0.14ドル/出力0.28ドル(100万トークンあたり)。Claude Sonnet 5の9月以降の標準価格との比較で入力21分の1、出力53分の1だ。
- LLM APIコストを削減したいエンジニア・PM
- DeepSeekをエージェントワークフローに組み込んでいる開発者
- V4 FlashとV4 Proどちらを選ぶか迷っている人
V4 FlashがV4 Proを超えた、何が起きたか
DeepSeek V4 Flash 0731はアーキテクチャを一切変えていない。パラメータ数は284B、アクティブパラメータは13B(MoE: Mixture of Experts、入力ごとに一部のパラメータのみを活性化する効率的なアーキテクチャ)のまま。変わったのは「再ポストトレーニング」だけだ。
ポストトレーニングとは、事前学習済みモデルに対して強化学習などでタスク固有の能力を磨く工程だ。DeepSeekはエージェントタスクに特化してこの工程を再実施し、性能を跳ね上げた(出典: MarkTechPost、2026年7月31日)。
既存ユーザーへの影響はゼロだ。エンドポイント、APIキー、モデル名(deepseek-v4-flash)は変わらず、更新は自動適用された。マイグレーション作業なしに性能向上を受け取れる設計は、開発者体験への配慮を示している。
9つのベンチマークの数値を読む
DeepSeekが公表したエージェント系ベンチマークの主要数値は以下だ(出典: DeepSeek Official、2026年7月31日)。Terminal-Bench 2.1はエージェントがターミナル操作を通じてコーディングタスクを自律的に完了する能力を評価するベンチマークで、エージェントワークフローの実用性を測る指標として注目されている。
| ベンチマーク | Flash Preview | V4 Pro Preview | Flash 0731 |
|---|---|---|---|
| Terminal-Bench 2.1 | 61.8 | 72.1 | 82.7 |
| DeepSWE | 7.3 | — | 54.4 |
| DSBench-FullStack | 37.0 | — | 68.7 |
| Cybergym | — | — | 76.7 |
| Toolathlon | — | — | 70.3 |
DeepSWEのスコアが7.3から54.4へ645%改善した数値が特に目を引く。ソフトウェアエンジニアリングタスクの自律的な達成度を評価するこのベンチマークで、Flash PreviewはProに大きく劣っていた。その差が一気に逆転した。
重要な注意点がある。これらの数値はすべてDeepSeek自身が自社ハーネスで計測した自己申告値だ。DSBench系は非公開の評価環境で実施され、Hacker News上でも「自己採点テストの結果をそのまま信じていいのか」という指摘が複数出ていた(出典: Hacker News、2026年7月31日)。
コスト比較: 月1000ドルが47ドルになる計算
V4 Flash 0731の価格は入力0.14ドル/出力0.28ドル(100万トークンあたり)で、パブリックベータ後も変わっていない(出典: Artificial Analysis、2026年7月31日)。
| モデル | 入力 $/1M | 出力 $/1M |
|---|---|---|
| DeepSeek V4 Flash 0731 | $0.14 | $0.28 |
| DeepSeek V4 Pro | $0.43 | $0.88 |
| GPT-5.6 Luna | $1.00 | $2.00 |
| Claude Sonnet 5(9月以降) | $3.00 | $15.00 |
Claude Sonnet 5の標準価格と比べると、出力トークンで53倍の差になる。エージェントワークフローは出力側のトークン消費が多いため、このコスト差が利益率に影響しうる。
Hacker Newsスレッドで開発者のHassan(@nutlope)は「コスト対性能比で現状最良のモデル」とコメントした(出典: Hacker News、2026年7月31日)。一方で「安さに釣られて設計を変えると、実際のタスクで想定より性能が出ないことがある」という慎重な意見も同スレッドに複数見られた。
Codex / Responses APIネイティブ対応で変わること
V4 Flash 0731でもう一つ重要な変更はOpenAIのResponses API形式への対応だ。VS CodeのCodex拡張、ChatGPTデスクトップアプリ、Codex CLIのバックエンドとして、設定ファイルの変更だけでV4 Flash 0731を利用できるようになった(出典: explainx.ai、2026年7月31日)。
DeepSeekはCodexとの統合手順を公式ドキュメントに掲載しており、Codex CLIからデスクトップアプリ、IDE拡張まで同じ設定で対応する。既存のOpenAI系ツールを使っているチームが、コードをほぼ変えずにバックエンドを切り替えられる選択肢が生まれた形だ。
重みはHugging FaceにApache 2.0ライセンスで公開されており、セルフホスト版を自社サーバーで運用することも可能だ(出典: Simon Willison、2026年7月31日)。
使う前に整理しておくべき3つの懸念
コスト優位が魅力的なのは事実だが、V4 Flash 0731には明確なトレードオフが3つある。
自己申告ベンチマークの信頼性。今回の9ベンチのうちDSBench系はDeepSeek自社製の評価セットだ。SWE-bench Verifiedでもデータのブレが見られ、DeepSeekの公式レポートでは73.7%だが、緩いハーネスで集計した数値は79.0%になる(出典: MorphLLM、2026年7月31日)。実務での性能は自分のユースケースで直接試すことが前提になる。
データ主権と中国サーバーの問題。DeepSeekのホストAPIを経由するデータは中国国内のサーバーで処理される。中国の国家情報法は対象企業が国家安全機関の情報収集に協力することを義務付けており、GDPR対象事業、HIPAA対象医療、政府・防衛関連の情報を扱う場合、ホストAPIは適切ではない(出典: byteiota、2026年7月31日)。Apache 2.0ライセンスのセルフホスト版か、規制対応のあるプロバイダ経由での運用が必要だ。
最高品質が必要なタスクでの限界。Terminal-BenchではClaude Opus 4.8が約85.0に対してV4 Flash 0731は82.7で若干下回る。コスト優位は大きいが、最上位の推論精度が求められる場面ではまだ差がある(出典: Artificial Analysis、2026年7月31日)。
スケールするエージェントワークフロー、コスト感度の高いプロダクト、データ規制がない開発・試験環境では有力な選択肢だ。逆に規制環境、最高精度要件、プロプライエタリデータを扱う本番環境では慎重に判断する必要がある。
- 公開日: 2026年7月31日(パブリックベータ)
- 構造: 284B MoE、アクティブ13B(アーキテクチャ変更なし)
- 価格: 入力$0.14 / 出力$0.28(100万トークンあたり)
- Terminal-Bench 2.1: 82.7(V4 Pro Preview: 72.1 / Flash Preview: 61.8)
- DeepSWE: 54.4(Flash Preview比 645%改善)
- DSBench-FullStack: 68.7(Flash Preview: 37.0)
- Responses API対応: あり(Codex CLI / VS Code拡張 / ChatGPTデスクトップ)
- ライセンス: Apache 2.0(セルフホスト可)
- 注意: 全ベンチマークはDeepSeek自己申告値
DeepSeek vs Claude|コスト設計の判断材料をそろえる
V4 Flash 0731のコスト優位をどう活かすかは、ワークフロー設計次第だ。AIコーディングエージェントの選び方とDeepSeek V4 Proの価格戦争記事も合わせて読むと判断しやすい。
関連記事
- Claude Sonnet 5 エージェントガイド2026(V4 Flash対抗のAnthropicモデルを比較する)
- DeepSeek V4 Proレビュー 2026年4月版(Flashの前身モデルとの違い)
- AIエージェント時代の開発者ロール変化(エージェントワークフロー設計の視点)
本記事はDeepSeekの公式発表、Hacker News、TechTimes、Artificial Analysis、Simon Willisonのブログ等の情報をもとに執筆した。ベンチマーク数値はDeepSeekの自己申告値であり、独立した第三者検証が完了していない。価格は変更になる可能性がある。本記事の情報は参考目的であり、特定製品の導入を推奨するものではない。ビジネス上の判断は自組織の状況をもとに判断されたい。APIのデータ処理に関する規制対応は、各組織の法務・コンプライアンス担当部門に確認されたい。