DeepSeek V4.1 Flash完全解説|GPT-6 Astraの最大83倍安いAIは本物か
- DeepSeek V4.1 Flashの性能と価格を正確に把握したいエンジニア・開発者
- GPT-6 AstraやClaude Fable 5.1との使い分けを検討しているPM・CTOクラス
- 中国製AIのリスクを整理してチームに説明する必要がある技術担当者
「出力トークンがGPT-6 Astraの83倍安い。それでコーディングベンチマークはほぼ同等」。2026年9月10日、DeepSeekがV4.1 Flashをリリースした直後、開発者コミュニティはこの数字をどう受け取っていいか迷った。
「さすがにまた誇大広告だろうと思ってDeepSWE回したら、74.2%出て口が開いた」(HackerNews、u/ksprite11)。「V4 Proのときは75%値下げ→翌四半期に実質値上げというパターンを食らったので今回は様子見している」(Reddit r/LocalLLaMA)。「キャッシュヒット$0.003/Mは破格。ただし個人情報を含むプロジェクトには当然使えない」(note.com、伊藤正章)。
熱狂と懐疑が同時に走る。それがV4.1 Flash登場直後の空気だ。
何が変わったか:V4 FlashとV4.1 Flashの差
V4.1 Flashは名前が似ているが、前作V4 Flash(2026年7月31日版)から中身が大きく変わっている。
最大の変更点はアーキテクチャだ。従来の均一なMoE構造から、**Causal Encoder-Decoder(CED)**と呼ばれる新設計に移行した。40層のTransformerを「エンコーダー20層+デコーダー20層」に分割し、入力(プレフィル)と出力(デコード)で活性化パラメータ数を分けた。
| 項目 | V4 Flash(0731版) | V4.1 Flash |
|---|---|---|
| 総パラメータ | 284B | 552B |
| プレフィル時活性化 | 13B(均一) | 8B |
| デコード時活性化 | 13B(均一) | 16B |
| マルチモーダル | ✗(別モデル) | ✓(ネイティブ) |
| コンテキスト | 128K | 1M |
| Terminal-Bench 2.1 | 82.7 | 90.6 |
| DeepSWE v1.1 | 54.4% | 74.2% |
(出典:DeepSeek API公式ドキュメント、latent.space AINews、2026年9月10日)
「エンコーダーで文脈を圧縮してからデコーダーに渡す」という分業により、KVキャッシュのメモリ使用量は前バージョン比で約75%削減されたと報告されている(出典:latent.space AINews、2026年9月10日)。総パラメータは2倍に増えながら、推論コストは下がるという逆説的な設計だ。
ネイティブ画像理解が統合されたことで、画像入りのコードベース解析やUIスクリーンショットからのコード生成が単一モデルで完結するようになった。V4 Flashではテキスト専用とVision別モデルに分かれていた。
ベンチマークの実態:どこで勝ち、どこで負けるか
DeepSeekが公表するスコアは印象的だ。だが独立した評価と並べると、より正確な位置づけが見える。
アジェンティックコーディング(DeepSeekの得意領域)
| ベンチマーク | V4.1 Flash | GPT-6 Astra | Claude Opus 5 |
|---|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 非公開 | 89.1 |
| DeepSWE v1.1 | 74.2% | 非公開 | 74.0% |
| CyberGym | 88.1% | 非公開 | — |
| SWE-bench Verified | — | — | — |
(出典:DeepSeek公式、officechai.com、flowtivity.ai。GPT-6 Astraはこれらのベンチに非公開)
総合スコア(LLM Stats複合指標)
- GPT-6 Astra: 59.9
- Claude Fable 5.1: 55.9
- DeepSeek V4.1 Flash: 51.8
アジェンティックコーディングの特定ベンチマークでは米国勢と競れるが、総合的な性能では約8ポイント差が存在する。
注意すべき点が1つある。MindStudioのエンジニアが「DeepSeekの公開ベンチマークは社内計測だが、外部での手動テストでは同一スコアを再現できない」と指摘している(MindStudio技術ブログ、2026年9月12日)。自社ベンチマークと第三者評価のギャップはDeepSeekに限らないが、この数字をそのまま鵜呑みにすることは推奨しない。
価格の実態:「83倍安い」の条件と落とし穴
V4.1 Flashの最も注目すべき数字は価格だ。
| モデル | 入力 $/1Mトークン | 出力 $/1Mトークン | キャッシュヒット |
|---|---|---|---|
| DeepSeek V4.1 Flash(オフピーク) | $0.15 | $0.60 | $0.003 |
| DeepSeek V4.1 Flash(ピーク) | $0.30 | $1.20 | — |
| Claude Fable 5.1 | $10.00 | $50.00 | — |
| GPT-6 Astra | $10.00 | $50.00 | — |
| Gemini 3.8 Flash | 未公表 | 未公表 | — |
(出典:DeepSeek APIドキュメント、Spheron.network、2026年9月時点)
オフピーク時の出力トークン比較では、$0.60/M対$50/Mで計算すると最大83倍の差になる。ただしいくつかの条件がある。
ピーク・オフピーク問題: 価格はピーク時に2倍になる。DeepSeekはオフピーク帯を明示していないが、UTCで08:00〜20:00(日本時間17:00〜05:00)がピーク帯とされている。日中の業務時間での稼働は$0.30/$1.20の計算になる。
価格の歴史的ブレ: DeepSeek V4 Proは2026年5月に「永久」値下げを発表したにもかかわらず、8月の価格改定でオフピーク出力価格が$0.87/Mから$1.98/Mへ実質128%増となった。V4.1 Flashの「$0.15/M」という価格が6か月後も維持されるかは保証がない。詳細はDeepSeek V4-Pro価格戦争の経緯と8月値上げの経緯を参照。
9月14日以降の変更: V4 Proへの既存APIリクエストは9月14日04:00 UTC以降、自動的にV4.1 Flashにルーティングされ、V4.1 Flash料金が適用される。V4 Proからの移行組にとっては実質値下げだが、契約ベースで課金管理している企業は請求書の単価が変わる点に注意が必要だ。
中国データ問題:何が起きているか
DeepSeekのホストAPIを使う場合、プロンプトは中国国内サーバーを経由する。この点について楽観的な見方は難しい。
確認されている事実:
- 韓国の個人情報保護委員会(PIPC)は2026年初頭、DeepSeekがユーザーの同意なしにプロンプトをBeijing Volcano Engine Technology(ByteDanceグループ)に転送していたと確認した
- 中国の国家情報法(2017年)により、中国企業は当局からの情報提供要請に応じる法的義務を持つ
- 政府機関でのDeepSeek使用禁止措置:オーストラリア(連邦デバイス)、台湾(完全禁止、自己ホスティングも含む)、チェコ共和国(公共行政)
「中国製AIを使うな」という短絡的な主張をしたいわけではない。問題はどのデータを送るかだ。公開情報の要約、コードレビュー(機密情報を除く)、汎用的な質問応答など、送信内容が問題にならないユースケースでは、コスト効率のメリットは現実的に大きい。一方、個人情報、医療データ、未公開の事業情報を含むプロンプトにホストAPIを使うことは、現状のリスク状況を踏まえると推奨できない。
→ 参考:中国AI規制と渡航禁止令の背景
オープンウェイトの現実:「自分で動かせるか」
DeepSeekはV4.1 Flashのウェイトを9月10日に同時リリースした。MITライセンスで商用利用も改変も自由だ。これによりホストAPIのデータリスクを回避する手段が存在する。
ただし実際にセルフホスティングするには以下のハードルがある。
ハードウェア要件: 最低8台のデータセンター向けGPU(合計約614GB VRAM)が必要だ。V4 Flashは2×H200で動いたが、V4.1 Flashはその3倍以上のVRAMを要求する。コンシューマー向けGPUでのローカル実行は現実的でない。
量子化の難しさ: ウェイトはFP4形式でエキスパートが圧縮されており、通常のINT4/INT8量子化パイプラインがそのまま適用できない。コミュニティでFP8版は公開されているが、Q4_K_Mレベルの軽量化はまだ開発中だ。
ファインチューニング: 新しいCEDアーキテクチャ向けのファインチューニングレシピはまだ存在しない。vLLM(公式)、SGLang、llama.cpp移植版が推論環境として対応済みだが、追加学習は今後の課題だ。
「コンプライアンス上、自社で動かすしかない大企業にとってはまだ敷居が高い。ただMITが付いている意味は大きく、1〜2四半期で状況は変わる」(crystal-method.com、エンタープライズリスクフレームワーク記事、2026年9月)。
9月第1週に何が起きていたか:5モデルが10日で乱立
V4.1 Flashの位置づけを理解するには、リリースされた週のコンテキストが欠かせない。
2026年9月1〜11日の10日間で以下のモデルが相次いでリリースされた。
- 9月1日: Claude Fable 5.1 + Mythos 5.1(Anthropic)、キャッシュ読み込み価格75%カット
- 9月2日: Gemini 3.8 Flash(Google)、Muse Spark 1.3(Meta)
- 9月3日: GPT-6 Astra(OpenAI)、ExploitBench 100%達成でCritical安全閾値に到達(出典:OpenAI GPT-6 Astra System Card)
- 9月10日: DeepSeek V4.1 Flash(DeepSeek)
DeepSeekが9日間遅れてリリースしたのは偶然ではないという見方もある。GPT-6 AstraとClaude Fable 5.1の価格・性能が確定したタイミングで、それとの価格差を最大限に見せて登場する、という戦略的な遅延という指摘だ。実際、すべての比較記事がV4.1 FlashをGPT-6 AstraおよびClaude Fable 5.1と直接比較する形になった。
→ 関連:GPT-6 Astra完全ガイド / Claude Fable 5.1リリース解説 / DeepSeek V4 Flash前バージョン評価
現時点で有効な使い方は以下のパターンだ。
向いているケース:
- 機密情報を含まない大量のコードレビュー・補完(コスト削減効果が大きい)
- マルチモーダルを使ったUIスクリーンショット→コード生成
- 長文ドキュメントの要約・分類(1Mコンテキストを活かせる)
- 社内ホスティングでセキュリティを確保した上でのRAGアプリ
向いていないケース:
- 個人情報・医療・金融データを含むプロンプト
- 高い推論精度が要求されるタスク(総合スコアでGPT-6 Astraに8ポイント劣る)
- ベンチマーク上の数字をそのまま要件にしている仕様
DeepSeek V4.1 Flashの正確な価格・利用規約はDeepSeek APIドキュメントで確認を。料金はピーク/オフピーク帯で変わるため、本番導入前にコスト試算を行うこと。
本記事の価格・ベンチマーク数値は2026年9月16日時点の公開情報に基づく。DeepSeekの価格は過去に予告なく変更された実績があるため、最新情報は公式ドキュメントで確認すること。ベンチマーク数値にはDeepSeek社の自己申告値を含み、第三者による完全な再現性は保証されない。本記事は情報提供を目的としており、特定製品の導入・投資判断の根拠として利用することは推奨しない。本記事はDeepSeekおよびいかなるAI企業とも利害関係を持たない。