GPT-6 Astra完全解説|AGI宣言・Fable 5.1比較・Critical指定の現実
- GPT-6 AstraとClaude Fable 5.1のどちらを業務に使うか判断したい開発者・PM
- 「AGI到来」という報道の中身を冷静に評価したいAI実務者
- AstraのCriticalサイバー指定がセキュリティに与えるリスクを把握したい情報セキュリティ担当者
「今日の朝に起きたら、Xのタイムラインが全部Astraの話になってた。ChatGPTが落ちている最中にOpenAIが新モデルをリリースするとは思わなかった」——ある開発者が9月3日の夜にそう書いた。
同じ9月3日、ChatGPT・Claude・Grokが同時ダウンする障害が起きた(詳細記事)。その混乱が収まる前に、OpenAIはGPT-6 Astraの限定プレビューを開始した。OpenAI共同創業者のグレッグ・ブロックマンは「私個人的にはOpenAIがAGIに到達したと思う。このモデルがそれかもしれない」と述べた(Axios、2026年9月3日)。
「世界で最も高性能で整合性の取れたモデル」。これがOpenAIの自己評価だ。独立評価機関は別の数字を出している。
GPT-6 Astraとは何か——Criticalパウスからリリースまでの経緯
GPT-6 Astraは、OpenAIが2026年9月3日に限定プレビュー公開した最新フロンティアモデルだ。コードネーム「Astra」は2026年8月に内部評価で一時停止するまで、外部にはほぼ知られていなかった。
2026年8月10日の停止について先に触れておく。OpenAIは独自のPreparedness Frameworkによってモデルの危険度を「Low」「Medium」「High」「Critical」の4段階で評価する。AstraはExploitBench(サイバー攻撃能力ベンチマーク)で100%を記録し、「Criticalサイバー」の閾値に触れた(Astra Critical指定の全貌参照)。OpenAIは2週間の追加強化学習訓練を実施し、ハッキング能力を「High」水準に抑制した上でリリースに踏み切った。
訓練規模は、OpenAI研究者エイダン・クラークが「社内最大のトレーニングラン」と述べたStargate(テキサス)の10万台超のGPUクラスタで実施された。また、今回初めて「以前のOpenAIモデルが新モデルの訓練を監督する」形式が採用された。
リリーススケジュールは次の通りだ。9月3日:信頼パートナー(Trusted Access Program)向け限定プレビュー。9月4日:一般APIアクセス開放、ChatGPT Plus・Pro・Business・Enterprise向け順次展開。AWS経由の提供も予定されている。
ベンチマーク詳細——OpenAI自己申告と独立評価の乖離
ここが最も重要な部分だ。OpenAIが公開した自己申告ベンチマークと、独立評価機関の数字はかなり違う。
OpenAI自己申告(2026年9月3日時点)
| ベンチマーク | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| FrontierMath | 97.6% | — |
| ARC-AGI-3 | 99.9% | — |
| ExploitBench | 100% | — |
| GPQA Diamond | 96.0% | — |
| Terminal-Bench 4.0 | 57.7 | 52.6 |
| DeepSWE | 74.1 | — |
OpenAIが選んだ評価セットでは、Astraはほぼすべてで最高スコアを記録している。ただし、FrontierMathとARC-AGI-3はOpenAIが訓練に使用したデータと重複している可能性が否定できない(外部研究者の指摘)。
Artificial Analysis独立評価(2026年9月4日時点)
独立評価機関のArtificial Analysisによると、Intelligence Index(9評価の総合)では:
- Claude Fable 5.1: 66点
- GPT-6 Astra: 61点
Fable 5.1が5点上回る。エージェントコーディングと科学系タスクではFable 5.1が優位、数学とサイバーセキュリティではAstraが優位、という棲み分けだ。
「Artificial Analysisはエージェントコーディング・科学タスクでClaudeが前にいると示している」とNextBigFutureは報告した(NextBigFuture、2026年9月3日)。
料金比較
Artificial Analysisの算定(7:2:1キャッシュヒット:入力:出力比)によると:
| モデル | 入力 | キャッシュ入力 | 出力 | 実効(7:2:1比) |
|---|---|---|---|---|
| GPT-6 Astra | $10/M | $1.00/M | $50/M | $7.70/M |
| Claude Fable 5.1 | $10/M | $0.25/M | $50/M | $7.18/M |
ベースの入力・出力単価は両モデルで同じだ。差はキャッシュ価格にある。Fable 5.1は9月1日にキャッシュ読み取り価格を$1→$0.25に75%削減した(Fable 5.1詳細参照)。キャッシュ活用率が70%以上のシステムでは、Fable 5.1の実効コスト優位がさらに広がる。
「AGI到来」宣言——何が本当で何が誇張か
グレッグ・ブロックマンの発言を正確に引用する。「I personally believe we’ve achieved AGI. I think it might be about this model」(Axios、2026年9月3日)。
重要な注釈が2つある。
第1に、OpenAIはAGIを「人間と同等か、それ以上に経済的価値のあるすべての作業を実行できる自動化システム」と定義している。ブロックマンは「ユーザー自身が判断してほしい」と留保を置いており、OpenAI社としてのAGI正式宣言は行っていない。
第2に、AGIの公式宣言はMicrosoftとOpenAI間の契約上の意味を持つ。OpenAIはMicrosoftからの投資条件として「AGI達成時には独占ライセンスが終了する」条項を持つとされており、この点でOpenAIは慎重に言葉を選ぶインセンティブがある。
ある独立系AIリサーチャーはX(旧Twitter)で「ARC-AGI-3が99.9%というのは、訓練データ汚染なしには説明が難しい。ベンチマークを変えれば景色が変わる」と指摘した(2026年9月3日)。Fast Companyは「Astraは史上最も有能で、最も論争的なモデル」と評した(Fast Company、2026年9月3日)。
判定:「非常に強力だが、AGIと呼ぶかどうかは定義次第」が現時点での適切な評価だ。
Criticalサイバー能力の実態——何を制限したのか
AstraがExploitBench 100%を達成したことは事実だ。OpenAIのPreparedness Frameworkでは「高度な専門家でも困難な自律的ゼロデイ攻撃を可能にする」水準がCriticalと定義されている。
2週間の追加訓練で何が変わったか:ハッキング能力は「High」レベルに抑制された。OpenAIによれば、Astraは「一般公開に安全な状態」だが「危険な能力を有する(High水準)」ことは認めている。NBC Newsは「Astraはセキュリティ措置を作動させた」と報じた(NBC News、2026年9月3日)。
実際の制限内容:
- ハッキング支援の明示的拒否:ゼロデイ開発の直接支援は拒否する設計
- 難読化コードの説明拒否:悪用が明らかなコードの解説を制限
- セキュリティ研究者向け例外なし:信頼レベルによる例外機能は未実装
ただし、このアーキテクチャ上の「ハードブロック」がいかに堅牢かは、現時点では独立検証が完了していない。AlJazeeraは「規制当局からの監視強化が不可避」と報じた(Al Jazeera、2026年9月4日)。
日本ユーザーへの現実的なインパクト
今すぐ使えるか:ChatGPT Plus・Pro・Business・Enterpriseユーザーは数日内に利用可能になる予定だ。APIは9月4日から一般開放済みで、gpt-6-astraをモデルIDとして呼び出せる。地域データ処理(データレジデンシー)を使う場合は10%の割増料金が発生する。
日本語性能:現時点(2026年9月4日)では日本語の独立ベンチマーク結果が存在しない。OpenAIの自己申告は英語タスク中心だ。Claude Fable 5.1は日本語コーパスに特化した訓練データを追加したとAnthropicが明言している(Claude音声モードの日本語対応を参照:Claude音声モード日本語ガイド)。日本語タスクで両者を切り替えてテストすることを推奨する。
エンタープライズコスト試算:月100Mトークン(入出力70:30)でAPIを使う場合、GPT-6 AstraはClaude Fable 5.1より約8%コスト高になる試算だ。大手企業がどう予算を組むかについてはUberの4ヶ月予算崩壊の事例が参考になる。
使い分け指針:数学・コード生成の純粋性能を求めるならAstraが有力。エージェントワークフロー・長文コンテキスト・日本語品質ならFable 5.1が現在有力。サイバーセキュリティ用途は両モデルとも使用制限があるため別途確認が必要だ。
早期ユーザーの声——良い点と悪い点
リリース後数時間のX上の反応から実際のユーザー評価を拾う。
正の評価:AIYouTuberのMatthew Bermanは「今まで使った中で最高のモデル。単なる改善ではなく、真の跳躍だ」と述べた。コンピューター操作(Computer Use)に特に言及し「AstraはFable 5.1より別次元で速い」と評価した(X、2026年9月3日)。開発者のPankaj Kumarは「Webアプリ開発でAstraはFable 5.1を多くの場面で上回る」と報告した(X、2026年9月3日)。
負の評価:OpenAI安全チームのMia Glaeseが認めたように、リアルタイムのサイバー監視機構が「無関係の作業中にも動作を停止させる」ことがある。段階的なアクセス制限で信頼パートナー以外は利用が遅れることへの不満も目立った。AIリサーチャーのGary Marcusは「ARC-AGI-3の成功はすばらしいが、AGIの証明ではない。実世界の開放的タスクではたくさんの問題が出るだろうと予想する」と指摘した(Substack、2026年9月3日)。
コミュニティ評価の中心は「コンピューター操作で圧倒的、数学で強い、AGI宣言は過大」にまとめられる。
- 公開日: 2026年9月3日(限定)/ 9月4日(一般API)
- コンテキスト: 1.05〜1.1Mトークン(マルチウィンドウメモリ機能付き)
- 訓練: Stargate(テキサス)10万台超GPU、社内最大規模
- 料金: 入力$10/M、キャッシュ入力$1/M、出力$50/M
- Criticalサイバー判定: 制限付きリリース。ExploitBench 100%を達成、追加訓練後にHighレベルに抑制
- AGI宣言: OpenAI正式宣言なし。グレッグ・ブロックマン個人見解として「このモデルかもしれない」
- 日本語対応: 独立ベンチマーク未公開(2026年9月4日時点)
Claude Fable 5.1のリリース詳細と移行ガイドを読む
GPT-6 Astraと比較されるClaude Fable 5.1(9月1日GA)。75%のキャッシュ価格削減、新機能、旧モデルからの移行手順を解説している。
関連記事
- ChatGPT・Claude・Grok同時ダウン|AI集中リスクが露わになった9月3日の障害
- OpenAI Astraが「危険すぎる」と自社が止めた日|Critical評価の全貌
- Claude Fable 5.1リリース詳細と料金・移行ガイド
- UberのAI予算が4ヶ月で消えた理由|Claude Codeとトークン課金の罠
本記事は2026年9月4日時点の公開情報をもとに執筆した。GPT-6 Astraのベンチマーク・料金・機能は今後変更される可能性がある。APIを利用する際はOpenAI公式ドキュメントで最新情報を確認すること。本記事はいかなる投資判断の根拠にも使用しないこと。