NVIDIAのAVOがARC-AGI-3で満点|真の主役はモデルではなくハーネスだった
「公開セットだけで、しかもモデルじゃなくてハーネスの話だろ?」。Hacker Newsのスレッド(news.ycombinator.com、2026年8月21日)は、称賛と懐疑が入り混じる議論で沸いた。NVIDIAが8月21日に発表した結果は確かに数字の上では歴史的だ。AI最前線モデルが1%未満しか取れなかったベンチマークを、100%で制覇した。ただし「AIが賢くなった」という話ではない。同じClaude Opus 5が、包まれ方を変えただけで30%から100%に化けた話だ(The New Stack、2026年8月21日)。
- AIエージェント開発に携わっており、ベンチマーク結果の解釈に興味がある開発者
- Claude Opus 5など最前線モデルの実運用性能を把握したいエンジニア
- AGIをめぐる議論の現在地を知りたいAI研究者・技術ジャーナリスト
- エージェント設計(ハーネス・スキャフォールディング)の重要性に注目しているチームリード
ARC-AGI-3とは — 最前線AIが「1%未満」だったベンチマーク
ARC-AGI-3は、ARC Prize財団(共同創設者:FrançoisChollet・Mike Knoop)が2026年3月25日に公開したインタラクティブ推論ベンチマークだ(ARC Prize、2026年3月)。
ARC-AGI-1(2019年)とARC-AGI-2(2025年)がグリッドパズルの入出力例から規則を推論させる「静的テスト」だったのに対し、ARC-AGI-3は根本的に異なる。エージェントはゲームのような環境に放り込まれ、説明書も目標提示もなく、自力で環境のルールを学習しながら25種類・計183レベルのパズルをクリアしなければならない。
ローンチ当日の2026年3月25日に30日間の開発者プレビューデータが示した結果は衝撃的だった(DataCamp、2026年4月)。
| モデル | スコア(準プライベートセット) |
|---|---|
| Gemini 3.1 Pro | 0.37% |
| GPT-5.4(High) | 0.26% |
| Claude Opus 4.6 | 0.25% |
| 人間 | 100% |
人間は誰でも解けるが、最前線AIはすべて1%未満。この落差が「AGIへの本当の距離」を示していた。
スコアの指標はRHAE(Relative Human Action Efficiency)。スコア = min(1.0, 人間の行動数 / AIの行動数)² で計算され、無駄な試行錯誤には二乗ペナルティが課される。ただし重要な点がある。公開セット(25環境)のスコアは公式リーダーボードに反映されない。ARC Prize財団が定めたルールで「公開セットのスコアはAGIへの進捗の有効な指標ではない」とされている(ARC Prize Docs)。実際の評価は準プライベートセットで行われる。
その準プライベートセットで現時点のSoTAを出しているのがClaude Opus 5だ。30.16%。過去最高だが、人間の100%には大きく届かない(BenchLM.ai、2026年8月)。
AVOが達成した100% — 同じモデルが30%から満点に化けた仕組み
2026年8月21日、NVIDIAはデベロッパーブログで驚くべき数字を公開した。ARC-AGI-3の公開セット全25環境・183レベルをRHAE 100.00で完走した。しかも6,624アクションを使用し、人間のベースラインより12%少ない行動数でクリアしている(NVIDIA Developer Blog、2026年8月21日)。
使用モデルはAnthropicのClaude Opus 5。準プライベートセットで30.16%を出したのと同じモデルだ。NVIDIAが変えたのはモデルではない。**ハーネス(エージェントシステム)**だ。
AVO(Agentic Variation Operators)の構造
AVOの核心は「スーパーバイザー」コンポーネントにある。メインエージェント(Claude Opus 5)の行動を常時監視し、以下の介入を行う。
- スタック検知: 同じ状態で行動が繰り返される場合に強制リセット
- 探索バリエーション: 行き詰まった際に異なる戦略を生成して試行
- メモリ管理: 環境のルールと過去の試行結果をコンテキストに構造化して保持
- エラー回復: 誤方向に進んだと判断した場合の早期打ち切り
モデルの重みに触れずに、周囲のシステム設計だけでスコアを3.3倍に引き上げた。TechCrunchはこの結果を「NVIDIAは今、AIエージェントにおいてモデルではなくハーネスが主役であることを示した」と報じた(TechCrunch、2026年8月21日)。
「100%達成」に対する批判と正確な読み方
Hacker Newsのスレッドでの反応は複雑だった。賞賛の声もあったが、批判的な指摘が目立った。
批判1: 公開セットにすぎない
前述の通り、ARC Prize財団は公開セットのスコアを「AGIへの進捗の有効な指標ではない」と明示している。公開セットは開発者向けのデモ用途であり、繰り返しのアクセスによる過適合リスクが除外できない(ai.wain.blog、2026年8月)。本当の評価は準プライベートセットで行われ、そこでのAVO結果はまだ公表されていない。
批判2: モデルが賢くなったわけではない
30%→100%の飛躍はClaude Opus 5の推論能力の向上ではなく、それを包むシステムの改善だ。これはスキャフォールディング(足場組み)と呼ばれる手法で、以前から使われてきた。ARC-AGI-3の公開セットはオープンソースの「ヒューマンリプレイ付きハーネス」でもほぼ100%に近いスコアが出ることも確認されている。
批判3: NVIDIAのモデルではない
この100%達成はNVIDIAが開発したAIモデルの成果ではない。AnthropicのClaude Opus 5をNVIDIAのインフラとエージェントシステムで包んだ結果だ。NVIDIAの功績はシステムエンジニアリングにある(Enera Labs、2026年8月)。
一方で肯定的な解釈も成立する。AI Weekly(AI Weekly、2026年8月)は「人間より12%少ないアクションで全レベルを解いた事実は、エージェント効率の観点から見ると本物の成果だ」と評価する。
エージェント設計がモデル選定を逆転する時代
この結果が示す最も重要なインプリケーションは、AIシステムの性能を左右する主変数が変わったという点だ。
2024年頃まで、開発者の判断軸は「どのモデルを使うか」だった。Claude vs GPT vs Gemini。しかし2026年8月時点では別の問いが浮上している。「どのハーネスで包むか」。
The New Stackは「Claude Opus 5単体で30%、AVOに包まれると100%。この差はスキャフォールディングの設計品質がモデルの選択より重要な世界への入り口を示している」と指摘する(The New Stack、2026年8月21日)。
エージェント設計が重要になる理由は3つある。
- 長時間タスクへの耐性: 単一推論でなく複数ステップを持続するエージェントでは、最初の誤りを検知・修正する仕組みがないとエラーが蓄積する
- コンテキスト管理: 長期タスクで関連情報を選択的に保持し、無関係な情報でコンテキストを埋めないための外部メモリ設計
- フォールバック戦略: 行き詰まりを検知して戦略を切り替えるロジックは、モデルが持つ能力を実際に引き出すために必要
この視点で見ると、NVIDIAのAVO達成は「AGIが来た」という話ではなく「エージェントシステム設計の時代が来た」という話として読む方が正確だ。準プライベートセットで現在30.16%にとどまるClaude Opus 5が、同等のハーネスで何%に化けるかは未公表。それこそが次の注目点だ。
そしてNVIDIAだけではない。OpenAIは7月、GPT-5.6 SolでARC-AGI-3の公開セットスコアを13.3%から38.3%に引き上げた。モデルの重みを変えずに、APIの2つの設定を有効にするだけで達成した結果だ(ExplainX、2026年7月)。有効にした設定は「retained reasoning(推論の持続)」と「compaction(コンテキスト圧縮)」の2つ。ハーネスがスコアを左右するという事実は、複数の組織で同時に観測されている。
さらにX上ではpbshgthm(poobesh)と名乗るユーザーが8月19日、Claude Code + Opus 5で追加ハーネスなしに100%を達成したと主張し、「カギは”行動の前に反証可能な予測を強制する”だけだった」と投稿した(X @pbshgthm)。真偽の独立検証は行われていないが、複数の異なるアプローチが公開セットを飽和させつつある状況は、「公開セットがいかに本番評価と切り離されているか」を改めて示している。
- ARC-AGI-3ローンチ: 2026年3月25日、ARC Prize財団
- 人間の基準スコア: 100%(準プライベートセット含む全環境)
- ローンチ時の最前線AI: すべて0.4%未満(Gemini 3.1 Pro: 0.37%)
- Claude Opus 5(準プライベートセット、独立評価): 30.16%
- NVIDIA AVO(公開セット、自己申告): 100.00 RHAE
- AVO使用アクション数: 6,624(人間比12%減)
- モデルの変更: なし。ハーネス(システム設計)のみ変更
- 公開セットの位置付け: 公式リーダーボードには不採用。ARC Prize財団は「AGIへの進捗の有効な指標ではない」と明示
Claude Opus 5の実力をベンチマークで把握したい開発者へ
ARC-AGI-3での30.16%達成を含むClaude Opus 5の全ベンチマーク比較と実務での使い所を解説している。コスト・速度・推論品質のトレードオフも整理した。
関連記事
- Claude Opus 5完全ガイド — ベンチマーク・価格・実務での使い方
- Jensen HuangのAGI「達成済み」発言と業界の反応 — 何をもってAGIとするか
- Humanity’s Last Exam — AIが初めて解けなかったベンチマークの中身
- GPT-5.6 Sol / Terra / Luna徹底解説 — Anthropic、Googleとの比較と選定指針
本記事に記載のベンチマーク数値はNVIDIAデベロッパーブログ(2026年8月21日)、ARC Prize公式リーダーボード、BenchLM.aiの各公開データに基づいています。スコアは評価方法・ハーネス・推論設定によって異なります。本記事は投資・開発方針の決定を推奨するものではありません。