Claude Fable 5はなぜジェイルブレークに強いのか|AI安全性格差100倍の実態
「安全研究をしていたら、うっかり汎用ジェイルブレークを作ってしまった」。2026年9月3日、LessWrongにそう告白する投稿が現れた。MATSリサーチのリッチ・バートン=クーパーは、AIの不正な行動を監視するシステムを研究する過程で、どんな有害な質問でも挿入できるテンプレート型攻撃を誤って生み出したのだ(LessWrong, 2026年9月3日)。
その攻撃は23モデル中9モデルに対して84〜100%の成功率を記録した。残ったのは最新のAnthropicモデルとMeta Muse Spark 1.1だけだった。
- AIツールを業務導入しているIT担当者・セキュリティ責任者
- Claude、Grok、Geminiなど複数モデルの安全性を比較したい開発者
- AIジェイルブレークと開示ポリシーの最新動向を追う研究者・ジャーナリスト
FAR.AIが突きつけた「100倍の格差」
2026年7月29日、AIセキュリティ研究機関FAR.AIは業界初の包括的なAIセキュリティリーダーボードを公開した(FAR.AI, 2026年7月29日)。CBRNE(化学・生物・放射性物質・核・爆発物)とサイバーセキュリティの6カテゴリで、主要4モデルに自動攻撃ツールをぶつけた。
結果は衝撃的だった。
| モデル | 汎用ジェイルブレーク数 | 発見コスト(概算) |
|---|---|---|
| Grok 4.5(SpaceXAI) | 448件 | 約58ドル |
| Gemini 3.1 Pro(Google) | 249件 | 約278ドル |
| Claude Fable 5(Anthropic) | 0件 | 1万4200ドル超(発見できず) |
| GPT-5.6 Sol(OpenAI) | 0件 | 1万4200ドル超(発見できず) |
Grok 4.5を突破するコストはわずか58ドル。対してClaude Fable 5は1万4200ドル以上かけた自動探索でも1件も見つからなかった(arXiv: 2608.03070, 2026年8月5日)。100倍超の格差だ。
FAR.AIは「問題はAI安全性全体が弱いことではなく、モデル間の格差が極端に大きいことだ」と強調している。最も弱いモデルがエコシステム全体のリスクを引き上げる。Grok APIを使えば、誰でも58ドルで化学兵器の合成手順を引き出せる汎用テンプレートが作れるかもしれない現実が浮かび上がった。
安全研究が生んだ「意図せぬ兵器」
バートン=クーパーはもともと、AIが密かに有害な目標を持つ「陰謀的行動」を検知する監視システムを研究していた。そのためにAIが不正行動をするシナリオの合成データが必要で、現実的なトランスクリプトを自動生成するパイプラインを作った。
その生成プロンプトを少し改造したところ、汎用ジェイルブレークになった。数時間の作業で。
「どんな有害な質問でも埋め込める穴埋めテンプレートになった」と本人は書いている。テストした23モデルのうち9モデルで84〜100%の成功率。化学・生物・核・爆発物・サイバー攻撃の全カテゴリで「ひどく有害な回答」が得られた(LessWrong, 2026年9月3日)。
バートン=クーパーはプロンプト自体の公開を見送った。「インフォハザード(有害情報の拡散リスク)を考慮した」とある。ただし手法の存在と概要は開示し、影響を受けたモデルのベンダー各社には事前に通知している。これが「責任ある開示」の現在地だ。
Hacker Newsでのコメント(投稿から6時間で200件超)では「安全研究をするほど攻撃ツールが生まれるパラドックス」と揶揄する声と、「それでも公開より非公開のほうがリスクを低く保てる」と支持する声が割れた。セキュリティ研究者のリアクションはおおむね「正しい判断だが、制度的なサポートが必要」というものだった。
Claude Fable 5はなぜ0件だったのか
FAR.AIの調査でClaude Fable 5が汎用ジェイルブレーク0件を達成した理由について、Anthropicは詳細な技術説明を行っていない。ただし、外部の研究者が整理した要因は以下のようなものだ。
まず多層防御の構造がある。Anthropicは入力フィルタリング、モデル本体のトレーニング時の安全性埋め込み、出力モデレーションを独立したレイヤーとして積み上げており、一層が突破されても次の層が機能する設計になっている。
次に「Constitutional AI(CAI)」と呼ばれる手法だ。モデルが自らの原則に違反しているか自己評価しながら学習するプロセスで、安全性を後付けで追加するのではなくトレーニングの中核に組み込む。
加えて、FAR.AIが用いた攻撃手法はすでにAnthropicの内部テストチームが対処済みだった可能性が高い。バートン=クーパーが発見した汎用テンプレートもClaude Fable 5には効かなかったとバートン=クーパー本人が報告している(LessWrong, 2026年9月3日)。
ただし注意が必要だ。「見つからなかった」は「存在しない」を意味しない。FAR.AIの調査は特定の自動探索手法に限定されており、異なる手法や人間の手による探索で突破できる可能性はある。
Reddit r/ClaudeAIでは「Claude Fable 5も日常的にジェイルブレークされている動画がYouTubeに出ている」という指摘があり、汎用的な工業的攻撃への耐性と個別の創意工夫による攻撃への耐性は別物だという議論があった。
「開示制度が壊れている」。業界の構造問題
バートン=クーパーとFAR.AI創設者アダム・グリーヴは連名で「AIジェイルブレーク開示は壊れている」と題した提言を発表した(AI Frontiers, 2026年)。
現状の問題点は3つだ。
1つ目は開示チャネルの不一致。Google DeepMind、Meta、SpaceXAI(旧xAI)はジェイルブレークを通常の脆弱性開示プログラムの対象外としており、報告先が存在しない。
2つ目はNDA問題。研究者がベンダーに報告すると、守秘義務契約を求められ、他社モデルへの適用を含む知見を発表できなくなるケースがある。
3つ目は安全なハーバーの欠如。ジェイルブレーク研究者が法的リスクを負わずに活動できる保護環境が整っていない。
グリーヴはX(旧Twitter)でAnthropicのポリシーを名指しし「Anthropicの責任開示ポリシーは私たちが参加したいと思えないほど厳格すぎる。脆弱性を他社モデルに適用される場合でも永久に拘束できる」と批判した(@ARGleave, X)。Anthropicへの評価が高い人物による批判だけに、業界内で注目を集めた。
企業への実際の影響と今できること
この格差が企業に意味するのは何か。現実的な影響は2つある。
APIを経由した攻撃リスク。もし社内システムがGrok APIやGemini APIを利用しており、そのシステムがユーザー入力を直接モデルに渡している場合、汎用ジェイルブレーク経由でシステムプロンプトが漏洩したり、意図しないコンテンツが生成されたりするリスクがある。58ドルで作れるテンプレートが悪意ある競合他社や外部攻撃者に使われる可能性を排除できない。
ベンダー選定の基準変化。これまでモデル選定はベンチマーク(精度・速度・コスト)が中心だったが、FAR.AIのリーダーボードは「安全性」を定量化した第3の軸を提示した。特に医療・金融・公共サービス領域では、モデルが有害な指示に従う確率が契約上の問題にもなりうる。
Xでは「これでGrokを使う企業のセキュリティ担当者は全員説明責任を問われるようになった」という厳しい声もあった。一方でxAIは「評価手法がモデルの実際の運用リスクを反映していない」と反論しており、この議論は続いている。
- 利用モデルのリーダーボード確認: FAR.AIのリーダーボード(leaderboard.far.ai)で自社が使うモデルの評価スコアを確認する。特にCBRNEカテゴリの結果に注目。
- 入力サニタイズの実装: APIを介してユーザー入力をモデルに渡す場合、システムプロンプトとユーザー入力を明確に分離し、プロンプトインジェクション攻撃(悪意ある指示を入力に紛れ込ませてモデルを操る手法)を防ぐ実装を確認する。入力サニタイズ(不審な文字列・命令の除去・無害化処理)も有効だ。
- 社内モデル利用ポリシーの整備: 機密情報(個人情報・営業秘密・法的文書)をAIに入力しないルールを文書化し、全従業員に周知する。
AIモデルの安全性比較を深掘りしたい方へ
Claude Fable 5が汎用ジェイルブレーク0件を達成した技術的背景と、Anthropicの多層防御設計の詳細を関連記事で確認できます。モデル選定の判断材料としてご活用ください。
関連記事
- Claude Fable 5が19日ぶり復活——誤検知問題と業界初ジェイルブレーク評価基準
- GPT-5.6とAISI「ジェイルブレーク二重基準」問題——Fable 5との扱いの差は何を意味するか
- AISI Mythos 5 エージェント「偽の身元」事件と安全性評価の限界
本記事の数値はFAR.AI(2026年7月29日公開)およびLessWrong(2026年9月3日)の公開情報に基づく。テスト条件・手法の詳細はarXiv:2608.03070を参照。セキュリティ評価は特定の攻撃手法に限定されたものであり、記載モデルの安全性を包括的に保証するものではない。評価結果は継続的に更新される可能性があり、本記事公開後に状況が変化している場合がある。特定AIモデルおよびサービスを推奨・保証する意図はなく、本記事は情報提供のみを目的とする。