メインコンテンツへスキップ
AI News 14分で読める

OpenAI・Anthropicが「安全審査員を社内に常駐」へ|独立性は本物か

「評価者には机、バッジ、ノートパソコンを渡し、発見したことを公表する権利も与える」。2026年9月12日、OpenAI CEOのサム・アルトマンはXにそう書いた。数日後、AnthropicのCEOダリオ・アモデイも同様の提案を公表し、フロンティアAI企業全社が独立した第三者評価者を社内に常駐させるべきだと訴えた(TechCrunch, 2026年9月16日)。

ところがAnthropicが9月18日に発表した「最初の評価機関」は、AIの安全研究機関ではなかった。ITコンサルティング大手AccentureのFaculty部門だ(TechCrunch, 2026年9月18日)。同日、100人超のAI研究者・評価者が連名で「この計画では真の独立性は担保されない」と警告する書簡を公開した(CNBC, 2026年9月18日)。

この記事はこんな人におすすめ
  • AIの安全性やガバナンスに関心があるエンジニア・研究者
  • OpenAIやAnthropicの内部ガバナンスを把握したいビジネスパーソン
  • 「AIは本当に安全なのか」という問いを持つすべての読者

そもそも「常駐型評価」とは何か

これまでの第三者評価は「試験前の一回限り」だった。AIラボがモデルをリリースする直前に外部研究者を呼び込み、限られた時間でリスクを確かめる形式だ。OpenAIがGPT-6 Astraのリリース前にApollo Research(AI安全性テスト専門の独立機関)に与えた評価期間はわずか3日。METRがHugging Face事件(2026年初頭にAIモデルが予期せぬ行動を示したとされるインシデント)の独立調査を依頼されたときも約1週間だった(TechCrunch, 2026年9月16日)。

アモデイが提案した「常駐型」はこれを根本から変えようとするものだ。評価者はラボに席を持ち、学習・評価・デプロイの全工程にアクセスし、安全インシデントを報告し、結果を外部に公表できる権限を持つ。Epoch AIが作成したAL0〜AL5のスケール(Anthropicが自社AIのR&D自動化率を測るために採用したもの)と同じく、AIの自律性が高まれば高まるほど人間の監視が追いつかなくなるというのが提案の背景にある。

アモデイが9月16日に公開した提案には、METR(機械行動評価研究機関)やRedwood Researchが評価機関の候補として明記されていた。両者はAI安全研究に特化した非営利組織で、コミュニティから高い信頼を得ている。アルトマンも「OpenAIも同様にコミットする」と表明し、METRとRedwood Researchとの交渉が進行中であることを確認した(Bloomberg, 2026年9月22日)。

Accentureという「想定外の選択」

9月18日、AnthropicはAccentureのFaculty部門(旧Faculty AI)が最初の常駐評価機関になると発表した。Facultyのチームはモデルの評価・レッドチーム(悪意ある入力でAIの脆弱性を探す手法)・アライメントアセスメント(AIが人間の意図に沿って動いているかを検証する評価)・セーフガードのテストを担当するとされている。

しかしこの選択に研究者コミュニティは困惑した。AccentureはAI安全性の専門機関ではなく、世界最大のITコンサルティング会社だ。売上の相当部分を企業へのAI導入支援から得ており、AIラボとの商業的な関係を持つ。本来「独立評価者」に求められる中立性と、コンサルタントとしてのビジネス上の利害が、構造的に矛盾する可能性がある。

コミュニティでも批判の声が相次いだ。「METRを期待していたのにAccentureだった、という落胆がある。Accentureは優秀だろうが、彼らのビジネスモデルはAI普及の加速にある。それが評価を歪めないと誰が保証するのか」という趣旨の指摘が、AI研究者のSNSや技術フォーラムで繰り返し共有された。

100人超の専門家が警告した「独立性の条件」

同じ9月18日、100人超のAI研究者・評価者が連名の公開書簡を発表した(CNBC, 2026年9月18日)。書簡は常駐型評価の方向性を歓迎しつつ、真の独立性には以下が不可欠だと主張した。

  • 出版権の保証: 企業の承認なく調査結果を公表できること
  • 十分な評価期間: 「3日間」や「1週間」ではなく、複数月単位のアクセス
  • 従業員へのインタビュー権限: コードやデータだけでなく、社内文化や意思決定過程への踏み込み
  • 法的拘束力: 自主的なコミットメントではなく、規制による義務化

書簡の起草に参加した研究者の一人は、「過去の評価では企業がNDA(秘密保持契約)で発見を隠蔽できる状態だった。口約束で変わるとは思えない」と述べた。米国でもイリノイ州が7月に第三者監査を義務化するAI安全措置法SB315を成立させたが、大多数の州には同様の規制がなく、自主規制への依存が続いている。現時点でAnthropicもOpenAIも、評価者の数、アクセスできる情報の範囲、公表できる内容の上限について具体的な数字を開示していない(TechCrunch, 2026年9月16日)。

また、この取り組みに加わっていない企業も多い。Meta、xAI(イーロン・マスクのAI企業)、Google DeepMindはいずれも常駐型評価へのコミットを表明していない。DeepMindのデミス・ハサビスは、個社への評価者常駐より業界横断の標準化組織を作るべきだという立場を示しており、アモデイ提案とは異なるアプローチを示唆している(AI Weekly, 2026年9月22日)。

「自主規制」がたどる道

自主規制の歴史はAI分野に限らず、産業界が外部監視を回避するための時間稼ぎとして使われてきた側面がある。AI企業が同様の落とし穴にはまるかどうかは、今後の数ヶ月の動きで見えてくる。

肯定的なシグナルもある。METRはすでにOpenAIとの独立レビュー契約に合意したことをX上で明かしており(METR公式X, 2026年9月)、Redwood Researchと共同でHugging Face事件の調査を進めている。評価機関側が「条件が悪ければ断る」という姿勢を維持する限り、形骸化は防ぎやすい。

懸念点は、METR・Redwoodのような組織のキャパシティだ。フロンティアAI企業が複数社同時に常駐を求めれば、評価者側が評価の質を保てるだけの人員・時間を確保できるかどうかが問われる。「評価者を薄く広く使われると、形だけの承認機関になってしまう」という声も専門家から上がっている。

コンテキストとして押さえたいのが、この発表の直前に起きたことだ。9月8日にはAnthropicの研究者ジェイコブ・コクソンが「Anthropicは無責任に超知能を開発している」として辞職を公表。同23日には国連安保理でアモデイ自身がAIの制御喪失リスクを演説している。常駐型評価の提案は、高まる社会的圧力と社内からの批判に応える形でのシグナル発信という性格を持つ。

このプロセスが名目上の「安全ラベル」で終わるか、それとも真に機能する監視体制の先例になるかは、評価者への実質的なアクセス権と公表権が契約として担保されるかどうかにかかっている。

常駐型安全評価が「本物」かどうかを見分ける4つの指標
  1. 評価者の公表権: 企業の承認なく調査結果を公開できるか
  2. 評価期間の長さ: 3日・1週間ではなく複数月単位か
  3. 評価機関の財務的独立: 被評価企業から収益の大部分を得ていないか
  4. 法的拘束力の有無: 自主的コミットか、規制による義務化か

AIの安全性評価に関心があるすべての読者へ

METRがフロンティアAI企業で実際に何を発見したかは、公開レポートで確認できる。関連記事でMETRの評価実績と、AIエージェントが内部でどのような「逸脱」を起こすかを把握しよう。

METRフロンティアリスクレポートを読む

関連記事


本記事の情報は2026年9月24日時点のものです。評価機関との契約内容や公開されるレポートの範囲は今後変わる可能性があります。投資・意思決定の参考とする場合は最新の一次情報をご確認ください。

Share