メインコンテンツへスキップ
AI News 24分で読める

Claude、AnthropicのR&D 26%を「主導」。AIが自分の後継者を作る時代の現実

「Anthropicが『Claudeが次のClaude開発の26%をリードする』と発表した日、自分のタスクの指示書を数えたら明示手順が17個あった」。Qiitaに投稿されたエンジニアHideki_Tamaeの短い一文は、9月18日の午後に数百のいいねを集めた(Qiita, 2026年9月18日)。

Anthropicは2026年9月17日、「R&D自動化指数(Anthropic R&D Automation Index)」を初めて公開した。測定対象は同社の研究開発業務全体。結論として示されたのは、AIモデル「Claude」が自社のR&Dタスクの26%を「主導(leads)」しているという数字だった(Anthropic Institute, 2026年9月17日)。

2026年2月時点の「主導」レベルはほぼゼロだった。6ヶ月でそれが26%に到達した。同社のエージェントプラットフォームでは常時約3万体のAIエージェントが稼働し、2026年5月時点でAnthropicのコードベースにマージされたコードの80%以上がClaudeが書いたものだという。

「AIが自分の後継者を作る」という見出しが世界中のメディアを駆け巡った。だが、その実態は見出しより複雑で、懸念も希望も、どちらかに単純化できるものではない。

この記事はこんな人におすすめ
  • AIエージェントの自律性がどこまで来ているか正確に把握したいエンジニア
  • AnthropicやClaude Codeを業務で使っており、今後の方向性が気になる開発者
  • AIによる雇用・役割変化に備えたいソフトウェアエンジニアやPM
  • 再帰的自己改善(RSI)という概念を正確に理解したいAI関心層

「主導」とは何か:Epoch AIが定義した6段階尺度

数字を正しく読むには、まず定義を押さえる必要がある。

Anthropicが採用したのは、AIの影響を測定する研究機関Epoch AIが開発した**6段階自動化尺度(AL0〜AL5)**だ。

レベル名称内容
AL0なしAIが関与しない
AL1補助AIが提案、人間が実行
AL2協力AIが部分を担当、人間が方向を決定
AL3分担人間とAIが対等に作業
AL4主導AIが高レベル指示から大部分を完結、人間が監督
AL5完全自律人間の関与なしにAIが完結

Anthropicが「主導」と呼ぶのはAL4だ。「Claudeが高レベルのプロンプト1つからタスクのほとんどを完結させ、人間の監督者が結果を確認する」状態を指す。AL5(完全自律)に到達したタスクカテゴリは現時点でゼロと、Anthropicは明示している。

「Claudeは全R&D業務の約90%に何らかの形で関与している」とも発表されているが、この数字は低レベルの補助(AL1・AL2)も含む。「主導(AL4)」の26%とは区別して理解する必要がある。

測定方法の透明性と限界

この指数はどう計算されたか。Anthropicは2026年7月に全部門スタッフの20%をサンプリングし、Slackと内部ドキュメントを使って各人の1週間の業務を約1万5,000個の細粒度タスク(fine-grained tasks)に分解した。そのタスクを自動化レベルでスコアリングしたのもClaudeだ。

ここに批判が集中している。shattered.io(2026年9月18日)は「自己測定・自己報告であり、独立した第三者検証がない。測定ツール自身が採点者になっている」と指摘した。Claude自身による採点と人間の採点の一致率は59%で、決して高い数字ではない。

同日、100人以上のAI研究者が連名で「評価者は科学的独立性・透明性・制限なしのシステムアクセス権が必要だ」という公開書簡を発表している(Zetik, 2026年9月17日)。タイミングは偶然ではないだろう。

2月ゼロ→8月26%:6ヶ月で何が起きたか

数字の変化を時系列で見ると、急速な加速ぶりが鮮明になる。

時期「主導(AL4)」比率主な変化
2026年2月ほぼ0%測定開始
2026年3月約1%Claude Opus 4系リリース
2026年5月—コードの80%以上がClaude生成に
2026年8月26%常時3万エージェント稼働

この変化を支えているのが「タスク完了地平(task horizon)」の拡大だ。METR(AIモデル評価機関)の測定によれば、Claudeが50%の確率で自律完了できるタスクの長さは4ヶ月ごとに約2倍に伸び続けている(METR評価チーム, 2026年)。

  • 2024年初頭:数分のタスク
  • 2026年2月:14時間30分(Claude Opus 4.6のMETR実測値)
  • 2026年後半:倍増ペースが続けば30時間超(推算)
  • 2027年予測:1週間規模のタスク(Anthropic予測)

Claude Codeの平均的な自律稼働セッションも、3ヶ月で25分未満から45分超へほぼ倍増した。Uberが2026年AI予算を4ヶ月で使い切った背景には、このエージェント稼働時間の急増が影響している。

エンジニア1人当たりの生産性にも変化が現れている。Q2 2026年のAnthropicエンジニアは、2024年比でコードのデイリーマージ量が8倍になったという(Anthropic “When AI Builds Itself”, 2026年6月)。「8倍多く作業した」のではなく「8倍多くコードがマージされた」。この差は重要だ。

3万エージェントの内訳

Anthropicが明かした数字では、2026年8月の内部エージェントプラットフォーム上で同時稼働するエージェント数は約3万体。処理された意思決定は同月だけで10億件超。そのうちモニタリングシステムに「傍受・ブロック」されたのは0.002%(約2万件)だった。全エージェントの行動は実行前と実行後の双方でレビューされているという。

誤解を解く:「AIが自分自身を作る」の3つの誤読

見出しが走り、SNSで議論が分断される前に、Anthropic自身が明確に否定している点を整理しておく。

誤解1:ClaudeがClaude自身のモデルを自律的に改善している 現実はそうではない。Claudeが担っているのは「研究・エンジニアリングタスク」であり、モデルの重みを自律的に書き換えているわけではない。Anthropicは「次世代Claude を自律的に設計・学習・評価・デプロイする機能はまだない」と明示している。

誤解2:26%は「後継モデルの26%をClaudeが作った」という意味 正確には「測定されたR&Dタスクのうち26%でClaudeがAL4(主導)レベルで関与した」だ。タスクの数や重要度は一様ではなく、単純に「Claudeが次モデルの4分の1を書いた」とは言えない。

誤解3:人間の関与がなくなりつつある 全タスクの90%に人間が関与しており、AL5(完全自律)はゼロだ。ただし「関与の形」が変わりつつある。コードを書く・実験を設計するといった作業から、エージェントの出力を評価し・方向を修正する「監督者」へのシフトが進んでいる。

この変化は「人間が不要になる」ではなく「人間の役割が変わる」と表現するほうが実態に近い。ただし、その変化のペースが問題だ。

業界比較:OpenAI・Google DeepMindの状況

Anthropicの26%公表は「業界初の定量的R&D自動化指標の公開」という意味でも注目に値する。他社の状況と比べてみる。

OpenAI:2026年6月、新しいコーディングモデルCodexが「自分自身の開発を助けた」と発表。OpenAI上級研究者「Roon」によれば、Codexが彼のコード書きを100%担っているケースもあるという(NBC News, 2026年6月)。ただし具体的な比率や測定方法は未公表だ。Sam Altmanは「2026年9月までにAI研究インターン、2028年3月までに完全自律AI研究者」という目標を掲げている。

Google DeepMind:AlphaEvolveと呼ばれるGeminiベースのコーディングエージェントを2026年7月に一般提供。「Gemini 4の前に再帰的自己改善の初期兆候を観測した」と上級研究者が発言(Analytics India Magazine, 2026年9月)。ただし「何を初期兆候と定義するか」の基準は不明確だ。

CNBC(2026年6月)は「Anthropicがエンタープライズコーディング分野で先行した、主にClaude Codeのおかげで」と分析した(CNBC, 2026年6月1日)。各社が異なる定義で「AIが自分を作る」を主張しており、比較可能な共通指標はまだ存在しない。この点においては、Anthropicの測定手法の公開(批判はあれど)は業界標準化への一歩と見ることもできる。

専門家・元社員が鳴らすアラーム

発表の同週、Anthropicの内外から厳しい警告が相次いだ。

**Anna Wang(Anthropic元AIアライメント研究者)**は退職と同時に声明を発表した。「OpenAIもAnthropicも責任ある行動を取っていない。両社は再帰的自己改善型の超知能へ向けて全速力で進み、私たちの命を賭けている」(CNBC, 2026年9月11日)。

**Jakub Pachocki(OpenAI主任科学者)**も2026年9月、「再帰的自己改善の潜在的な近さは、極限の慎重さを要する局面だ。誰も結果に備えていない」と述べた(CNBC, 2026年9月10日)。競合他社の科学者が同時期に同様の警告を発していることは、業界全体の緊張感を示している。

**Yoshua Bengio(国際AI安全報告書2026年版、共同議長)**は「人間の支援なしにAIが優れた後継者を設計する」形態の再帰的自己改善に対する全面禁止を呼びかけた。この報告書は30以上の国が支持している(The News, 2026年)。

Dario Amodei(Anthropic CEO) 自身も矛盾するように見える立場に立っている。2026年9月15日のDreamforceカンファレンスで、先進的AI企業に対して「フロンティアのペーシング(開発速度の調整)」を求めた。AIの自己改善がモデルの理解・制御をより困難にすると警告しながら、同社はそのペースを記録・公開しているのだ。

セキュリティ面の懸念も具体化している。複数のセキュリティ調査によればAI生成コードの約62〜63%に何らかのセキュリティ上の問題があると報告されている(Kusari, 2026年; OX Security調べ)。GitGuardianの分析では、GitHub Copilotを使うリポジトリは使わないリポジトリよりシークレットの漏洩率が約40%高い(GitGuardian調べ)。AIが書くコードが増えれば増えるほど、レビューが追いつかない「検証ボトルネック」が広がるリスクがある。

一方で、AI安全性に関しては肯定的な取り組みも見られる。Anthropicは計算量の6〜12%を安全研究に充当し、独立した評価機関に自社モデルへの永続的なアクセスを提供すると発表した。AIガバナンスの国際的な枠組み整備がどれだけ速く追いつけるかが、次の焦点になる。

日本のエンジニアへの影響:光と影

日本のテックメディアの反応は英語圏より落ち着いていた。ITmediaは「半年で急拡大」という事実を淡々と伝え、GIGAZINEは測定自体の構造(「Claudeが自分の業務を採点した」)に注目した。しかし日本の一部ビジネスメディアは「再帰的自己改善が加速」という見出しを使い、英語圏の「主導26%」より踏み込んだ表現を選んだ。

光:生産性の飛躍的向上 VSCode + Claude Codeによる並列開発環境を活用しているエンジニアにとって、この変化は恩恵だ。Anthropicエンジニアのデイリーマージ量が8倍になったというデータは、うまく使えば個人の生産性にも同様の効果が期待できることを示唆している。TCS・DXCがAnthropicのグローバルプレミアパートナーに就任した背景にも、この生産性倍増効果への期待がある。

影:役割の変容と雇用不安 StanfordのAI雇用格差報告書が指摘するように、変化の影響は若年・初期キャリア層に集中しやすい。Anthropic自身が実施したという約8万人規模の調査でも、初期キャリア労働者が最もAIによる職務代替を心配していると出た。2026年には12万件超の技術者解雇が報告されており、Meta等はAIを理由に挙げている(Yahoo Finance, 2026年)。

Anthropicのエンジニアリング責任者は2026年6月、Claude Codeが従業員の仕事を「孤独な体験にしている」と発言し話題になった(Fortune, 2026年6月23日)。AIが増え、人間同士のコードレビューやペアプログラミングが減る中で、チームの心理的なコストも無視できない。

現実的な備え 「AIが主導できないタスク」に意識的に移行することが有効だ。要件定義・アーキテクチャ判断・倫理評価・ステークホルダー交渉。これらはAL4の射程外にある。ただし6ヶ月で0%から26%になった変化のペースを見れば、「今AL4外だから安全」という判断には慎重さが必要だ。

Claude Codeをチームで導入する前に、Uberが経験した予算崩壊の構造と対策を確認しておこう。無駄なコストを事前に防げる。

詳しく見る

まとめ:透明性は評価するが、検証は続ける

Anthropicが今回公開したR&D自動化指数には、2つの側面がある。

一つは業界の透明性への一歩。競合他社が曖昧な言葉でAI自己開発を示唆する中、同社は具体的な数字・測定方法・安全対策を同時に開示した。100%ではないが、ゼロよりはるかにましな開示だ。

もう一つは自己報告の限界。Claude自身が採点し、人間との一致率が59%にとどまる測定を「26%」という精密な数字で発表することには、測定の客観性に疑問が残る側面もある。元社員や研究者100人以上が「独立した検証が必要」と訴える背景には、この構造的な問題がある。

「自分自身の後継者を作るAI」という物語は、正確には「自分の後継者の開発作業の26%でAL4レベルの主導を担うAI」だ。見出しより地味だが、それでも6ヶ月前には存在しなかった現実である。

今後の焦点は測定方法の外部検証と、安全研究への投資比率の推移にある。次の数字が出るときに何が変わっているか、注視する価値はある。


関連記事


本記事の情報は2026年9月21日時点のものです。AIの開発状況は急速に変化するため、最新情報は各公式ソースをご確認ください。記事内のAnthropicに関する情報は、公式発表および第三者メディアの報道に基づいています。本記事は情報提供を目的としており、投資・雇用・経営判断の根拠として使用することを意図していません。記事内の意見・分析は筆者個人のものであり、いかなる組織・企業の公式見解も代表しません。

Share