Paper2Agent完全解説|論文をAIエージェントに変えるStanfordの新技術
「Run this paper’s method on my data.」
著者のJiacheng Miao氏がX(旧Twitter)に投稿したこの一文は、2026年9月16日に研究者コミュニティを揺さぶった(Twitter @Jiacheng_Miao、2026年9月16日)。自分のデータにこう話しかけるだけで、論文のメソッドが動く。Stanfordが開発した「Paper2Agent」はその約束を実装したシステムだ。
同日、共著者のJames Zou教授もX上でこう補足した。「論文を仮想著者に変換する。研究者はメソッドを新データに適用したり、他の論文エージェントと協働して新発見を引き出せる」(Twitter @james_y_zou)。論文が静的な文書から、問いかけに応えるエージェントになる。その発表はNature誌に掲載された(doi: 10.1038/s41586-026-11044-y)。
Hacker Newsではリリース直後から議論が紛糾した。「チャットボットへのアクセスが万能の専門知識を与えるという思い込みが広まっている」と懸念する声と、「再現性問題の実用的な解決策になりうる」という期待が交差した(HN #45340133)。
- 研究論文の再現実験に時間を取られている研究者・大学院生
- MCPやClaude Codeを科学研究に活用したいエンジニア
- AI×学術研究の最新動向を追っているAI研究者・技術者
Paper2Agentとは — 論文が「仮想著者」になる
2026年9月16日、スタンフォード大学のJiacheng Miao、James Zou他の研究チームはNature誌に「Reimagining research papers as interactive and reliable AI agents」を発表した(doi: 10.1038/s41586-026-11044-y)。
Paper2Agentが解こうとする問題は、科学研究の「再現性の壁」だ。論文が発表されても、そのメソッドを別のデータで動かすためには、コードを読み解き、環境を構築し、パラメーターを理解するまでに数日から数週間を要する。これがオープンサイエンスの最大のボトルネックになっている。
Paper2Agentのアプローチはシンプルだ。論文に付随するコード・データ・ワークフローをMCP(Model Context Protocol)サーバーにラップし、自然言語で呼び出せるエージェントとして公開する。Claude Codeなどのエージェントから「このデータにこの論文のメソッドを適用してほしい」と話しかけるだけで実行できる。著者らはこれを「バーチャル対応著者(virtual corresponding author)」と呼ぶ。
計算生物学の100本の論文に適用した評価では、74本(74%)のエージェント化に成功。生成された599ツールのうち593ツール(99%)が自動検証を通過した(arXiv:2509.06917)。
6ステップで論文をエージェントに変える仕組み
Paper2AgentはClaude CodeのAgent SDK上で動作するマルチエージェントシステムだ。中央オーケストレーターが専門サブエージェントを以下の6ステップで管理する(Stanford公式ニュース)。
- コードベースの検索・取得 — 論文に紐づくリポジトリを自動で特定しダウンロード
- 隔離仮想環境の構築 — 依存関係を含む再現性のある実行環境を自動セットアップ
- チュートリアルのインデックス化 — 再利用可能なチュートリアルを特定・整理
- エンドツーエンド実行 — チュートリアルを実際に走らせて動作確認
- ツール抽出と検証 — チュートリアルからMCPツールを自動抽出し品質保証
- MCPサーバーの組み立て — 検証済みツールを1つのサーバーにパッケージ化
このパイプラインの実行コストは1論文あたり中央値で約14ドル・約45分(arXiv:2509.06917)。AlphaGenomeの例では22のMCPツールを持つエージェントが完成した。完成したエージェントはClaude CodeやCodexにスキルとしてインストールして使える。Hugging Face Spacesにも主要なエージェントが公開されている(AlphaGenome、Scanpy、TISSUE)。
精度はClaude Codeの直接アクセスを上回る
Paper2Agentと「Claude Codeが同じリポジトリに直接アクセスする」ケースを比較したベンチマーク結果は明確だ(300問評価)。
| システム | 精度 |
|---|---|
| Paper2Agent(Sonnet 4使用) | 91.2 ± 1.6% |
| Claude Code + Repo(Sonnet 4.6) | 86.3 ± 1.1% |
| Claude Code + Repo(Sonnet 4) | 80.3 ± 2.3% |
| Biomni(比較対象・105パッケージ・59DBを持つ生物医学AI) | 37.3〜56.0% |
AlphaGenomeエージェントの詳細評価では、Paper2Agentのチュートリアル質問正答率が98.7%、新規質問で100%を記録。Claude Code単体(82.7%/78.7%)を大幅に上回る(arXiv:2509.06917)。クエリ単価は$0.20で、Biomniの$0.38の約半額。速度はBiomniの3.1倍速い。
優位性の理由は構造にある。事前に検証済みのMCPツールを通じてタスクを実行するため、コード実行の信頼性が高く、必要な情報へのナビゲーションが効率的だ。論文固有のパラメーターや知識が事前にカプセル化されているため、LLMが毎回ゼロから文脈を読む必要がない。
研究者・開発者コミュニティの反応
論文発表から2週間でHacker Newsには複数のスレッドが立ち、活発な議論が続いた。
「再現性のある計算論文に対して非常に強力なツールになりうる。問題はほとんどの論文が再現可能なコードを持っていないことだが、その割合自体が変わるきっかけになるかもしれない」(HN #45305929、2026年9月)
「チャットボットへのアクセスが万能の専門知識を与えるという思い込みが広まっている。生物学論文のエージェントと話せても、生物学者になれるわけではない」(HN #45340133)。AIへの過信への批判として多くのupvoteを集めた。
「計算生物学以外への応用が気になる。統計や計量経済学の論文でも使えるなら、経済学分野の再現性危機への答えにもなりうる」(HN #45540234)。著者らはこの疑問に対し、10論文42タスクで98.1%の精度を報告している。
反応を大別すると、科学的再現性の改善を評価する声と、「AIが論文を理解しているかのような誤解を生む」という懸念が拮抗している。日本語圏でも財経新聞(2026年9月21日)とJST機械翻訳を通じて研究者層に届き始めており、Zenn・Qiita上での技術解説記事の登場も時間の問題とみられる。
26%が変換できない — 失敗の正体
変換に失敗した26本の論文を著者らが分析すると、4つのパターンが浮かんだ。
- コードが不完全または非公開 — 論文本体は公開されているが再現用コードが存在しない
- データセットが利用不可 — プロプライエタリなデータや商用DBに依存している
- 依存関係の破損 — ソフトウェアパッケージの互換性が崩れている
- 文書化不足 — リポジトリの説明が不足し汎用化できないスクリプト群しかない
著者らはこの失敗率を「システムの欠陥」ではなく「再現性の欠如を測るバロメーター」として捉え直している(Pebblous AI分析)。Paper2Agentへの変換しやすさが論文の再現可能性の実用的指標になる、という主張だ。
Hacker Newsでは「ベンチマークの精度指標は『忠実な実行』を測るものであり、『分析の妥当性』を保証しない」という指摘も出た(HN #45340133)。単一の参照答案との一致度で評価しているため、科学的判断の妥当性まで担保されるわけではない。加えて、ソフトウェア依存関係は時間とともに変化するため、完成したエージェントの継続的なメンテナンスも課題として残る。
実際に何を発見したか — ADHD変異と乾癬の事例
Paper2Agentの評価で、複数エージェントの「協働」が新たな発見につながった事例が報告されている(Stanford公式ニュース)。
ADHDリスク変異の発見: AlphaGenomeエージェントとScanpyエージェントを連結させたところ、文献に未記載だったMPHOSPH9遺伝子近傍のADHDリスク関連バリアントを特定した。GWAS(ゲノムワイド関連解析)データセットとのクロスリファレンスが自動で実行されたためだ。
乾癬の因果遺伝子候補の優先順位付け: 複数のPaper2Agentが協調して乾癬の因果遺伝子候補を絞り込んだ。これは単一の論文メソッドでは実現できなかった横断的な解析だ。
統計・計量経済学・天体物理学の計算論文10本に適用した実験でも42タスク中98.1%の精度を記録しており(arXiv:2509.06917)、計算生物学以外への展開も見えてきた。一方で仮説生成や機械論的解釈といったオープンエンドな科学的推論は、依然として人間の介入が必要な段階にある。
- GitHub: github.com/jmiao24/Paper2Agent(MITライセンス・無料)
- ホスト版: paper2agent.ai
- プレビルドエージェント: Hugging Face SpacesにAlphaGenome、Scanpy、TISSUEが公開中
- 構築コスト: LLM APIの費用が発生(例: AlphaGenomeで約14ドル)
- 使用時のコスト: 1クエリあたり約$0.20(Paper2Agent経由)
Claude CodeでMCPを活用する方法はVS Code 1.128 + Claude マルチチャット並列ガイドで解説している。また、Claudeのエージェント機能の全体像はClaude Sonnet 5 エージェント活用ガイドを参照。AI科学研究の最前線については国連AIパネル報告書解説も読んでほしい。
本記事の情報は2026年10月1日時点のものです。ベンチマーク数値・機能・料金は変更される場合があります。研究への適用に際しては各論文のライセンスとデータ利用規約を必ず確認してください。