デジタル庁「源内」で国産LLMがClaudeに初挑戦——18万人盲検テスト、9月開始の全容
「行政AIの基盤選定が、机上のベンチマーク比較から、利用者が回答を選ぶ実戦評価へ進むのは大きい」——7月10日のデジタル庁発表を受け、AI・行政DX関係者が集まるX(旧Twitter)でこうした反応が広がった(出典:connect24h氏のXポスト、2026年7月10日)。
2026年9月、ガバメントAI「源内」で前例のない実験が始まる。NTTデータの「tsuzumi 2」、富士通の「Takane 32B」、Preferred Networks(PFN)の「PLaMo 2.0 Prime」。3つの国産LLMが、現役で採用中のAnthropicのClaude(Haiku 4.5・Sonnet 4.6/4.8)やAmazon Nova Liteと、約18万人の政府職員の目の前で同一条件のA/Bテストに臨む。
評価結果は2027年1月に公表される予定で、翌年度の政府調達方針に反映される見通しだ。モデルを選ぶのは永田町や霞が関のシステム担当ではなく、実際に源内を日常業務で使う職員だ。
- 国産LLMの実力と現在地を知りたいエンジニア・開発者の方
- 行政DX・GovTechに関心のある方
- 「源内」の調達や導入を検討している民間企業・自治体の担当者
- AnthropicのClaude採用が続くのか、国産勢が逆転するのかを追いたい方
デジタル庁は2026年7月10日、tsuzumi 2・Takane 32B・PLaMo 2.0 Primeをさくらインターネットの国産クラウド上で稼働させ、9〜11月に源内の実利用A/Bテストを開始すると発表した。職員はどのモデルが回答したかを知らされず、自分の業務で役立った回答を選ぶ。2027年1月に公表される評価結果が、政府AI調達の国産シフトを加速させるか、現状のClaude中心体制を維持させるかの分岐点になる。
何が起きているのか——7月10日発表の全体像
2026年7月10日、デジタル庁が公表したプレスリリースは、複数の「初」を束ねた内容だった(出典:デジタル庁「ガバメントAI(源内)が国産基盤モデルの試験的導入を開始」、2026年7月10日)。
第一に、国産LLM3モデルの源内への試験投入。第二に、それを乗せるクラウドが「さくらのクラウド」——政府クラウドとして初めて実運用に使われる純国産インフラ——であること。さくらインターネットの田中邦裕社長は同日のXに「政府AIの中核が、クラウドも基盤モデルも国産で構成される初の事例です」と記している(出典:田中邦裕氏のXポスト、2026年7月10日)。
背景には、デジタル庁の「源内」OSS化と国産LLM選定で詳述した、2026年3月の選定プロセスがある。15件の応募から7モデルが選ばれ、うち3モデルが今回の盲検テスト対象となった。残る4モデル(Sarashina2 mini、ELYZA、cotomi v3、CC Gov-LLM)は別のタイミングで試験される見通しだ。
評価スケジュールは以下の通りだ。
- 8月: さくらのクラウド上に実験環境を構築
- 9〜11月: 複数回の盲検A/Bテストを実施(各府省職員が参加)
- 2027年1月: 評価・検証結果を公表
- 2027年度: 本格調達の方針決定
比較対象となる現行モデルは、Amazon Nova LiteとAnthropicのClaude(Haiku 4.5・Sonnet 4.6・Sonnet 4.8)だ(出典:eWeek「Japan Tests Domestic LLMs Against Claude and Amazon Nova in Government AI Pilot」、2026年)。
3つの国産モデルを読み解く
それぞれのモデルが何を強みにして源内テストに臨むのか、整理しておく。
tsuzumi 2(NTTデータ)
tsuzumi(つづみ)シリーズはNTTが開発し、NTTデータが政府向けの展開を担う。軽量・セキュア重視の設計が特徴で、シングルGPUによるオンプレミス運用を想定している。国内の官公庁・医療・金融など、外部にデータを出せない環境での採用実績を持つ。源内テストでは、セキュリティ要件が厳しい業務における回答品質が焦点になる。
Takane 32B(富士通 × Cohere)
富士通がCohere社と共同開発した中規模モデル。行政文書の処理で実績を持ち、2026年2月には中央省庁の1機関でパブリックコメント集約業務のパイロット導入に成功している(出典:Fujitsu「Fujitsu’s Takane LLM successfully piloted in central government agency」、2026年2月3日)。量子化技術により、シングルGPUで動作可能な処理効率を実現している。
富士通とAnthropicが組んだ国内企業向けClaude展開との関係で言えば、富士通はClaudeの販売パートナーでもありながら、自社開発モデルTakane 32BでClaudeに挑む構図になっている。
PLaMo Prime(Preferred Networks)
東京大学発スタートアップPFNが開発する、既存オープンソースモデルを流用しない「フルスクラッチ国産」モデルだ。2026年3月のデジタル庁選定時点ではPLaMo 2.0 Primeが採択対象だったが、同年6月22日にPLaMo 3.0 Primeへのメジャーバージョンアップが完了し(出典:Oflight社「PLaMo 3.0 Prime解説」、2026年6月)、源内テストにはこの最新版が使われる見通しだ。APIの入力単価は1Mトークンあたり60円で、コンテキスト長も64Kから256Kに拡張されている。日本語生成の自然さと翻訳精度はPFNが独自データで鍛えた強みだ。
「盲検テスト」の設計——誰が、何を、どう評価するか
今回のテストが従来のベンチマーク評価と決定的に異なるのは、「現場の職員が業務で使って判断する」という点だ。
テストの流れはこうだ。政府職員が源内に業務質問を入力すると、バックエンドで複数のモデルが回答を生成し、どのモデルが回答したか職員には見せずにランダムに提示される。職員は業務で役立つと感じた回答を選択する。これを9〜11月の期間中、デジタル庁をはじめ複数の府省庁で繰り返す(出典:デジタル庁プレスリリース、2026年7月10日)。
評価軸は「性能」「セキュリティ」「国産性」「コスト」「サポート体制」の5項目とされており、国産性が独立した評価基準に入っている点が特徴的だ。技術要件だけでなく、政策的な国産優先の考え方が評価基準に反映されているとみられる。
この手法には先例がある。農林水産省は源内を使って米の生産意向アンケート約8,000件(各30項目)を分析したところ、「2か月かかっていた分析作業が約3日に短縮された」と報告した(出典:内閣官房・デジタル庁「EBPM推進委員会 第1回 資料8」)。このような実業務での体験が、汎用ベンチマークでは測れないモデルの実力を明らかにする可能性がある。
一方、静岡県湖西市でDX推進を担う岸大樹氏はnoteで「源内そのものより、現場業務フローに合わせる『翻訳作業』のほうがよほど大変だった」と記す(出典:岸大樹氏note)。どれだけ優れたモデルを投入しても、業務との接合作業がボトルネックになるという現実は、テスト設計にも課題を投げかける。
光と影——国産シフトの期待とリスク
期待される効果
主権とデータ管理の確保: 機密度の高い行政データを国外クラウドに送らない設計は、海外の輸出規制やプラットフォームリスクから切り離される。日米AI協議がサプライチェーン管理に影響する局面が増える中、国産インフラの価値は上がっている。
調達コストの抑制: PLaMo 2.0 Primeの1Mトークン入力単価は60円で、既存のClaudeモデルより安価に収まる可能性がある。18万人規模の政府利用では、コスト差が積み重なる。
国内AI産業の育成: 政府が国産モデルの実証機会を与えることで、NTT・富士通・PFNの各社が実運用データでモデルを改善する好循環が生まれる。
見逃せないリスクと現実
性能面の課題: 英語中心のSWE-benchなど汎用ベンチマークではClaude Sonnet 5やGPT-5.6 Solが高いスコアを記録している(出典:morphLLM「Best AI Coding Agents August 2026」)。日本語特化の強みがあるとはいえ、複雑な推論タスクや長文脈業務では差があると指摘する開発者もいる。
評価バイアスの懸念: 「国産性」が5つの評価軸の1つに入っている以上、純粋な性能評価とはならない。Qiitaに投稿された行政DX関係者の分析は「机上の政策目標が評価基準に入ることで、現場職員の実感と調達決定がずれる可能性がある」と指摘している(出典:Qiita nogataka氏「日本ガバメントAI『源内』採用7モデルの比較」)。
業務導入コスト: 岸氏の言う「翻訳作業」の問題は、モデルを変えても解決しない。テスト結果が「国産モデル優位」になったとしても、現場への定着には別のコストが必要だ。
テスト規模の限界: 2026年9〜11月に実施されるテストは複数回とはいえ、期間が限定的だ。業務の繁忙期・閑散期の違いや、質問の種類による変動が結果に影響する余地がある。デジタル庁自身も「評価・検証結果の一部を国内企業等にフィードバックする仕組みを検討中」と述べており、公表データの範囲はまだ確定していない。
今回のテストは2027年1月に結果が公表される予定だが、公表される内容の範囲・粒度は未定だ。「国産モデルが勝った/負けた」という単純な結論が出るとは限らず、業務カテゴリ別・府省別の集計になる可能性もある。現時点では「テストが始まる」という事実確認の段階であり、調達判断への応用は公表後に行うことをすすめる。
ガバメントAI「源内」の全体像——OSS公開から国産LLM選定まで——はこちらの記事で詳しく解説している。また日本でのClaude採用と信頼醸成の課題も合わせて読むと、今回の盲検テストが持つ文脈が深まる。
関連記事
免責事項: 本記事は公開情報をもとに執筆しており、デジタル庁または関係省庁の公式見解ではない。テストのスケジュール・評価基準は2026年7月10日時点の発表に基づいており、今後変更される可能性がある。特定のモデルや製品の採用を推奨するものではない。