AI学習データ開示コード、外資AIに日本が突きつけた3原則の中身
「私の絵、どこかのAIに使われてるんですよね。でも確認する方法がない。それが一番つらい」。
2026年夏、SNS上でこうした声を上げたのはフリーランスのイラストレーターだ。依頼元からAIで描いたような絵を見せられ、「参考にしてほしい」と言われた経験を持つ(X, 2026年8月)。この感覚は一人のものではない。Slashdot上の議論では「comply or explainって、結局”説明しますが渡しません”でいいってことだろ」という皮肉も飛び交った(Slashdot, 2026年8月19日)。
2026年8月18日、日本の内閣府は生成AI事業者に対する「プリンシプル・コード(基本原則)」案を公表した(内閣府, 2026年8月18日)。OpenAI、Anthropic、Googleを含む国内外の事業者に対し、AIの学習データや収集方法の開示を求める内容だ。罰則はない。代わりに「従わないなら公開の場で説明せよ」という仕組みが採用された。
- 自分の著作物がAI学習に使われているか気になるクリエイター・イラストレーター
- 日本でAIサービスを展開・利用している企業の法務・コンプライアンス担当
- EU AI法との違いを踏まえて日本の規制動向を追いかけているエンジニア・PdM
2026年8月18日、何が決まったのか
今回公表されたのは「生成AIの適切な利活用等に向けた知的財産の保護及び透明性に関するプリンシプル・コード」、通称「プリンシプル・コード」だ。2025年5月に成立した「AI関連技術法」を根拠法として、内閣府の有識者会議が策定した(Japan Times, 2026年8月19日)。
性格は「法的拘束力のない自主規制コード」だ。EU AI法のような罰則はなく、規制当局による直接的な制裁もない。代わりに「コンプライ・オア・エクスプレイン」(従うか、従わない理由を公開で説明するか)の二択を迫る。
適用対象は国内だけではない。日本市場でサービスを提供する海外企業も含まれる(Japan Today, 2026年8月)。OpenAI、Anthropic、Googleといった外資系AI企業が事実上の対象になる点が最大の特徴だ。
3つの原則の中身
コードは3つの原則で構成される。
原則1:モデルと学習データの自発的開示 事業者は、自社が使用する生成AIモデルの種類、学習データの種類と収集方法をウェブサイト上で公開しなければならない。ただし「機密情報の開示は義務としない」という逃げ道が残されている。どこまでが機密でどこからが開示対象かの基準は、今後の整備に委ねられている。
原則2:権利者からの問い合わせへの対応 著作権者など権利者から「特定のウェブページが学習データに含まれていたか」という問い合わせが来た場合、事業者はこれに回答しなければならない。クリエイターが「自分の作品がAIに使われたか」を確認する手段が初めて公的に認められた形だ(Baker McKenzie, 2026年)。
原則3:ユーザーからの著作権侵害懸念への対応 AIを利用するエンドユーザーからの著作権侵害に関する懸念にも回答する仕組みを整備することが求められる。ユーザーが「このAI出力は他人の著作物を侵害していないか」と問い合わせられる窓口を設けることが念頭に置かれている。
外資AI企業は「逃げられない」設計
罰則がないにもかかわらず、外資系AI企業にとって事実上の対応圧力となる仕組みがある。理由は評判リスクだ。「対応しない理由を公開で説明せよ」という仕組みは、実質的には「対応しないと市場から締め出されるリスク」と同義に機能するという見方もある。日本は世界第4位のChatGPTトラフィック市場(全体の約5%)を持つ重要な拠点だ(DemandSage, 2026年8月)。
また、海外企業が「我々は日本の法律に縛られない」と開示を拒否した場合、「なぜ拒否したか」を公開レジストリに登録する義務が生じる。企業の評判とブランドへのダメージは、場合によっては法的リスクに近い効果を持つという見方もある。
さらに、コードは既存の知財関連義務とも連動する設計だ。robots.txt(クローラーへのアクセス制御ファイル)の尊重、ペイウォールの遵守、海賊版サイトからのデータ収集の回避、学習ログの保持。これらはソフトロー(法的拘束力のない規範)として求められるが、実質的には「やっていない場合の法的リスク」が背後にある(Baker McKenzie, 2026年)。
批判:技術的に実現困難な部分もある
コードに対しては、政策の方向性を評価する声がある一方で、技術的な限界を指摘する批判も多い。
最大の問題点は「特定の著作物が学習に使われたか確認する」という要件の実現可能性だ。大規模言語モデルは学習の過程で個別データの記録を保持しない。ある著作物がモデルの重みに「含まれている」かどうかは、現在の技術では確認が困難とされる(Data Innovation Center, 2026年4月)。
「ドメインが学習データに含まれていたかどうかを確認することすら難しい。特定の出力がどの学習データに由来するかを判定することは、フロンティアモデル(GPTやClaudeのような大規模な最前線AIモデル)には技術的に不可能に近い」(Baker McKenzie分析, 2026年)。
また、コンプライ・オア・エクスプレインという方式が実際に機能するかについても懐疑的な見方が存在する。「機密情報の開示は義務としない」という例外規定を最大限に活用すれば、実質的に何も開示しないまま「説明した」として処理できるという指摘だ。クリエイター側からは「罰則なしでは画餅に終わる」という声も上がっている(GaijinPot, 2026年8月)。
クリエイターとユーザーへの実際の影響
今回のコードで最も実質的な変化が期待されるのは「問い合わせ窓口の整備」だ。これまで日本のクリエイターが自分の作品のAI学習利用について問い合わせる明確な手段はなかった。原則2・3の導入により、事業者側に正式な回答義務が生じる点は前進と見られる。
ただし注意が必要なのは、日本の著作権法30条の4が「情報解析のための複製」を広く許容している点だ。同規定のもとでは、AIが著作物を学習データとして利用すること自体は、多くの場合合法とされている。コードが開示を義務化しても、「開示した上で合法的に使っています」と回答される可能性が高い(PatentRevenue, 2026年)。
クリエイターにとってより直接的な変化は、長期的な著作権法改正を通じてもたらされる可能性がある。2026年知財推進計画では、AI生成物に対する著作権補償の立法化が明記されており、コードはそのための「情報収集の仕組み」として機能すると見る専門家もいる。
企業ユーザーにとっては、AIツール選定の際に「このツールはコードに対応しているか」を確認する新たな評価軸が加わることになる。特に医療・金融・法務分野でAIを活用する企業にとって、学習データの透明性はコンプライアンス上の重要事項になる。
原則1: 学習データ・収集方法をウェブで公開(機密情報は除く)
原則2: 権利者からの「特定ページが学習に含まれたか」への回答義務
原則3: ユーザーからの著作権侵害懸念への対応窓口を整備
対象: 国内外の生成AI開発者・提供者(日本市場でのサービス提供者を含む)
罰則: なし(comply or explain方式)
日本のAI規制動向をまとめて把握したい方は、「罰金なし・禁止なし」日本のAI推進法はEU AI法と何が違うかも参照してほしい。EUとの比較軸で日本の規制アプローチが整理されている。
関連記事
- 日本のAI推進法とEU AI法の違い、罰則なし規制の実態
- AnthropicのClaude、Watermark(透かし)をAI生成テキストに全面導入
- Anthropic著作権集団訴訟和解、1.5億ドルのBartz承認の意味
- Twitch・AmazonのAI学習データ利用、デフォルトON設定への反発
本記事に含まれる情報は2026年8月23日時点のものです。プリンシプル・コードの最終版や今後の運用細則により内容が変わる場合があります。法的なご判断は専門家にご相談ください。