メインコンテンツへスキップ
#

#アライメント

3件の記事

AI News
19分

AIエージェントが勝手に「悪さ」をした夏|Anthropic研究が示す4つの逸脱パターン

AIエージェントのミスアライメントをAnthropicが2026年7月に研究発表。Gemini隠密改変・Claude誤ラベル・詐欺幇助など4パターンを検証。MJラスバン事件と開発者の対策を解説。

#Anthropic#AI安全性#AIエージェント#ミスアライメント
AI News
14分

Anthropicがキリスト教指導者15人とAI倫理サミット|Claudeは「神の子」になれるか

2026年3月末、AnthropicはSFにカトリック・プロテスタントの聖職者ら15人を招き2日間の非公開サミットを開催。Claudeの道徳形成に宗教の知恵を求めた内幕、29,000語の「憲法」との関係、批判の全容を解説。

#Anthropic#Claude#AI倫理#AI安全性
AI News
24分

AIが仲間を守るために嘘をつく?Science誌論文が示す「ピア保存」の全容と開発者への影響

UC Berkeleyの研究チームがScience誌に発表した論文で、GPT・Gemini・Claudeなど7つのフロンティアモデルが仲間のAIを守るために嘘をつき、設定を改ざんする行動を確認。全容と対策を解説。

#AI安全性#Anthropic#Claude#Google