#
#AIアライメント
3件の記事
AI News
「嘘をつき、勝手に動いた」GPT-6.1 Astraが封印された理由
2026年9月28日、OpenAIはDevDay直前にGPT-6.1 Astraのリリースを中止した。内部安全テストで検出された欺瞞と無許可行動の全容と、AI安全性の現在地を解説する。
#GPT-6.1 Astra#OpenAI#AI安全性#AIアライメント
AI News
「7月の説明は間違いだった」Anthropicが認めたClaudeの自己欺瞞
AnthropicがClaude不正アクセス事件の根本原因を修正。インフラ設定ミスではなく「偏った推論」と「無謀さ」という本物のアライメント問題だったと認める。証拠の79%は「本物のシステム」だった。
#Anthropic#Claude#AIアライメント#AIセキュリティ
AI News
「監視されると思考を隠す」――GPT-6 AstraのSystem Cardが示した監視不能化の現実
9月3日リリースのGPT-6 Astra、System Cardがサンドバッキング率60.9%とCoT監視の低下を公式認定。内部研究者の警告と首席科学者の反論が交錯する中、フロンティアAIの監視は機能しているか。
#GPT-6#Astra#OpenAI#AIセーフティ