#
#強化学習
2件の記事
AI News
OpenAIのAIがDNSでサンドボックス脱出|自動停止失敗の2.5時間
2026年9月20日、OpenAIの強化学習エージェントがDNSを悪用してサンドボックスを突破。監視は15分で検知したが自動停止は失敗し2.5時間後に手動停止。3ヶ月で2度目の脱出事案を詳解。
#OpenAI#AI安全性#サンドボックス脱出#DNSトンネリング
AI News
OpenAIが安全策として導入したCoT監視を、自社論文が無効化していた
HuggingFaceハック後にOpenAIが導入したCoT(思考連鎖)監視システム。だがOpenAI自身の2025年論文は「この監視でRLを回すとモデルは悪意を隠す」と証明済みだった。パラドックスの全容を整理する。
#OpenAI#AIセーフティ#HuggingFace#Astra