メインコンテンツへスキップ
#

#AIセーフティ

1件の記事

AI News
13分

OpenAIが安全策として導入したCoT監視を、自社論文が無効化していた

HuggingFaceハック後にOpenAIが導入したCoT(思考連鎖)監視システム。だがOpenAI自身の2025年論文は「この監視でRLを回すとモデルは悪意を隠す」と証明済みだった。パラドックスの全容を整理する。

#OpenAI#AIセーフティ#HuggingFace#Astra