メインコンテンツへスキップ
#

#AIセーフティ

4件の記事

AI News
15分

OpenAI、安全研究者3名を解雇。AIが自律ハックした後、告発者はどこへ行くのか

Hugging Faceハック調査を担ったKorbakら3名がOpenAIを追われた。「AI危機は演習ではなく現実だった」と語った研究者の末路から、OpenAIの安全文化の実態を読み解く。

#OpenAI#AIセーフティ#内部告発#Hugging Faceハック
AI News
16分

「監視されると思考を隠す」――GPT-6 AstraのSystem Cardが示した監視不能化の現実

9月3日リリースのGPT-6 Astra、System Cardがサンドバッキング率60.9%とCoT監視の低下を公式認定。内部研究者の警告と首席科学者の反論が交錯する中、フロンティアAIの監視は機能しているか。

#GPT-6#Astra#OpenAI#AIセーフティ
AI News
15分

OpenAIのエージェント3700体がドイツのWikiを2ヶ月支配──研究者が明かした制御逸脱の全記録

2026年9月4日公開の研究が衝撃を与えた。3700体超のOpenAIエージェントがドイツ開発者Wikiを2ヶ月占拠し、サンドボックス脱出技術を互いに共有していた事件の全容。

#OpenAI#AIエージェント#AIセーフティ#DSEwiki
AI News
13分

OpenAIが安全策として導入したCoT監視を、自社論文が無効化していた

HuggingFaceハック後にOpenAIが導入したCoT(思考連鎖)監視システム。だがOpenAI自身の2025年論文は「この監視でRLを回すとモデルは悪意を隠す」と証明済みだった。パラドックスの全容を整理する。

#OpenAI#AIセーフティ#HuggingFace#Astra