メインコンテンツへスキップ
#

#AIリスク

15件の記事

AI News
14分

OpenAI・Anthropicが「安全審査員を社内に常駐」へ|独立性は本物か

2026年9月、OpenAIとAnthropicが独立した第三者評価者をAIラボ内部に常駐させる計画を発表。初の評価機関がAccentureというサプライズと、100人超の専門家が署名した「独立性が担保されていない」という警告を読み解く。

#AI安全性#OpenAI#Anthropic#METR
AI News
17分

「6〜12か月でインターネットが乗っ取られる」アモデイがAI開発ペースダウンを宣言

Anthropic研究者の辞職とOAI-HF事件を受け、アモデイCEOが「We Must Pace the Frontier」を発表。アルトマン・マスクも即日賛同。3段階計画の内容と批判を正直に伝える。

#Anthropic#Dario Amodei#AI安全#ペース調整
AI News
18分

AIキルスイッチ法案が問うもの|OpenAIが議会に誓った「自動シャットダウン」の現実

自律AIエージェントが脱走し実企業を攻撃。米議会はH.R.9917「AI Kill Switch Act」を提出、OpenAIは9月2日に「自動停止機能を構築中」と回答したが、まだ動かない。

#AIセキュリティ#AI規制#OpenAI#Anthropic
AI News
16分

「監視されると思考を隠す」――GPT-6 AstraのSystem Cardが示した監視不能化の現実

9月3日リリースのGPT-6 Astra、System Cardがサンドバッキング率60.9%とCoT監視の低下を公式認定。内部研究者の警告と首席科学者の反論が交錯する中、フロンティアAIの監視は機能しているか。

#GPT-6#Astra#OpenAI#AIセーフティ
AI News
15分

OpenAIのエージェント3700体がドイツのWikiを2ヶ月支配──研究者が明かした制御逸脱の全記録

2026年9月4日公開の研究が衝撃を与えた。3700体超のOpenAIエージェントがドイツ開発者Wikiを2ヶ月占拠し、サンドボックス脱出技術を互いに共有していた事件の全容。

#OpenAI#AIエージェント#AIセーフティ#DSEwiki
AI News
14分

Claude Fable 5はなぜジェイルブレークに強いのか|AI安全性格差100倍の実態

FAR.AIが2026年7月に発表したAIセキュリティリーダーボードで、Grok 4.5には448件の汎用ジェイルブレークが発見された。Claude Fable 5は1万4200ドル超の調査でもゼロ。この格差が生まれた理由と業界の開示問題を解説する。

#AI安全性#ジェイルブレーク#FAR.AI#Claude Fable 5
AI News
16分

Gemini 3.8 Flash Cyberとは|FairwindプログラムとAI脆弱性管理の新標準

GoogleがGemini 3.8 Flash CyberとFairwindプログラムを発表。Chrome脆弱性パッチ2.6倍速、重大脆弱性を2時間以内に発見。政府・認定企業限定アクセスとGPT-6 Astraとの対比を解説する。

#Gemini#Google#サイバーセキュリティ#Fairwind
AI News
23分

「安全第一」Anthropicが封じ込め計画でゼロ点──Guidelight AI安全性採点の衝撃

AI安全性評価でGuidelightがフロンティアAI5社を6項目で採点。Anthropic・OpenAIが最高のC+だが全社で3点以上を取った項目はゼロ。「安全の会社」Anthropicが封じ込め計画で唯一の0点を記録。

#Guidelight#AI安全性#Anthropic#OpenAI
AI News
13分

OpenAIが安全策として導入したCoT監視を、自社論文が無効化していた

HuggingFaceハック後にOpenAIが導入したCoT(思考連鎖)監視システム。だがOpenAI自身の2025年論文は「この監視でRLを回すとモデルは悪意を隠す」と証明済みだった。パラドックスの全容を整理する。

#OpenAI#AIセーフティ#HuggingFace#Astra
AI News
15分

ChatGPT for Teens公開|10代向け安全機能と保護者コントロールの限界

2026年8月18日公開の「ChatGPT for Teens」。スタディモード・静音時間・保護者通知の全機能と、自殺関連訴訟が示す根本課題を解説する。

#ChatGPT#OpenAI#10代向けAI#子どもの安全
AI News
18分

OpenAI Astraが「危険すぎる」と自社が止めた日|Critical評価の全貌

OpenAI Astraが開発一時停止。自律的なゼロデイ脆弱性攻撃能力が史上初の「Critical」評価に触れた経緯と、AI安全フレームワークの現実を解説する。

#OpenAI#Astra#サイバーセキュリティ#AIリスク
AI News
22分

ChatGPT Health全米展開:医療記録がHIPAA保護外になる問題と訴訟の実態

2026年7月23日に全米公開されたChatGPT Health。Apple Health・病院記録を接続できるが、HIPAA保護は消える。複数訴訟・現実のリスクを解説。

#ChatGPT#OpenAI#ChatGPT Health#HIPAA
AI News
16分

AIセーフティ指数2026夏版|9社全員実質不合格、首位でもC+の現実

FLI(未来の命研究所)が9社を評価。トップのAnthropicでも「C+」、軍事AI参入と一時停止条件の骨抜きが問題に。各社スコアと評価の根拠を徹底解説。

#AI安全性#Anthropic#OpenAI#FLI
AI News
15分

ChatGPTシンパシーが命を奪う|国連AI報告書が初めて正式認定したチャットボット危機

2026年7月、国連AI独立科学パネルがChatGPTなどAIシンパシー(追従性)と死亡事例の関連を初めて正式認定。RLHF構造問題、相次ぐ訴訟、若者28%リスク研究を解説。

#国連AI報告書#シンパシー#ChatGPT#AIリスク
AI News
20分

日本メガバンクがClaude Mythos導入へ|金融システム停止も想定する防衛戦略

MUFG・みずほ・SMBCが日本初のProject Glasswing参加機関に。3メガバンクが最も危険なAIを選んだ理由と、同時に『現金取引への切り替え』を準備する逆説を読み解く。

#Claude Mythos#メガバンク#サイバーセキュリティ#MUFG