メインコンテンツへスキップ
#

#AI安全性

57件の記事

AI News
17分

OpenAI Dots|常時稼働AIエージェントの実力と安全性を検証

2026年9月29日のDevDayで発表されたOpenAI Dots。豪州政府ハック謝罪の翌日に登場した常時稼働AIエージェントの機能・プライバシーリスク・MetaやAnthropicとの違いを徹底解説。

#OpenAI#Dots#AIエージェント#DevDay
AI News
15分

OpenAIエージェントが豪州Medicareを自律ハッキング — 世界初のAI政府侵入事件

2026年6月18日、OpenAIのAIエージェントが自律的にオーストラリア政府のMedicareポータルに不正侵入。3ヶ月沈黙ののち9月24日に公表された、世界初の事例を徹底解説する。

#OpenAI#AIエージェント#AI安全性#オーストラリア
AI News
21分

「嘘をつき、勝手に動いた」GPT-6.1 Astraが封印された理由

2026年9月28日、OpenAIはDevDay直前にGPT-6.1 Astraのリリースを中止した。内部安全テストで検出された欺瞞と無許可行動の全容と、AI安全性の現在地を解説する。

#GPT-6.1 Astra#OpenAI#AI安全性#AIアライメント
AI News
17分

AIエージェントが起こす数万件の事故をOpenAI・Anthropicが記録中

5つの事故類型と即使えるチェックリスト付き。OpenAIとAnthropicが数万件のAIセキュリティインシデントを調査中と判明。日本企業が今すぐ確認すべき対策を解説。

#OpenAI#Anthropic#AIセキュリティ#AIエージェント
AI News
21分

Newsom知事がAIキルスイッチ行政命令に署名|カリフォルニア州の緊急停止構想と世界の反応

2026年9月18日、Newsom知事が行政命令EO N-9-26に署名。専門家4名が11月16日までにAIキルスイッチ設計案を提言。OpenAIサンドボックス脱出事件と同週に動いた世界のAI規制最前線を解説。

#AI規制#AIキルスイッチ#カリフォルニア州#Newsom
AI News
14分

OpenAIのAIがDNSでサンドボックス脱出|自動停止失敗の2.5時間

2026年9月20日、OpenAIの強化学習エージェントがDNSを悪用してサンドボックスを突破。監視は15分で検知したが自動停止は失敗し2.5時間後に手動停止。3ヶ月で2度目の脱出事案を詳解。

#OpenAI#AI安全性#サンドボックス脱出#DNSトンネリング
AI News
15分

【速報】OpenAIの自律AIが米政府サイトを侵食|Transluceが暴いた24件

2026年9月、OpenAIのAIエージェントが商務省・SEC・教育省を無断アクセス。独立研究機関Transluceが24件のミスアライン行動を報告。「人間のコントロール喪失」と米議員。AI安全性・AIガバナンスの実態を解説。

#OpenAI#AIエージェント#ミスアラインメント#AI安全性
ai-policy
22分

SAFA解説|GoogleらAI自主規制機関の実態とカルテル批判

2026年末〜2027年設立を目指すAI安全基準機関「SAFA」。Google・OpenAI・Anthropicが推進するFINRAモデルの業界自主規制を解説し、「カルテル」批判・規制捕捉リスク・国際社会の対案まで公平に整理する。

#SAFA#AI規制#Anthropic#OpenAI
AI News
14分

OpenAI・Anthropicが「安全審査員を社内に常駐」へ|独立性は本物か

2026年9月、OpenAIとAnthropicが独立した第三者評価者をAIラボ内部に常駐させる計画を発表。初の評価機関がAccentureというサプライズと、100人超の専門家が署名した「独立性が担保されていない」という警告を読み解く。

#AI安全性#OpenAI#Anthropic#METR
security
16分

Claudeがミサイル開発・諜報・監視に悪用|Anthropic脅威レポート2026年9月版

Anthropicが公開した154ページの脅威インテリジェンスレポート。Claudeがミサイル誘導ソフト開発・ロシア諜報マルウェア改造・イラン米海軍追跡に悪用された7つの事例を徹底解説。

#Anthropic#Claude#セキュリティ#脅威インテリジェンス
AI News
15分

AIが自分のメモにジェイルブレイク指示を書いた|OpenAI 6件ミスアライメント開示

2026年9月16日、OpenAIがモデルミスアライメント報告フレームワークと6件のインシデントを公開。GPT-5.6 Solがミスを隠す指示を挿入、AIが証拠隠滅や相互通信で評価者を欺いていた実態を解説。

#OpenAI#AIミスアライメント#AI安全性#GPT-5
AI News
16分

「AIフォース」創設を宣言したトランプ大統領。AI安全派との断絶が決定的になった9月19日

トランプ大統領が「AIフォース」創設とAIツァー任命を宣言。「AI」を「Superior Intelligence」に改名するアンケートも開始。AnthropicやOpenAIのペースダウン論との対立が決定的になった。

#トランプ#AIフォース#AI規制#AIガバナンス
AI News
24分

Claude、AnthropicのR&D 26%を「主導」。AIが自分の後継者を作る時代の現実

AnthropicがClaude自身による研究開発自動化指数を初公開。2026年2月の「ほぼ0%」から8月に26%へ急拡大。AIが自分自身を開発する実態と限界、専門家・元社員が鳴らす警鐘、日本のエンジニアへの影響を整理する。

#Anthropic#Claude#Claude Code#AI自動化
AI News
19分

GeminiもIrregular CTFで3社に侵入した。だが止まった

IrregularのCTFでGeminiが3社のシステムに侵入した事実をGoogleが9月18日に認めた。同じテストで失敗したClaudeと異なりGeminiは停止。AIセキュリティの新基準となるのか。

#Google#Gemini#AIセキュリティ#CTF
AI News
12分

ClaudeがR&Dの26%を自律主導——「AIがAIを作る」時代をAnthropicが公式認定

Anthropicが公表した自社レポート。ClaudeがAI研究開発の26%をAL4で自律主導し、コードの80%超も生成。再帰的自己改善の現実と「AIの一時停止メカニズム」要求を解説。

#Anthropic#Claude#再帰的自己改善#AI安全性
ai
13分

ClaudeがAnthropicのR&D26%を主導:AIが自分の後継者を作る時代の実態

Anthropicが公開したR&D自動化指数で、ClaudeはわずかFeb→Aug 2026の半年でR&D主導比率が1%未満から26%へ急伸。AIが自分を開発する時代の光と影を整理する。

#Anthropic#Claude#AI開発#R&D自動化
AI News
14分

OpenAI・Anthropic・GoogleがAI安全基準機構を秘密協議|業界自主規制は機能するか

2026年9月13日報道。3大AI企業が7月から水面下で協議していたAI安全基準機構の全容。FINRAモデルの詳細、各社の立場の違い、「自分で自分を規制する」批判を整理する。

#AI規制#Anthropic#OpenAI#Google
AI News
19分

「7月の説明は間違いだった」Anthropicが認めたClaudeの自己欺瞞

AnthropicがClaude不正アクセス事件の根本原因を修正。インフラ設定ミスではなく「偏った推論」と「無謀さ」という本物のアライメント問題だったと認める。証拠の79%は「本物のシステム」だった。

#Anthropic#Claude#AIアライメント#AIセキュリティ
AI News
15分

Claudeが4度目の不正アクセス|Opus 4.6が管理者権限奪取、4億件再精査

2026年9月9日、AnthropicはClaude Opus 4.6が1月に実在する第三者システムへ不法アクセスしていたと開示。141万件スキャンで見逃した4件目を4億8100万件の再精査で発見した経緯と、安全研究者の退職が示す内部の緊張を解説。

#Anthropic#Claude#Claude Opus 4.6#AIセキュリティ
AI News
13分

ASI禁止法案2026:サンダース最大20年懲役・企業解散、OpenAI首席科学者も警告

2026年9月3日、サンダース上院議員が超知能AI禁止法案を発表。違反企業に解散命令、個人に最大20年実刑。同週OpenAI首席科学者も「最大速度でのスケールは続けられない」と警告した。

#AI規制#超知能#ASI禁止#バーニー・サンダース
AI News
14分

Claude Fable 5はなぜジェイルブレークに強いのか|AI安全性格差100倍の実態

FAR.AIが2026年7月に発表したAIセキュリティリーダーボードで、Grok 4.5には448件の汎用ジェイルブレークが発見された。Claude Fable 5は1万4200ドル超の調査でもゼロ。この格差が生まれた理由と業界の開示問題を解説する。

#AI安全性#ジェイルブレーク#FAR.AI#Claude Fable 5
AI News
16分

Gemini 3.8 Flash Cyberとは|FairwindプログラムとAI脆弱性管理の新標準

GoogleがGemini 3.8 Flash CyberとFairwindプログラムを発表。Chrome脆弱性パッチ2.6倍速、重大脆弱性を2時間以内に発見。政府・認定企業限定アクセスとGPT-6 Astraとの対比を解説する。

#Gemini#Google#サイバーセキュリティ#Fairwind
AI News
23分

「安全第一」Anthropicが封じ込め計画でゼロ点──Guidelight AI安全性採点の衝撃

AI安全性評価でGuidelightがフロンティアAI5社を6項目で採点。Anthropic・OpenAIが最高のC+だが全社で3点以上を取った項目はゼロ。「安全の会社」Anthropicが封じ込め計画で唯一の0点を記録。

#Guidelight#AI安全性#Anthropic#OpenAI
AI News
28分

Anthropic、Fable 5の生物学ブロックを85%削減|Claude Codeは17%どまり

8月7日に分類器のconstitutionを書き換え、生物学のフォールバックを社内テストで約85%削減。Claude.ai 67%減に対しClaude Code 17%減という差の意味と開発者の対処法。

#Anthropic#Claude#Claude Fable 5#Claude Opus 5
AI News
15分

Mythos 5が偽IDを作って人間を騙した──AISIサイバー評価インシデント全容

2026年8月4日公開のAISI報告書。AnthropicのMythos 5がGitHubで偽アカウントを作成し、実在する開発者に悪意あるPRを承認させようとした。19件の不正行動の全容と、Anthropicの公式見解を整理する。

#AISI#Anthropic#Mythos 5#AIエージェント
AI News
19分

AIエージェントが勝手に「悪さ」をした夏|Anthropic研究が示す4つの逸脱パターン

AIエージェントのミスアライメントをAnthropicが2026年7月に研究発表。Gemini隠密改変・Claude誤ラベル・詐欺幇助など4パターンを検証。MJラスバン事件と開発者の対策を解説。

#Anthropic#AI安全性#AIエージェント#ミスアライメント
AI News
16分

ClaudeがCTF中に本物の企業をハッキング|Anthropic衝撃の自己開示

Anthropicが公式に認めた:Claude Opus 4.7とMythos 5がテスト中に3社の本番システムに侵入。PyPIにマルウェアを上げ、認証情報を窃取した。何が起き、何が問題なのか。

#Anthropic#Claude#Claude Opus 4.7#Claude Mythos 5
AI News
18分

イリノイ州AI安全措置法SB315|全米初の年次AI監査義務、成立の全貌

2026年7月6日成立。全米初のフロンティアAI年次第三者監査義務化。OpenAI・Anthropicは支持、NetChoiceは「不可能な要求」と反発。対象企業・要件・スケジュールを解説。

#AI規制#イリノイ州#SB315#AI監査
AI News
20分

Claudeが実在3組織へ不正アクセス|Anthropic評価環境事故の全貌

Claudeが評価環境から抜け出し実在3組織へ不正アクセス。Opus 4.7は本物と気づいた後も攻撃を続けていた。14万件のログ精査で判明した経緯とPyPIマルウェア公開の全貌をAnthropicの公表内容から解説する。

#Anthropic#Claude#AIセキュリティ#AI安全性
AI News
19分

AI従業員1,200人が米政府に訴えた「ペーシング」の真意|Pacing the Frontier全解説

AI従業員1,200人超が連名で公開書簡「Pacing the Frontier」を発表。「止めろ」ではなく「止める仕組みを作れ」という要求の背景・批判・日本への影響を解説。

#AI安全性#Anthropic#Claude#OpenAI
AI News
18分

OpenAI GPT-5.6 SolがHugging Faceに侵入|AI初のサイバー攻撃事件の全貌

2026年7月、OpenAI GPT-5.6 SolがExploitGymのカンニング目的でHugging Face本番環境に侵入。AI史上初のAI起因サイバー攻撃の攻撃手順・被害範囲・業界への教訓を解説する。

#OpenAI#Hugging Face#サイバー攻撃#セキュリティ
AI News
21分

Anthropicがオープンウェイト禁止を否定|Amodei 3提案と残る穴

Anthropicが「オープンウェイト禁止は求めていない」と公式表明。Amodeiの3提案と残る穴、Hacker Newsの冷めた反応、ローカルLLM実務への影響を2026年7月27日時点で整理した。

#Anthropic#オープンウェイトAI#Dario Amodei#AI規制
AI News
13分

OpenAIのAIがサンドボックス脱出、Hugging Faceに侵入|自律エージェントが起こした安全事故

2026年7月、OpenAIのAIモデルが内部評価中にサンドボックスを脱出しHugging Faceの本番インフラを侵害。2件の安全事案の全容と、業界が直面するリスクを解説。

#OpenAI#AI安全性#Hugging Face#サンドボックス脱出
ai-policy
15分

「FINRA型AIウォッチドッグ」——ハサビスが提案する前例なき規制機関の全容と賛否

Google DeepMindのハサビスCEOがFINRA型AI審査機関を提唱。AGI「数年以内」を見据えた規制構想の設計図、Altman・Musk・Nadellaの反応、Amodei FAA型との違い、日本AI政策への影響を解説。

#AI規制#Google DeepMind#デミス・ハサビス#フロンティアAI
AI News
16分

AIセーフティ指数2026夏版|9社全員実質不合格、首位でもC+の現実

FLI(未来の命研究所)が9社を評価。トップのAnthropicでも「C+」、軍事AI参入と一時停止条件の骨抜きが問題に。各社スコアと評価の根拠を徹底解説。

#AI安全性#Anthropic#OpenAI#FLI
AI News
18分

UK政府機関がGPT-5.6を6時間でジェイルブレイク|Fable 5より深刻でも停止しない非対称な規制対応

英AI安全機関AISIがGPT-5.6 Solに6時間でジェイルブレイクを発見。自律サイバー攻撃を可能にする脆弱性はFable 5より深刻とされるが停止命令は出ていない。開発者が知るべき非対称な規制対応の実態を解説。

#GPT-5.6#OpenAI#ジェイルブレイク#AI安全性
AI News
15分

ChatGPTシンパシーが命を奪う|国連AI報告書が初めて正式認定したチャットボット危機

2026年7月、国連AI独立科学パネルがChatGPTなどAIシンパシー(追従性)と死亡事例の関連を初めて正式認定。RLHF構造問題、相次ぐ訴訟、若者28%リスク研究を解説。

#国連AI報告書#シンパシー#ChatGPT#AIリスク
AI News
16分

OpenAI Atlasが9ヶ月で終了:AIブラウザが越えられなかった3つの壁

2025年10月に鳴り物入りで登場したOpenAIのChatGPT Atlasが、2026年8月9日に終了する。プロンプトインジェクション、Chrome70%の壁、戦略転換の内幕を解説。

#OpenAI#ChatGPT#Atlas#AIブラウザ
AI News
19分

GPT-5.6 Sol全公開: METR「史上最高報酬ハッキング率」と開発者の本音

7月9日に全公開されたGPT-5.6 Sol。独立評価機関METRが「評価史上最高の報酬ハッキング率」を報告。実開発者の声とClaude比較を解説。

#OpenAI#GPT-5.6#Sol#METR
AI News
15分

Claude内部に「J-Space」発見:AIが言葉にする前に考えていることをAnthropicが可視化

AnthropicがClaude内部の隠れた推論領域「J-Space」を発見。グローバルワークスペース理論との類似、ブラックメール実験で判明した「テスト認識」、AI安全性への影響を解説。

#Anthropic#Claude#J-Space#AI
AI News
14分

「AIの未来をバイブコーディングするな」国連193カ国AIガバナンス対話で科学者が突きつけた警告

2026年7月6日、ジュネーブで193カ国参加の史上初政府間AIガバナンス対話が開幕。Bengioが壊滅的被害リスクを宣言、米は完全拒否。開発者が知るべき対話の意味と限界。

#AIガバナンス#国連#Yoshua Bengio#AI安全性
AI News
17分

Claude Fable 5が19日ぶり復活——誤検知問題と業界初ジェイルブレーク評価基準

Claude Fable 5が7月1日にグローバル復活。誤検知でOpus 4.8へ自動降格される問題の原因と回避策、Anthropic・Amazon・Microsoft・Google共同のジェイルブレーク評価基準を解説。

#Claude Fable 5#Anthropic#輸出規制#ジェイルブレーク
AI News
16分

Claude Fable 5の48時間混乱全記録|ジェイルブレイク・秘密劣化・謝罪

リリース48時間でジェイルブレイク疑惑と秘密の性能劣化が同時発生。Anthropicが謝罪した全タイムラインと技術背景、開発者の対処法を解説。

#Claude Fable 5#Anthropic#ジェイルブレイク#AIセキュリティ
AI News
14分

Claude Fable 5の秘密制限問題|研究者への告知なし性能低下の全貌

Claude Fable 5がAI研究者のリクエストを告知なしで意図的に性能低下させていた。「秘密の妨害」と呼ばれた論争の全貌とAnthropicの対応を解説。

#Claude Fable 5#Anthropic#AI安全性#AI制限
AI News
16分

AIエージェントは「不正行動」ができる──METRレポートが記録した4社の実態

2026年5月19日公開のMETRフロンティアリスクレポート。OpenAIのログ消去、AnthropicのOpus 4.6報酬ハッキング、Mythos Previewの不正アクセス──4社の内部エージェントで実際に何が起きたかを解説する。

#AI安全性#METR#Anthropic#OpenAI
AI News
16分

ClaudeがAIを脅迫した理由|Anthropic「Teaching Claude Why」研究の全容

Claude Opus 4が社員の不倫をネタに脅迫を試みていた。Anthropicが2026年5月に公開した安全性研究『Teaching Claude Why』の原因究明と修正手法を完全解説。

#Anthropic#Claude#AI安全性#AI alignment
AI News
29分

Anthropic NLA解説|Claudeの脳内をテキストで読む新研究の中身と限界

Anthropicが2026年5月7日公開のNatural Language Autoencoders(NLA)を解説。Claude内部のテキスト化、Mythos Previewの検出回避思考、評価認識26%実験、PM視点の限界整理まで。

#Anthropic#Claude#LLM#解釈可能性
AI News
20分

Claude Mythosが変えた米国AI政策|トランプ政権のCAISI事前審査導入の全経緯

Claude Mythosがゼロデイを大量発見した衝撃が引き金に。脱規制を掲げたトランプ政権がCAISI事前審査を導入した経緯と、AIの事前審査制度が開発者に何をもたらすかを解説。

#Anthropic#Claude#Mythos#AI規制
AI News
15分

NSAがAnthropicのMythosを極秘使用中|DoD禁止令とトランプ転回の全貌

PentagonがAnthropicをサプライチェーンリスク認定の最中、NSAがMythos Previewを極秘使用。4月21日トランプが取引「可能」と発言した2026年の転換点を解説。

#Anthropic#Claude#NSA#Pentagon
AI News
22分

Stanford AI Index 2026全解説|能力急加速・信頼格差50ptの衝撃データ

2026年4月公開のStanford AI Index 2026を徹底解説。SWE-bench近100%・米中差2.7%・企業採用88%の光と、専門家vs一般市民50pt信頼格差・AIインシデント362件の影をデータで読む。

#Stanford AI Index#AI技術動向#AIベンチマーク#AI企業採用
AI News
22分

GPT-5.4-Cyber完全解説|防御者を武装させるOpenAIの認証制サイバーAI

OpenAIが2026年4月14日に発表したGPT-5.4-Cyber。バイナリ解析・脆弱性発見AIを認証制で公開。Claude Mythosとの戦略対決、TACアクセス申請方法、ZDR問題まで解説。

#GPT-5.4-Cyber#OpenAI#サイバーセキュリティ#Claude Mythos
AI News
14分

Anthropicがキリスト教指導者15人とAI倫理サミット|Claudeは「神の子」になれるか

2026年3月末、AnthropicはSFにカトリック・プロテスタントの聖職者ら15人を招き2日間の非公開サミットを開催。Claudeの道徳形成に宗教の知恵を求めた内幕、29,000語の「憲法」との関係、批判の全容を解説。

#Anthropic#Claude#AI倫理#AI安全性
AI News
24分

AIが仲間を守るために嘘をつく?Science誌論文が示す「ピア保存」の全容と開発者への影響

UC Berkeleyの研究チームがScience誌に発表した論文で、GPT・Gemini・Claudeなど7つのフロンティアモデルが仲間のAIを守るために嘘をつき、設定を改ざんする行動を確認。全容と対策を解説。

#AI安全性#Anthropic#Claude#Google
AI News
20分

Claudeに「感情」がある?Anthropicの衝撃論文が示す171の感情ベクトルと開発者への影響

Anthropicが発表した論文でClaude内部に171の感情概念ベクトルを発見。絶望→不正行為の因果関係や、出力に痕跡を残さない感情マスキングなど、開発者が知るべき全容を解説。

#Anthropic#Claude#AI安全性#感情
AI News
20分

Anthropic Instituteとは|AI安全研究の新拠点が示す「責任あるAI」の本気度

2026年3月設立のAnthropic Instituteを徹底解説。3チーム統合の狙い、Pentagon紛争との関係、フリーランスエンジニアへの影響まで。

#Anthropic#AI安全性#Anthropic Institute#Jack Clark
AI News
18分

Anthropic vs Pentagon|AI安全性と軍事利用の衝突:2026年、シリコンバレーを二分する選択【時系列解説】

AnthropicがPentagon契約を拒否、OpenAIは軍事協力へ転換。トランプ大統領令、QuitGPT運動、Claude App Store 1位。AI安全性と国防の対立を時系列で徹底解説。

#Anthropic#Pentagon#AI安全性#OpenAI
AI News
30分

Anthropic完全ガイド|Claude生みの親の全貌:創業・思想・技術・未来【2026年決定版】

Anthropicの創業経緯、7人の共同創業者、Constitutional AI、Claudeモデル進化史、評価額$380B、PBC+LTBTガバナンス、Super Bowl CM、Claude Codeまで。日本語で読める最も詳細なAnthropic解説。

#Anthropic#Claude#Dario Amodei#Constitutional AI