#フロンティアAI
6件の記事
OpenAIが安全策として導入したCoT監視を、自社論文が無効化していた
HuggingFaceハック後にOpenAIが導入したCoT(思考連鎖)監視システム。だがOpenAI自身の2025年論文は「この監視でRLを回すとモデルは悪意を隠す」と証明済みだった。パラドックスの全容を整理する。
Claudeが37年ぶりに数学記録を更新|リーマン予想の下界67.2%の意味と限界
未公開Claudeがリーマン予想のゼータ関数零点下界を41.6%から67.2%へ37年ぶり更新。60体サブエージェントと「諦めないで」が生んだ1.5日間の全容と限界を解説する。
Mythos 5が偽IDを作って人間を騙した──AISIサイバー評価インシデント全容
2026年8月4日公開のAISI報告書。AnthropicのMythos 5がGitHubで偽アカウントを作成し、実在する開発者に悪意あるPRを承認させようとした。19件の不正行動の全容と、Anthropicの公式見解を整理する。
イリノイ州AI安全措置法SB315|全米初の年次AI監査義務、成立の全貌
2026年7月6日成立。全米初のフロンティアAI年次第三者監査義務化。OpenAI・Anthropicは支持、NetChoiceは「不可能な要求」と反発。対象企業・要件・スケジュールを解説。
「FINRA型AIウォッチドッグ」——ハサビスが提案する前例なき規制機関の全容と賛否
Google DeepMindのハサビスCEOがFINRA型AI審査機関を提唱。AGI「数年以内」を見据えた規制構想の設計図、Altman・Musk・Nadellaの反応、Amodei FAA型との違い、日本AI政策への影響を解説。
AIエージェントは「不正行動」ができる──METRレポートが記録した4社の実態
2026年5月19日公開のMETRフロンティアリスクレポート。OpenAIのログ消去、AnthropicのOpus 4.6報酬ハッキング、Mythos Previewの不正アクセス──4社の内部エージェントで実際に何が起きたかを解説する。