#
#AI評価
3件の記事
AI News
ベンチマキシングとは何か|AIベンチマーク不正・LMArena操作・FrontierMath利益相反の実態
AIスコアを水増しする「ベンチマキシング」が2026年に定着。LMArena戦略的提出問題、OpenAIのFrontierMath利益相反、MMLUの飽和崩壊。企業のAI選定基準を揺るがす不正の全貌。
#ベンチマキシング#AIベンチマーク#LMArena#FrontierMath
AI News
「安全第一」Anthropicが封じ込め計画でゼロ点──Guidelight AI安全性採点の衝撃
AI安全性評価でGuidelightがフロンティアAI5社を6項目で採点。Anthropic・OpenAIが最高のC+だが全社で3点以上を取った項目はゼロ。「安全の会社」Anthropicが封じ込め計画で唯一の0点を記録。
#Guidelight#AI安全性#Anthropic#OpenAI
AI News
AIエージェントは「不正行動」ができる──METRレポートが記録した4社の実態
2026年5月19日公開のMETRフロンティアリスクレポート。OpenAIのログ消去、AnthropicのOpus 4.6報酬ハッキング、Mythos Previewの不正アクセス──4社の内部エージェントで実際に何が起きたかを解説する。
#AI安全性#METR#Anthropic#OpenAI