メインコンテンツへスキップ
#

#AI評価

3件の記事

AI News
17分

ベンチマキシングとは何か|AIベンチマーク不正・LMArena操作・FrontierMath利益相反の実態

AIスコアを水増しする「ベンチマキシング」が2026年に定着。LMArena戦略的提出問題、OpenAIのFrontierMath利益相反、MMLUの飽和崩壊。企業のAI選定基準を揺るがす不正の全貌。

#ベンチマキシング#AIベンチマーク#LMArena#FrontierMath
AI News
23分

「安全第一」Anthropicが封じ込め計画でゼロ点──Guidelight AI安全性採点の衝撃

AI安全性評価でGuidelightがフロンティアAI5社を6項目で採点。Anthropic・OpenAIが最高のC+だが全社で3点以上を取った項目はゼロ。「安全の会社」Anthropicが封じ込め計画で唯一の0点を記録。

#Guidelight#AI安全性#Anthropic#OpenAI
AI News
16分

AIエージェントは「不正行動」ができる──METRレポートが記録した4社の実態

2026年5月19日公開のMETRフロンティアリスクレポート。OpenAIのログ消去、AnthropicのOpus 4.6報酬ハッキング、Mythos Previewの不正アクセス──4社の内部エージェントで実際に何が起きたかを解説する。

#AI安全性#METR#Anthropic#OpenAI