メインコンテンツへスキップ
#

#ベンチマーク

19件の記事

AI News
14分

Gemini 4 Argon 徹底解説:ベンチマーク首位奪還も限定公開の理由【2026年10月】

GoogleがGemini 4 Argonをリリース。18項目中12首位のベンチマーク結果、1Mトークン出力対応、サイバー防衛限定公開の背景、Claude/GPT-6との比較を徹底解説。

#Gemini 4 Argon#Google DeepMind#フロンティアAI#ベンチマーク
AI Tools
14分

Cognition SWE-2:Kimi K3後処理でFable 5.1と同点、64%安の実態と制約

2026年9月10日リリース。Kimi K3をRLで後処理したSWE-2がFable 5.1並みのFrontierCode 50.0%・64%安を主張。ただしAPIなし・Devin専用。制約の意味と使いどころを読む。

#Cognition#SWE-2#Devin#Kimi K3
AI News
15分

Sakana AI「Fugu Max」の実力と誤算。フロンティアモデル不要を掲げた東京発AIの光と影

Sakana AIのFugu Max/Ultra v2が9月11日公開。Fable 5除外でChartography首位も「これはOpenRouterでは?」と開発者。ベンチマークの読み方と実用上の限界を検証。

#サカナAI#Fugu Max#AIオーケストレーション#マルチエージェント
AI News
20分

Gemini 3.8 Flash 完全解説|価格据え置きでも実コスト4割増の思考トークン問題

2026年9月2日リリースのGemini 3.8 Flash。表面価格は3.7と同額でも、思考トークンが出力の約73%を占め実コストが膨らむ。Flash Cyber・Fairwindプログラムの全容も解説。

#Google#Gemini#Gemini 3.8 Flash#AI比較
AI News
16分

NVIDIAのAVOがARC-AGI-3で満点|真の主役はモデルではなくハーネスだった

同じClaude Opus 5が単体30%→AVO搭載で100%。2026年8月21日、NVIDIAが公開セット全183レベルを制覇。「モデルではなくハーネスが主役」という不都合な真実を解説する。

#NVIDIA#AVO#ARC-AGI-3#Claude Opus 5
ai-models
17分

Gemini 3.7 Flash完全解説|3週間で前世代を超えたコーディングAIの実力と限界

8月13日リリースのGemini 3.7 Flash。FrontierCode 43.6%・半額以下の価格。Sonnet 5・GPT-5.6 Terraとの実ベンチ比較と「まだ弱い点」を正直に整理する。

#Gemini#Gemini 3.7 Flash#Google#LLM
AI News
20分

Grok 4.6レビュー|Opus 5に迫る61点、2.4倍コスト安の勝算と500Kの壁

xAIが8月12日公開のGrok 4.6はIntelligence Index 61点でOpus 5(63点)に肉薄。2.4倍コスト安・1.6倍速の強みと500Kの制限・Trustpilot問題を実ユーザーの声で読み解く。

#Grok#xAI#Grok 4.6#AIモデル比較
AI News
15分

DeepSeek V4 Flash 0731 正式公開|ProをAgentベンチで超えた仕組みと限界

コスト21分の1でProモデルを超えたFlash 0731の実態。Terminal-Bench 82.7、DeepSWE 645%改善の詳細と、自己申告ベンチの問題・中国サーバーリスクを整理する。

#DeepSeek#DeepSeek V4 Flash#エージェントAI#LLM
ai-models
19分

Gemini 3.6 Flashは「最悪の新モデル」か|炎上分析とコスト実績データで検証

Gemini 3.6 FlashはSNSで「最悪モデル」と炎上中。本当にそうなのか?コスト最大71%削減の実績データと、エージェント性能向上の根拠を数値で検証する。

#Gemini 3.6 Flash#Gemini#Google#LLM
AI News
19分

Grok 4.5公開|料金1/8の衝撃と幻覚率54%の代償【Claude比較】

SpaceXAIが7月8日にGrok 4.5を一般公開。$2/$6の低価格とエージェント性能首位の一方、幻覚率は25%から54%に倍増。実ユーザーの賛否と使い分けの判断基準を整理する。

#Grok#xAI#SpaceXAI#Grok 4.5
AI News
20分

GPT-5.6 Sol/Terra/Luna 完全検証 — ベンチマーク不正と Fable 5 半額の現実

OpenAIが本日公開したGPT-5.6ファミリー(Sol・Terra・Luna)を徹底検証。METRが史上最高のベンチマーク不正率を記録する一方、Claude Fable 5の半額という価格差が開発者を引きつける。

#OpenAI#GPT-5.6#Sol#Terra
AI News
22分

Grok 4.5 private beta始動:Cursor学習データと閉鎖エコシステムの現実

Elon MuskがGrok 4.5のprivate betaをSpaceX・Teslaで開始。1.5T V9モデルにCursorデータを追加学習し「Opusに匹敵」と主張するが独立ベンチマークはゼロ。Cursorユーザーが知るべき現実。

#Grok#xAI#SpaceX#Cursor
AI News
18分

Claude Fable 5公開: SWE-Bench 80.3%の実力とガードレール論争

本日一般公開のClaude Fable 5はMythos同一モデルにセーフガードを追加。SWE-Bench Pro 80.3%、$10/$50の価格設定と「Ferrariに30mphリミッター」批判の実態を整理。

#Claude#Anthropic#Claude Fable 5#Claude Mythos 5
AI News
20分

Gemini 3.5 Flash GA徹底レビュー|Terminal-Bench 76.2%でPro超え・289tok/sの実力

2026年5月にGAしたGemini 3.5 Flash。Terminal-Bench 76.2%でGemini 3.1 Pro超え、$1.50/$9で289トークン/秒。Claude・GPT-5.5との使い分けをPM視点で整理。

#Google#Gemini#Gemini 3.5 Flash#LLM
AI News
17分

Claude Opus 4.7 レビュー:SWE-bench 87.6%の実力と2300票「退化」批判の真相

Redditで2300票の「退化」批判とCopilot 15倍請求問題を整理。SWE-bench 87.6%の実力と炎上の真因、移行コストを正直に評価する。

#Claude#Anthropic#Claude Opus 4.7#AIモデル
AI News
15分

Gemini 3.1 Pro完全解説|ベンチマーク王者が抱える光と影

Gemini 3.1 Proのスペック・料金・ベンチマークを徹底解説。GPT-5.4・Claude Opus 4.6との比較や開発者の本音、PMとしての評価を日本語で詳説。

#Google#Gemini#Gemini 3.1 Pro#LLM
AI News
15分

Humanity's Last Exam|AIベンチマークの最終試験で各モデルの実力が見えた

Nature誌掲載のAIベンチマーク「Humanity's Last Exam」を解説。Claude Opus 4.6やGemini 3 Proなど主要モデルのスコア比較、方法論の強みと弱点、そしてこの試験が示すAIの現在地。

#AI#ベンチマーク#Humanity's Last Exam#Claude
AI News
28分

Claude Sonnet 4.6レビュー|SWE-bench 79.6%でOpus級性能をSonnet価格で

Claude Sonnet 4.6はSWE-bench 79.6%でOpusとの差が1.2ptに縮小。価格はSonnet据え置きの入力$3/出力$15。adaptive thinking・1Mコンテキストの新機能とAPI移行手順、GPT-5.2・Gemini 3 Proとの競合比較を解説。

#Claude#Anthropic#Claude Sonnet#AI
AI News
24分

Gemini 3 Deep Think 完全ガイド|使い方・料金・GPT-5/Claude比較【2026年2月】

Gemini 3 Deep Thinkの使い方・料金・始め方を図解で解説。ARC-AGI-2で84.6%を達成した推論AIの実力を、GPT-5・Claude Opus 4.6と徹底比較。無料枠の制限やGoogle AI Ultra(月額36,400円)の費用対効果まで網羅。

#Gemini#Google#Deep Think#推論AI