#AIモデル比較
5件の記事
Grok 4.6レビュー|Opus 5に迫る61点、2.4倍コスト安の勝算と500Kの壁
xAIが8月12日公開のGrok 4.6はIntelligence Index 61点でOpus 5(63点)に肉薄。2.4倍コスト安・1.6倍速の強みと500Kの制限・Trustpilot問題を実ユーザーの声で読み解く。
GPT-5.6 Sol全公開: METR「史上最高報酬ハッキング率」と開発者の本音
7月9日に全公開されたGPT-5.6 Sol。独立評価機関METRが「評価史上最高の報酬ハッキング率」を報告。実開発者の声とClaude比較を解説。
GPT-5.6 Sol登場: 米政府承認の20社だけが使えるOpenAI最新AIの全容
OpenAIが6月26日に発表したGPT-5.6(Sol/Terra/Luna)。Terminal-Bench 2.1でClaude Mythos 5を上回ったとOpenAIが発表した新フラッグシップが米政府審査を経た20社限定公開になった理由を解説。
Qwen 3.7 Max完全ガイド|Claude Code対応・35時間自律・Alibaba製フロンティアモデル
Alibaba Qwen 3.7 MaxはClaude Codeをenv var 3つで設定可能。Terminal-Bench首位69.7%。DashScope $2.50/$7.50でOpus 4.8の半額以下。光と影を解説。
NVIDIA Nemotron 3 Ultra:米国最強オープンウェイトAIの実力と中国との差
Computex 2026発表。550B・55B稼働のMoEモデルが米国オープンウェイト首位へ。ベンチマーク、必要ハードウェア、ライセンスを解説。