#エージェントAI
9件の記事
Claude Sonnet 5.5徹底解説|30%速く・同価格でSWE-Bench 81.3%の実力
2026年9月28日リリースのClaude Sonnet 5.5を開発者目線で検証。SWE-Bench 81.3%、Terminal-Bench 70.6%の数値の意味と、Opus 5.5との使い分け、サイバー系タスクの注意点まで整理する。
Claude Opus 5.5完全ガイド|Fable 5.1級の性能を40%安く、破壊的変更4点を整理
2026年9月22日リリースのClaude Opus 5.5を解説。$4/$20の値下げ、Terminal-Bench 66.4%の実力、Opus 5からの移行で踏む破壊的変更4点と対処法を整理する。
Sakana AI「Fugu Max」の実力と誤算。フロンティアモデル不要を掲げた東京発AIの光と影
Sakana AIのFugu Max/Ultra v2が9月11日公開。Fable 5除外でChartography首位も「これはOpenRouterでは?」と開発者。ベンチマークの読み方と実用上の限界を検証。
Grok 4.6レビュー|Opus 5に迫る61点、2.4倍コスト安の勝算と500Kの壁
xAIが8月12日公開のGrok 4.6はIntelligence Index 61点でOpus 5(63点)に肉薄。2.4倍コスト安・1.6倍速の強みと500Kの制限・Trustpilot問題を実ユーザーの声で読み解く。
DeepSeek V4 Flash 0731 正式公開|ProをAgentベンチで超えた仕組みと限界
コスト21分の1でProモデルを超えたFlash 0731の実態。Terminal-Bench 82.7、DeepSWE 645%改善の詳細と、自己申告ベンチの問題・中国サーバーリスクを整理する。
Ultracodeで170万トークンが消えた: Claude Code最新機能の実際のリスク
Claude CodeのUltracode機能がリリース2日後に170万トークンを焼き尽くした問題の全容。Pro/Max各プランの実コスト、無返金ポリシー、安全な使い方を整理する。
IPO申請翌日にClaudeが落ちた理由|サブエージェント暴走とエージェントAIの構造的リスク
2026年6月2日、Anthropic IPO申請の翌日にClaude全サービスが停止。サブエージェント無限ループが原因。障害の全タイムラインとエージェントAIの構造的脆弱性を解説する。
Claude Managed Agentsの「Dreaming」。眠っている間にAIが賢くなる仕組みと業務活用の現実
AnthropicがCode with Claude 2026で発表したDreaming機能。エージェントが過去100件の履歴を自動解析して自己改善。Harvey完了率6倍の実例とリスク・導入方法を解説。
GPT-5.5完全ガイド2026|幻覚率86%の実態とClaude Opus 4.7との使い分け
2026年4月リリースのGPT-5.5を徹底検証。幻覚率86%の衝撃的実態、Terminal-Bench首位の真相、Claude Opus 4.7との用途別使い分けを開発者視点で解説。