メインコンテンツへスキップ
#

#エージェントAI

9件の記事

AI Tools
22分

Claude Sonnet 5.5徹底解説|30%速く・同価格でSWE-Bench 81.3%の実力

2026年9月28日リリースのClaude Sonnet 5.5を開発者目線で検証。SWE-Bench 81.3%、Terminal-Bench 70.6%の数値の意味と、Opus 5.5との使い分け、サイバー系タスクの注意点まで整理する。

#Claude#Anthropic#Claude Sonnet 5.5#AIモデル
AI Tools
29分

Claude Opus 5.5完全ガイド|Fable 5.1級の性能を40%安く、破壊的変更4点を整理

2026年9月22日リリースのClaude Opus 5.5を解説。$4/$20の値下げ、Terminal-Bench 66.4%の実力、Opus 5からの移行で踏む破壊的変更4点と対処法を整理する。

#Claude#Anthropic#Claude Opus 5.5#AIモデル
AI News
15分

Sakana AI「Fugu Max」の実力と誤算。フロンティアモデル不要を掲げた東京発AIの光と影

Sakana AIのFugu Max/Ultra v2が9月11日公開。Fable 5除外でChartography首位も「これはOpenRouterでは?」と開発者。ベンチマークの読み方と実用上の限界を検証。

#サカナAI#Fugu Max#AIオーケストレーション#マルチエージェント
AI News
20分

Grok 4.6レビュー|Opus 5に迫る61点、2.4倍コスト安の勝算と500Kの壁

xAIが8月12日公開のGrok 4.6はIntelligence Index 61点でOpus 5(63点)に肉薄。2.4倍コスト安・1.6倍速の強みと500Kの制限・Trustpilot問題を実ユーザーの声で読み解く。

#Grok#xAI#Grok 4.6#AIモデル比較
AI News
15分

DeepSeek V4 Flash 0731 正式公開|ProをAgentベンチで超えた仕組みと限界

コスト21分の1でProモデルを超えたFlash 0731の実態。Terminal-Bench 82.7、DeepSWE 645%改善の詳細と、自己申告ベンチの問題・中国サーバーリスクを整理する。

#DeepSeek#DeepSeek V4 Flash#エージェントAI#LLM
AI News
19分

Ultracodeで170万トークンが消えた: Claude Code最新機能の実際のリスク

Claude CodeのUltracode機能がリリース2日後に170万トークンを焼き尽くした問題の全容。Pro/Max各プランの実コスト、無返金ポリシー、安全な使い方を整理する。

#Claude Code#Ultracode#Anthropic#動的ワークフロー
AI News
14分

IPO申請翌日にClaudeが落ちた理由|サブエージェント暴走とエージェントAIの構造的リスク

2026年6月2日、Anthropic IPO申請の翌日にClaude全サービスが停止。サブエージェント無限ループが原因。障害の全タイムラインとエージェントAIの構造的脆弱性を解説する。

#Claude#Claude Code#Anthropic#障害
AI News
15分

Claude Managed Agentsの「Dreaming」。眠っている間にAIが賢くなる仕組みと業務活用の現実

AnthropicがCode with Claude 2026で発表したDreaming機能。エージェントが過去100件の履歴を自動解析して自己改善。Harvey完了率6倍の実例とリスク・導入方法を解説。

#Claude#Anthropic#AIエージェント#Managed Agents
AI News
23分

GPT-5.5完全ガイド2026|幻覚率86%の実態とClaude Opus 4.7との使い分け

2026年4月リリースのGPT-5.5を徹底検証。幻覚率86%の衝撃的実態、Terminal-Bench首位の真相、Claude Opus 4.7との用途別使い分けを開発者視点で解説。

#GPT-5.5#OpenAI#Claude#AI比較