#エージェントAI
6件の記事
Grok 4.6レビュー|Opus 5に迫る61点、2.4倍コスト安の勝算と500Kの壁
xAIが8月12日公開のGrok 4.6はIntelligence Index 61点でOpus 5(63点)に肉薄。2.4倍コスト安・1.6倍速の強みと500Kの制限・Trustpilot問題を実ユーザーの声で読み解く。
DeepSeek V4 Flash 0731 正式公開|ProをAgentベンチで超えた仕組みと限界
コスト21分の1でProモデルを超えたFlash 0731の実態。Terminal-Bench 82.7、DeepSWE 645%改善の詳細と、自己申告ベンチの問題・中国サーバーリスクを整理する。
Ultracodeで170万トークンが消えた: Claude Code最新機能の実際のリスク
Claude CodeのUltracode機能がリリース2日後に170万トークンを焼き尽くした問題の全容。Pro/Max各プランの実コスト、無返金ポリシー、安全な使い方を整理する。
IPO申請翌日にClaudeが落ちた理由|サブエージェント暴走とエージェントAIの構造的リスク
2026年6月2日、Anthropic IPO申請の翌日にClaude全サービスが停止。サブエージェント無限ループが原因。障害の全タイムラインとエージェントAIの構造的脆弱性を解説する。
Claude Managed Agentsの「Dreaming」。眠っている間にAIが賢くなる仕組みと業務活用の現実
AnthropicがCode with Claude 2026で発表したDreaming機能。エージェントが過去100件の履歴を自動解析して自己改善。Harvey完了率6倍の実例とリスク・導入方法を解説。
GPT-5.5完全ガイド2026|幻覚率86%の実態とClaude Opus 4.7との使い分け
2026年4月リリースのGPT-5.5を徹底検証。幻覚率86%の衝撃的実態、Terminal-Bench首位の真相、Claude Opus 4.7との用途別使い分けを開発者視点で解説。