#SWE-bench
6件の記事
DevinがなぜGoldmanとNASAに選ばれ$40B評価を狙えるのか
Cognition AIのDevinが$40B評価額で追加調達交渉中。ARR $492Mを達成した自律コーディングエージェントの実力と、開発者が直面する「バブシッティング税」の実態を解説。
Claude Opus 4.8 完全ガイド|Dynamic Workflow・3倍安いFast Mode・正直さ改善
Opus 4.8を徹底解説。SWE-bench Pro 69.2%、Dynamic Workflows、3倍安いFast Mode、Opus 4.7の問題修正、プロンプトインジェクション後退まで。
Claude Opus 4.7 レビュー:SWE-bench 87.6%の実力と2300票「退化」批判の真相
Redditで2300票の「退化」批判とCopilot 15倍請求問題を整理。SWE-bench 87.6%の実力と炎上の真因、移行コストを正直に評価する。
Claude Opus 4.7のコスト実態|価格据え置きでも実質35%増えるトークン課金の正体
Claude Opus 4.7はSWE-bench 87.6%に到達した一方、新トークナイザで同じ入力が最大35%多くトークン化される。実測コスト・ユーザーの賛否・移行判断基準を整理する。
Claude Opus 4.7 完全ガイド|SWE-bench 87.6%・xhigh effort・/ultrareview
2026年4月16日リリースのClaude Opus 4.7を解説。SWE-bench 87.6%、xhigh努力レベル、タスクバジェット、/ultrareview、Claude Designまで。
AIコーディングエージェント比較2026|Claude Code・Cursor・Copilot実力と料金
JetBrains1万人調査とSWE-benchデータで比較。Claude Code・Cursor・Copilotの料金・ベンチマーク・実ユーザー評価を徹底分析。