メインコンテンツへスキップ
AI Tools 14分で読める

Cognition SWE-2:Kimi K3後処理でFable 5.1と同点、64%安の実態と制約

「自分のCLIは要らない、すでにハーネスがある」。Cognitionが9月10日にSWE-2を発表した直後、公式アナウンス下に投稿されたこの一文がコミュニティの空気を象徴していた(出典:AiCybr、2026年9月10日)。

SWE-2はMoonshot AIのKimi K3(2.8兆パラメータ)を土台に、コーディング特化の強化学習で後処理したモデルだ。Cognitionは「FrontierCode 1.1 MainでFable 5.1と1ポイント以内のスコア、かつ64%安いコスト」を謳っている(出典:TechTimes、2026年9月11日)。

数字だけ見ればフロンティアモデル相当の性能を大幅コストダウンで実現した快挙に見える。だがAPIは公開されない。オープンウェイトも出ない。使えるのはDevinの管理環境の中だけだ。

この記事はこんな人におすすめ
  • Devin・Claude Code・Cursorを比較検討しているエンジニア・開発チーム
  • AIコーディングエージェントのコストパフォーマンスを追っているCTO・PM
  • Kimi K3やオープンウェイトモデルのポストトレーニング手法に興味がある研究者
  • 「64%安」という主張の根拠と制約を正確に把握したい人

SWE-2とは:Kimi K3を後処理したコーディング特化モデル

SWE-2はCognitionが2026年9月10日にリリースしたコーディングエージェント向けモデルだ。ベースはMoonshot AI(中国)のKimi K3で、2.8兆パラメータのオープンウェイトモデルを強化学習でファインチューニングしている(出典:MarkTechPost、2026年9月12日)。

Cognitionはこれまで自社モデルの訓練に注力してきたが、今回は既存のオープンウェイトをベースとした後処理という路線に転換している。「ゼロから学習するよりKimi K3の上に積み上げる方が早く、安い」という判断だ。

リリース時点の提供形態は以下の通り:

  • Devin Desktop・Devin CLI:即日利用可能
  • Devin Web・Fusion(マルチモデルワークフロー):順次展開
  • Devin Pro(月20ドル)加入者:2026年10月10日まで使用料無料

APIや重みの公開は発表されていない。

ベンチマーク:何が本当でどこが怪しいか

Cognitionが発表したSWE-2の主なベンチマーク結果は下表の通りだ(出典:explainx.ai、2026年9月10日)。

ベンチマークSWE-2Kimi K3(ベース)
FrontierCode 1.1 Main50.0%44.2%
DeepSWE 1.173.0%68.5%
Terminal-Bench 2.192.8%88.3%
Terminal-Bench 427.3%21.5%

全ベンチマークでKimi K3を上回り、FrontierCode 1.1 MainではFable 5.1(Anthropic)の約51%と「1ポイント以内」を主張している。さらに「SWE-1.7比でエージェントステップ58%削減、タスク当たりコスト81%減」という数字も出している(出典:CellCog、2026年9月11日)。

ただし注意点がある。

独立した第三者によるベンチマーク再現が2026年9月13日時点でまだ存在しない。CellCogの分析によると、SWE-2はTerminal-Bench 4(最難関カテゴリ)では同スコア帯の競合と比べて1〜2ポイント劣るケースがある。Cognitionが公開した「64%安」の比較条件(対Fable 5.1のどのエフォートレベルか)も完全には明示されていない。

シングルランRL:コスト削減の核心技術

SWE-2の最大の技術的特徴は「コスト罰則付きシングルランRL」だ。従来のRLトレーニングでは「中(medium)」「高(high)」「最大(max)」の各エフォートレベルを別々の学習ランで調整する必要があった。SWE-2ではこれを1回の学習ランで完結させている(出典:AiCybr、2026年9月10日)。

仕組みはシンプルだ。各エフォートレベルに対してコスト罰則(linear cost penalty)を設定し、Kimi K3のコスト・性能パレートフロンティアの局所的な傾きに合わせてチューニングする。これにより1回のRLパスで複数のエフォートレベルを同時最適化できる。

Cognitionによると、ベースモデル(Kimi K3)の上にこのRLを適用することで、ほぼ全ベンチマークで5〜6ポイントの改善を実現している。「フロンティアモデル並みの性能を、フロンティアモデル並みの学習コストをかけずに実現する」という設計思想だ。

「CLIで使いたくない」:開発者コミュニティの反発

発表直後のコメントで最も引用されたのが「I don’t want to use your CLI. I already have my own harnesses.(CLIは要らない。すでに自分のハーネスがある)」という投稿だ(出典:CellCog、2026年9月11日)。

この反応の背景には、SWE-2がDevinの管理環境以外からアクセスできないという制約がある。

  • APIなし: OpenRouter・LiteLLM・LangChainから直接呼び出し不可
  • オープンウェイトなし: ローカル実行・カスタムファインチューニング不可
  • CI/CD統合制限: GitHubアクションやカスタムパイプラインへの直接組み込みが難しい

GitHubのイシュートラッカーにも「oh-my-piのバンドルプロバイダーカタログにSWE-2が見当たらない」という報告が複数寄せられた(出典:GitHub Issue #11687、2026年9月)。

Cognitionの立場から見れば、この制約はビジネスモデルの問題でもある。モデルを開放すれば同様の後処理を他社が実施できてしまう。Kimi K3はオープンウェイトだが、SWE-2を動かすRLの成果物を囲い込むことで差別化を維持しようとしている。

光の部分:Devin Pro月20ドルで10月まで無料

制約を踏まえた上で、メリットも正直に書く。

Devin Pro(月20ドル)の加入者は、2026年10月10日まで追加料金なしでSWE-2を使える。Cognitionによると、SWE-2 mediumはSWE-1.7と比べてFrontierCode上でタスク当たりコストが81%削減、エージェントステップが58%減少する(出典:explainx.ai、2026年9月10日)。

Devinにすでに月20ドルを払っているチームにとっては、実質的なモデルアップグレードがゼロコストで提供されることになる。特にソフトウェアエンジニアリング特化のバルクタスク処理を行うチームは恩恵が大きい。

10月10日以降の課金体系はまだ発表されていない。

Claude Codeとどう使い分けるか

「SWE-2 vs Claude Code」は直接比較するより、用途で切り分ける方が実態に即している。

Claude CodeはターミナルやIDEに統合して、開発者がリアルタイムで制御しながら使うツールだ。コードの説明、リファクタ、デバッグ支援、コミット準備といった「開発者の隣にいるアシスタント」の役割を担う。

SWE-2を動かすDevinは「チケットを渡したら勝手にやってくれるAIエンジニア」型だ。タスクを与えてプルリクエストが出てくるまで人間が介入しない、という使い方を想定している。

どちらが適切かはチームのワークフロー次第だ。コードレビューを人間が保持したままAI補助を最大化したいならClaude Code系、定型タスクの自動化率を上げたいならDevin系という棲み分けは今後も続くだろう。

独立検証が未完了

2026年9月13日時点で、Cognitionが公開したベンチマーク数値の第三者による独立再現は確認されていない。「64%安」の比較条件や、FrontierCode 1.1 MainでのFable 5.1との比較方法の詳細は完全には公開されていない。数値は参考値として扱うこと。

AIコーディングエージェント比較2026

Devin・Claude Code・Cursor・Copilotを実用観点で比較した記事はこちら。

比較記事を読む

関連記事


免責事項

本記事は公開情報に基づくジャーナリスティックな解説を目的としています。記載されたベンチマーク数値・価格・機能はCognitionおよび各社の公式発表に基づきますが、変更される可能性があります。投資判断・製品採用判断は必ずご自身でご確認ください。

Share