メインコンテンツへスキップ
AI News 16分で読める

DevinがなぜGoldmanとNASAに選ばれ$40B評価を狙えるのか

「本当に一生懸命試した。でも機能しなかった」。Answer.AIの共同創業者ジェレミー・ハワードは2025年1月、X(旧Twitter)にそう投稿した。20件の実務タスクを試して完了できたのは3件。当時「世界初のAIソフトウェアエンジニア」として鳴り物入りでデビューしたDevinへの最初期の批判だった(X @jeremyphoward, 2025年1月)。

それから1年半後の2026年8月12日、その同じ製品を作るCognition AIが評価額$40B(約5.8兆円)での追加調達交渉に入ったとTechCrunchが報じた。前回の$26B評価額から54%の上乗せだ(TechCrunch, 2026年8月12日)。

「使えない」という評判と「$40B」の数字はどう両立するのか。

この記事はこんな人におすすめ
  • DevinやClaude Codeなどのコーディングエージェントを業務で評価・導入検討している開発者・エンジニアリングマネージャー
  • AIスタートアップの評価額と実態のギャップに関心を持つエンジニアやテック投資家
  • 自律型AIエージェントに「何ができて何ができないか」を正確に把握したいCTO・PdM

$40B評価額の根拠 — 4ヶ月で売上倍増した数字の中身

Cognitionの調達履歴を並べると数字の加速度感が伝わる。2025年9月に$400Mで$10B評価。2026年5月に$1Bで$26B評価。そして2026年8月には$40B超を狙う。8ヶ月で評価額が4倍だ(PYMNTS, 2026年8月)。

投資家が根拠にするのは売上の成長速度だ。2026年5月の調達時点でARR(年間経常収益換算)は$492M。これは前年からおよそ13倍という成長で、エンタープライズ顧客の利用は月次50%増ペースが6ヶ月続いていたとCEOのスコット・ウーがTechCrunchに語っている(TechCrunch, 2026年5月)。追加調達交渉のタイミングではARRが$1Bに迫りつつあるとされる(TechCrunch, 2026年8月)。

大口顧客の顔ぶれも材料になっている。ゴールドマン・サックス、メルセデス・ベンツ、NASA、サンタンデール、米国政府機関。単なるベンチャー企業ではなく、最も保守的なセクターでの導入実績が並ぶ。

もう一つ投資家が好む指標がある。「Cognition自身のコードの90%はDevinが書いている」というデータだ。これは「自社プロダクトを自社で使い倒しているか」というエンジニアリング界の信頼指標(Dog-fooding)で、単なるマーケティング主張ではなく組織が信頼して日常業務に使っていることを示す(The Next Web, 2026年5月)。

ただし評価額と製品の実力は別の話だ。

Devinの技術仕様と「自律性」の実態

Devinが他のコーディングAIと根本的に異なる点は動き方にある。

Claude CodeやCursorはターミナルやエディタの中でリアルタイムに開発者と並走する。Devinは違う。「タスクを渡したら、完成したPRが届く」という設計だ。専用のクラウドサンドボックス内でコードを読み、計画を立て、実装し、テストを実行し、バグを修正する。すべてが終わったらプルリクエストを提出する。チェックインなし、承認なし。

技術仕様は以下の通りだ。コンテキストウィンドウは1,000万トークン超(長大なモノレポも丸ごと読める)。VSCode拡張機能から操作でき、SlackやJiraとも統合される。Jira、CircleCI、GitLabなどのCI/CDパイプラインとも連携する。

ただしベンチマーク上の数字は複雑な絵を描く。SWE-bench Verified(実際のGitHubオープンソースイシューを解決させるテスト)でDevinのスコアは13.86%。Claude Codeが80.8%、OpenAI Codexが72.1%を出しているのと比べて大きく劣る(AI Coding Agents Compared, web3aiblog, 2026年5月)。

Cognitionはこのギャップをこう説明する。「SWE-benchは『問題の場所をすでに知っていて、ファイルを特定された状態』から計測される。Devinは本当のゼロからコードベース全体を探索する別物だ」。確かに評価条件が異なるが、それでも数値の差は大きい。明確に定義されたタスクでのDevinの実務完了率は30〜50%というサードパーティ報告もある(web3aiblog, 2026年5月)。

NASAとGoldman Sachsはどう使っているのか

評価額$40Bと実務完了率30〜50%の矛盾を解く鍵は「何に使うか」にある。

エンタープライズ顧客がDevinを使うのは、腕の立つシニアエンジニアが嫌がる仕事だ。古いPythonコードをPython 3.12へ移行する、クラウドプロバイダーを乗り換える、既存のAPIにテストを書き足す、ドキュメントを自動生成する。こうした「やらなければならないが優先度が上がらない」類の積み残しタスク群だ。

Devinはこの種の作業で「眠らない junior」として機能する。人間が指示だけ出して、翌朝PRを確認するという運用形態だ。NASAやGoldman Sachsのようなレガシーシステムを大量に抱える組織にとって、このユースケースは明確に価値がある。レガシー移行プロジェクトは大量の定型作業を含み、通常の開発者リソースを引き剥がさずに進められるメリットが大きい。

一方、曖昧な仕様・大規模なアーキテクチャ設計・既存コードと密に絡み合った機能実装では苦手が露呈する。「任せっきりにできる作業の範囲が、思っていたより狭い」というのが実際に使った開発者の共通見解だ(SitePoint, Devin Aftermath, 2025年5月)。

開発者が直面する「バブシッティング税」とコスト問題

批判の核心は二つある。実際の自律性の低さと、予測不能な課金だ。

シリーズBフィンテック企業のフルスタック開発者はこう言い切っている。「バブシッティング税は本物だ。複雑なタスクでは、エージェントの進捗を確認するだけで、自分で書いた方が早かった時間を使っている」(SitePoint, 2025年5月)。

コスト面も問題になっている。月$20のエントリープランは実際にはほぼ「玄関ドア」に過ぎない。内部にはACU(Agent Compute Unit)という独自課金が待ち構えており、Coreプランで$2.25/ACU。複雑なタスク1件で簡単に$40を超える。実務上、Claude CodeやCursorと比べてタスクあたり5〜10倍のコストになるという報告が複数の実務家ブログに並ぶ(BrainRoad, Devin Pricing, 2026年)。

これはUberがClaude Codeで年間予算を4ヶ月で使い切った話と構造が似ている。予測不能なエージェント課金が財務担当者には扱いにくい。

Claude Code・Codex・Copilotとの棲み分け

2026年時点の実務家の間では、各ツールに明確な用途分担が定着しつつある。

Devin: 完全委任可能な定型タスク(移行、テスト追加、ボイラープレート生成)。人間のレビューは最後だけでよい。

Claude Code: 複雑な多ファイルリファクタリング、大規模コードベース全体の把握、PRレビュー補助。SWE-bench 80.8%はエージェント型AIの中で最高水準で、難易度の高い作業に向く。開発者がリアルタイムで確認しながら進める半自律型(Claude Code vs Devin, LOW/CODE, 2026年)。

GitHub Copilot: 日常のインライン補完とIDE統合。Copilot Workspace(GA化済み)はステップごとに人間の承認が必要で、完全委任型ではない。

OpenAI Codex: CI/CDパイプラインへの組み込みと DevOps連携。SWE-bench 72.1%でCodex整合性は高い。

ある比較記事が使った表現が実態をよく表している。「Devinは眠らない新卒、Claude Codeはシニアの10倍増幅器」(tech-insider.org, 2026年)。どちらが優れているかではなく、何を任せるかで使い分ける時代だ。

Hacker Newsのスレッド「Ask HN: CognitionはなぜこれほどのValuationを得られるのか」では、トレーニングベンチマークとカスタマーインタラクションログが重複するデータセットから来ており「自然とベンチマークにオーバーフィットする」という指摘が上位コメントに並んだ。評価額の数字と実際の完了率の乖離への懐疑は投資家ではなく開発者コミュニティから来ている(HN, 2026年7月)。

$40B評価額が正当化されるかは、Devinがレガシー移行市場を本当に制圧できるかにかかっている。

DevinとClaude Codeの選択基準まとめ
観点DevinClaude Code
動き方完全自律(委任してPRが届く)半自律(ターミナルで並走)
SWE-bench13.86%(実GitHub課題)80.8%
得意な仕事定型・移行・テスト追加複雑な多ファイル改修
料金$20〜/月 + ACU課金(タスクあたり$40以上も)トークン課金($2/$10/MTok)
コスト感タスクあたり5〜10倍高い傾向予測しやすい

エージェント型AIのコスト管理に悩んでいるエンジニアへ

Devinの課金モデルはUberが年間予算を4ヶ月で使い切ったClaude Codeと同じ構造問題を抱える。エージェントAIの予算管理手法を合わせて確認しよう。

UberのAI予算崩壊事例を読む

関連記事


本記事に記載された評価額・ARR・ベンチマーク数値は各種報道および公開情報に基づきます。Cognition AIの$40B評価額はあくまで「交渉中」の報道であり、実際の調達完了・確定評価額とは異なります。投資判断の根拠としての使用はお控えください。

Share