Claude Sonnet 5.5徹底解説|30%速く・同価格でSWE-Bench 81.3%の実力
「max effortで動かしたら128,000 thinkingトークンを全部消費して、最終出力が出てこなかった」
HackerNewsにこう書いたエンジニアのコメントは、リリース当日に多くのupvoteを集めた(HackerNews、2026年9月28日)。Anthropicが「30%速い・同価格」と発表したClaude Sonnet 5.5は、開発者コミュニティの反応を二分した。
一方でBoxのVP of AI ProductsであるYashodha Bhavnani氏は「Sonnet 5.5はより正確で、2.4倍速く、合計トークン数が12%少なかった」と述べた(Anthropic、2026年9月28日)。ZendeskのAIディレクターAbhinay Kathuria氏も「チケット処理が20%速くなり、顧客を待たせる時間が短くなった」と報告している。CodeRabbitのVP of AIであるDavid Loker氏のベンチマークでは「44件の実際のPRレビューで1件あたり6分33秒、Sonnet 5の13分31秒のほぼ半分の時間で完了し、コメント数も24%少なかった」(CodeRabbit Blog、2026年9月28日)。
本稿では、Sonnet 5.5のスペックとベンチマーク、Opus 5.5との使い分け、そして見落としがちな注意点を整理する。
- Claude APIを使って開発・運用しているエンジニア・開発者
- Sonnet 5.5へのアップグレードタイミングを判断したい人
- Sonnet 5.5とOpus 5.5のコストを比較検討している人
Claude Sonnet 5.5の基本スペック
Anthropicは2026年9月28日、Claude 5.5ファミリーの第2弾としてClaude Sonnet 5.5を正式リリースした(Anthropic)。第1弾のOpus 5.5(9月22日リリース)から6日後の発表だ。
| 項目 | Sonnet 5.5 | Sonnet 5(参考) |
|---|---|---|
| 入力料金(/MTok) | $2.00 | $2.00 |
| 出力料金(/MTok) | $10.00 | $10.00 |
| キャッシュ読み取り(/MTok) | $0.20 | $0.20 |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 128,000 tokens | 128,000 tokens |
| 出力速度 | Sonnet 5比+30%以上 | ベースライン |
| タスクあたりコスト | 最大30%削減 | ベースライン |
価格はSonnet 5から据え置き。「速くなったのに値上げなし」という点が開発者に刺さった(VentureBeat、2026年9月28日)。
「コスト30%削減」の正体はシンプルだ。速度向上により推論時間が短くなるほか、ツール呼び出し回数自体が減少する。Anthropicの内部テストでは、Sonnet 5.5は同一タスクでSonnet 5よりもツール呼び出しを少なくバッチ処理し、Opus 5が7.7回かかっていたイテレーションを3.6回に圧縮した。同じ出力を得るための計算量が減るため、実コストは表面上の料金以上に下がる。
ベンチマーク数値とその意味
数字を並べると成長が際立つ。
| ベンチマーク | Sonnet 5 | Sonnet 5.5 | Opus 5.5(参考) |
|---|---|---|---|
| SWE-Bench Pro | 63.2% | 81.3% | 89.9% |
| SWE-Bench Multilingual | — | 90.3% | — |
| Terminal-Bench 4.0 | 10.3% | 70.6% | 66.4% |
| CursorBench 4.0 | — | 55.5% | — |
出典: The Decoder、Vellum AI、2026年9月
注目はTerminal-Bench 4.0だ。Sonnet 5の10.3%からSonnet 5.5では70.6%に急伸し、Opus 5.5(66.4%)を上回った。Terminal-Benchはコマンドライン上の自律的なコーディングタスクを評価するもので、Claude Codeのようなエージェント的な使用環境に近い。「ターミナルで動かすエージェント」としてはSonnet 5.5の方が安くてOpus 5.5以上のスコアという逆転現象が起きている。
SWE-Bench Proでは、Sonnet 5.5(81.3%)はOpus 5.5(89.9%)より8.6ポイント低い。ただし料金差はSonnet 5.5が5分の1以下($2/$10 vs $4/$20)。コスト効率で見れば、一般的なバグ修正やコーディング支援にSonnet 5.5が優位な場面は多い。
Sonnet 5.5が向いているケース / 向かないケース
実際に選択する局面を整理する。
向いているケース:
- 日常的なコーディング支援: バグ修正、コードレビュー、ドキュメント生成。速度とコストのバランスが最適
- Claude Codeでのエージェント実行: Terminal-Bench 4.0でOpus 5.5を上回る。Claude Codeのデフォルトモデル候補
- 大量処理・バッチAPI: Sonnet 5からの値上げなしで高速化。処理件数が多い場合のコスト削減に直結
- 文書作成・分析・プレゼン: Anthropicが「日常ワークの標準モデル」として位置づけている用途
向かないケース:
- 複雑な数学的推論・研究レベルの問題: Opus 5.5($4/$20)の方が精度が高い
- 長時間エージェントタスクでmax effortを使う場合: 128K thinkingトークン上限で出力前に止まる報告あり。さらに「Sonnet 5.5をmax effortで使うと、Opus 5.5をmax effortで使うより1タスクあたり27%高コストになる一方でスコアは2ポイント低い」という分析もある(kingy.ai、2026年9月)
- 一部の難解なプログラミング言語: Sonnet 5.5はSonnet 5より特定のエソテリック言語ベンチマークでスコアが低下(HackerNews報告: Sonnet 5比でスコアが17.8%から7.4%に低下、HN)
- フロントエンドUI・デザイン作業: 複数のレビュアーが「Opus 5.5や競合モデルと比べてフロントエンドデザインが明らかに劣る」と指摘。カードレイアウトやアニメーションの品質が低下する事例が報告されている
- 創作的文章: 「一から文章を生成する上限がOpus 5.5より低い。美的・人文的な文章にはまだ差がある」という評価もある(2026年9月)
サイバーセキュリティタスクへの注意
Sonnet 5.5には「高リスクサイバーセキュリティタスク時に自動でSonnet 5へフォールバックする」動作が組み込まれている(The New Stack、2026年9月)。ユーザーがSonnet 5.5を指定してリクエストしても、Anthropicのセーフガードがリスクを検知すれば内部でモデルが切り替わる。
これはCTFや通常のペネトレーションテストのような一般的なセキュリティ業務には影響しない可能性が高い。ただし、エクスプロイト開発や高度な攻撃シナリオ分析を目的としたリクエストは、Sonnet 5.5のAPI料金で課金されながら実際にはSonnet 5で処理される可能性がある。セキュリティ関連業務でモデルを選定する際は留意が必要だ。
同様のアプローチはClaude Sonnet 5での拒否・議論の多さでも問題になっていた経緯がある。5.5世代での「スマートなフォールバック」はユーザー体験として改善だが、透明性の観点では疑問が残る。
Opus 5.5との使い分けの実際
Claude Opus 5.5が登場したことで「どちらを選ぶか」という判断が必要になった。2つの軸で整理できる。
精度重視ならOpus 5.5: SWE-Bench Pro 89.9%と Sonnet 5.5(81.3%)には8.6ポイントの差がある。複数ステップにわたる推論や、失敗のコストが高いタスクではOpus 5.5が安全だ。
スループット重視ならSonnet 5.5: Terminal-Bench 4.0でSonnet 5.5(70.6%)はOpus 5.5(66.4%)を上回る。料金は5分の1以下のため、大量処理では選択肢にならない理由がない。
「Sonnet 5.5とOpus 5.5の両方を試したが、日常的なコーディングはSonnet 5.5で十分。Opus 5.5はかなり複雑な設計タスクに留めている」という使い分けが開発者コミュニティでは多数派になりつつある(kingy.ai、2026年9月)。
特筆すべきはトークン効率だ。Anthropicの内部金融タスクスイート(2,441タスク)では、Sonnet 5.5は1回の回答あたり平均121,000トークンを使用したのに対し、Sonnet 5は497,000トークンを使用した。同等の出力品質を得るために必要なトークン数が約75%削減されている(Anthropic docs)。これが「コスト30%削減」の主要因だ。
Sonnet 5から移行する際の注意点(破壊的変更)
Sonnet 5.5にはSonnet 5から動作が変わる5つの破壊的変更がある。モデルIDをclaude-sonnet-5-5に差し替えるだけでは既存コードが壊れる可能性が高い(Anthropicドキュメント)。
- Thinkingの無効化方法変更:
"disabled"は400エラーになる。between_toolsを使うこと - Forced tool useが廃止:
tool_choice: "any"または"tool"は400エラー。autoとnoneのみ有効 - Thinkingブロックがアカウントに紐付けられた: 他アカウントで生成したthinkingブロックは再利用不可
computer_20251124ツールが非対応: Claude API・Google Cloudではcomputer_toolset_20260801を使うこと(Bedrock上は引き続き動作)- Advisorツールのモデル制限: Opus 4.8・4.7・Sonnet 5をAdvisorとして使えない。Opus 5.5・Sonnet 5.5以降を指定すること
また非破壊的な変更として、ツール呼び出し間のテキストがtextブロックでなくthinkingブロックで届くようになった。中間テキストをユーザーにストリーミング表示するアプリは、display値を設定しない限り表示が消える。
新たに利用可能なベータ機能として、メッセージ単位でのeffort制御、会話途中でのsystemメッセージ変更、compact-2026-09-04ヘッダによるCompact on Demand、inline-tools-2026-09-15ヘッダによるインラインツール定義も追加されている。
GPT-6 AstraやGemini 3.8 Flashとの価格比較
Sonnet 5.5の最大の競争優位はコストパフォーマンスだ。
| モデル | 入力(/MTok) | 出力(/MTok) |
|---|---|---|
| Claude Sonnet 5.5 | $2.00 | $10.00 |
| Claude Opus 5.5 | $4.00 | $20.00 |
| GPT-6 Astra(標準) | $10.00 | $50.00 |
| GPT-6 Astra(長文) | $20.00 | $75.00 |
| Gemini 3.8 Flash(導入価格) | $0.75 | $3.75 |
出典: OpenRouter、Yotta Labs、eesel.ai、2026年9月
GPT-6 Astraは標準料金でSonnet 5.5の5倍高い。Artificial Analysisの総合インテリジェンス指数ではSonnet 5.5(56)がGPT-6 Astra(53)を上回りつつコストは5分の1だ(Artificial Analysis、2026年9月)。
Gemini 3.8 Flashは2026年末まで導入価格でさらに安いが、Sonnet 5.5のLLM Statsスコアが58.0に対しGemini 3.8 Flash Cyberは38.9と品質差が大きい。大量処理でコストが最優先の場合はGeminiが選択肢に入るが、コーディング精度でSonnet 5.5が必要な場面では逆転できない。
「Sonnet 5.5とGPT-6 Astraの比較では、エージェント的なコーディングタスクでSonnet 5.5が勝り、しかもトークン単価で5分の1以下。既存のOpenAIエコシステムへの依存がなければ切り替えを検討する価値がある」というのが、開発者コミュニティの共通見解だ(The Neuron、2026年9月)。
- リリース: 2026年9月28日。Claude 5.5ファミリー第2弾
- 価格: $2/$10(Sonnet 5と同額、値上げなし)
- 速度: Sonnet 5比30%以上高速(138トークン/秒)
- タスクコスト: 最大30%削減(トークン消費量約75%減)
- SWE-Bench Pro: 63.2%→81.3%(18.1ポイント向上)
- Terminal-Bench 4.0: 10.3%→70.6%(Opus 5.5を超える)
- 破壊的変更5点: Sonnet 5から移行する場合は要確認
- サイバー系タスク: 高リスク判定時はSonnet 5へ自動フォールバック
- 注意点: max effortで128K thinkingトークン上限に到達する報告あり
Claude Sonnet 5.5はAPIリリース当日からclaude-sonnet-5-5のモデルIDで利用可能。Anthropic Consoleのドキュメントで移行ガイドと破壊的変更の詳細を確認してから切り替えることを推奨する。
関連記事
- Claude Opus 5.5完全ガイド|Fable 5.1級の性能を40%安く
- Claude Sonnet 5の評判と実力|拒否・コスト問題を検証
- Claude Code最新ガイド2026年版
- AIモデル料金戦争2026|OpenAI・Anthropic・Google比較
本記事の数値・仕様は2026年9月30日時点の情報に基づく。Anthropicは予告なく料金・仕様を変更する場合がある。最新情報はAnthropic公式ドキュメントで確認すること。