Claude Opus 5.5完全ガイド|Fable 5.1級の性能を40%安く、破壊的変更4点を整理
「最低effortで既知バグの72%を検出した。Opus 5が高effortで56%だったのと比べると、設定を上げることなく精度が上がっている」。Deloitte ConsultingのCIOであるCarl Bennett氏が、Claude Opus 5.5の事前テストでこう評価した(出典: Anthropic、2026年9月22日、筆者訳)。
Anthropicは2026年9月22日、Claude Opus 5.5を正式リリースした。価格はOpus 5から20%削減の$4/$20(入力/出力、100万トークンあたり)。ベンチマーク上はFable 5.1レベルの性能を主張し、「Claude 5.5ファミリーの第1弾」と位置づけられている(出典: Claude on X、2026年9月22日)。発表から8時間後には「Fable 5.1の60%のコストで全ベンチマークをリード」という見出しがVentureBeatに並んだ(出典: VentureBeat)。
ただし、移行は単純ではない。Opus 5.5にはOpus 5から動作が変わる4つの破壊的変更があり、モデルIDを差し替えるだけでは既存コードが壊れる可能性が高い。本稿ではスペックとベンチマーク、コスト計算、そして移行時に踏む変更点を整理する。
- Claude APIをプロダクションで使っているエンジニア・開発者
- Opus 5からOpus 5.5への移行を検討しているチーム
- Fable 5.1は高すぎると感じていてその代替を探している人
- 長時間エージェント(Claude Code・自律エージェント)のコスト削減を目指している人
- 料金: $4/$20(100万トークンあたり入力/出力)。Opus 5から20%削減、キャッシュ読み取りは60%削減
- 性能: Terminal-Bench 4.0で66.4%(Opus 5は52.3%)。知識作業GDPval-AA v2.1でFable 5.1を111 Elo上回る
- 速度: Opus 5より30%以上高速。デフォルトeffortは
medium(Opus 5はhigh) - 破壊的変更: thinking無効化不可、forced tool useエラー、thinkingブロック紐付け、computer_20251124非対応の4点
- 新機能: inline tools(beta)、compact on demand(beta)、fast mode(research preview)
- 筆者の判断: エージェントコーディングや長時間知識作業のOpus 5運用は移行を検討する価値あり。ただし移行ガイドを読んでから
Claude Opus 5.5のスペック: 何が変わったか
公式発表の数字を先に並べる(出典: Anthropic Platform Docs、2026年9月22日)。
| 項目 | Opus 5.5 | Opus 5 | Fable 5.1 |
|---|---|---|---|
| リリース | 2026年9月22日 | 2026年7月24日 | 2026年9月1日 |
| API入力 | $4/MTok | $5/MTok | $10/MTok |
| API出力 | $20/MTok | $25/MTok | $50/MTok |
| キャッシュ読み取り | $0.20/MTok | $0.50/MTok | $0.25/MTok |
| コンテキスト | 100万トークン | 100万トークン | 100万トークン |
| 最大出力 | 128K | 128K | 128K |
| デフォルトeffort | medium | high | high |
| 推論速度 | Moderate | Moderate | Slower |
| 知識カットオフ | 2026年6月 | 2026年4月 | 2026年6月 |
モデルIDはclaude-opus-5-5。Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWSすべてで同じIDが使える。
コスト削減の核心はキャッシュ読み取りだ。Opus 5の$0.50から$0.20に60%下がった。長い会話を繰り返すエージェントや、同じシステムプロンプトを多数のリクエストで使い回すワークロードほど、この値下げの恩恵が大きい。Anthropicの試算では、代表的なエージェントワークロードでOpus 5との比較コストが40%削減になるという。
ひとつ注意点がある。デフォルトeffortパラメータ(推論に使うトークン量をlow/medium/high/xhighで段階指定する設定)がmediumになった。Opus 5はデフォルトhighだったため、同じプロンプトをそのままOpus 5.5に送ると、思考量が減って出力品質が変わる可能性がある。effortを明示的に指定していなかったコードは、動作確認が必要だ(出典: What’s new in Claude Opus 5.5)。
ベンチマーク詳解: 「Fable 5.1レベル」の実態
Anthropicが発表したベンチマーク数値を検証する(出典: 前掲Anthropic、2026年9月22日)。
| ベンチマーク | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0(エージェントコーディング) | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1(コーディング精度) | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0(コーディング) | 57.8% | 51.8% | 46.6% | — |
| SWE-bench Pro(コード修正) | 89.9% | — | — | — |
| GDPval-AA v2.1(知識作業、Elo) | 1846 | 1735 | 1708 | 1542 |
| Humanity’s Last Exam(総合) | 67.7% | 65.6% | 63.6% | — |
| Terminal-Bench-Science(科学エージェント) | 58.7% | 52.6% | 29.0% | — |
| OSWorld 2.0(PC操作、partial) | 81.8% | 80.7% | 74.0% | — |
| Chartography(チャート認識) | 89.0% | 88.4% | 83.4% | — |
| AutomationBench(業務自動化) | 40.0% | 31.4% | 26.9% | 41.4% |
※太字は各行のトップスコア(出典: Anthropic、2026年9月22日)。これらの数値はAnthropicの自己申告値であり、独立機関による検証ではない。
全体的にOpus 5.5が9/10項目でトップだが、AutomationBenchはGPT-6 Astraが1.4ポイント上回っている。業務ワークフロー自動化を主用途にするなら、この差を念頭に置く必要がある。
特筆すべき数字が2つある。Terminal-Bench 4.0の66.4%は、Opus 5の52.3%から14.1ポイントの向上だ。エージェントコーディングでは1ターンの精度が上がるほど全体の完走率が指数的に伸びるため、この差は金銭換算でも大きく出やすい。Optiverの検証では「Opus 5と同品質を約半分のターンで達成」という結果が出ている(出典: 前掲Anthropic)。
GDPval-AA v2.1の1846 EloはFable 5.1の1735を111上回る。このベンチマーク上では、Opus 5.5はFable 5.1より高いスコアを出している。ただし他のベンチマーク(AutomationBench等)ではFable 5.1や競合モデルが上位に立つ場面もあり、用途別に検証が必要だ。
VentureBeatは「Fable 5.1の60%のコストで主要ベンチマークをリード」と報じた(出典: 前掲VentureBeat)。厳密にはFable 5.1(入力$10、出力$50)に対してOpus 5.5は入力で60%安、出力も60%安なので、表現は正確だ。
現行のClaude Opus 5のeffortパラメータと位置づけについては、Claude Opus 5完全ガイドで整理している。Opus 5.5への移行比較の前提として読んでおくとよい。
コスト削減の仕組み: 「40%安」の計算根拠
Anthropicが「Opus 5より40%安く運用できる」と主張する根拠を計算で確認する。
基本料金の差は入出力ともに20%削減だ。100万トークン入力 + 100万トークン出力という単純な組み合わせでは、Opus 5が$30に対してOpus 5.5は$24で20%の削減になる。
削減幅が40%に拡大するのはキャッシュの効果による。エージェントの代表的なワークロードでは、同じシステムプロンプトや長いコンテキストを多数のリクエストで読み込む。Opus 5.5のキャッシュ読み取りは$0.20/MTok(Opus 5の$0.50から60%削減)だ。具体例で計算する。
- Opus 5: 入力トークン合計100万のうち90万がキャッシュヒット → (10万 × $5 + 90万 × $0.50) / 100万 = $0.95/MTok実効入力コスト
- Opus 5.5: 同条件 → (10万 × $4 + 90万 × $0.20) / 100万 = $0.58/MTok実効入力コスト
キャッシュヒット率90%の想定ではOpus 5.5の実効入力コストはOpus 5の60%強。そこに出力の20%削減が加わることで、全体コストが約40%削減というAnthropicの主張と合う。
ただし、キャッシュヒット率が低い(短いプロンプトを毎回送る)ワークロードでは効果が小さくなる。キャッシュを活用しない場合の削減幅は20%にとどまる。
なお、同日にOpenAIがGPT-6 Solをリリースした(Opus 5.5のリリースから約90分後)。第三者メディアの報道によればGPT-6 Solの料金はOpus 5.5のほぼ半額とされる(出典: 9to5Google、2026年9月22日)。最新の公式料金はOpenAIの料金ページで確認を推奨する。独立評価機関Artificial AnalysisのIntelligence Index v4.3.2では、Opus 5.5が81.03、GPT-6 Solが80.45で誤差の範囲内だった。コーディング精度ではOpus 5.5が80.1 vs 74.3と優位だ。コストを最優先するならGPT-6 Sol、性能の上限を追うならOpus 5.5という棲み分けになる(出典: Unite.AI)。
Opus 5からOpus 5.5への移行: 破壊的変更4点
モデルIDをclaude-opus-5からclaude-opus-5-5に変えるだけでは動かない可能性がある。4つの破壊的変更を確認する(出典: What’s new in Claude Opus 5.5)。
1. thinking無効化が不可になった
Opus 5ではthinking: {"type": "disabled"}が使えたが、Opus 5.5では受け付けず400エラーになる。thinking: {"type": "enabled", ...}(手動budgetモード)も同様だ。代わりにeffortパラメータを使う。
# Opus 5(動作していた)
client.messages.create(
model="claude-opus-5",
thinking={"type": "disabled"}, # 使えていた
...
)
# Opus 5.5(400エラー)→ thinkingフィールドを削除するか adaptive に変更
client.messages.create(
model="claude-opus-5-5",
# thinking は省略(または {"type": "adaptive"} と明示)
# effortで代替: "low" が旧 disabled に最も近い動作
extra_body={"output_config": {"effort": "low"}},
...
)
effortをlowに設定すると、Opus 5でthinkingを無効化していた場合に近いコスト・速度で動作する。Anthropicのドキュメントには各effortレベルの実測コスト比較があるので、移行前に確認することを推奨する。
2. forced tool use(any/tool)がエラーになった
tool_choice: {"type": "any"}や{"type": "tool", "name": "..."} を使っていると400エラーになる。{"type": "auto"}(デフォルト)と{"type": "none"}は引き続き使える。
特定ツールを必ず呼ばせたい場合はtool_choice: {"type": "auto"}にstrict: trueを組み合わせる、もしくはstructured outputsに移行する。
3. thinkingブロックがモデルと会話に紐付けられた
thinkingブロックとは、モデルの推論過程をAPIが返す出力ブロックのことだ。Opus 5.5ではこのブロックが「どのモデルが生成したか」と「会話の文脈」に紐付けられた。
Opus 5で生成されたthinkingブロックをOpus 5.5は読める。逆もOpus 5.5 → Opus 5.5の会話継続は問題ない。ただしFable/Mythos(Anthropicの最上位モデルシリーズ)モデルのthinkingブロックはOpus 5.5では読めない。モデルを混在させたエージェントを組んでいる場合は要注意だ。
会話の途中でシステムプロンプトやtools定義を編集した場合、それ以降のthinkingブロックが無効になる(2026年8月31日以降に作成されたアカウントではデフォルトで400エラー)。対処法は、編集の代わりにmid-conversation system messages(会話の途中でシステムメッセージを注入するAPIパターン)を使うことだ。
4. computer_20251124ツールが非対応(Claude API / Google Cloud)
旧来のcomputer_20251124ツールはClaude API / Google Cloudでは使えなくなった。新しいcomputer_toolset_20260801に移行する必要がある。Amazon Bedrockでは引き続きcomputer_20251124が使える。
移行チェックリスト:
-
thinking: disabled/enabled→output_config: {effort: ...}に置き換え -
tool_choice: any/tool→auto+strict: trueに変更 - thinkingブロックを扱うコードでモデル判定ロジックを確認
- computer use統合は
computer_20251124→computer_toolset_20260801に更新
なお、AnthropicAdapter.generate_objectなどのサードパーティライブラリが内部でforced tool_choiceを使っている場合にも影響が出る。Arize-aiのphoenixライブラリで確認されており(出典: GitHub #16395)、使っているライブラリが既に対応済みかを確認する必要がある。
新機能: inline toolsとcompact on demand
移行の話ばかりになったが、Opus 5.5には使い勝手を改善する新機能も2つ入っている。
inline tools(ベータ)
inline-tools-2026-09-15ベータヘッダを使うと、会話の途中でツール定義を追加・変更できる。通常のtools配列はプロンプトキャッシュのプレフィックスに含まれるため、ツール定義を変えるたびにキャッシュが無効化されコストが発生する。inline toolsではsystemメッセージ内のtool_additionブロックにツール定義を直接渡すことで、tools配列を変えずにツールを追加できる。キャッシュが維持されたまま、実行中のエージェントが動的に使えるツールを増やせる(出典: Anthropic Platform Docs)。
長時間エージェントで「ステップAが完了したらステップBのツールを解放する」という設計が、キャッシュコストを払わずに実現できるようになる。
compact on demand(ベータ)
compact-2026-09-04ベータヘッダを使うと、会話全体を要約したcompactionブロックを受け取り、それ以降はそのブロックを古いメッセージの代わりに渡せる。長い会話でコンテキストが膨らみすぎた場合に、任意のタイミングで圧縮できる。前述のthinkingブロック紐付けとの相互作用があり、圧縮後に保持するturnsのthinkingブロックを有効のまま保てる条件が公式ドキュメントに記載されている。
ユーザーの声: 光と影
発表から24時間以内の評判を整理する。
光の側。Ramp(フィンテック)のStaff Software EngineerであるJohn Ruelas氏は「verbose出力が直った。いい同僚のように書く」と評価した(出典: 前掲Anthropic)。Opus 5で指摘されていた「Claudeらしい冗長さ」について、Anthropicは「最も重要な情報を最初に置き、冗長性を40%削減した」と述べており、初期ユーザーからも改善を認める声が複数出ている(出典: Claude on X、2026年9月22日)。
Clio(法律テックSaaS)のSean Heintz氏は「大きなエンジニアリングタスクを渡して一晩放置した」とアンアテンデッド実行の信頼性を評価している(出典: 前掲Anthropic)。
影の側。HNでは「Claude Codeで引数なしに作業を中断して議論し始める」という報告が初日に出た(出典: Hacker News、2026年9月22日、筆者訳)。これは測定値ではなく個別事例だが、エージェントワークロードを本番に投入する前に自分のタスクセットで検証する必要性を示唆する。
また、thinkingが常時オンになりトークン消費が見えにくくなったという指摘がある。effortを明示指定しないと、デフォルトmediumで思考トークンが積み上がり、コスト予測が難しくなる。移行後はusage APIで思考トークンの消費を確認することを推奨する。
誰がOpus 5.5に移行すべきか
Anthropicの発表から、Opus 5.5が恩恵を出しやすい用途と、そうでない用途を整理する。
移行する価値が高い:
- 長時間エージェントコーディング: Terminal-Bench 4.0で14.1ポイント向上。Claude Codeや自作エージェントで大量のリクエストを流すワークロードは、キャッシュ読み取り60%削減の恩恵を受けやすい
- 知識集約型の長文タスク: GDPval-AA v2.1でFable 5.1を上回る。複雑なリサーチ、長文解析、ファイナンシャルモデルなど
- Opus 5でコスト超過が続いているチーム: Deloitteの「最低effortで72% vs 高effortで56%」は、effortを下げながら性能が上がるという逆転現象を示す
慎重に検討が必要:
- 業務ワークフロー自動化がメイン: AutomationBenchでGPT-6 Astraに1.4ポイント劣る。競合比較が必要な場面では個別評価を推奨
- forced tool_choiceを多用しているコード: 移行コストが大きい。先にstrict tool use対応の工数を見積もること
- thinkingを無効化していたワークロード: effortをlowにすることで代替できるが、動作確認が必要
GitHub CopilotでもOpus 5.5が使えるようになった(出典: GitHub Changelog、2026年9月22日)。コードエディタ経由でOpus 5を使っていたユーザーは、設定を変えるだけで利用できる。
- Opus 5で
thinking: disabledやtool_choice: any/toolを使っているコードを grep で洗い出す - effortパラメータを明示的に設定し、Opus 5の
high相当にするにはhighを指定する - サードパーティライブラリ(LangChain、phoenix等)がforced tool_choiceを使っている場合があるため、バージョンアップを確認
- staging環境でeffort sweep(同じプロンプトをlow/medium/high各設定で実行し、品質とコストのバランスを確認する作業)を実施してからproductionに投入する
AI価格競争の背景についてはClaudeの価格変動とAI価格戦争で整理している。Opus 5.5の値下げがどの文脈で起きたかを理解する参考に。
Fable 5.1の破壊的変更(Fable 5からの移行注意点)はClaude Fable 5.1リリース詳解で扱っている。Opus 5.5はFable 5.1と共通する破壊的変更があるため、両記事を合わせて読むと移行の全体像が把握できる。
本記事の数値は2026年9月22〜23日時点の公式発表および独立評価機関の情報に基づく。APIの料金・仕様は予告なく変更される場合がある。最新情報はAnthropicの公式ドキュメントを確認すること。ベンチマーク数値はAnthropicの自己申告値を含む。