AI Briefing · Vol.22

Claude Opus 5.5とは?性能と特徴、価格を解説

Opus 5から変わった点と設定の選び方

updated 2026.09.29
read 7 min
生成AI活用
author
五月女 裕太 ビジョン・コンサルティング
AI Center of Excellence 所属
AI コンサルタント

生成AIコンペ2年連続最優秀賞(日経・日刊工業新聞ほか掲載)/AWS Summit 2025事例ブース登壇/AWS主催生成AIセミナー2025 2度登壇など、業界トップを走るAIエキスパート。

AIに関するテーマを相談する→
2026年9月26日の確認

Claude Opus 5.5は2026年9月22日に公開されました。

料金・仕様・提供先は2026年9月26日に公式資料で再確認しました。

answer

Claude Opus 5.5は、Anthropicが2026年9月22日に公開したOpusの最新版です。性能を落とした版ではなく、多くの作業でFable 5.1並みの性能を、Opus 5より20%安いAPI単価で使えます。

Read this if

この記事が役立つ方へ

Claude Opus 5.5を業務で使うか、使うならどの設定と料金で使うかを決めたい方に向けています。

  • 開発リーダー
  • 情報システム部門
  • AI導入の担当者
  1. Opus 5.5を業務に使ってよいか、判断の材料が足りない
  2. どの推論の強さで使えばよいか決められない
  3. 単価は下がったと聞くが、自社の請求額が下がるか分からない
01

Claude Opus 5.5とは?Opus 5から変わった点

Opus 5.5は、Opus 5の後継として公開された、ClaudeのOpus系列の最新のモデルです。多くの作業で単価の高いFable 5.1と同じ水準の性能を、より安い単価で使えるのが特徴です。

Claudeの主な系列は、価格の高い順にFable・Opus・Sonnet・Haikuです。Anthropicは2026年9月22日にOpus 5.5を公開しました。多くの作業でFable 5.1の水準で動くと説明しています。既定の設定なら、一般的な作業の費用はOpus 5より40%下がるとしています。

切り替えでつまずきやすいのが、Opus 5で決めた推論の強さをそのまま使うことです。Anthropicも、段階を測り直すよう勧めています。推論の強さは、どの使い方でも既定の段階から試し、足りない作業だけ上げます。公開と同時に、Pro・Max・Teamと席単位のEnterpriseでは、5時間ごとの利用上限が引き上げられました。APIやクラウド経由で使った量に応じて払う場合は、段階を上げるほど費用が増えます。請求額を確かめながら切り替えてください。

Opus 5から変わった点は、次のとおりです。

Opus 5から変わった点(費用・速さ・単価) 図1
40%減 一般的な作業の費用(既定の段階どうし) Anthropic
30%以上 出力の速さの向上 Anthropic
20%減 APIの単価(入力4ドル・出力20ドル) Anthropic
一般的な作業の費用は、既定の段階どうしで40%下がりました。出力はOpus 5より30%以上速くなりました。

3つのうち、費用の40%だけは使い方で変わります。既定の段階どうしで比べた値だからです。

Opus 5から変わった点(性能・文章・設定) 図2
項目Opus 5.5Opus 5
公表された性能開発・知識作業・画面操作の評価で上回ります—
文章の書き方要点を先に書き、専門用語を減らしましたOpus 5は読みにくいという声が多くありました(Anthropic)
図表や画面の読み取り細かい図表をツールなしでも以前より正確に読めます読み取りを補う工夫が要る場合がありました
推論の強さの既定mediumhigh
思考を切る設定(APIとClaude Code)使えません使えます
性能・文章・図表の読み取りが良くなりました。一方で推論の強さの既定はmediumに下がり、思考は切れなくなりました。

表のうち、使い方に大きく関わるのは推論の強さの既定です。何も指定しないと、Opus 5.5はOpus 5より一段低いmediumで動きます。

02

基本スペックは?Opus 5との違いと推論の強さ

Opus 5.5は、Opus 5と同じく100万トークンを扱え、最大出力は12.8万トークンです。知識の時点は2026年6月で、Opus 5より新しくなりました。

Anthropicは、Opus 5.5の数え方で100万トークンを約55.5万語・約250万文字の目安としています。

Opus 5.5とOpus 5の基本仕様 図3
項目Opus 5.5Opus 5
位置づけOpusの最新版前のOpus(旧モデル・提供は継続)
モデルIDclaude-opus-5-5claude-opus-5
公開日2026年9月22日2026年7月24日
提供が続く期間少なくとも2027年9月22日まで少なくとも2027年7月24日まで
コンテキスト100万トークン100万トークン
最大出力12.8万トークン12.8万トークン
入力と出力文章と画像を読み、文章を返します文章と画像を読み、文章を返します
知識の時点2026年6月2026年5月
扱える量と出力の上限、入出力の形式は同じです。Opus 5も少なくとも2027年7月24日までは提供が続きます。

モデルそのものは文章を返します。Claudeのアプリの資料作成の機能と組み合わせると、スライドや文書のファイルも作れます。

Fable 5.1は、Claudeで単価の高い系列のモデルです。入力10ドル・出力50ドルで、Opus 5.5の入力4ドル・出力20ドルより高めです。Anthropicによると、Fable 5.1は難しい推論と長いエージェント作業向けです。Opus 5.5は、長い開発作業と知識作業向けです。

Anthropicの評価表では、Opus 5.5がFable 5.1をどの評価でも上回ります。ただし同社は、社内で使った実感では両者の差は点数ほど大きくないとしています。同じプログラムの書き換えでは、Opus 5.5が9.5時間、Fable 5.1が12時間で終えました。費用も、Opus 5.5のほうが51%少なかったとしています。それでも、難しい推論をじっくり任せたい作業では、Fableとも比べてみる価値があります。

推論の強さ(effort)は、low・medium・high・xhigh・maxから選びます。上げるほど深く考えますが、時間と費用も増えます。Opus 5.5では考える過程(思考)を切れないので、深さはこの段階で調整します。

推論の強さ(effort)の段階と最初に試す作業 図4
  1. low トークンを大きく節約し、能力は少し下がります 短い質問、定型の処理、補助の処理
  2. medium トークンの節約と能力の釣り合いをとります 日常の開発、資料作成、調査 Opus 5.5の既定
  3. high 良い結果に必要なだけトークンを使います 複雑な開発やコードレビュー
  4. xhigh 長い作業に向けて能力を広げます 30分を超える長いエージェント作業やコーディング
  5. max 使うトークンに上限を設けず、最大の能力を出します xhighでも足りない、特に深い推論が要る難問
後の段階ほど深く考え、使うトークンと費用が増えます。

最初に試す作業は、xhighだけがAnthropicの説明で、ほかはこの記事の目安です。

Anthropicによると、Opus 5.5は同じ段階でも、Opus 5より1回の応答で考える量が多い傾向があります。xhighとmaxでは、この差が特に大きくなります。そのため、Opus 5で決めた段階をそのまま使わず、自分の作業で測り直すよう勧めています。

Claudeのアプリでは、送信ボタンの横のモデル名から「Effort」を開き、段階を選べます。Anthropicのヘルプによると、段階を上げるほど答えは丁寧になりますが、時間がかかり、利用上限に早く達します。

Claude Codeでは、/effortというコマンドか、モデルを選ぶ画面で段階を変えられます。Opus 5.5は選ばなければmediumで始まり、maxは今のセッションの間だけ使われ、既定としては保存されません。

仕様はOpus 5とほぼ同じです。使い始めるときは、推論の強さの段階を選び直します。

03

性能は?Anthropicの公表値でOpus 5と比べる

Anthropicの発表資料の表では、Opus 5.5は開発・知識作業・画面操作の評価でOpus 5を上回りました。端末での開発作業(Terminal-Bench 4.0)は、52.3%から66.4%に上がりました。実務の成果物を比べるGDPval-AA(対戦形式の点数)は、1708から1846に上がっています。

Anthropicの発表資料の表から、Opus 5.5・Fable 5.1・Opus 5の値を抜き出しました。

Anthropicの公表値(Opus 5.5・Fable 5.1・Opus 5) 図5
評価Opus 5.5Fable 5.1Opus 5
端末での複雑な開発作業(Terminal-Bench 4.0)66.455.852.3
採用されるコード変更(FrontierCode v1.1)54.450.348.0
実際の開発の依頼(CursorBench 4.0)57.851.846.6
業務アプリの自動化・Zapierの計測(AutomationBench)40.031.426.9
難問・ツールあり(Humanity's Last Exam)67.765.663.6
科学研究の作業(Terminal-Bench-Science 0.1)58.752.629.0
画面操作・部分点の値(OSWorld 2.0)81.880.774.0
どの評価でも、Opus 5.5がOpus 5とFable 5.1を上回りました。Opus 5.5の値は特に断りがなければmaxで、端末での開発作業だけxhighで測った値です。GDPval-AAは、実務の成果物を比べる対戦形式の点数です。Opus 5.5が1846、Fable 5.1が1735、Opus 5が1708でした。この値は、Artificial Analysisの計測をAnthropicが載せたものです。

科学研究の作業で、Opus 5との差が最も開いています。29.0%から約2倍になりました。

安全装置が働いた課題は、前の世代のモデルが代わりに解きました。そのため、Anthropicは、Opus 5.5の本来の値はもっと高い可能性が高いとしています。業務アプリの自動化(AutomationBench)では、止められた課題を不合格として数えています。

Anthropicの同じ表では、GPT-6 AstraがOpus 5.5を上回る評価もあります。GPT-6 Astraの値は、業務アプリの自動化で41.4%、科学研究の作業で64.6%です。

開発作業のTerminal-Bench 4.0・FrontierCode・CursorBenchは、どれも伸びました。既定のmediumでも、CursorBenchは52.5%で、maxのOpus 5の46.6%を上回ります。

Anthropicの社内試験と早期に使った企業も、実際の仕事でOpus 5と比べた結果を報告しています。

Opus 5との差が大きく出た3つの例 図6
39/40回 Webアプリの全ページの表示を速くする課題で成功 Anthropic · 社内試験
16/18本 四半期業績の報告書が合格 Anthropic · 社内試験
72% コードレビューで既知のバグを発見(lowで・Opus 5はhighで56%) Deloitte
社内試験の2例とDeloitteの報告で、Opus 5.5はOpus 5を大きく上回りました。

報告書の例では、Opus 5は1本も合格しませんでした。

Anthropicと早期利用企業が示したOpus 5との差 図7
課題(報告元)Opus 5.5Opus 5
20万行のコードの監査と修正(早期テスター)3時間未満20時間超、トークンはOpus 5.5の2.5倍
Webアプリの全ページの表示を速くする(社内試験)40回中39回成功改善は小さく、アプリの挙動まで変えました
架空の企業合併の分析と資料作成(社内試験)63分で、費用は50%少なくなりました93分で、小さな誤りがありました
四半期業績の報告書(推論の強さを変えて試行・社内試験)18本中16本が合格どの試行も合格なし
コードレビューで既知のバグを見つけた割合(Deloitte)lowで72%highで56%
金融の業務で求める項目を満たした割合(Hebbia)86.6%60.3%
同じ品質に要した出力トークン(Factory)Opus 5のhighと同じ品質で、出力トークンは20〜25%少なくなりました—
報告されたどの例でも、Opus 5.5はOpus 5より良い結果を出すか、同じ課題を短い時間か少ない費用で終えました。

文章も変わりました。Anthropicは、バグの説明の書き方を2つのモデルで比べて公開しています。Opus 5は原因を短く示した後、すぐコードの説明に入り、影響は後半で書いています。Opus 5.5は、冒頭で原因を言い切り、請求額の減少のうち不具合による金額まで書いています。

Anthropicの資料では、性能も文章の書き方も、Opus 5から良くなっています。

04

第三者の計測では?主要モデルと比べたOpus 5.5の位置

第三者のArtificial Analysisは、各社の主要モデルを同じ課題で測っています。Opus 5.5の総合指数は58で首位でした。Opus 5の51を上回り、Fable 5.1とOpenAIのGPT-6 Astraの53も上回っています。

Artificial Analysisの計測での総合指数と、1つの課題にかかった費用と出力トークンは次のとおりです。

主要モデルの総合指数(Artificial Analysis) 図8
モデル総合指数
Opus 5.558
Fable 5.153
GPT-6 Astra53
Opus 5(前のモデル)51
GPT-6 Sol48
GPT-5.6 Sol47
Grok 4.746
Grok 4.644
Opus 5.5が58で首位です。値は各モデルで選べる推論の強さの上限で測ったもので、Grok 4.7はxhigh、Grok 4.6はhighです。
主要モデルの1つの課題の費用(Artificial Analysis) 図9
モデル1つの課題の費用
Opus 5.55.98
Fable 5.17.63
GPT-6 Astra3.26
Opus 5(前のモデル)5.86
GPT-6 Sol1.06
GPT-5.6 Sol1.99
Grok 4.73.74
Grok 4.61.86
1つの課題の費用は、Opus 5.5が5.98ドルで、Fable 5.1の7.63ドルに次いで高い値です。1つの課題の出力トークンは、Opus 5.5が11.9万で最も多く、Opus 5は7.3万です。ほかの6モデルは2.7万〜8.1万です。

総合指数と並べて見てください。GPT-6 Astraは、Opus 5.5より総合指数が5点低く、費用は約半分です。

Opus 5.5は1つの課題で出力トークンを11.9万使い、費用は5.98ドルでした。同じ計測で、GPT-6 Solは1.06ドル、GPT-6 Astraは3.26ドルでした。

私はこの首位を、点数より費用とセットで読んでいます。GPT-6 Solとの差は総合指数で10点ですが、1つの課題の費用は5倍以上あるからです。

知識作業と業務の自動化の評価では、Opus 5.5がどれも首位でした。

知識作業と業務の自動化の成績(Artificial Analysis) 図10
モデル実務の成果物(GDPval-AA)知識作業の成果物(AA-Briefcase)業務の自動化(AutomationBench-AA)
Opus 5.51846182270%
Fable 5.11735167859%
GPT-6 Astra1542156968%
Opus 5(前のモデル)1708167357%
GPT-6 Sol1487148362%
GPT-5.6 Sol1588148760%
Grok 4.71695165766%
Grok 4.61605153967%
GDPval-AAとAA-Briefcaseは対戦形式の点数で、高いほど良い成績です。GDPval-AAは図5と同じ計測の値です。

業務の自動化の列では、Opus 5.5とGPT-6 Astraの差は2ポイントです。

開発と科学計算、難問の評価でも、Opus 5.5は首位か首位に並びました。一方、Artificial Analysisは、首位に届いていない評価もあるとしています。GDP.pdf・CritPt・AA-LCRの3つです。

開発と科学計算、難問の成績(Artificial Analysis) 図11
モデル端末での複雑な開発作業(Terminal-Bench 4.0)科学計算のコード(SciCode)難問(Humanity's Last Exam)
Opus 5.560%67%61%
Fable 5.152%63%59%
GPT-6 Astra59%56%55%
Opus 5(前のモデル)49%56%55%
GPT-6 Sol44%58%48%
GPT-5.6 Sol40%57%49%
Grok 4.726%57%43%
Grok 4.621%56%43%
端末での開発作業は、GPT-6 Astraと並ぶ値です。図5と同じ名前の評価も、測った会社と条件が違うため値は一致しません。

科学計算のコードの列では、Opus 5.5がほかの7モデルを4ポイント以上離しています。

この計測では、推論の強さを上げても成績が伸びるとは限りませんでした。Terminal-Bench-Science 0.1は、科学研究の作業を測る評価です。Opus 5.5はxhighで61.9%、maxで59.0%でした。同じ評価の首位は、GPT-6 Astraの63.3%です。総合では首位でも、評価によっては他社が上に立ちます。

05

料金はいくら?定額プランとAPIの料金、費用が下がる条件

Pro・Max・Teamの定額プランは月額料金の中で使い、APIやクラウド経由は使った量に応じて払います。Claude APIの単価はOpus 5より20%下がりました。Anthropicによると、既定の段階なら一般的な作業の費用は約40%下がります。ただし第三者の計測では、maxどうしだと費用はほぼ同じでした。

定額プランの利用枠には、5時間ごとの上限と、週ごとの上限があります。Anthropicは発表と同時に、5時間ごとの上限を引き上げました。対象は、Pro・Max・Teamと、席単位で契約するEnterpriseです。

Opus 5.5は、Pro・Max・Team・Enterpriseの有料プランと、APIで使えます。定額プランとAPIの料金の違いは、次のとおりです。

定額プランとAPIの料金の違い 図12
プランと使い方料金(ドル)課金方式と利用枠
Pro(定額)月20ドル(年払いなら月17ドル)月額料金の中で、プランの利用枠まで使えます
Max(定額)月100ドルからProの5倍か20倍の利用枠から選べます
Team(定額・標準の席)1席あたり月25ドル(年払いなら月20ドル)利用枠はProより多く、枠の多い上位の席もあります
Enterprise(席の料金と利用分)1席あたり月20ドル(年払い)と利用分利用分はAPIの単価で払います
API(100万トークンあたり)入力4ドル・出力20ドル使った量に応じて払います
定額プランは月額料金の中で利用枠まで使い、APIとEnterpriseの利用分は使った量で払います。Amazon BedrockとGoogle Cloudの料金は、各クラウドの料金表で決まります。表の料金は税を含みません。

APIの単価は、100万トークンあたり入力4ドル・出力20ドルで、Opus 5の5ドル・25ドルから20%下がりました。同じ資料を繰り返し送るときに使うキャッシュの読み込みは0.20ドルです。Opus 5の0.50ドルから60%下がっています。

Anthropicによると、エージェント作業やコーディングの費用の大半は、このキャッシュの読み込みが占めます。

まとめて処理するバッチは半額で、速さを優先する高速モードは入力8ドル・出力40ドルです。

推論の強さを上げると、考える量の分だけ出力トークンが増えます。そのため、Opus 5と比べて費用がどれだけ下がるかは、比べる段階で変わります。

既定の段階どうしで比べるときは、Opus 5.5のmediumとOpus 5のhighを並べます。この場合は単価が下がったうえに使うトークンも減るため、Anthropicは費用が約40%下がるとしています。

一方、Artificial Analysisはmaxどうしで測っています。この条件では、Opus 5.5は出力トークンをOpus 5の約1.6倍使いました。1つの課題の費用は5.98ドルと5.86ドルで、ほぼ同じでした。Opus 5.5は同じ段階ならOpus 5より考える量が多く、maxで差が大きくなるためです。

約40%と「ほぼ同じ」は、比べる段階も、測った会社と課題も違います。自分の作業がどちらに近いかは、測るまで分かりません。APIで使った量に応じて払うなら、私はまずmediumのまま使い、1か月分の請求額をOpus 5の月と並べます。

Artificial Analysisは、段階ごとにも比べています。mediumからmaxまでのどの段階でも、総合指数が50以上のほかのモデルより安いか、成績が上でした。

費用が下がるかどうかは、単価よりも、どの段階で使うかで決まります。

06

どこで使える?切り替えの注意と安全装置

Opus 5.5は、有料プランならClaudeのアプリでもClaude Codeでも使えます。最新版のClaude Codeでは、既定のモデルもOpus 5.5です(Microsoft Foundry経由を除く)。使った量に応じて払う場合は、Claude APIから使えます。AWSでは、Amazon BedrockとClaude Platform on AWSから使えます。Google CloudとMicrosoft Foundryからも使えます。

APIのモデルIDはclaude-opus-5-5です。Amazon Bedrockでは、anthropic.claude-opus-5-5です。Opus 5は旧モデルとして使い続けられますが、AnthropicはOpus 5.5への移行を検討するよう勧めています。

どの使い方でも知っておきたいのが安全装置です。生物学やサイバーセキュリティの依頼と判断されると、Opus 5.5は答えません。使い方によっては、前の世代のモデルが代わりに答えます。Claude Codeでは、生物学の依頼はClaude Opus 5が答え直します。サイバーセキュリティの依頼はClaude Opus 4.8が答え直します。どちらも、会話の画面に知らせが出ます。

切り替わった後も、そのセッションは切り替え先のモデルで続きます。元に戻すには、/modelでモデルを選び直します。自動で切り替えず、毎回確かめることもできます。/configで「Switch models when a message is flagged」をオフにします。

Opus 5から切り替えるときの確認項目(APIで組み込んでいる場合) 図13
変わる点結果Opus 5.5での動き設定の直し方
思考をオフにする設定エラーエラーになります(思考は切れません)設定を外し、深さは推論の強さで調整します
ツールの使用の強制エラーエラーになります自動に戻し、使う場面を指示文で伝えます
旧版の画面操作ツールエラーClaude APIとGoogle Cloudでエラーになります新しいツール群へ置き換えます(Amazon Bedrockは不要です)
思考の記録を含む会話の書き換えエラー前の指示やツール、発言を書き換えて送るとエラーになります(2026年8月31日以降に作ったアカウント)書き換えず、会話の途中に指示を足して変えます
推論の強さの既定挙動の変化mediumで動きます(Opus 5はhigh)段階ごとに品質と費用を測り直します
ツール呼び出しの間の文章挙動の変化思考の欄に入り、既定では空で返ります経過を画面に出すなら、thinking.displayの設定を変えます
推論の強さの既定と、ツール呼び出しの間の文章はエラーにならずに動きが変わります。それ以外はエラーにつながる変更なので、先に直します。

図13は、上の4行のうち、自分の環境に当たる行から直してください。思考を切る設定とツールの使用の強制は、送った時点でエラーになります。これは公式資料に明記されています。

組み込み済みの仕組みの切り替えを手順から一緒に確かめたい場合は、AIに関するテーマの相談をご利用ください。

APIでは、安全装置が働くと断りの応答が返ります。Opus 5.5へ移る前に、別のモデルで再試行する設定を用意しておきます。

07

利用者の評判は?評価される点と気になる点

利用者からは、文章が簡潔で読みやすくなった点や、利用枠が長く持つ点を評価する声があります。一方で、利用枠の減り方や日本語での応答、安全装置での切り替えを気にする声もあります。

公開直後の利用報告21件を、論点ごとにまとめると次のとおりです。

利用者の評判(公開直後の報告を論点ごとに整理) 図14
論点評価する声気になる声
文章と日本語簡潔になり、機械的な書き方が減ったうえ、日本語も自然になりました日本語の依頼に英語で答える場合があります
開発とレビュー既存のコード全体の見直しで多くの問題を見つけ、説明も分かりやすいです考えや調査の深さは、Fableや他社のモデルが上という声もあります
資料作成スライドや資料を少ない指示で形にできます込み入った高難度の作業は、Fableに任せるという声があります
利用枠定額プランの利用枠が以前より長く持ちます(公式も5時間ごとの上限を引き上げました)Opus 5より枠の減りが速い、mediumでも早く使い切るという報告もあります
設定と安全装置多くの作業はmediumかhighで足り、maxは要らないとする声生物学の依頼で別のモデルに切り替わるのが気になるという声
自分の作業に近い行の不満から先に確かめると、切り替えの失敗を減らせます。

定額プランで使うなら、利用枠の行と、文章と日本語の行を先に確かめます。

私も業務でOpus 5.5を使っています。推論の強さは既定のmediumのままでも、十分に働いている印象です。GPT-5.6 Solで作っていたシステムの不具合も、見つけて直してくれました。Fable 5.1で進めていた業務もOpus 5.5で問題なくこなせたため、利用料を大きく抑えられました。

一方で、日本語で指示していても、途中から英語で返ってくることがよくあります。アプリの開発中に、安全装置に引っかかったこともありました。どちらも、表の気になる声と同じ点です。

08

まとめ:Opus 5.5に切り替える?使い方別の結論

独自見解

どの使い方でも、まず既定の段階で試し、品質が足りない作業に限って段階を上げます。

推論の強さは、上げるほど良い結果になるとは限りません。第三者の計測でも、maxに上げても伸びなかった評価がありました。早期に使ったFactoryは、Opus 5.5を「mediumを既定にしたいと思えた初めてのモデル」と評しています。Opus 5でhigh以上にしていた作業は、段階を選び直します。

私なら、定額プランではすぐにOpus 5.5で試します。合わなければ、モデルを選び直すだけで戻せるからです。利用枠の減りが速いという声もあるので、最初の数日は残りの枠を見ながら使います。

APIで自社のシステムに組み込んでいる場合は、私なら図13のエラーになる項目を直すまで切り替えません。止まるのが本番の処理だからです。

使い方別の結論は次のとおりです。

使い方別の結論 図15
すぐ試す 定額プラン(Pro・Max・Team)で使う場合です。既定の段階で使い、利用枠の減り方と、日本語の依頼に英語で答えないかを確かめます。
段階を測る 使った量で払うAPIやクラウドの場合です。mediumで使い、品質と請求額をOpus 5と並べ、足りない作業だけ段階を上げます。
直してから APIで自社のシステムに組み込んでいる場合です。「段階を測る」に加えて、図13の確認項目を直してから移り、mediumとhighで品質と費用を比べます。
lowと比べる 費用を抑えたい大量の処理です。lowで足りるかを試し、まだ高ければ、単価がOpus 5.5の半分のSonnet 5も比べます。
段階の決め方はどの使い方でも同じです。確かめるものは、定額プランなら利用枠の減り方、使った量で払うなら請求額です。

自分の使い方に当たるものを1つ選んでください。そこに書いた確かめることが、切り替えた後の点検項目になります。

Opus 5.5は、Opus 5より良い結果を安い単価で出せる場面が多いモデルです。

Anthropicの表の値は、同社の環境と推論の強さで測った値です。第三者の値は、Artificial Analysisが各モデルの推論の強さの上限で測った値です。

段階ごとの最初に試す作業(図4)は目安です。最後は同じ課題で品質と実際の費用を比べて決めます。

09

出典と調査方法

本文・図表の根拠に用いた資料です(2026年9月26日時点)。仕様・料金・提供条件と性能の公表値は、Anthropicの公式資料を参照しました。同じ条件での計測は、Artificial Analysisの公開結果を参照しました。利用者の評判は、2026年9月23日〜25日に公開された利用報告21件をもとに、論点ごとにまとめました。

  1. Anthropic|Claude Opus 5.5の発表 — 公開日と位置づけ、Opus 5と比べた費用と速さの説明、性能の比較表と測定条件、社内試験と早期利用企業の結果、安全装置の根拠。
  2. Anthropic|Claude Opus 5.5のモデル仕様 — モデルID、コンテキストと最大出力、知識の時点、既定の推論の強さ、単価、提供先と提供終了の目安の根拠。
  3. Anthropic|Claude Opus 5.5の変更点 — Opus 5から切り替えるときの破壊的変更、動きの違い(既定の推論の強さ・考える量・ツール呼び出しの間の文章)と料金の根拠。
  4. Anthropic|Claude Opusの製品ページ — Claudeの有料プランでの提供、高速モードの料金、得意な用途、性能表の測定条件の根拠。
  5. Anthropic|Claude Opus 5のモデル仕様 — Opus 5の公開日と提供終了の目安、仕様と単価、既定の推論の強さの根拠。
  6. Anthropic|Claude APIの料金 — キャッシュ・バッチ・高速モード・長い入力の料金条件の根拠。
  7. Anthropic|推論の強さ(effort)の設定 — 推論の強さの段階ごとの説明と向く作業、Opus 5.5とOpus 5の既定と推奨の違いの根拠。
  8. Anthropic|Claudeのプランと料金 — Pro・Max・Teamの月額料金と、APIの単価の根拠。
  9. Anthropic|Claude Codeのモデルと推論の強さの設定 — Claude Codeで推論の強さを変える方法(/effortとモデルの選択画面)、Opus 5.5の既定、安全装置による別モデルへの切り替えと知らせの根拠。
  10. Anthropic|Claudeアプリのモデルと推論の強さの設定 — Claudeのアプリで推論の強さを選ぶ方法、段階を上げたときの利用上限への影響、思考を切れないことの根拠。
  11. Artificial Analysis|Claude Opus 5.5の計測記事 — Opus 5.5の総合指数と評価ごとの成績、Opus 5と比べた出力トークンと1回の費用の説明の根拠。
  12. Artificial Analysis|GPT-6 SolとClaude Opus 5.5の比較 — 同じ条件で測ったOpus 5.5とGPT-6 Solの総合指数・評価ごとの成績・1タスクの費用の根拠。
  13. Artificial Analysis|GPT-6 AstraとClaude Opus 5の比較 — 同じ条件で測ったOpus 5とGPT-6 Astraの総合指数・評価ごとの成績・1タスクの費用の根拠。
  14. Artificial Analysis|Grok 4.7とClaude Fable 5.1の比較 — 同じ計測でのFable 5.1とGrok 4.7の総合指数・評価ごとの成績・1タスクの費用の根拠。
  15. Artificial Analysis|GPT-5.6 SolとGrok 4.6の比較 — 同じ計測でのGPT-5.6 SolとGrok 4.6の総合指数・評価ごとの成績・1タスクの費用の根拠。
  16. Artificial Analysis|Terminal-Bench-Science 0.1の計測 — 科学研究の作業の評価で、Opus 5.5をxhighとmaxで測った値の根拠。
Vision Consulting

PoCを「技術実験」で終わらせず、経営判断まで設計する。

対象業務の選定、現状値の計測、評価設計、ガバナンス、本番移行判定を一つの意思決定プロセスとして整理します。

share
AIに関するテーマを相談する→