Claude Opus 5.5は2026年9月22日に公開されました。
料金・仕様・提供先は2026年9月26日に公式資料で再確認しました。
Claude Opus 5.5は、Anthropicが2026年9月22日に公開したOpusの最新版です。性能を落とした版ではなく、多くの作業でFable 5.1並みの性能を、Opus 5より20%安いAPI単価で使えます。
この記事が役立つ方へ
Claude Opus 5.5を業務で使うか、使うならどの設定と料金で使うかを決めたい方に向けています。
- Opus 5.5を業務に使ってよいか、判断の材料が足りない
- どの推論の強さで使えばよいか決められない
- 単価は下がったと聞くが、自社の請求額が下がるか分からない
Claude Opus 5.5とは?Opus 5から変わった点
Opus 5.5は、Opus 5の後継として公開された、ClaudeのOpus系列の最新のモデルです。多くの作業で単価の高いFable 5.1と同じ水準の性能を、より安い単価で使えるのが特徴です。
Claudeの主な系列は、価格の高い順にFable・Opus・Sonnet・Haikuです。Anthropicは2026年9月22日にOpus 5.5を公開しました。多くの作業でFable 5.1の水準で動くと説明しています。既定の設定なら、一般的な作業の費用はOpus 5より40%下がるとしています。
切り替えでつまずきやすいのが、Opus 5で決めた推論の強さをそのまま使うことです。Anthropicも、段階を測り直すよう勧めています。推論の強さは、どの使い方でも既定の段階から試し、足りない作業だけ上げます。公開と同時に、Pro・Max・Teamと席単位のEnterpriseでは、5時間ごとの利用上限が引き上げられました。APIやクラウド経由で使った量に応じて払う場合は、段階を上げるほど費用が増えます。請求額を確かめながら切り替えてください。
Opus 5から変わった点は、次のとおりです。
3つのうち、費用の40%だけは使い方で変わります。既定の段階どうしで比べた値だからです。
| 項目 | Opus 5.5 | Opus 5 |
|---|---|---|
| 公表された性能 | 開発・知識作業・画面操作の評価で上回ります | — |
| 文章の書き方 | 要点を先に書き、専門用語を減らしました | Opus 5は読みにくいという声が多くありました(Anthropic) |
| 図表や画面の読み取り | 細かい図表をツールなしでも以前より正確に読めます | 読み取りを補う工夫が要る場合がありました |
| 推論の強さの既定 | medium | high |
| 思考を切る設定(APIとClaude Code) | 使えません | 使えます |
表のうち、使い方に大きく関わるのは推論の強さの既定です。何も指定しないと、Opus 5.5はOpus 5より一段低いmediumで動きます。
基本スペックは?Opus 5との違いと推論の強さ
Opus 5.5は、Opus 5と同じく100万トークンを扱え、最大出力は12.8万トークンです。知識の時点は2026年6月で、Opus 5より新しくなりました。
Anthropicは、Opus 5.5の数え方で100万トークンを約55.5万語・約250万文字の目安としています。
| 項目 | Opus 5.5 | Opus 5 |
|---|---|---|
| 位置づけ | Opusの最新版 | 前のOpus(旧モデル・提供は継続) |
| モデルID | claude-opus-5-5 | claude-opus-5 |
| 公開日 | 2026年9月22日 | 2026年7月24日 |
| 提供が続く期間 | 少なくとも2027年9月22日まで | 少なくとも2027年7月24日まで |
| コンテキスト | 100万トークン | 100万トークン |
| 最大出力 | 12.8万トークン | 12.8万トークン |
| 入力と出力 | 文章と画像を読み、文章を返します | 文章と画像を読み、文章を返します |
| 知識の時点 | 2026年6月 | 2026年5月 |
モデルそのものは文章を返します。Claudeのアプリの資料作成の機能と組み合わせると、スライドや文書のファイルも作れます。
Fable 5.1は、Claudeで単価の高い系列のモデルです。入力10ドル・出力50ドルで、Opus 5.5の入力4ドル・出力20ドルより高めです。Anthropicによると、Fable 5.1は難しい推論と長いエージェント作業向けです。Opus 5.5は、長い開発作業と知識作業向けです。
Anthropicの評価表では、Opus 5.5がFable 5.1をどの評価でも上回ります。ただし同社は、社内で使った実感では両者の差は点数ほど大きくないとしています。同じプログラムの書き換えでは、Opus 5.5が9.5時間、Fable 5.1が12時間で終えました。費用も、Opus 5.5のほうが51%少なかったとしています。それでも、難しい推論をじっくり任せたい作業では、Fableとも比べてみる価値があります。
推論の強さ(effort)は、low・medium・high・xhigh・maxから選びます。上げるほど深く考えますが、時間と費用も増えます。Opus 5.5では考える過程(思考)を切れないので、深さはこの段階で調整します。
- low トークンを大きく節約し、能力は少し下がります 短い質問、定型の処理、補助の処理
- medium トークンの節約と能力の釣り合いをとります 日常の開発、資料作成、調査 Opus 5.5の既定
- high 良い結果に必要なだけトークンを使います 複雑な開発やコードレビュー
- xhigh 長い作業に向けて能力を広げます 30分を超える長いエージェント作業やコーディング
- max 使うトークンに上限を設けず、最大の能力を出します xhighでも足りない、特に深い推論が要る難問
最初に試す作業は、xhighだけがAnthropicの説明で、ほかはこの記事の目安です。
Anthropicによると、Opus 5.5は同じ段階でも、Opus 5より1回の応答で考える量が多い傾向があります。xhighとmaxでは、この差が特に大きくなります。そのため、Opus 5で決めた段階をそのまま使わず、自分の作業で測り直すよう勧めています。
Claudeのアプリでは、送信ボタンの横のモデル名から「Effort」を開き、段階を選べます。Anthropicのヘルプによると、段階を上げるほど答えは丁寧になりますが、時間がかかり、利用上限に早く達します。
Claude Codeでは、/effortというコマンドか、モデルを選ぶ画面で段階を変えられます。Opus 5.5は選ばなければmediumで始まり、maxは今のセッションの間だけ使われ、既定としては保存されません。
仕様はOpus 5とほぼ同じです。使い始めるときは、推論の強さの段階を選び直します。
性能は?Anthropicの公表値でOpus 5と比べる
Anthropicの発表資料の表では、Opus 5.5は開発・知識作業・画面操作の評価でOpus 5を上回りました。端末での開発作業(Terminal-Bench 4.0)は、52.3%から66.4%に上がりました。実務の成果物を比べるGDPval-AA(対戦形式の点数)は、1708から1846に上がっています。
Anthropicの発表資料の表から、Opus 5.5・Fable 5.1・Opus 5の値を抜き出しました。
| 評価 | Opus 5.5 | Fable 5.1 | Opus 5 |
|---|---|---|---|
| 端末での複雑な開発作業(Terminal-Bench 4.0) | 66.4 | 55.8 | 52.3 |
| 採用されるコード変更(FrontierCode v1.1) | 54.4 | 50.3 | 48.0 |
| 実際の開発の依頼(CursorBench 4.0) | 57.8 | 51.8 | 46.6 |
| 業務アプリの自動化・Zapierの計測(AutomationBench) | 40.0 | 31.4 | 26.9 |
| 難問・ツールあり(Humanity's Last Exam) | 67.7 | 65.6 | 63.6 |
| 科学研究の作業(Terminal-Bench-Science 0.1) | 58.7 | 52.6 | 29.0 |
| 画面操作・部分点の値(OSWorld 2.0) | 81.8 | 80.7 | 74.0 |
科学研究の作業で、Opus 5との差が最も開いています。29.0%から約2倍になりました。
安全装置が働いた課題は、前の世代のモデルが代わりに解きました。そのため、Anthropicは、Opus 5.5の本来の値はもっと高い可能性が高いとしています。業務アプリの自動化(AutomationBench)では、止められた課題を不合格として数えています。
Anthropicの同じ表では、GPT-6 AstraがOpus 5.5を上回る評価もあります。GPT-6 Astraの値は、業務アプリの自動化で41.4%、科学研究の作業で64.6%です。
開発作業のTerminal-Bench 4.0・FrontierCode・CursorBenchは、どれも伸びました。既定のmediumでも、CursorBenchは52.5%で、maxのOpus 5の46.6%を上回ります。
Anthropicの社内試験と早期に使った企業も、実際の仕事でOpus 5と比べた結果を報告しています。
報告書の例では、Opus 5は1本も合格しませんでした。
| 課題(報告元) | Opus 5.5 | Opus 5 |
|---|---|---|
| 20万行のコードの監査と修正(早期テスター) | 3時間未満 | 20時間超、トークンはOpus 5.5の2.5倍 |
| Webアプリの全ページの表示を速くする(社内試験) | 40回中39回成功 | 改善は小さく、アプリの挙動まで変えました |
| 架空の企業合併の分析と資料作成(社内試験) | 63分で、費用は50%少なくなりました | 93分で、小さな誤りがありました |
| 四半期業績の報告書(推論の強さを変えて試行・社内試験) | 18本中16本が合格 | どの試行も合格なし |
| コードレビューで既知のバグを見つけた割合(Deloitte) | lowで72% | highで56% |
| 金融の業務で求める項目を満たした割合(Hebbia) | 86.6% | 60.3% |
| 同じ品質に要した出力トークン(Factory) | Opus 5のhighと同じ品質で、出力トークンは20〜25%少なくなりました | — |
文章も変わりました。Anthropicは、バグの説明の書き方を2つのモデルで比べて公開しています。Opus 5は原因を短く示した後、すぐコードの説明に入り、影響は後半で書いています。Opus 5.5は、冒頭で原因を言い切り、請求額の減少のうち不具合による金額まで書いています。
Anthropicの資料では、性能も文章の書き方も、Opus 5から良くなっています。
第三者の計測では?主要モデルと比べたOpus 5.5の位置
第三者のArtificial Analysisは、各社の主要モデルを同じ課題で測っています。Opus 5.5の総合指数は58で首位でした。Opus 5の51を上回り、Fable 5.1とOpenAIのGPT-6 Astraの53も上回っています。
Artificial Analysisの計測での総合指数と、1つの課題にかかった費用と出力トークンは次のとおりです。
| モデル | 総合指数 |
|---|---|
| Opus 5.5 | 58 |
| Fable 5.1 | 53 |
| GPT-6 Astra | 53 |
| Opus 5(前のモデル) | 51 |
| GPT-6 Sol | 48 |
| GPT-5.6 Sol | 47 |
| Grok 4.7 | 46 |
| Grok 4.6 | 44 |
| モデル | 1つの課題の費用 |
|---|---|
| Opus 5.5 | 5.98 |
| Fable 5.1 | 7.63 |
| GPT-6 Astra | 3.26 |
| Opus 5(前のモデル) | 5.86 |
| GPT-6 Sol | 1.06 |
| GPT-5.6 Sol | 1.99 |
| Grok 4.7 | 3.74 |
| Grok 4.6 | 1.86 |
総合指数と並べて見てください。GPT-6 Astraは、Opus 5.5より総合指数が5点低く、費用は約半分です。
Opus 5.5は1つの課題で出力トークンを11.9万使い、費用は5.98ドルでした。同じ計測で、GPT-6 Solは1.06ドル、GPT-6 Astraは3.26ドルでした。
私はこの首位を、点数より費用とセットで読んでいます。GPT-6 Solとの差は総合指数で10点ですが、1つの課題の費用は5倍以上あるからです。
知識作業と業務の自動化の評価では、Opus 5.5がどれも首位でした。
| モデル | 実務の成果物(GDPval-AA) | 知識作業の成果物(AA-Briefcase) | 業務の自動化(AutomationBench-AA) |
|---|---|---|---|
| Opus 5.5 | 1846 | 1822 | 70% |
| Fable 5.1 | 1735 | 1678 | 59% |
| GPT-6 Astra | 1542 | 1569 | 68% |
| Opus 5(前のモデル) | 1708 | 1673 | 57% |
| GPT-6 Sol | 1487 | 1483 | 62% |
| GPT-5.6 Sol | 1588 | 1487 | 60% |
| Grok 4.7 | 1695 | 1657 | 66% |
| Grok 4.6 | 1605 | 1539 | 67% |
業務の自動化の列では、Opus 5.5とGPT-6 Astraの差は2ポイントです。
開発と科学計算、難問の評価でも、Opus 5.5は首位か首位に並びました。一方、Artificial Analysisは、首位に届いていない評価もあるとしています。GDP.pdf・CritPt・AA-LCRの3つです。
| モデル | 端末での複雑な開発作業(Terminal-Bench 4.0) | 科学計算のコード(SciCode) | 難問(Humanity's Last Exam) |
|---|---|---|---|
| Opus 5.5 | 60% | 67% | 61% |
| Fable 5.1 | 52% | 63% | 59% |
| GPT-6 Astra | 59% | 56% | 55% |
| Opus 5(前のモデル) | 49% | 56% | 55% |
| GPT-6 Sol | 44% | 58% | 48% |
| GPT-5.6 Sol | 40% | 57% | 49% |
| Grok 4.7 | 26% | 57% | 43% |
| Grok 4.6 | 21% | 56% | 43% |
科学計算のコードの列では、Opus 5.5がほかの7モデルを4ポイント以上離しています。
この計測では、推論の強さを上げても成績が伸びるとは限りませんでした。Terminal-Bench-Science 0.1は、科学研究の作業を測る評価です。Opus 5.5はxhighで61.9%、maxで59.0%でした。同じ評価の首位は、GPT-6 Astraの63.3%です。総合では首位でも、評価によっては他社が上に立ちます。
料金はいくら?定額プランとAPIの料金、費用が下がる条件
Pro・Max・Teamの定額プランは月額料金の中で使い、APIやクラウド経由は使った量に応じて払います。Claude APIの単価はOpus 5より20%下がりました。Anthropicによると、既定の段階なら一般的な作業の費用は約40%下がります。ただし第三者の計測では、maxどうしだと費用はほぼ同じでした。
定額プランの利用枠には、5時間ごとの上限と、週ごとの上限があります。Anthropicは発表と同時に、5時間ごとの上限を引き上げました。対象は、Pro・Max・Teamと、席単位で契約するEnterpriseです。
Opus 5.5は、Pro・Max・Team・Enterpriseの有料プランと、APIで使えます。定額プランとAPIの料金の違いは、次のとおりです。
| プランと使い方 | 料金(ドル) | 課金方式と利用枠 |
|---|---|---|
| Pro(定額) | 月20ドル(年払いなら月17ドル) | 月額料金の中で、プランの利用枠まで使えます |
| Max(定額) | 月100ドルから | Proの5倍か20倍の利用枠から選べます |
| Team(定額・標準の席) | 1席あたり月25ドル(年払いなら月20ドル) | 利用枠はProより多く、枠の多い上位の席もあります |
| Enterprise(席の料金と利用分) | 1席あたり月20ドル(年払い)と利用分 | 利用分はAPIの単価で払います |
| API(100万トークンあたり) | 入力4ドル・出力20ドル | 使った量に応じて払います |
APIの単価は、100万トークンあたり入力4ドル・出力20ドルで、Opus 5の5ドル・25ドルから20%下がりました。同じ資料を繰り返し送るときに使うキャッシュの読み込みは0.20ドルです。Opus 5の0.50ドルから60%下がっています。
Anthropicによると、エージェント作業やコーディングの費用の大半は、このキャッシュの読み込みが占めます。
まとめて処理するバッチは半額で、速さを優先する高速モードは入力8ドル・出力40ドルです。
推論の強さを上げると、考える量の分だけ出力トークンが増えます。そのため、Opus 5と比べて費用がどれだけ下がるかは、比べる段階で変わります。
既定の段階どうしで比べるときは、Opus 5.5のmediumとOpus 5のhighを並べます。この場合は単価が下がったうえに使うトークンも減るため、Anthropicは費用が約40%下がるとしています。
一方、Artificial Analysisはmaxどうしで測っています。この条件では、Opus 5.5は出力トークンをOpus 5の約1.6倍使いました。1つの課題の費用は5.98ドルと5.86ドルで、ほぼ同じでした。Opus 5.5は同じ段階ならOpus 5より考える量が多く、maxで差が大きくなるためです。
約40%と「ほぼ同じ」は、比べる段階も、測った会社と課題も違います。自分の作業がどちらに近いかは、測るまで分かりません。APIで使った量に応じて払うなら、私はまずmediumのまま使い、1か月分の請求額をOpus 5の月と並べます。
Artificial Analysisは、段階ごとにも比べています。mediumからmaxまでのどの段階でも、総合指数が50以上のほかのモデルより安いか、成績が上でした。
費用が下がるかどうかは、単価よりも、どの段階で使うかで決まります。
どこで使える?切り替えの注意と安全装置
Opus 5.5は、有料プランならClaudeのアプリでもClaude Codeでも使えます。最新版のClaude Codeでは、既定のモデルもOpus 5.5です(Microsoft Foundry経由を除く)。使った量に応じて払う場合は、Claude APIから使えます。AWSでは、Amazon BedrockとClaude Platform on AWSから使えます。Google CloudとMicrosoft Foundryからも使えます。
APIのモデルIDはclaude-opus-5-5です。Amazon Bedrockでは、anthropic.claude-opus-5-5です。Opus 5は旧モデルとして使い続けられますが、AnthropicはOpus 5.5への移行を検討するよう勧めています。
どの使い方でも知っておきたいのが安全装置です。生物学やサイバーセキュリティの依頼と判断されると、Opus 5.5は答えません。使い方によっては、前の世代のモデルが代わりに答えます。Claude Codeでは、生物学の依頼はClaude Opus 5が答え直します。サイバーセキュリティの依頼はClaude Opus 4.8が答え直します。どちらも、会話の画面に知らせが出ます。
切り替わった後も、そのセッションは切り替え先のモデルで続きます。元に戻すには、/modelでモデルを選び直します。自動で切り替えず、毎回確かめることもできます。/configで「Switch models when a message is flagged」をオフにします。
| 変わる点 | 結果 | Opus 5.5での動き | 設定の直し方 |
|---|---|---|---|
| 思考をオフにする設定 | エラー | エラーになります(思考は切れません) | 設定を外し、深さは推論の強さで調整します |
| ツールの使用の強制 | エラー | エラーになります | 自動に戻し、使う場面を指示文で伝えます |
| 旧版の画面操作ツール | エラー | Claude APIとGoogle Cloudでエラーになります | 新しいツール群へ置き換えます(Amazon Bedrockは不要です) |
| 思考の記録を含む会話の書き換え | エラー | 前の指示やツール、発言を書き換えて送るとエラーになります(2026年8月31日以降に作ったアカウント) | 書き換えず、会話の途中に指示を足して変えます |
| 推論の強さの既定 | 挙動の変化 | mediumで動きます(Opus 5はhigh) | 段階ごとに品質と費用を測り直します |
| ツール呼び出しの間の文章 | 挙動の変化 | 思考の欄に入り、既定では空で返ります | 経過を画面に出すなら、thinking.displayの設定を変えます |
図13は、上の4行のうち、自分の環境に当たる行から直してください。思考を切る設定とツールの使用の強制は、送った時点でエラーになります。これは公式資料に明記されています。
組み込み済みの仕組みの切り替えを手順から一緒に確かめたい場合は、AIに関するテーマの相談をご利用ください。
APIでは、安全装置が働くと断りの応答が返ります。Opus 5.5へ移る前に、別のモデルで再試行する設定を用意しておきます。
利用者の評判は?評価される点と気になる点
利用者からは、文章が簡潔で読みやすくなった点や、利用枠が長く持つ点を評価する声があります。一方で、利用枠の減り方や日本語での応答、安全装置での切り替えを気にする声もあります。
公開直後の利用報告21件を、論点ごとにまとめると次のとおりです。
| 論点 | 評価する声 | 気になる声 |
|---|---|---|
| 文章と日本語 | 簡潔になり、機械的な書き方が減ったうえ、日本語も自然になりました | 日本語の依頼に英語で答える場合があります |
| 開発とレビュー | 既存のコード全体の見直しで多くの問題を見つけ、説明も分かりやすいです | 考えや調査の深さは、Fableや他社のモデルが上という声もあります |
| 資料作成 | スライドや資料を少ない指示で形にできます | 込み入った高難度の作業は、Fableに任せるという声があります |
| 利用枠 | 定額プランの利用枠が以前より長く持ちます(公式も5時間ごとの上限を引き上げました) | Opus 5より枠の減りが速い、mediumでも早く使い切るという報告もあります |
| 設定と安全装置 | 多くの作業はmediumかhighで足り、maxは要らないとする声 | 生物学の依頼で別のモデルに切り替わるのが気になるという声 |
定額プランで使うなら、利用枠の行と、文章と日本語の行を先に確かめます。
私も業務でOpus 5.5を使っています。推論の強さは既定のmediumのままでも、十分に働いている印象です。GPT-5.6 Solで作っていたシステムの不具合も、見つけて直してくれました。Fable 5.1で進めていた業務もOpus 5.5で問題なくこなせたため、利用料を大きく抑えられました。
一方で、日本語で指示していても、途中から英語で返ってくることがよくあります。アプリの開発中に、安全装置に引っかかったこともありました。どちらも、表の気になる声と同じ点です。
まとめ:Opus 5.5に切り替える?使い方別の結論
独自見解どの使い方でも、まず既定の段階で試し、品質が足りない作業に限って段階を上げます。
推論の強さは、上げるほど良い結果になるとは限りません。第三者の計測でも、maxに上げても伸びなかった評価がありました。早期に使ったFactoryは、Opus 5.5を「mediumを既定にしたいと思えた初めてのモデル」と評しています。Opus 5でhigh以上にしていた作業は、段階を選び直します。
私なら、定額プランではすぐにOpus 5.5で試します。合わなければ、モデルを選び直すだけで戻せるからです。利用枠の減りが速いという声もあるので、最初の数日は残りの枠を見ながら使います。
APIで自社のシステムに組み込んでいる場合は、私なら図13のエラーになる項目を直すまで切り替えません。止まるのが本番の処理だからです。
使い方別の結論は次のとおりです。
自分の使い方に当たるものを1つ選んでください。そこに書いた確かめることが、切り替えた後の点検項目になります。
Opus 5.5は、Opus 5より良い結果を安い単価で出せる場面が多いモデルです。
Anthropicの表の値は、同社の環境と推論の強さで測った値です。第三者の値は、Artificial Analysisが各モデルの推論の強さの上限で測った値です。
段階ごとの最初に試す作業(図4)は目安です。最後は同じ課題で品質と実際の費用を比べて決めます。
出典と調査方法
本文・図表の根拠に用いた資料です(2026年9月26日時点)。仕様・料金・提供条件と性能の公表値は、Anthropicの公式資料を参照しました。同じ条件での計測は、Artificial Analysisの公開結果を参照しました。利用者の評判は、2026年9月23日〜25日に公開された利用報告21件をもとに、論点ごとにまとめました。
- Anthropic|Claude Opus 5.5の発表 — 公開日と位置づけ、Opus 5と比べた費用と速さの説明、性能の比較表と測定条件、社内試験と早期利用企業の結果、安全装置の根拠。
- Anthropic|Claude Opus 5.5のモデル仕様 — モデルID、コンテキストと最大出力、知識の時点、既定の推論の強さ、単価、提供先と提供終了の目安の根拠。
- Anthropic|Claude Opus 5.5の変更点 — Opus 5から切り替えるときの破壊的変更、動きの違い(既定の推論の強さ・考える量・ツール呼び出しの間の文章)と料金の根拠。
- Anthropic|Claude Opusの製品ページ — Claudeの有料プランでの提供、高速モードの料金、得意な用途、性能表の測定条件の根拠。
- Anthropic|Claude Opus 5のモデル仕様 — Opus 5の公開日と提供終了の目安、仕様と単価、既定の推論の強さの根拠。
- Anthropic|Claude APIの料金 — キャッシュ・バッチ・高速モード・長い入力の料金条件の根拠。
- Anthropic|推論の強さ(effort)の設定 — 推論の強さの段階ごとの説明と向く作業、Opus 5.5とOpus 5の既定と推奨の違いの根拠。
- Anthropic|Claudeのプランと料金 — Pro・Max・Teamの月額料金と、APIの単価の根拠。
- Anthropic|Claude Codeのモデルと推論の強さの設定 — Claude Codeで推論の強さを変える方法(/effortとモデルの選択画面)、Opus 5.5の既定、安全装置による別モデルへの切り替えと知らせの根拠。
- Anthropic|Claudeアプリのモデルと推論の強さの設定 — Claudeのアプリで推論の強さを選ぶ方法、段階を上げたときの利用上限への影響、思考を切れないことの根拠。
- Artificial Analysis|Claude Opus 5.5の計測記事 — Opus 5.5の総合指数と評価ごとの成績、Opus 5と比べた出力トークンと1回の費用の説明の根拠。
- Artificial Analysis|GPT-6 SolとClaude Opus 5.5の比較 — 同じ条件で測ったOpus 5.5とGPT-6 Solの総合指数・評価ごとの成績・1タスクの費用の根拠。
- Artificial Analysis|GPT-6 AstraとClaude Opus 5の比較 — 同じ条件で測ったOpus 5とGPT-6 Astraの総合指数・評価ごとの成績・1タスクの費用の根拠。
- Artificial Analysis|Grok 4.7とClaude Fable 5.1の比較 — 同じ計測でのFable 5.1とGrok 4.7の総合指数・評価ごとの成績・1タスクの費用の根拠。
- Artificial Analysis|GPT-5.6 SolとGrok 4.6の比較 — 同じ計測でのGPT-5.6 SolとGrok 4.6の総合指数・評価ごとの成績・1タスクの費用の根拠。
- Artificial Analysis|Terminal-Bench-Science 0.1の計測 — 科学研究の作業の評価で、Opus 5.5をxhighとmaxで測った値の根拠。
PoCを「技術実験」で終わらせず、経営判断まで設計する。
対象業務の選定、現状値の計測、評価設計、ガバナンス、本番移行判定を一つの意思決定プロセスとして整理します。
