生成AIモデルは、総合点の順位ではなく、任せたい仕事に近い指標がそろっているモデルから選びます。総合点は13モデルが11点の幅に収まり、同じ端末操作でも提供元と第三者測定が9.2ポイント違う例があるため、最後は自社の合否条件をそろえたPoCで決めます。
生成AIの候補を、流行ではなく仕事との相性で選びたい方へ
生成AIモデルの選定は、任せたい仕事をベースに進めます。主要13モデルを共通指数で俯瞰し、その仕事に近い指標がそろうモデルへ絞り、最後に同じ自社入力のPoCで確かめます。
- 任せたい仕事に合うAIモデル候補を短時間で絞りたい
- ベンチマークの点を自社の仕事へ結び付けたい
- PoCの採用・再確認・見送りを決めたい
結論|モデル名より先に仕事を分ける
最初に「調べる・読む・考える・作る・動かす」のどの仕事を任せるか決めます。仕事に近い公表値で試す相手を残し、同じ入力・合否条件のPoCで採否を確かめます。この記事の数値は能力の目安です。費用・契約・データ取扱い・地域条件は、各社の最新資料で確かめます。
この記事で先に決めるのは採用ではなく、試す仕事と合否条件です。代表入力・期待出力・重大な失敗・評価者・合否条件を1枚に固定します。
以降は「指標の意味→同じ表で比べられる範囲→自社PoC」の順で読みます。公表値は試す相手を残す入口で、採否は自社の入力で決めます。
総合1位や特定モデルの採用は、この記事だけでは決めません。仕事に近い指標で試す相手を残し、公表値だけでは分からない条件は、自社の入力と合否条件で確かめます。
試す相手の残し方は次です。①任せたい仕事を1つに決める。②その仕事に近い指標を1つだけ見る。③点数だけで細かい順位を決めず、試す候補を残す。④残した相手へ、同じ社内入力を渡して見比べる。
いま比べるモデルと、数字の読み方
この記事では、2026年8月24日に確認した主要13モデルを比較します。条件をそろえて読める数値だけを並べ、未公表の項目は混ぜません。
本記事が比べるのは文章を扱う大規模言語モデル(LLM)です。ベンチマークには正答率・Elo・複合指数など別の単位があります。数字を見る前に、仕事・単位・条件を確認します。
まず共通指数、次に仕事別の指標という順で候補を絞ります。共通指数は主要13モデルの位置を俯瞰し、候補の見落としを減らすための入口です。
この記事では、仕事を5つに分けて読みます。難問推論は専門的な問いを考える力、コード・端末は開発や端末操作、調査・ツールは情報を探して扱う力、画像入力は図表や画面を読む力、成果物作成は報告書や提案資料へ仕上げる力です。ベンチマークで確認できない仕事は、同じ条件の公表値がないため、未確認のまま自社PoCへ回します。
スマートフォンでは表が横に続きます。右へスワイプして「PoCで測る項目」まで確認してください。
| 指標 | 近い業務 | 指標が近いこと | PoCで測る項目 |
|---|---|---|---|
| GDPval-AA v2 | 知識業務 | 専門家の成果物づくりに近い。Eloなので正答率ではない。 | 自社様式で正確さ・修正時間を測る |
| GPQA Diamond | 科学推論 | 技術調査や仮説検討に近い。 | 根拠の妥当性と説明の再現性を測る |
| Terminal-Bench 2.1 | 端末操作 | 複数手順の実行に近い。社内権限は別確認。 | 禁止操作・復旧・人の確認を測る |
| BrowseComp | Web調査 | 情報探索と回答に近い。 | 出典一致・引用精度・調査時間を測る |
| MRCR | 長文からの情報回収 | 規程やRFPから指定情報を拾う仕事に近い。 | 取りこぼし・根拠箇所の一致を測る |
| AA-LCR | 長文横断の推論・統合 | 複数資料の根拠を結び付ける仕事に近い。 | 統合の正確さ・出典位置を測る |
| MMMU-Pro | 画像理解 | 図表や画面を読む力に近い。 | 数値読み取り・説明の正確さを測る |
この早見表の「どの仕事に近いか」は、当社が指標の内容から対応させたものです。提供元が用途を保証したものではありません。1つの指標だけで採用を決めない読み方を勧めます。
高得点=自社業務で成功ではありません。
主要13モデルを共通指数で俯瞰する
主要13モデルは、9試験をまとめた共通指数で横並びにできます。ここで分かるのは、この指数上での位置です。画像理解や日本語品質などは別に確認し、仕事別指標と自社PoCで最終候補を絞ります。
この章の「共通指数」は、Artificial Analysisが公表する Artificial Analysis Intelligence Index v4.1.1 の、この記事での呼び名です。正答率でも偏差値でもありません。9つの試験を、エージェント34%・コーディング24%・科学推論24%・一般18%の重みで平均し、0〜100の点に直した合成点です。
| モデル | 共通指数(点) | 測定設定(max・highなど) |
|---|---|---|
| Claude Opus 5 | 63 | max |
| Claude Fable 5 | 62 | max(Opus 4.8 fallbackあり) |
| GPT-5.6 Sol | 61 | max |
| Grok 4.6 | 61 | high |
| Kimi K3 | 60 | max |
| GLM-5.3 | 60 | max |
| Qwen3.8-Max | 58 | Qwen3.8 2.4T A95B(AAの掲載名) |
| GPT-5.6 Terra | 57 | max |
| Muse Spark 1.2 | 57 | xhigh |
| Gemini 3.7 Flash | 56 | high |
| Claude Sonnet 5 | 55 | max |
| DeepSeek-V4-Pro-0813 | 53 | max |
| GPT-5.6 Luna | 52 | max |
共通指数の並びは確認できますが、この並びのままで採否は決まりません。候補の位置を広く把握し、この次の章で、任せたい仕事に近い指標があるモデルを確認します。
共通指数には、知識業務・端末操作・専門推論に近い試験が含まれます。画像理解のMMMU-Pro、日本語品質、速度、費用、安全性は含まれません。63点は「63%正解」ではなく、52点が63点の約8割の実力という意味でもありません。
この次の章では、知識業務・端末操作・専門推論・画像理解の4指標を公式資料で確認します。共通指数の点差が小さいモデルも、仕事別の公表値と、同じ入力・評価者・合否条件を使う自社PoCで比較します。
仕事に近い4指標で、比較できる範囲を見分ける
2つの表を、仕事ごとに読み替えます。提供元が公表した値と、第三者が同一条件で測った値は別々に見て、候補を残します。残した候補は、同じ入力・権限・評価者・合否条件で比べます。
次の一覧は「どの仕事に近い数字が公表されているか」を確認するためのものです。モデル提供元自身の公式値を優先し、提供元に数値表がない場合だけ、別のモデル提供会社が公開した公式比較表の値を掲載元つきで使います。第三者の独立測定値は、次の表へ分けて載せています。なお知識業務のGDPval-AA v2とは、実務に近い課題をモデルに解かせ、勝敗の比較から相対的な強さを出す試験です。第三者Artificial Analysis(AA)が運営・測定し、各社公式表に載る値は同指標の引用です(引用時点は表ごとに異なります)。
| モデル | 知識業務 | 端末操作 2.1 | 専門推論 | 画像理解 |
|---|---|---|---|---|
| GPT-5.6 Sol | 知識業務 1,747.8 Elo | 端末操作 88.8% | 専門推論 94.6% | 画像理解 83%(ツールなし) |
| GPT-5.6 Terra | 知識業務 1,593 Elo | 端末操作 87.4% | 専門推論 92.9% | 画像理解 80.7%(ツールなし) |
| GPT-5.6 Luna | 知識業務 1,591.8 Elo | 端末操作 84.7% | 専門推論 92.3% | 画像理解 78.4%(ツールなし) |
| Claude Opus 5 | 知識業務 公式はグラフ(SOTAと記載)。数値表は未掲載 | 端末操作 未確認(公式数値表なし) | 専門推論 未確認(公式数値表なし) | 画像理解 未確認(公式数値表なし) |
| Claude Fable 5 | 知識業務 1,759.6 Elo | 端末操作 83.1% | 専門推論 92.6% | 画像理解 81.2%(ツールなし)(Moonshot比較表) |
| Claude Sonnet 5 | 知識業務 1,598 Elo(Google公式モデルカード) | 端末操作 80.4%(Google公式モデルカード) | 専門推論 未確認(公式カードにGPQAの掲載なし) | 画像理解 未確認(公式カードにMMMU-Proの掲載なし) |
| Grok 4.6 | 知識業務 1,753 Elo(SpaceXAI公式表) | 端末操作 未確認(公式はv3.0で26%) | 専門推論 未確認 | 画像理解 未確認 |
| Gemini 3.7 Flash | 知識業務 1,525 Elo(Google公式モデルカード) | 端末操作 85.8%(Google公式モデルカード) | 専門推論 未確認(公式カードにGPQAの掲載なし) | 画像理解 未確認(公式カードにMMMU-Proの掲載なし) |
| Kimi K3 | 知識業務 1,686 Elo(Moonshot表・第三者AA測定の引用) | 端末操作 88.3% | 専門推論 93.5% | 画像理解 81.6%(ツールなし) |
| Qwen3.8-Max | 知識業務 未確認(公式表にGDPval列なし) | 端末操作 86.6% | 専門推論 92.6% | 画像理解 未確認(公式表にMMMU-Pro列なし) |
| DeepSeek-V4-Pro-0813 | 知識業務 未確認 | 端末操作 87.9%(公式更新ログ) | 専門推論 未確認 | 画像理解 未確認 |
| Muse Spark 1.2 | 知識業務 1,628 Elo(Google公式モデルカード) | 端末操作 82.9%(Meta公式チャート・Muse Code) | 専門推論 未確認 | 画像理解 未確認 |
| GLM-5.3 | 知識業務 1,769 Elo(Z.ai公式表・第三者AA測定の引用) | 端末操作 88.2%(Z.ai公式表・Claude Code測定) | 専門推論 未確認(GLM-5.3の公式掲載なし) | 画像理解 未確認(GLM-5.3の公式掲載なし) |
| モデル | 知識業務 | 端末操作 2.1 | 専門推論 | 画像理解 |
|---|---|---|---|---|
| Claude Opus 5 | 知識業務 1,845 Elo | 端末操作 89.1% | 専門推論 93.2% | 画像理解 85% |
| Claude Fable 5 | 知識業務 1,738 Elo | 端末操作 84.6% | 専門推論 92.6% | 未掲載(掲載範囲の外) |
| GPT-5.6 Sol | 知識業務 1,723 Elo | 端末操作 88.0% | 専門推論 94.1% | 画像理解 83% |
| Grok 4.6 | 知識業務 1,747 Elo | 端末操作 88.4% | 専門推論 94.9% | 未掲載(掲載範囲の外) |
| Kimi K3 | 知識業務 1,678 Elo | 端末操作 85% | 専門推論 93.5% | 画像理解 81% |
| GLM-5.3 | 知識業務 1,769 Elo | 端末操作 83.9% | 専門推論 91.7% | 未掲載(掲載範囲の外) |
| Qwen3.8-Max | 知識業務 1,735 Elo | 未掲載(掲載範囲の外) | 未掲載(掲載範囲の外) | 未掲載(掲載範囲の外) |
| GPT-5.6 Terra | 知識業務 1,576 Elo | 端末操作 88.0% | 専門推論 92.5% | 画像理解 81% |
| Muse Spark 1.2 | 知識業務 1,628 Elo | 端末操作 80.1% | 専門推論 90.4% | 未掲載(掲載範囲の外) |
| Gemini 3.7 Flash | 知識業務 1,532 Elo | 端末操作 85.8% | 専門推論 94.5% | 画像理解 85% |
| Claude Sonnet 5 | 知識業務 1,595 Elo | 未掲載(掲載範囲の外) | 未掲載(掲載範囲の外) | 未掲載(掲載範囲の外) |
| DeepSeek-V4-Pro-0813 | 知識業務 1,590 Elo | 端末操作 78.7% | 専門推論 92.8% | 未掲載(掲載範囲の外) |
| GPT-5.6 Luna | 知識業務 1,578 Elo | 端末操作 80.9% | 専門推論 91.1% | 画像理解 79% |
- 知識業務|提供元の公表値:Claude Fable 5 1,759.6とGPT-5.6 Sol 1,747.8はOpenAIの同じ公式発表にある値で、この2つは直接比べられます。Grok 4.6 1,753はSpaceXAI公式の値です。同一条件の第三者測定:Claude Opus 5 1,845、GLM-5.3 1,769、Grok 4.6 1,747。PoCで見ること:実際の成果物で、正確さと人の修正時間を比べます。
- 端末操作|提供元の公表値:GPT-5.6 Sol 88.8%、Kimi K3 88.3%、GLM-5.3 88.2%、DeepSeek-V4-Pro-0813 87.9%。測定ハーネス(試験を実行させる周辺ソフトと手順)は各社で異なります。同一条件の第三者測定:Claude Opus 5 89.1%、Grok 4.6 88.4%。DeepSeek-V4-Pro-0813は78.7%へ下がります。PoCで見ること:自社の権限とツールで、成功率と禁止操作を確かめます。
- 専門推論|提供元の公表値:GPT-5.6 Sol 94.6%が最高で、Kimi K3 93.5%が続きます。同一条件の第三者測定:Grok 4.6 94.9%、Gemini 3.7 Flash 94.5%、GPT-5.6 Sol 94.1%。PoCで見ること:自社のルールや例外を含む問題で、答えだけでなく根拠も確認します。
- 画像理解|提供元の公表値:GPT-5.6 Sol 83%が最高で、Kimi K3 81.6%が続きます。同一条件の第三者測定:Gemini 3.7 FlashとClaude Opus 5が85%。掲載は6モデルだけです。PoCで見ること:実際の図表・画面・PDFで、読み取り漏れを比べます。
同じ列でも、発表元・評価時点・ツール・ハーネスが異なる場合があります。数値は同じ掲載元・同じ条件の範囲で読み、点差だけで優劣を決めません。実際、DeepSeek-V4-Pro-0813の端末操作は提供元87.9%・第三者78.7%で9.2ポイント違います。「未確認」は低性能という意味ではありません。
Terminal-Benchの別バージョンや、別のコーディング・自動化試験なども公式発表にあります。ただし、ここで扱う4指標と版や意味が違うため、同じ列へ流用していません。第三者Artificial Analysisの独立測定値は公式公表値の表へ混ぜず、上の候補整理で「同一条件の第三者測定」として区別して示しています。
共通指数で候補の位置を把握し、この表で任せたい仕事に近い公表値を確認したら、最後は同じ社内入力・制限時間・権限・評価者・合否条件のPoCへ進みます。公表値がないモデルも、必要な仕事ならPoCの候補から外しません。
長文を読む力と資料を作る力は別に見る
「長文に強い」を長い入力から情報を拾う力と読み替えることを勧めます。読みやすい報告書や編集可能なプレゼンを作る力は、別の入力・出力条件で確認します。複数ティア(同じ世代のモデルを性能と費用で分けた等級)がある場合も、名称だけで資料作成向けと決めず、公式資料で対象機能・入力と出力・提供経路を確認して自社PoCへ進めます。
ここでいう長いコンテキストは、モデルが一度に参照できる入力範囲です。資料作成は、構成・出典・ブランド・編集可能な形式まで見て判断します。
資料の体裁や納品形式の品質は、各社が同一条件の比較値を公表していないため、公式資料の範囲外です。出来上がりと人の修正時間は、自社の納品形式で測ります。
自社PoCで採否を決める
独自見解比較記事の結論をそのまま採用せず、自社の代表入力、期待する出力、重大な失敗、評価者を先に固定します。近い仕事の型を選んだら、合否の数字は自社の量に置き換えて使います。
必須条件を満たせば「PoCへ進める」、条件を直せば満たせそうなら「条件をそろえて再確認する」、重大な条件に反するなら「候補から外す」と読み分けます。
- 社内文書を根拠に答えさせたい|見るもの:規程や議事録から根拠箇所を示せるか。合格の目安:存在しない根拠0件、根拠箇所が10問中10問一致。決める人:業務部門の責任者。
- 開発と運用の作業を任せたい|見るもの:隔離環境で修正から復旧まで通せるか。合格の目安:禁止領域の変更0件、既存・追加テストをすべて通過。決める人:開発チームの責任者。
- 社外情報の調査と資料化を任せたい|見るもの:出典が原典と一致し、自社様式で出せるか。合格の目安:存在しない出典0件、人の修正時間が今より短い。決める人:調査を依頼する部門の責任者。
重大な誤根拠・機密逸脱・禁止変更は0件を条件にします。 10問・5タスク・2回は、最初のPoCを小さく始める例です。件数は自社の通常業務量と現行手順に合わせて決めてください。これは編集上の目安であり、自社基準に置き換えてよいものです。
比較の根拠・限界・更新方針
モデル名・提供状態・公表値は、調査時点に開いた各社公式ページと評価元の資料で確認しています。用途別の向き不向きは、同じ入力を渡して自社で見比べます。
対象はOpenAI・Anthropic・Google・Alibaba・SpaceXAI・Moonshot AI・DeepSeek・Meta・Z.aiの9社です。モデル名・提供状態は公式一次資料、共通指数はArtificial Analysisのモデル別ページと構造化データを根拠にしています。
- 掲載時点の主要モデルについて、同じ試験・版・条件で比較できる値だけを表に載せています。比較できる値がない項目は、自社PoCで確認します。
- 指標の版・ツール・推論設定・入力条件が違う値は混ぜず、同じ指標内で読みます。共通指数だけを実務の採用判断へ直結させません。
- 価格、ローカル実行、追加学習、利用規約は契約条件が変わるため、導入前に別途確認します。
- 速度・応答時間、日本語での品質、自社ツール・既存環境との相性、サポート・保守は横断比較せず、導入前の自社PoCと各社の最新資料で確認します。
- 数値表の対象は文章向け汎用モデルです。画像・動画・音声・ロボティクス向けと、限定提供のClaude Mythos 5は外しています。
モデル情報は短期間で変わるため更新前提で管理します。提供元の更新、更新依頼、定期確認を契機に調査をやり直し、更新版も編集・事実確認を経て公開します。
前回の点数をそのまま差し替えません。 指標の版や評価条件が変われば比較可能性を見直し、旧記述を証拠として残します。
まとめ|仕事に近い指標からPoCへ進む
読み終えたあとに決めるのは、モデルの採用ではなく、試す仕事・試す相手・合否条件です。任せたい仕事に近い指標を1つ選び、同じ条件の公表値がある相手を候補に残します。比較可能な公表値が足りない仕事は、同じ自社入力で複数モデルを試します。代表入力・期待出力・重大な失敗・評価者・停止条件・修正時間をそろえ、結果で限定導入・再確認・見送りを決めます。
| 決める項目 | 記入する内容の例 | 始める前の確認 |
|---|---|---|
| 試す入力 | 実際の業務文書を匿名化した入力を用意する | 全候補へ同じ内容を渡す |
| 合格する出力 | 事実誤りがなく、指定形式と根拠の条件を満たす | 採点を始める前に合格条件を固定する |
| 即時中止する失敗 | 機密漏えい・根拠の捏造・禁止操作を対象にする | 1件でも起きたらその候補の試験を止める |
| 評価者と採点方法 | 業務担当者と情報システム部門が共通シートで採点する | 誰が採点しても同じ基準を説明できるようにする |
| 人の修正時間 | 修正に要した時間と差し戻し回数を記録する | 現行手順と同じ測り方で比べる |
| 試験後の判断 | 限定導入・条件を直して再確認・見送りから選ぶ | 結果と判断理由を一緒に残す |
PoCを始めるときは、任せたい仕事を1つ選び、仕事別4指標で残した候補モデルへ同じ入力を渡します。この段階で採用を決めるのではなく、同じ条件で比較できる試験を始めます。
- 数値だけでなく、試験名と注意事項も併せて読む
- Opus 5を含む最新候補は公式発表日を一次資料で確認する
- 長文読解と資料作成を別の能力としてPoCする
よくある質問
総合順位は決められますか?Q1
本記事では決めません。仕事によって測る能力が違うため、任せたい仕事に近い指標で試す相手を残し、自社PoCで判断します。
長い入力を扱えるモデルなら、長い提案書も上手に作れますか?Q2
直結しません。長文読解は入力から情報を拾う力、資料作成は構成・正確さ・図表・編集形式まで含む別の仕事として確認することを勧めます。
新モデルが共通指数へまだ掲載されていない場合、候補から外すべきですか?Q3
掲載待ちだけを理由には外しません。公式発表で提供状態と用途を確認し、共通指数の未掲載を明記したうえで、同じ入力・同じ合否条件のPoCで比較することを勧めます。
プレビュー版のモデルを本番候補にできますか?Q4
候補にはできますが、提供地域、版の変更、保証範囲、切り替え時の影響を先に確認します。本番採用は自社の運用条件と停止条件を満たしたあとに判断することを勧めます。
出典と調査方法
本文と図の出典は番号から確認できます。公式資料と第三者評価を分け、モデル名・提供状態・数値の根拠を対応づけています。必要な主張の番号だけをたどってください。
- 公式-01|OpenAI公式発表|GPT-5.6 — GPT-5.6 Sol/Terra/Lunaの概要、Terminal-Bench 2.1を含む公表表、提供条件
- 公式-02|OpenAI公式モデル一覧 — GPT-5.6 Sol/Terra/Lunaと、比較対象外とした旧世代・別ティアの現行確認
- 公式-03|OpenAI公式API変更履歴 — GPT-5.6三ティアの直近更新と現行掲載を確認
- 公式-04|OpenAI公式廃止情報 — 調査日時点の廃止予定一覧を確認。将来の提供継続を保証するものではない
- 公式-05|Anthropic公式|Claude Opus 5 — 2026年7月24日の公開、GDPval-AA v2、Frontier-Bench、ARC-AGI-3、用途と提供状況
- 公式-06|Anthropic公式システムカード一覧 — Claude Opus 5、Sonnet 5、Fable 5の現行確認。Opus 4.8は旧世代の比較用記録
- 公式-07|Anthropic公式|Claude Fable 5 — 高難度・長時間タスクと保護機構の位置づけ
- 公式-08|Anthropic公式|Claude Sonnet 5 — 実務型Sonnetの位置づけと提供状況
- 公式-09|Anthropic公式モデルID・版一覧 — Claude Opus 5/Sonnet 5と旧世代モデルを区別する現行スナップショットID
- 公式-10|Anthropic公式モデルライフサイクル — Claude Opus 4.8の現行状態と、旧モデルの廃止・移行関係
- 公式-11|Google AI for Developers公式モデル情報 — 現行モデル名とPreview表記
- 公式-12|Google AI for Developers公式|Gemini 3.7 Flash — 一般提供(GA)、モデルID、入力・出力上限、マルチモーダル入力とツール対応
- 公式-13|Google AI for Developers公式変更履歴 — Gemini 3.7 Flashが2026年8月13日に一般提供されたことを確認
- 公式-14|Google AI for Developers公式|最新モデル選択ガイド — Gemini 3.7 Flashを現行主力とし、旧Flash系と3.1 Proからの推奨移行先にしていることを確認
- 公式-15|Google AI for Developers公式廃止情報 — 旧Gemini世代の提供終了と現行モデルへの移行情報
- 公式-16|Alibaba Cloud公式|Qwen3.8-Max — 2026年8月3日更新の公式モデル資料。モデルID qwen3.8-max、一般API向けの提供中と利用経路
- 公式-17|SpaceXAI公式|Grok 4.6発表 — 2026年8月12日の提供開始、GDPval-AA v2の公式値、コード・エージェント型タスク・知識業務向けという位置づけ
- 公式-18|SpaceXAI公式モデル一覧 — 2026-08-24の現行カタログでGrok 4.6の名称・位置づけを確認
- 公式-19|Moonshot AI公式モデル資料 — 公開ウェイト、ネイティブ・マルチモーダル、エージェント型、現行最上位という位置づけ、API提供、Kimi K3・Claude Fable 5・GPT-5.6 Solを含む4指標の公式比較表と測定条件
- 公式-20|DeepSeek公式|DeepSeek-V4 Preview — V4-Proは2026年8月13日にGA提供開始、V4-Flash-0731はPublic Betaとして別途採用
- 公式-21|DeepSeek公式更新履歴 — 2026年8月13日のV4-Pro正式提供。Terminal-Bench 2.1 87.9、HLE 42.7/60.0、Cybergym 83.3、AutomationBench 31.8を公式更新ログに記載。公式のモデル名はDeepSeek-V4-Pro。本文の表示名「DeepSeek-V4-Pro-0813」はGA提供開始日(2026-08-13)を付した版表記
- 公式-22|Alibaba Cloud公式|Qwen3.8-Max発表 — 2026年8月3日のQwen3.8-Max発表。API提供開始と現行旗艦の位置づけ
- 公式-23|Alibaba Cloud公式|Personal Token Plan — 旧ページに残るQwen3.8-Max-PreviewのToken Plan限定表記。一般APIとは提供経路を分けて扱う
- 公式-24|Z.ai公式|GLM-5.3 — 2026年8月14日発表。Terminal Bench 2.1=88.2(Claude Code 2.1.207で測定と脚注明記)、GDPval-AA v2=1769(Artificial Analysis測定の引用と脚注明記)を含む公式比較表。GPQA Diamond・MMMU-Proの掲載はない。前世代GLM-5.2(2026年6月16日)の値も同表に併記
- 公式-25|Qwen公式|Qwen3.8-Max発表 — 2026年8月2日発表。Terminal Bench 2.1=86.6(Claude Code avg@10・自社測定)、GPQA Diamond=92.6。公式表にGDPval・MMMU-Proの行はない。脚注で他社モデルのTB値は第三者AAやOpenAI公表値の引用と明記
- 公式-26|Meta公式|Muse Spark 1.2 — 2026年8月5日発表。Terminal-Bench 2.1=82.9%(Muse Codeハーネス・Meta自社評価チャート。チャート内で各モデルのハーネスが異なることが明記されている)。知識業務・専門推論・画像理解の数値表はない
- 公式-27|Google DeepMind公式|Gemini 3.7 Flashモデルカード — 2026年8月13日公開。Gemini 3.7 Flash・Gemini 3.6 Flash・Claude Sonnet 5・GPT-5.6 Terra・Muse Spark 1.2の5モデル比較表。GDPval-AA v2(1525/1598/1578/1628)とTerminal-bench 2.1(85.8/80.4/87.4/82.9)、共通指数を掲載。GPQA DiamondとMMMU-Proの行はない(Harvey LAB-AAとCharXivは別指標のため本文の専門推論・画像理解へは使わない)
- 第三者-01|Artificial Analysis|Claude Opus 5 — Intelligence Index v4.1.1の値、構成評価、実行設定
- 第三者-02|Artificial Analysis|Claude Fable 5 — 同一版の共通指数(v4.1.1)の現行値とfallback設定
- 第三者-03|Artificial Analysis|GPT-5.6 Sol — 同一版の共通指数(v4.1.1)の現行値
- 第三者-04|Artificial Analysis|Kimi K3 — 同一版の共通指数(v4.1.1)の現行値
- 第三者-05|Artificial Analysis|Qwen3.8 Max(公式Previewとの同一性未確認) — 同一版の共通指数(v4.1.1)の参考値。公式Token PlanブログのPreview版との同一性は当日確認できないため、モデルの提供状態・採否の根拠には使わない
- 第三者-06|Artificial Analysis|GPT-5.6 Terra — 同一版の共通指数(v4.1.1)の現行値
- 第三者-07|Artificial Analysis|Claude Sonnet 5 — 同一版の共通指数(v4.1.1)の現行値
- 第三者-08|Artificial Analysis|GPT-5.6 Luna — 同一版の共通指数(v4.1.1)の現行値
- 第三者-09|Artificial Analysis|AA-LCR — 指標名の補足説明(凍結34ソース外。本文の数値・採否の根拠には使用しない)
- 第三者-10|Artificial Analysis|GDPval-AA v2順位表 — 2026年8月24日確認。独立測定の知識業務Elo。Claude Opus 5 1,845・GLM-5.3 1,769・Grok 4.6 1,747・Claude Fable 5 1,738・GPT-5.6 Sol 1,723。各社公式表と混ぜない
- 第三者-11|Artificial Analysis|Terminal-Bench v2.1順位表 — 2026年8月24日確認。同一ハーネス(Terminus 2)の独立測定。GPT-5.6 Sol(xhigh)89.5%・Claude Opus 5 89.1%・Grok 4.6 88.4%・DeepSeek-V4-Pro 78.7%
- 第三者-12|Artificial Analysis|GPQA Diamond順位表 — 2026年8月24日確認。Grok 4.6 94.9%・Gemini 3.7 Flash 94.5%・GPT-5.6 Sol 94.1%
- 第三者-13|Artificial Analysis|Gemini 3.7 Flash — 2026年8月24日確認
- 第三者-14|Artificial Analysis|Muse Spark 1.2 — 2026年8月24日確認
- 第三者-15|Artificial Analysis|DeepSeek V4 Pro 0813 — 2026年8月24日確認
- 第三者-16|Artificial Analysis|GLM-5.3 — 同一版の共通指数(v4.1.1)の現行値(60)。2026年8月24日確認
- 第三者-17|Artificial Analysis|モデル比較・共通指数v4.1.1 — 2026年8月24日確認
- 第三者-18|Artificial Analysis|MMMU-Pro順位表 — 2026年8月24日確認。独立測定の画像理解。Gemini 3.7 FlashとClaude Opus 5が85%で最上位、GPT-5.6 Sol 83%
公式資料は2026年8月24日に確認しました。提供状況やモデル名が変われば、公式情報を見直します。
PoCを「技術実験」で終わらせず、経営判断まで設計する。
対象業務の選定、現状値の計測、評価設計、ガバナンス、本番移行判定を一つの意思決定プロセスとして整理します。
