Grok 4.7は、xAIが2026年9月21日に公開した、長時間のコーディングと知識作業に強いAIモデルです。API単価はGrok 4.6と同じ入力2ドル・出力6ドル(100万トークンあたり)で、Grok BuildやCursorなどで使えます。
Grok 4.7に切り替えるかを決めたい方に向けています
Grok 4.7が公開され、Grok 4.6から切り替えるか、どの作業に任せるかを決める材料を探している方に向けた記事です。
- Grok 4.6から切り替えてよいか分からない
- 何が良くなったのか分からない
- 単価は同じでも費用が変わるのか分からない
Grok 4.7とは?Grok 4.6から変わった点
Grok 4.7は、Grok 4.6より規模の大きい新たな基盤モデルです。数時間に及ぶ課題を重点的に学習し、自らの作業を見直す能力や、文書・資料の作成能力を高めたとxAIは説明しています。
Grok 4.7は2026年9月21日に公開されました。同日から、xAIのAPIやGrok Build、Cursorなどで使えます。Grok Buildはコーディング支援ツール、Cursorはコード編集ツールです。
xAIは、Grok 4.7をコーディングとエージェントによる作業、知識作業に向く最先端のモデルと位置づけています。エージェントによる作業とは、AIが複数の手順を自分で進めることです。
xAIによると、Grok 4.7は難しい課題で長時間の訓練を重ねており、長い文脈を理解して生かす力も上がりました。
xAIは、Grok 4.7の価格と処理速度をGrok 4.6と同等としています。
ただし、トークン単価が同じでも、1つの課題の費用まで同じとは限りません。第三者の評価機関Artificial Analysisの測定では、1つの課題の費用が増えています。推論の強さ(考える深さの設定)をどちらもhighにそろえると、1.86ドルから2.73ドルです。
Grok 4.7とGrok 4.6では、モデルの規模と訓練のほか、1つの課題にかかる費用と時間も違います。
Grok 4.6は、Grok 4.5をもとに追加で学習したモデルです。エージェントによる長時間の作業と、対話・視覚的な作業に重点を置きました。
基本スペックは?Grok 4.6との比較と推論の強さ
Grok 4.7のコンテキスト長は50万トークンで、1回の出力の上限は設けられていません。テキストと画像を入力でき、回答はテキストで返ります。推論の強さはlowからxhighまで選べ、これらの仕様はGrok 4.6と同じです。
コンテキスト長は、一度に扱える情報量を表します。Artificial Analysisは、50万トークンを「12ポイントの文字で記載したA4用紙約750ページ分」と換算しています。
| 項目 | Grok 4.7 | Grok 4.6 |
|---|---|---|
| APIでの公開日 | 2026年9月21日 | 2026年8月12日 |
| APIのモデル名 | grok-4.7 | grok-4.6 |
| コンテキスト長(一度に扱える情報量) | 50万トークン | 50万トークン |
| 1回の出力の上限 | 設けていません | 設けていません |
| 入力 → 出力 | テキスト・画像 → テキスト | テキスト・画像 → テキスト |
| 学習データの対象時期 | 2026年5月 | — |
| 推論の強さ(標準) | low〜xhigh(high) | low〜xhigh(high) |
コンテキスト長と入出力形式はGrok 4.6と同じです。移行を試すときは、これまでの指示文を出発点にできます。
APIでは、外部の処理を呼び出す関数呼び出しを使えます。Web検索、X(旧Twitter)の投稿を探すX検索、コード実行も使えます。
推論の強さは、APIのreasoning_effortで指定します。標準はhighです。強くするほど推論を多く行い、応答にかかる時間と費用も増えます。推論を完全に止める設定はありません。
推論の強さごとに向く作業を、xAIは次のように説明しています。Grok 4.7とGrok 4.6で共通です。
| 段階 | 推論の深さ(xAIの説明) | xAIが挙げる用途 |
|---|---|---|
| xhigh | 最も深く推論する設定です。応答には時間がかかります | 応答の速さより答えの質を優先したい難問 |
| high(標準設定) | 多くの推論トークンを使って検討します | 難度の高い問題、複雑な計算、複数段階の論理的推論 |
| medium | ある程度の応答時間をかけて、十分に推論します | 複雑なデータ分析、長い文脈を踏まえた推論 |
| low | 推論しつつ、応答の速さを優先します | 応答速度を重視するエージェント作業、簡単なツール呼び出し |
性能は?xAIの公表値でGrok 4.6と比べる
xAIの公表した比較表では、Grok 4.7は掲載されたすべての評価でGrok 4.6を上回りました。端末を操作して長時間の課題に取り組むTerminal-Bench 4.0が、最も伸びました。スコアは20.3%から37.6%に上がっています。
xAIの表は、Grok 4.7をxhigh、Grok 4.6をhighの推論の強さで測った値で、DeepSWE v1.1のGrok 4.7だけhighです。
比較の相手には、GPT-5.6 SolとClaude Fable 5.1も入っています。どちらも推論の強さはmaxです。
| 測る作業(評価の名前) | Grok 4.7(xhigh) | Grok 4.6(high) | GPT-5.6 Sol(max) | Claude Fable 5.1(max) |
|---|---|---|---|---|
| 端末を操作する長時間の作業(Terminal-Bench 4.0) | 37.6% | 20.3% | 37.3% | 57.9% |
| Cursorでの長時間の開発(CursorBench 4.0) | 46.3% | 40.4% | 41.7% | 51.8% |
| ソフトウェア開発の課題(DeepSWE v1.1・Grok 4.7はhigh) | 71.0% | 65.2% | 72.7% | 70.0% |
| 数時間を要する知識作業のスコア(AA-Briefcase v1.1) | 1,657 | 1,546 | 1,487 | 1,678 |
| 電気工学の課題(EEBench) | 64.0% | 53.0% | 39.4% | 56.4% |
| 法務の課題(Harvey Legal Agent Benchmark) | 19.6% | 15.8% | 2.5% | 6.7% |
| 臨床分野の推論(HealthBench Professional) | 56.7% | 48.5% | 60.5% | 62.1% |
開発分野では、Grok 4.7はCursorBench 4.0でGPT-5.6 Solを上回りました。Terminal-Bench 4.0ではほぼ同じ水準で、DeepSWE v1.1ではわずかに下回ります。一方、Claude Fable 5.1を上回ったのは、掲載された開発系の評価ではDeepSWE v1.1のみです。
知識作業を評価するAA-Briefcaseでは、Grok 4.7は1,657でした。GPT-5.6 Solを上回る一方、Claude Fable 5.1にはわずかに届いていません。AA-Briefcaseは、Artificial Analysisが設計した、数時間を要する知識作業の評価です。モデル同士の比較結果と課題の要件を満たした割合をもとに採点します。スコアは更新されるため、xAIの公表値と最新の掲載値が異なる場合があります。
臨床分野の推論を測るHealthBench Professionalも、48.5%から56.7%に上がりました。ただし、比較対象の他社2モデルには届いていません。
xAIの表の7つの評価すべてで、Grok 4.7はGrok 4.6を上回りました。他社の2モデルとの差は、評価によって分かれます。
第三者の計測では?主要モデルと比べたGrok 4.7の位置
Artificial Analysisの測定では、Grok 4.7の総合指数は46で、比較した8モデル中7番目です。一方、実務で作成する成果物を評価するGDPval-AAでは、表中のGPTの3モデルをすべて上回っています。
以下は、Artificial Analysisが共通の課題と実行環境で測った結果です。推論の強さはGrok 4.7がxhigh、Grok 4.6がhigh、ほかのモデルがmaxです。
| モデル(総合指数の高い順) | 総合指数 |
|---|---|
| Claude Opus 5.5・5.98ドル | 58 |
| Claude Fable 5.1・7.63ドル | 53 |
| GPT-6 Astra・3.26ドル | 53 |
| Claude Opus 5(前のモデル)・5.86ドル | 51 |
| GPT-6 Sol・1.06ドル | 48 |
| GPT-5.6 Sol・1.99ドル | 47 |
| Grok 4.7(xhigh)・3.74ドル | 46 |
| Grok 4.6(high)・1.86ドル | 44 |
実務の成果物と知識作業を評価する2つの指標で、Grok 4.7は比較的高い成績を収めました。どちらも、専門職の仕事を再現した課題でモデルの成果を比べます。この2つの指標では、Claudeの3モデルだけがGrok 4.7を上回ります。
| モデル(総合指数の高い順) | 実務の成果物のスコア(GDPval-AA) | 数時間を要する知識作業のスコア(AA-Briefcase) | 業務の自動化(AutomationBench-AA) |
|---|---|---|---|
| Claude Opus 5.5 | 1846 | 1822 | 70% |
| Claude Fable 5.1 | 1735 | 1678 | 59% |
| GPT-6 Astra | 1542 | 1569 | 68% |
| Claude Opus 5(前のモデル) | 1708 | 1673 | 57% |
| GPT-6 Sol | 1487 | 1483 | 62% |
| GPT-5.6 Sol | 1588 | 1487 | 60% |
| Grok 4.7(xhigh) | 1695 | 1657 | 66% |
| Grok 4.6(high) | 1605 | 1539 | 67% |
一方、共通環境で測ったTerminal-Bench 4.0では、Grok 4.7は26%でした。GPT-6 Solの44%やClaude Opus 5.5の60%を大きく下回っています。
| モデル(総合指数の高い順) | 端末での複雑な開発作業(Terminal-Bench 4.0) | 科学計算のコード生成(SciCode) | 難問(Humanity's Last Exam) |
|---|---|---|---|
| Claude Opus 5.5 | 60% | 67% | 61% |
| Claude Fable 5.1 | 52% | 63% | 59% |
| GPT-6 Astra | 59% | 56% | 55% |
| Claude Opus 5(前のモデル) | 49% | 56% | 55% |
| GPT-6 Sol | 44% | 58% | 48% |
| GPT-5.6 Sol | 40% | 57% | 49% |
| Grok 4.7(xhigh) | 26% | 57% | 43% |
| Grok 4.6(high) | 21% | 56% | 43% |
Grok 4.6から上がった項目と、下がった項目があります。測定はGrok 4.7がxhigh、Grok 4.6がhighです。Grok Buildを使った2項目は、どちらもxhighです。
xAIは、文書・資料の作成能力と長い文脈を扱う能力が上がったと説明しています。第三者の評価でも、文書・表計算・スライドなどの成果物を評価するGDPval-AAは1605から1695に上がりました。一方、別の評価であるAA-Briefcaseの内訳では分析の質が上がり、資料の見せ方はやや下がりました。長文読解を測るAA-LCRも、わずかに下がりました。
資料作成に使うなら、内容の正確さと見た目の仕上がりを両方比べます。Grok 4.6と同じ課題で試すと、違いが分かりやすくなります。
Terminal-Bench 4.0のスコアは、実行環境によって異なります。Grok 4.7はxAIの公表値では37.6%、Artificial Analysisの共通環境では26%、Grok Buildを使った測定では33%でした。
Next.jsの開発元であるVercelも、Grok 4.7の実装能力を評価しています。OpenCodeを使い、4回の試行のうち1回でも課題を達成すれば成功とする評価では、成功率は94%でした。8月13日に測定されたGrok 4.6の71%を上回っています。1つの課題の平均費用は0.160ドルから0.109ドルに下がり、平均所要時間は234.68秒から337.19秒に延びました。ただし、Grok 4.6は再測定されておらず、後から追加された課題は失敗として扱われます。そのため、この差には評価対象の変更も影響している可能性があります。
Artificial Analysisの測定では、1つの課題の所要時間はGrok 4.7(xhigh)が約956秒でした。Grok 4.6(high)は約532秒です(どちらも9月26日時点)。
総合では8モデル中7番目ですが、成果物と知識作業の2つの評価ではGPTの各モデルを上回ります。
料金はいくら?定額プランと従量課金、1つの課題の費用
Grok 4.7のAPI単価はGrok 4.6と同じで、100万トークンあたり入力2ドル、出力6ドルです。Grokの定額プランでは、週ごとの利用枠の範囲で、Grok Buildなどから使えます。ただし、APIの単価が据え置かれていても、1つの課題の費用は増える場合があります。
使い方は4つあります。Grok Buildの無料枠・Grokの定額プラン・Cursorのプラン・従量課金のxAIのAPIです。Grokの定額プランでは、チャットとGrok Buildなどで利用枠を共有します。
grok.comとスマートフォンアプリのチャットは、xAIが発表したGrok 4.7の提供先に入っていません。Grokの定額プランで試すときは、Grok Buildなどを使います。
| 料金体系 | 対応サービス | 利用枠・高速版の扱い |
|---|---|---|
| 無料枠 | Grok Build | 高速版のGrok 4.7 Fastは使えません |
| Grokの定額プラン | Grok Buildなど | チャットなどと週ごとの利用枠を共有します。上限に達したら、利用枠の追加購入か上位プランへの変更で使い続けられます |
| Cursorのプラン | Cursor | 全プランで使えます。高速版もCursorのプランで使えます |
| 従量課金 | xAIのAPI | 使った量に応じて課金されます。Grok 4.7 Fastは対象外です |
入力が20万トークン以上になると、そのリクエスト全体に高い単価がかかります。Grok 4.7とGrok 4.6で同じです。100万トークンあたりの単価は入力4.00ドル、出力12.00ドルです。長い資料を渡すときは、この境目を超えるかどうかで費用が変わります。
| 料金の項目 | Grok 4.7 | Grok 4.6 |
|---|---|---|
| 入力(ドル) | 2.00 | 2.00 |
| キャッシュ入力(同じ入力の再利用、ドル) | 0.50 | 0.50 |
| 出力(ドル) | 6.00 | 6.00 |
| プロンプトが20万トークン以上のときの入力(ドル) | 4.00 | 4.00 |
| プロンプトが20万トークン以上のときの出力(ドル) | 12.00 | 12.00 |
| Web検索・コード実行(千回あたり、ドル) | 5 | 5 |
| X検索(取得した投稿千件あたり、ドル) | 5 | 5 |
高速版のGrok 4.7 Fastは、同じモデルを高速な実行基盤で動かすものです。入力が20万トークン未満なら、100万トークンあたり入力4.00ドル・出力12.00ドルで、通常版より高くなります。提供先はCursorとGrok Buildに限られ、Cursorでは同サービスのプランを通じて支払います。公開APIとGrok Buildの無料枠では使えません。
Web検索やX検索などのツールには、トークン料金とは別に利用量に応じた料金がかかります。また、回答文だけでなく、考える過程で使う推論トークンも課金対象です。
推論の強さによって、実際の費用も変わります。Artificial Analysisの測定では、次のような差が出ています。
| モデルと推論の強さ | 総合指数 | 1つの課題の費用 |
|---|---|---|
| Grok 4.6 high | 44 | 1.86 |
| Grok 4.6 xhigh | 44 | 2.32 |
| Grok 4.7 high | 46 | 2.73 |
| Grok 4.7 xhigh | 46 | 3.74 |
Grok 4.7では、費用の大部分を入力処理が占めています。xhighでの3.74ドルのうち、出力トークン約8.1万に通常の出力単価を掛けた金額は約0.49ドルです。残りは、キャッシュされた分を含む入力の費用に当たります。
入力が多い作業では、キャッシュの活用が費用に影響します。xAIは、Grok 4.7でprompt_cache_keyの設定を強く推奨しています。未設定では、該当するキャッシュを持たないサーバーに処理が割り当てられ、通常の入力料金がかかりやすいためです。
Grok 4.7の費用は入力側が大半を占めるため、キャッシュを効かせると費用を抑えやすくなります。
Grok 4.7の総合指数は、highとxhighで同じ46でした。まず標準のhighで試し、足りない課題だけxhighと比べます。仕上がりの差が費用の増加に見合うかを判断しやすくなります。
どこで使える?Grok 4.6から切り替えるときの注意
Grok 4.7は、xAIのAPIやGrok Build、Cursorで使えます。OpenRouterなどの中継サービスからも使えます。Grok 4.6も引き続きAPIで提供されており、トークン単価は同じです。
APIのモデル名はgrok-4.7です。Responses APIと従来のChat Completionsの両方に対応しています。Grok Buildでは標準モデルに採用され、Cursorでは全プランで利用できます。OpenRouter、Vercel、Cloudflareを通じた利用にも対応しています。
xAIは、安全対策の仕組みも刷新したと説明しています。サイバー分野の作業には、防御にも攻撃にも使えるものがあります。xAI自身の評価であるHackerBench v0.3では、危険な依頼に応じる割合を3.3%に抑えたとしています。正当な作業はほとんど妨げない、とも説明しています。
APIでGrok 4.6から移行するときは、モデル名に加え、出力の量・推論結果の扱い・キャッシュの設定を確かめます。
| 確認項目 | 判定 | Grok 4.7の仕様・挙動 | 移行時の対応 |
|---|---|---|---|
| モデル名 | 要変更 | grok-4.7 | モデル名をgrok-4.7に変えます |
| 推論の強さ | そのまま | low〜xhigh、標準はhigh(Grok 4.6と同じ) | 今の推論の強さのまま試します |
| 出力の量 | 要確認 | 同じ設定でも増えやすくなります | 自社の出力上限と費用の見積もりを見直します |
| 推論の要約 | 要確認 | 内部の推論を要約して返します | 画面に表示するかを決めます |
| 暗号化された推論 | 要確認 | Responses APIでは毎回返ります | 次のリクエストに含めると、前回の推論を引き継げます |
| キャッシュ | 要変更 | 設定しないとキャッシュが使われにくく、通常の入力料金がかかりやすくなります | 会話ごとにprompt_cache_key(Chat Completionsではx-grok-conv-id)を設定します |
移行では、モデル名とキャッシュの設定に必ず手を入れます。
移行の手順を確かめたい場合は、ビジョン・コンサルティングの無料相談をご利用ください。
使った人の評判は?評価される点と気になる点
公開直後の利用報告では、「Grok 4.6より遅い」「出力が増えて費用がかさむ」「日本語が不自然」といった指摘が見られます。Grok 4.6へ戻したという人もいる一方、長時間の作業に粘り強く取り組む点を評価する声もあります。
利用者の評価を、所要時間・費用・使うツールなどの論点で整理しました。
| 論点 | 良かった点 | 気になった点 |
|---|---|---|
| 長い作業 | 長時間の課題に粘り強く取り組み、細部への配慮も良くなりました | — |
| 時間 | — | Grok 4.6より所要時間が長くかかりました |
| 出力と費用 | — | 同じ設定でも出力の量と費用が増え、Grok 4.6へ戻しました |
| 利用ツール | Grok Buildでは短い時間で修正できました | Cursorでは時間がかかり、意図しない変更が出ました |
| 役割 | レビューには役立ちました | 実装には向きませんでした |
| 日本語 | — | 英語の直訳のような不自然さが、Grok 4.6から改善されていません |
| 実務での使い心地 | 実務でも大きな問題なく使えました | 自分の用途では、Grok 4.6との差が小さく感じられました |
私自身は、Grok 4.7を調査や検索によく使っています。X検索では、他社モデルに調査を頼んだときとは異なる実践的なノウハウが見つかります。そのため、ほかのモデルと並行して情報収集を任せています。
一方、日本語の文章には、Grok 4.6と同様に冗長さや意味の通りにくさを感じることがあります。自然な日本語を書く用途では、手直しが必要だと感じています。
実装については、「向かない」という声とは異なる印象を持っています。私はCursorで、各モデルの得意分野に応じて作業を振り分ける公開プラグイン「pstack」を使っています。この環境でGrok 4.7に実装を任せると、意図したとおりに仕上がると感じています。
まとめ:Grok 4.7を使うべき?作業別の選び方
独自見解長時間のコーディングや資料作成なら、Grok 4.7を標準のhighで試すのが出発点です。一方、長文読解や費用を抑えたい処理では、Grok 4.6も比較の候補になります。処理の速さを優先する用途にはlowがあります。
選ぶときは、作業の内容に加えて求める仕上がりと許容できる時間・費用を先に決めておくと、判断しやすくなります。
| 作業 | 最初に試すモデルと推論の強さ | 比べる点 |
|---|---|---|
| Grok Buildでの長時間のコーディング | Grok 4.7(high) | 所要時間と出力の量をGrok 4.6と比べます |
| 資料作成などの知識作業 | Grok 4.7(high) | 資料の見せ方と日本語の自然さ |
| highでは十分な結果が得られない難しい課題 | Grok 4.7(xhigh) | 増える時間と費用に見合う差があるか |
| 長い資料を読み込んで答える作業 | Grok 4.7とGrok 4.6(どちらもhigh) | 答えの正確さ |
| 応答速度を優先する作業・簡単なツール呼び出し | Grok 4.7(low) | 作業が終わるまでの時間と仕上がり |
| 費用を抑えたい大量の処理 | Grok 4.6(medium) | 必要な品質を満たすか |
Grok Buildを使った端末作業の評価では、スコアが18%から33%へ上がりました(どちらもxhigh)。長時間のコーディングは、Grok 4.7を試す価値のある用途です。実際に使うときはhighから始め、足りなければxhighと比べます。
資料作成などの知識作業では、Grok 4.7がGrok 4.6を上回りました。実務の成果物(GDPval-AA)と知識作業(AA-Briefcase)の両方の評価です。測定はGrok 4.7がxhigh、Grok 4.6がhighです。ただし、資料の見せ方の評価はやや下がっています。内容に加えて、見た目と日本語の自然さも確かめます。
長文読解の評価(AA-LCR)は、Grok 4.6(high)が80%、Grok 4.7(xhigh)が77%でした。長い資料を読み込ませる用途では、新モデルだけに絞らず、Grok 4.6でも回答の正確さを比べる余地があります。
費用を抑えたい処理では、Grok 4.6のmediumも候補です。総合指数は43で、1つの課題の費用は1.50ドルでした。Grok 4.7(high)の2.73ドルより安く、必要な品質を満たせるなら費用を抑えられます。
xAIは、応答速度を重視するエージェント作業や、簡単なツール呼び出しにlowを推奨しています。急ぐ作業では、Grok 4.7のlowで必要な品質を保てるかが比較のポイントです。
他社のモデルも含めると、総合指数と知識作業のスコアはどちらもClaude Opus 5.5が最も高い値です。1つの課題の費用を抑える点では、GPT-6 Solが有力な比較候補です。
よく任せる作業を1つ選び、Grok 4.7とGrok 4.6に同じ課題を任せて、仕上がりと所要時間、費用(定額プランでは利用枠の減り方)を比べてから切り替えます。
Grok 4.7は、API単価を据え置いたまま、長時間の作業と知識作業の力を高めたモデルです。ただし、1つの課題の所要時間と費用まで据え置きとは限りません。得意な用途から試し、仕上がりを見てから切り替えます。
出典と調査方法
本文・図表は、2026年9月26日時点の以下の資料に基づきます。仕様・料金・提供条件はxAIの公式資料、性能比較はxAI、Artificial Analysis、Vercelの公表値を参照しています。利用者の評判は、公開直後の報告をもとに整理しました。
- xAI|Grok 4.7の発表 — 公開日と位置づけ、Grok 4.6からの変更点、価格と速度、性能の比較表と測定条件、安全対策、提供先を参照。
- xAI|Grok 4.7のモデル仕様 — モデル名、文脈長、知識の時点、入出力、推論の強さ、対応するAPIとツール、提供先、Grok Buildの無料枠、高速版を参照。
- xAI|APIの料金 — Grok 4.7とGrok 4.6の単価、長文入力時の単価、高速版の単価とCursorでの支払い、ツールの料金、課金対象のトークンを参照。
- xAI|APIのリリースノート — Grok 4.7とGrok 4.6のAPIでの提供開始日と、Grok 4.7の位置づけ・仕様・単価、Grok 4.6の出力の上限を参照。
- xAI|Grok 4.6の発表 — Grok 4.6の公開日と、重点を置いた作業、提供先と高速版を参照。
- xAI|Grok 4.6のモデル仕様 — Grok 4.6のモデル名、文脈長、入出力、単価を参照。
- xAI|推論の強さの設定 — 推論の強さごとの説明と向く作業、Grok 4.7とGrok 4.6の標準設定の段階、推論を止められないこと、推論の要約を参照。
- xAI|Grokのよくある質問 — GrokのWebサイトとアプリ(grok.com・iOS・Android)の案内、有料プランの週ごとの利用枠をチャットやGrok Buildなどで共通に使うことと、枠を使い切ったときの選択肢を参照。
- Artificial Analysis|Grok 4.7とGrok 4.6の比較 — 同じ条件で測ったGrok 4.7とGrok 4.6の総合指数・評価ごとの成績・1つの課題の費用と出力トークン・出力速度を参照。
- Artificial Analysis|Grok 4.7の計測記事 — Grok 4.7の業務評価の内訳、知らないことに回答した割合、Grok Buildを使った計測、Grok 4.6と比べた出力トークンを参照。
- Artificial Analysis|Grok 4.7の推論の強さ別の計測 — Grok 4.7をhighとxhighで測った総合指数と1つの課題の費用を参照。
- Artificial Analysis|Grok 4.6の推論の強さ別の計測 — Grok 4.6をlowからxhighまで測った総合指数と1つの課題の費用を参照。
- Artificial Analysis|GPT-6 SolとClaude Opus 5.5の比較 — 同じ条件で測ったGPT-6 SolとClaude Opus 5.5の総合指数・評価ごとの成績・1つの課題の費用と出力トークンを参照。
- Artificial Analysis|Grok 4.7とClaude Fable 5.1の比較 — 同じ計測でのClaude Fable 5.1の総合指数・評価ごとの成績・1つの課題の費用と出力トークンを参照。
- Artificial Analysis|GPT-6 AstraとClaude Opus 5の比較 — 同じ条件で測ったGPT-6 AstraとClaude Opus 5の総合指数・評価ごとの成績・1つの課題の費用と出力トークンを参照。
- Artificial Analysis|GPT-5.6 SolとGrok 4.6の比較 — 同じ計測でのGPT-5.6 SolとGrok 4.6の総合指数・評価ごとの成績・1つの課題の費用と出力トークンを参照。
- Vercel|Next.jsのエージェント評価 — Next.jsの実装課題で測ったGrok 4.7とGrok 4.6の成功率・1つの課題の平均費用・平均所要時間を参照。
- Anthropic|Claude Opus 5.5の発表 — Claude Fable 5.1のTerminal-Bench 4.0について、Anthropic自身が公表した値を確かめるための資料。
- Artificial Analysis|総合指数(Intelligence Index)の説明 — 総合指数が0〜100の尺度で、各評価の点の加重平均であることを参照。
PoCを「技術実験」で終わらせず、経営判断まで設計する。
対象業務の選定、現状値の計測、評価設計、ガバナンス、本番移行判定を一つの意思決定プロセスとして整理します。
