AI Briefing · Vol.20

Grok 4.7とは?性能と特徴、価格を解説

Grok 4.6から変わった点と作業ごとの選び方

updated 2026.09.29
read 7 min
生成AI活用
author
五月女 裕太 ビジョン・コンサルティング
AI Center of Excellence 所属
AI コンサルタント

生成AIコンペ2年連続最優秀賞(日経・日刊工業新聞ほか掲載)/AWS Summit 2025事例ブース登壇/AWS主催生成AIセミナー2025 2度登壇など、業界トップを走るAIエキスパート。

AIに関するテーマを相談する→
answer

Grok 4.7は、xAIが2026年9月21日に公開した、長時間のコーディングと知識作業に強いAIモデルです。API単価はGrok 4.6と同じ入力2ドル・出力6ドル(100万トークンあたり)で、Grok BuildやCursorなどで使えます。

Read this if

Grok 4.7に切り替えるかを決めたい方に向けています

Grok 4.7が公開され、Grok 4.6から切り替えるか、どの作業に任せるかを決める材料を探している方に向けた記事です。

  • Grok 4.6からの切り替えを考えている
  • コーディングや資料作成に使いたい
  • APIで業務に組み込んでいる
  1. Grok 4.6から切り替えてよいか分からない
  2. 何が良くなったのか分からない
  3. 単価は同じでも費用が変わるのか分からない
01

Grok 4.7とは?Grok 4.6から変わった点

Grok 4.7は、Grok 4.6より規模の大きい新たな基盤モデルです。数時間に及ぶ課題を重点的に学習し、自らの作業を見直す能力や、文書・資料の作成能力を高めたとxAIは説明しています。

Grok 4.7は2026年9月21日に公開されました。同日から、xAIのAPIやGrok Build、Cursorなどで使えます。Grok Buildはコーディング支援ツール、Cursorはコード編集ツールです。

xAIは、Grok 4.7をコーディングとエージェントによる作業、知識作業に向く最先端のモデルと位置づけています。エージェントによる作業とは、AIが複数の手順を自分で進めることです。

xAIによると、Grok 4.7は難しい課題で長時間の訓練を重ねており、長い文脈を理解して生かす力も上がりました。

xAIは、Grok 4.7の価格と処理速度をGrok 4.6と同等としています。

ただし、トークン単価が同じでも、1つの課題の費用まで同じとは限りません。第三者の評価機関Artificial Analysisの測定では、1つの課題の費用が増えています。推論の強さ(考える深さの設定)をどちらもhighにそろえると、1.86ドルから2.73ドルです。

Grok 4.7とGrok 4.6では、モデルの規模と訓練のほか、1つの課題にかかる費用と時間も違います。

Grok 4.6は、Grok 4.5をもとに追加で学習したモデルです。エージェントによる長時間の作業と、対話・視覚的な作業に重点を置きました。

Grok 4.6から変わった点 図1
+2ポイント 第三者の総合指数(high同士で44→46) Artificial Analysis
2ドル APIの入力単価(100万トークンあたり・出力は6ドル)。Grok 4.6と同じ xAI
2.73ドル 1つの課題の費用(Grok 4.6は1.86ドル) Artificial Analysis
新しい基盤モデルを採用し、訓練の重点も変わりました。トークン単価は同じでも、1つの課題の費用はhigh同士で1.86ドルから2.73ドルに増えています。
02

基本スペックは?Grok 4.6との比較と推論の強さ

Grok 4.7のコンテキスト長は50万トークンで、1回の出力の上限は設けられていません。テキストと画像を入力でき、回答はテキストで返ります。推論の強さはlowからxhighまで選べ、これらの仕様はGrok 4.6と同じです。

コンテキスト長は、一度に扱える情報量を表します。Artificial Analysisは、50万トークンを「12ポイントの文字で記載したA4用紙約750ページ分」と換算しています。

Grok 4.7とGrok 4.6の基本仕様 図2
項目Grok 4.7Grok 4.6
APIでの公開日2026年9月21日2026年8月12日
APIのモデル名grok-4.7grok-4.6
コンテキスト長(一度に扱える情報量)50万トークン50万トークン
1回の出力の上限設けていません設けていません
入力 → 出力テキスト・画像 → テキストテキスト・画像 → テキスト
学習データの対象時期2026年5月—
推論の強さ(標準)low〜xhigh(high)low〜xhigh(high)
2列の値は、公開日・モデル名・学習データの時期の3行を除いて同じです。

コンテキスト長と入出力形式はGrok 4.6と同じです。移行を試すときは、これまでの指示文を出発点にできます。

APIでは、外部の処理を呼び出す関数呼び出しを使えます。Web検索、X(旧Twitter)の投稿を探すX検索、コード実行も使えます。

推論の強さは、APIのreasoning_effortで指定します。標準はhighです。強くするほど推論を多く行い、応答にかかる時間と費用も増えます。推論を完全に止める設定はありません。

推論の強さごとに向く作業を、xAIは次のように説明しています。Grok 4.7とGrok 4.6で共通です。

推論の強さの段階と向く作業(xAIの説明) 図3
段階推論の深さ(xAIの説明)xAIが挙げる用途
xhigh最も深く推論する設定です。応答には時間がかかります応答の速さより答えの質を優先したい難問
high(標準設定)多くの推論トークンを使って検討します難度の高い問題、複雑な計算、複数段階の論理的推論
mediumある程度の応答時間をかけて、十分に推論します複雑なデータ分析、長い文脈を踏まえた推論
low推論しつつ、応答の速さを優先します応答速度を重視するエージェント作業、簡単なツール呼び出し
標準はhighです。xhighは、答えの質を速さより優先するときの段階で、応答に時間がかかります。
03

性能は?xAIの公表値でGrok 4.6と比べる

xAIの公表した比較表では、Grok 4.7は掲載されたすべての評価でGrok 4.6を上回りました。端末を操作して長時間の課題に取り組むTerminal-Bench 4.0が、最も伸びました。スコアは20.3%から37.6%に上がっています。

xAIの表は、Grok 4.7をxhigh、Grok 4.6をhighの推論の強さで測った値で、DeepSWE v1.1のGrok 4.7だけhighです。

比較の相手には、GPT-5.6 SolとClaude Fable 5.1も入っています。どちらも推論の強さはmaxです。

xAIが公表した性能(Grok 4.7・Grok 4.6・他社の2モデル) 図4
測る作業(評価の名前)Grok 4.7(xhigh)Grok 4.6(high)GPT-5.6 Sol(max)Claude Fable 5.1(max)
端末を操作する長時間の作業(Terminal-Bench 4.0)37.6%20.3%37.3%57.9%
Cursorでの長時間の開発(CursorBench 4.0)46.3%40.4%41.7%51.8%
ソフトウェア開発の課題(DeepSWE v1.1・Grok 4.7はhigh)71.0%65.2%72.7%70.0%
数時間を要する知識作業のスコア(AA-Briefcase v1.1)1,6571,5461,4871,678
電気工学の課題(EEBench)64.0%53.0%39.4%56.4%
法務の課題(Harvey Legal Agent Benchmark)19.6%15.8%2.5%6.7%
臨床分野の推論(HealthBench Professional)56.7%48.5%60.5%62.1%
Grok 4.7はすべての評価でGrok 4.6を上回り、法務と電気工学では4モデルで最も高い値です。端末での作業では、Claude Fable 5.1が大きく上回ります。この表のClaude Fable 5.1の値は、xAIが載せたものです。Terminal-Bench 4.0は、Anthropic自身の公表値と異なります。

開発分野では、Grok 4.7はCursorBench 4.0でGPT-5.6 Solを上回りました。Terminal-Bench 4.0ではほぼ同じ水準で、DeepSWE v1.1ではわずかに下回ります。一方、Claude Fable 5.1を上回ったのは、掲載された開発系の評価ではDeepSWE v1.1のみです。

知識作業を評価するAA-Briefcaseでは、Grok 4.7は1,657でした。GPT-5.6 Solを上回る一方、Claude Fable 5.1にはわずかに届いていません。AA-Briefcaseは、Artificial Analysisが設計した、数時間を要する知識作業の評価です。モデル同士の比較結果と課題の要件を満たした割合をもとに採点します。スコアは更新されるため、xAIの公表値と最新の掲載値が異なる場合があります。

臨床分野の推論を測るHealthBench Professionalも、48.5%から56.7%に上がりました。ただし、比較対象の他社2モデルには届いていません。

xAIの表の7つの評価すべてで、Grok 4.7はGrok 4.6を上回りました。他社の2モデルとの差は、評価によって分かれます。

04

第三者の計測では?主要モデルと比べたGrok 4.7の位置

Artificial Analysisの測定では、Grok 4.7の総合指数は46で、比較した8モデル中7番目です。一方、実務で作成する成果物を評価するGDPval-AAでは、表中のGPTの3モデルをすべて上回っています。

以下は、Artificial Analysisが共通の課題と実行環境で測った結果です。推論の強さはGrok 4.7がxhigh、Grok 4.6がhigh、ほかのモデルがmaxです。

主要モデルの総合指数と1つの課題の費用(Artificial Analysis) 図5
モデル(総合指数の高い順)総合指数
Claude Opus 5.5・5.98ドル58
Claude Fable 5.1・7.63ドル53
GPT-6 Astra・3.26ドル53
Claude Opus 5(前のモデル)・5.86ドル51
GPT-6 Sol・1.06ドル48
GPT-5.6 Sol・1.99ドル47
Grok 4.7(xhigh)・3.74ドル46
Grok 4.6(high)・1.86ドル44
棒は総合指数(0〜100)、モデル名の後ろの金額は1つの課題の費用です。Grok 4.7の総合指数は8モデル中7番目です。費用の3.74ドルは、Claudeの3モデルより安く、GPTの3モデルとGrok 4.6より高い水準です。

実務の成果物と知識作業を評価する2つの指標で、Grok 4.7は比較的高い成績を収めました。どちらも、専門職の仕事を再現した課題でモデルの成果を比べます。この2つの指標では、Claudeの3モデルだけがGrok 4.7を上回ります。

主要モデルの実務の成果物・知識作業・業務の自動化(Artificial Analysis) 図6
モデル(総合指数の高い順)実務の成果物のスコア(GDPval-AA)数時間を要する知識作業のスコア(AA-Briefcase)業務の自動化(AutomationBench-AA)
Claude Opus 5.51846182270%
Claude Fable 5.11735167859%
GPT-6 Astra1542156968%
Claude Opus 5(前のモデル)1708167357%
GPT-6 Sol1487148362%
GPT-5.6 Sol1588148760%
Grok 4.7(xhigh)1695165766%
Grok 4.6(high)1605153967%
Grok 4.7は、実務の成果物と知識作業のスコアで表中のGPT各モデルを上回りました。業務の自動化の列では、Grok 4.6の67%がGrok 4.7の66%をわずかに上回ります。

一方、共通環境で測ったTerminal-Bench 4.0では、Grok 4.7は26%でした。GPT-6 Solの44%やClaude Opus 5.5の60%を大きく下回っています。

主要モデルの開発作業・科学計算・難問(Artificial Analysis) 図7
モデル(総合指数の高い順)端末での複雑な開発作業(Terminal-Bench 4.0)科学計算のコード生成(SciCode)難問(Humanity's Last Exam)
Claude Opus 5.560%67%61%
Claude Fable 5.152%63%59%
GPT-6 Astra59%56%55%
Claude Opus 5(前のモデル)49%56%55%
GPT-6 Sol44%58%48%
GPT-5.6 Sol40%57%49%
Grok 4.7(xhigh)26%57%43%
Grok 4.6(high)21%56%43%
端末での開発作業と難問への回答では、Grok 4.7は表中の他社モデルを下回っています。端末での開発作業の26%は、他社で最も低いGPT-5.6 Solの40%にも届きません。

Grok 4.6から上がった項目と、下がった項目があります。測定はGrok 4.7がxhigh、Grok 4.6がhighです。Grok Buildを使った2項目は、どちらもxhighです。

Grok 4.6からの変化の内訳(Artificial Analysis) 図8
33% Grok Buildでの端末作業(Terminal-Bench 4.0)。Grok 4.6は18% Artificial Analysis
1994点 知識作業の分析の質(AA-Briefcase)。Grok 4.6は1690点 Artificial Analysis
1499点 資料の見せ方(AA-Briefcase)。Grok 4.6は1519点 Artificial Analysis
77% 長い文書を読んで答える(AA-LCR)。Grok 4.6は80% Artificial Analysis
Grok Buildでの端末作業と分析の質は上がり、資料の見せ方と長文読解は下がりました。ほかに、知らないことに回答する割合が34%から29%に下がりました。Grok Buildでのコーディング指数も、47から56に上がっています。

xAIは、文書・資料の作成能力と長い文脈を扱う能力が上がったと説明しています。第三者の評価でも、文書・表計算・スライドなどの成果物を評価するGDPval-AAは1605から1695に上がりました。一方、別の評価であるAA-Briefcaseの内訳では分析の質が上がり、資料の見せ方はやや下がりました。長文読解を測るAA-LCRも、わずかに下がりました。

資料作成に使うなら、内容の正確さと見た目の仕上がりを両方比べます。Grok 4.6と同じ課題で試すと、違いが分かりやすくなります。

Terminal-Bench 4.0のスコアは、実行環境によって異なります。Grok 4.7はxAIの公表値では37.6%、Artificial Analysisの共通環境では26%、Grok Buildを使った測定では33%でした。

Next.jsの開発元であるVercelも、Grok 4.7の実装能力を評価しています。OpenCodeを使い、4回の試行のうち1回でも課題を達成すれば成功とする評価では、成功率は94%でした。8月13日に測定されたGrok 4.6の71%を上回っています。1つの課題の平均費用は0.160ドルから0.109ドルに下がり、平均所要時間は234.68秒から337.19秒に延びました。ただし、Grok 4.6は再測定されておらず、後から追加された課題は失敗として扱われます。そのため、この差には評価対象の変更も影響している可能性があります。

Artificial Analysisの測定では、1つの課題の所要時間はGrok 4.7(xhigh)が約956秒でした。Grok 4.6(high)は約532秒です(どちらも9月26日時点)。

総合では8モデル中7番目ですが、成果物と知識作業の2つの評価ではGPTの各モデルを上回ります。

05

料金はいくら?定額プランと従量課金、1つの課題の費用

Grok 4.7のAPI単価はGrok 4.6と同じで、100万トークンあたり入力2ドル、出力6ドルです。Grokの定額プランでは、週ごとの利用枠の範囲で、Grok Buildなどから使えます。ただし、APIの単価が据え置かれていても、1つの課題の費用は増える場合があります。

使い方は4つあります。Grok Buildの無料枠・Grokの定額プラン・Cursorのプラン・従量課金のxAIのAPIです。Grokの定額プランでは、チャットとGrok Buildなどで利用枠を共有します。

grok.comとスマートフォンアプリのチャットは、xAIが発表したGrok 4.7の提供先に入っていません。Grokの定額プランで試すときは、Grok Buildなどを使います。

Grok 4.7の払い方と使える場所 図9
料金体系対応サービス利用枠・高速版の扱い
無料枠Grok Build高速版のGrok 4.7 Fastは使えません
Grokの定額プランGrok Buildなどチャットなどと週ごとの利用枠を共有します。上限に達したら、利用枠の追加購入か上位プランへの変更で使い続けられます
CursorのプランCursor全プランで使えます。高速版もCursorのプランで使えます
従量課金xAIのAPI使った量に応じて課金されます。Grok 4.7 Fastは対象外です
Grokの定額プランはチャットなどと利用枠を共有し、xAIのAPIは使った量に応じて課金されます。定額プランで試す入口は、Grok Buildなどです。2026年9月26日時点の内容です。

入力が20万トークン以上になると、そのリクエスト全体に高い単価がかかります。Grok 4.7とGrok 4.6で同じです。100万トークンあたりの単価は入力4.00ドル、出力12.00ドルです。長い資料を渡すときは、この境目を超えるかどうかで費用が変わります。

Grok 4.7とGrok 4.6のAPI料金(100万トークンあたり) 図10
料金の項目Grok 4.7Grok 4.6
入力(ドル)2.002.00
キャッシュ入力(同じ入力の再利用、ドル)0.500.50
出力(ドル)6.006.00
プロンプトが20万トークン以上のときの入力(ドル)4.004.00
プロンプトが20万トークン以上のときの出力(ドル)12.0012.00
Web検索・コード実行(千回あたり、ドル)55
X検索(取得した投稿千件あたり、ドル)55
2026年9月26日時点の単価です。通常の入力・出力、長い入力、ツール利用の単価はGrok 4.6と同じです。入力が20万トークン以上になると、入力は4.00ドル、出力は12.00ドルに上がります。

高速版のGrok 4.7 Fastは、同じモデルを高速な実行基盤で動かすものです。入力が20万トークン未満なら、100万トークンあたり入力4.00ドル・出力12.00ドルで、通常版より高くなります。提供先はCursorとGrok Buildに限られ、Cursorでは同サービスのプランを通じて支払います。公開APIとGrok Buildの無料枠では使えません。

Web検索やX検索などのツールには、トークン料金とは別に利用量に応じた料金がかかります。また、回答文だけでなく、考える過程で使う推論トークンも課金対象です。

推論の強さによって、実際の費用も変わります。Artificial Analysisの測定では、次のような差が出ています。

推論の強さごとの総合指数と1つの課題の費用(Artificial Analysis) 図11
モデルと推論の強さ総合指数1つの課題の費用
Grok 4.6 high441.86
Grok 4.6 xhigh442.32
Grok 4.7 high462.73
Grok 4.7 xhigh463.74
折れ線は総合指数(左の軸)、棒は1つの課題の費用(右の軸・ドル)です。Grok 4.7はhighとxhighで総合指数が同じ46で、費用だけが2.73ドルから3.74ドルに上がります。

Grok 4.7では、費用の大部分を入力処理が占めています。xhighでの3.74ドルのうち、出力トークン約8.1万に通常の出力単価を掛けた金額は約0.49ドルです。残りは、キャッシュされた分を含む入力の費用に当たります。

入力が多い作業では、キャッシュの活用が費用に影響します。xAIは、Grok 4.7でprompt_cache_keyの設定を強く推奨しています。未設定では、該当するキャッシュを持たないサーバーに処理が割り当てられ、通常の入力料金がかかりやすいためです。

Grok 4.7の費用は入力側が大半を占めるため、キャッシュを効かせると費用を抑えやすくなります。

Grok 4.7の総合指数は、highとxhighで同じ46でした。まず標準のhighで試し、足りない課題だけxhighと比べます。仕上がりの差が費用の増加に見合うかを判断しやすくなります。

06

どこで使える?Grok 4.6から切り替えるときの注意

Grok 4.7は、xAIのAPIやGrok Build、Cursorで使えます。OpenRouterなどの中継サービスからも使えます。Grok 4.6も引き続きAPIで提供されており、トークン単価は同じです。

APIのモデル名はgrok-4.7です。Responses APIと従来のChat Completionsの両方に対応しています。Grok Buildでは標準モデルに採用され、Cursorでは全プランで利用できます。OpenRouter、Vercel、Cloudflareを通じた利用にも対応しています。

xAIは、安全対策の仕組みも刷新したと説明しています。サイバー分野の作業には、防御にも攻撃にも使えるものがあります。xAI自身の評価であるHackerBench v0.3では、危険な依頼に応じる割合を3.3%に抑えたとしています。正当な作業はほとんど妨げない、とも説明しています。

APIでGrok 4.6から移行するときは、モデル名に加え、出力の量・推論結果の扱い・キャッシュの設定を確かめます。

Grok 4.6から切り替えるときの確認項目(APIで組み込んでいる場合) 図12
確認項目判定Grok 4.7の仕様・挙動移行時の対応
モデル名要変更grok-4.7モデル名をgrok-4.7に変えます
推論の強さそのままlow〜xhigh、標準はhigh(Grok 4.6と同じ)今の推論の強さのまま試します
出力の量要確認同じ設定でも増えやすくなります自社の出力上限と費用の見積もりを見直します
推論の要約要確認内部の推論を要約して返します画面に表示するかを決めます
暗号化された推論要確認Responses APIでは毎回返ります次のリクエストに含めると、前回の推論を引き継げます
キャッシュ要変更設定しないとキャッシュが使われにくく、通常の入力料金がかかりやすくなります会話ごとにprompt_cache_key(Chat Completionsではx-grok-conv-id)を設定します
要変更の2項目(モデル名とキャッシュ)は、移行するときに必ず直します。推論の強さは今の設定のまま試せます。

移行では、モデル名とキャッシュの設定に必ず手を入れます。

移行の手順を確かめたい場合は、ビジョン・コンサルティングの無料相談をご利用ください。

07

使った人の評判は?評価される点と気になる点

公開直後の利用報告では、「Grok 4.6より遅い」「出力が増えて費用がかさむ」「日本語が不自然」といった指摘が見られます。Grok 4.6へ戻したという人もいる一方、長時間の作業に粘り強く取り組む点を評価する声もあります。

利用者の評価を、所要時間・費用・使うツールなどの論点で整理しました。

使った人の評判(公開直後の報告を論点ごとに整理) 図13
論点良かった点気になった点
長い作業長時間の課題に粘り強く取り組み、細部への配慮も良くなりました—
時間—Grok 4.6より所要時間が長くかかりました
出力と費用—同じ設定でも出力の量と費用が増え、Grok 4.6へ戻しました
利用ツールGrok Buildでは短い時間で修正できましたCursorでは時間がかかり、意図しない変更が出ました
役割レビューには役立ちました実装には向きませんでした
日本語—英語の直訳のような不自然さが、Grok 4.6から改善されていません
実務での使い心地実務でも大きな問題なく使えました自分の用途では、Grok 4.6との差が小さく感じられました
評価は、使うツールや任せる役割で分かれています。切り替えの判断では、時間と費用の指摘を先に確かめます。

私自身は、Grok 4.7を調査や検索によく使っています。X検索では、他社モデルに調査を頼んだときとは異なる実践的なノウハウが見つかります。そのため、ほかのモデルと並行して情報収集を任せています。

一方、日本語の文章には、Grok 4.6と同様に冗長さや意味の通りにくさを感じることがあります。自然な日本語を書く用途では、手直しが必要だと感じています。

実装については、「向かない」という声とは異なる印象を持っています。私はCursorで、各モデルの得意分野に応じて作業を振り分ける公開プラグイン「pstack」を使っています。この環境でGrok 4.7に実装を任せると、意図したとおりに仕上がると感じています。

08

まとめ:Grok 4.7を使うべき?作業別の選び方

独自見解

長時間のコーディングや資料作成なら、Grok 4.7を標準のhighで試すのが出発点です。一方、長文読解や費用を抑えたい処理では、Grok 4.6も比較の候補になります。処理の速さを優先する用途にはlowがあります。

選ぶときは、作業の内容に加えて求める仕上がりと許容できる時間・費用を先に決めておくと、判断しやすくなります。

作業別の結論 図14
作業最初に試すモデルと推論の強さ比べる点
Grok Buildでの長時間のコーディングGrok 4.7(high)所要時間と出力の量をGrok 4.6と比べます
資料作成などの知識作業Grok 4.7(high)資料の見せ方と日本語の自然さ
highでは十分な結果が得られない難しい課題Grok 4.7(xhigh)増える時間と費用に見合う差があるか
長い資料を読み込んで答える作業Grok 4.7とGrok 4.6(どちらもhigh)答えの正確さ
応答速度を優先する作業・簡単なツール呼び出しGrok 4.7(low)作業が終わるまでの時間と仕上がり
費用を抑えたい大量の処理Grok 4.6(medium)必要な品質を満たすか
長時間のコーディングや知識作業ではGrok 4.7が有望です。長文読解や費用を重視する用途では、Grok 4.6も比較の候補になります。

Grok Buildを使った端末作業の評価では、スコアが18%から33%へ上がりました(どちらもxhigh)。長時間のコーディングは、Grok 4.7を試す価値のある用途です。実際に使うときはhighから始め、足りなければxhighと比べます。

資料作成などの知識作業では、Grok 4.7がGrok 4.6を上回りました。実務の成果物(GDPval-AA)と知識作業(AA-Briefcase)の両方の評価です。測定はGrok 4.7がxhigh、Grok 4.6がhighです。ただし、資料の見せ方の評価はやや下がっています。内容に加えて、見た目と日本語の自然さも確かめます。

長文読解の評価(AA-LCR)は、Grok 4.6(high)が80%、Grok 4.7(xhigh)が77%でした。長い資料を読み込ませる用途では、新モデルだけに絞らず、Grok 4.6でも回答の正確さを比べる余地があります。

費用を抑えたい処理では、Grok 4.6のmediumも候補です。総合指数は43で、1つの課題の費用は1.50ドルでした。Grok 4.7(high)の2.73ドルより安く、必要な品質を満たせるなら費用を抑えられます。

xAIは、応答速度を重視するエージェント作業や、簡単なツール呼び出しにlowを推奨しています。急ぐ作業では、Grok 4.7のlowで必要な品質を保てるかが比較のポイントです。

他社のモデルも含めると、総合指数と知識作業のスコアはどちらもClaude Opus 5.5が最も高い値です。1つの課題の費用を抑える点では、GPT-6 Solが有力な比較候補です。

よく任せる作業を1つ選び、Grok 4.7とGrok 4.6に同じ課題を任せて、仕上がりと所要時間、費用(定額プランでは利用枠の減り方)を比べてから切り替えます。

Grok 4.7は、API単価を据え置いたまま、長時間の作業と知識作業の力を高めたモデルです。ただし、1つの課題の所要時間と費用まで据え置きとは限りません。得意な用途から試し、仕上がりを見てから切り替えます。

09

出典と調査方法

本文・図表は、2026年9月26日時点の以下の資料に基づきます。仕様・料金・提供条件はxAIの公式資料、性能比較はxAI、Artificial Analysis、Vercelの公表値を参照しています。利用者の評判は、公開直後の報告をもとに整理しました。

  1. xAI|Grok 4.7の発表 — 公開日と位置づけ、Grok 4.6からの変更点、価格と速度、性能の比較表と測定条件、安全対策、提供先を参照。
  2. xAI|Grok 4.7のモデル仕様 — モデル名、文脈長、知識の時点、入出力、推論の強さ、対応するAPIとツール、提供先、Grok Buildの無料枠、高速版を参照。
  3. xAI|APIの料金 — Grok 4.7とGrok 4.6の単価、長文入力時の単価、高速版の単価とCursorでの支払い、ツールの料金、課金対象のトークンを参照。
  4. xAI|APIのリリースノート — Grok 4.7とGrok 4.6のAPIでの提供開始日と、Grok 4.7の位置づけ・仕様・単価、Grok 4.6の出力の上限を参照。
  5. xAI|Grok 4.6の発表 — Grok 4.6の公開日と、重点を置いた作業、提供先と高速版を参照。
  6. xAI|Grok 4.6のモデル仕様 — Grok 4.6のモデル名、文脈長、入出力、単価を参照。
  7. xAI|推論の強さの設定 — 推論の強さごとの説明と向く作業、Grok 4.7とGrok 4.6の標準設定の段階、推論を止められないこと、推論の要約を参照。
  8. xAI|Grokのよくある質問 — GrokのWebサイトとアプリ(grok.com・iOS・Android)の案内、有料プランの週ごとの利用枠をチャットやGrok Buildなどで共通に使うことと、枠を使い切ったときの選択肢を参照。
  9. Artificial Analysis|Grok 4.7とGrok 4.6の比較 — 同じ条件で測ったGrok 4.7とGrok 4.6の総合指数・評価ごとの成績・1つの課題の費用と出力トークン・出力速度を参照。
  10. Artificial Analysis|Grok 4.7の計測記事 — Grok 4.7の業務評価の内訳、知らないことに回答した割合、Grok Buildを使った計測、Grok 4.6と比べた出力トークンを参照。
  11. Artificial Analysis|Grok 4.7の推論の強さ別の計測 — Grok 4.7をhighとxhighで測った総合指数と1つの課題の費用を参照。
  12. Artificial Analysis|Grok 4.6の推論の強さ別の計測 — Grok 4.6をlowからxhighまで測った総合指数と1つの課題の費用を参照。
  13. Artificial Analysis|GPT-6 SolとClaude Opus 5.5の比較 — 同じ条件で測ったGPT-6 SolとClaude Opus 5.5の総合指数・評価ごとの成績・1つの課題の費用と出力トークンを参照。
  14. Artificial Analysis|Grok 4.7とClaude Fable 5.1の比較 — 同じ計測でのClaude Fable 5.1の総合指数・評価ごとの成績・1つの課題の費用と出力トークンを参照。
  15. Artificial Analysis|GPT-6 AstraとClaude Opus 5の比較 — 同じ条件で測ったGPT-6 AstraとClaude Opus 5の総合指数・評価ごとの成績・1つの課題の費用と出力トークンを参照。
  16. Artificial Analysis|GPT-5.6 SolとGrok 4.6の比較 — 同じ計測でのGPT-5.6 SolとGrok 4.6の総合指数・評価ごとの成績・1つの課題の費用と出力トークンを参照。
  17. Vercel|Next.jsのエージェント評価 — Next.jsの実装課題で測ったGrok 4.7とGrok 4.6の成功率・1つの課題の平均費用・平均所要時間を参照。
  18. Anthropic|Claude Opus 5.5の発表 — Claude Fable 5.1のTerminal-Bench 4.0について、Anthropic自身が公表した値を確かめるための資料。
  19. Artificial Analysis|総合指数(Intelligence Index)の説明 — 総合指数が0〜100の尺度で、各評価の点の加重平均であることを参照。
Vision Consulting

PoCを「技術実験」で終わらせず、経営判断まで設計する。

対象業務の選定、現状値の計測、評価設計、ガバナンス、本番移行判定を一つの意思決定プロセスとして整理します。

share
AIに関するテーマを相談する→