是开发应用程序还是为代理制定预算?请从您实际要运行的模型开始。该 2026年5月15日迁移通知 指出,原始的 Grok 4 ID 现在只需简单的推理即可解析为 Grok 4.3。成功调用旧的 ID 已不再能证明该 ID 由原始模型提供。.
API 的使用量与 Grok 的消费者订阅分开计费。. Grok 订阅和访问定价 涵盖了聊天套餐;这些月费并非用于直接集成xAI的代币积分。.
想在将提示词集成到应用中之前先试用一下吗? 在 GlobalGPT 上尝试 Grok 4.6 用于基于聊天的流程。使用 xAI API 密钥进行自定义集成,并直接通过 xAI 进行结算。本文由 GlobalGPT 发布;产品链接包含推荐追踪功能。.
Grok 4 API定价:当前费率及已停用的原始费率
下表使用了 xAI 建议零售价(2026年9月8日核查). 每个金额均为每百万代币的美元金额。输入、缓存输入和输出属于不同的计费类别,因此单一的混合“每百万代币价格”掩盖了工作负载的实际成本。.
每100万枚代币的美元金额 · 标准处理
grok-4.3
原始 Grok 4 个重定向目标
背景: 1,000,000 代币
提示词 < 200K
- 输入
- $1.25
- 缓存输入
- $0.20
- 输出 / 推理
- $2.50
提示词 >= 200K
- 输入
- $2.50
- 缓存输入
- $0.40
- 输出 / 推理
- $5.00
grok-4.6
当前旗舰
背景: 500,000 个代币
提示词 < 200K
- 输入
- $2.00
- 缓存输入
- $0.50
- 输出 / 推理
- $6.00
提示词 >= 200K
- 输入
- $4.00
- 缓存输入
- $1.00
- 输出 / 推理
- $12.00
grok-4.5
当前一代的早期选项
背景: 500,000 个代币
提示词 < 200K
- 输入
- $2.00
- 缓存输入
- $0.30
- 输出 / 推理
- $6.00
提示词 >= 200K
- 输入
- $4.00
- 缓存输入
- $0.60
- 输出 / 推理
- $12.00
一旦提示词达到 200K 个令牌,长上下文费率将适用于该请求中的所有令牌,包括输出。.
其他列出的 Grok 第 4 家族 ID 包括: grok-4.20-0309-reasoning, grok-4.20-0309-非推理版 和 grok-4.20-multi-agent-0309. 每个模型均采用100万令牌的上下文窗口,且其短令牌/长令牌速率与Grok 4.3中列出的相同。匹配的单价并不意味着匹配的总令牌消耗量,特别是在多代理任务中。.
如果需要一种专门针对编程的替代方案,, grok-build-0.1 具有 256K 的上下文窗口,短上下文的输入/缓存/输出速率分别为 $1.00/$0.20/$2.00, 在200K提示词阈值下,这些速率将升至$2.00/$0.20/$2.00。有关更广泛的行为和使用场景,请参阅我们的 Grok 4.6 评测.

最初的 $3 / $15 价格怎么了?
较早的参考文献,包括我们的 Grok 4 API 集成指南, ,原版 Grok 的报价为:每百万输入代币 $3,每百万输出代币 $15。请将此视为历史报价,而非已停用的 ID 当前的账单。 旧的官方型号网址现已跳转至通用型号目录,因此这并非一份新验证的存档价格表。.
"(《世界人权宣言》) 原始 Grok 4 公告 描述了一个包含 256,000 个令牌的上下文窗口。该历史容量,以及较早版本的 Fast 模型价格或阈值,绝不能被复制到替换方案的预算中。关于 grok-4-0709 目前为 Grok 4.3,推理工作量较低,按 Grok 4.3 的费率计费。.

Grok 4 是一个型号,而 Grok 也是某款消费类产品的名称。我们的 关于“Grok 4”的说明 提供了该产品的背景信息。对于新代码,请明确选择受支持的模型,而不是依赖于停用重定向,或假设提供商的别名保持不变。.
输入、缓存输入和推理如何影响账单
一项请求,三次象征性收费
未缓存的输入
(I – C) × 输入速率
I = 所有提示符令牌;C = 缓存的提示符令牌。.
缓存输入
C × 缓存速率
缓存的令牌是输入的一部分,而不是额外的输入。.
可计费产出
O × 产出率
O 包括在端点将其包含在输出中时进行的推理。.
代币估算值(以美元计)= [(I – C) × 输入费率 + C × 缓存输入费率 + O × 输出费率] / 1,000,000。. 然后加上相应的工具费、仓储费或其他费用。在进行计算之前,请使用包含缓存令牌的“总计”提示,选择长上下文费率。.
输入包括发送给模型的消息、指令和对话历史记录。缓存机制会在不同请求间复用相同的起始前缀;该机制是自动的,xAI 会推荐一个对话标识符以提高复用率。外观相似的提示词并不一定能保证缓存命中。该 提示词缓存文档 解释了匹配行为。.
在“聊天补全”中,阅读 prompt_tokens_details.cached_tokens; ;在“回复”中,请阅读 input_tokens_details.cached_tokens. .......。 缓存使用及定价参考 bills 按完全完成率计算推理代币。如果输出总数中已包含推理,则添加 推理令牌 再次计算的话就会出现重复计算。.
Grok 4.6 支持低、中、高和 x高 推理开销;其文档记录的默认值为高,且无法禁用推理功能。Grok 4.3 支持无、低、中和高。 因此,对于严格的提取任务,值得评估将推理难度设为“无”的 Grok 4.3 版本;而 Grok 4.6 即使在可见答案较短的情况下,也可能消耗更多的令牌。参见 推理设置 以及上文提到的 Grok 4.3 的型号条目。.
工具调用、批处理任务和优先级请求
根据 官方工具价格表, 网页搜索、X 搜索和代码执行每 1,000 次调用分别消耗 $5,即每次调用消耗 $0.005,此外还需消耗代币。一个请求可以多次调用这些工具。 十次搜索调用会在模型代币消耗之前增加 $0.05;启用某项工具并不能预知该工具将被使用多少次。.
附件检索费用为每1,000次查询$10;馆藏检索费用为每1,000次查询$2.50。存储的文件和馆藏还需支付每日存储费和下载费。 图片和视频采用独立的计价单位,因此在仅文本的代币估算中请勿将其纳入计算。我们的 Grok 图像和视频工作流教程 涵盖了这一独立的发电路径。.
"(《世界人权宣言》) 批处理应用程序接口 针对 Grok 4.3 以及所列出的三种 Grok 4.20 变体,提供 20% 令牌折扣。 该折扣适用于输入、缓存输入、输出和推理令牌。Grok 4.6 的模型页面注明不支持批量 API。请勿一概适用 50% 的折扣,也不要假设列表中的每个模型都支持批量处理。.
优先处理 当返回时,其消耗的令牌数量为标准令牌费率的 2 倍,包括缓存令牌和推理令牌, 服务等级 证实 优先级. 若回退到默认层级,则适用标准费率。优先级仅适用于聊天完成和回复,不适用于批量 API。.
三个透明的API成本示例
这些是建议零售价的估算值,并非实际发票金额。以下所有请求均采用标准处理流程,仅限文本,不使用任何工具,不提供存储空间,不进行重试,且不含税。“输出”包括任何可计费的推理内容。前两个工作负载假设提示词长度低于200K个令牌。.
每次请求的成本和每10,000次请求的成本
Grok 4.3 · 无缓存
$0.005 / 次请求
2,000 个输入 × $1.25 + 1,000 个输出 × $2.50,除以 1M。10,000 个请求 = $50。.
Grok 4.6 · 无缓存
$0.010 / 次请求
2,000 个输入 × $2 + 1,000 个输出 × $6,除以 1M。10,000 个请求 = $100。.
Grok 4.6 · 90% 已缓存
$0.0073 / 请求
200 个未缓存 × $2 + 1,800 个已缓存 × $0.50 + 1,000 个输出 × $6,除以 1M。10,000 个请求 = $73。.
当输入在工作负载中占主导地位时,较高的缓存命中率最为有效。 在那个 Grok 4.6 的示例中,尽管有 90% 的输入令牌被缓存,但缓存仍可为每次调用节省 $0.0027,即总量的 27%。 输出开销保持在 $0.006。评估节省效果时应以整个请求为基准,而不仅仅是缓存部分。.
200K的提示词阈值可能会改变整个请求
又有一个输入令牌突破了价格门槛
199,999 个提示令牌
$0.459998
Grok 4.6:(199,999 × $2 + 10,000 输出 × $6) / 1M。无缓存。.
200,000 个提示令牌
$0.920000
Grok 4.6:(200,000 × $4 + 10,000 输出 × $12) / 1M。无缓存。.
主要 定价表中明确使用了“长文本 >= 200k 个令牌”这一表述” 并指出,一旦提示词达到阈值,所有令牌都将按较高费率计费。部分模型详情文本中提到“超过”20万。若预算设定为恰好200,000,请使用定价表中明确的阈值;切勿假设仍适用较低费率。.
对于月度预测,请分别针对每个工作负载、上下文区间、缓存命中模式和推理设置,估算请求量。加上预期的重试次数和工具调用次数。然后将该估算值与您在小型试点后获得的实际成本数据进行对比。每呼叫几美分的成本数据只有在假设条件与生产环境相符时才有参考价值。.
上下文、输出、速率限制和支出限制是不同的
调整规模前需检查的四个限制条件
上下文窗口
应要求
Grok 4.3:100万代币。Grok 4.6:50万。这并非每月配额。.
输出预算
每条回复
设置一个受支持的输出上限。上下文容量并不能保证能产生如此明显的输出效果。.
RPS / TPM
吞吐量
每秒请求数和每分钟令牌数。两者都必须保持在团队层级范围内。.
支出控制
金钱
预付余额、自动充值和账单结算限额分别控制不同的充值行为。.
公众 速率限制表 其中,Grok 4.3 的 Tier 0 规格为每秒 37 次请求、每分钟 1000 万个令牌;Grok 4.6 的规格为每秒 150 次请求、每分钟 5000 万个令牌。 这些是已发布的层级条目,并不保证每个密钥都具有相同的可用容量。您团队的控制台才是其当前模型访问权限和限制的权威来源。.
分级标准基于自2026年1月1日以来的累计API支出: 第0至第4层分别为$0、$50、$250、$1,000和$5,000。 请求限流按每秒计算,计算方式为每分钟请求配额除以 60,因此您无法在一次突发请求中耗尽整整一分钟的配额。输入、输出、推理和缓存令牌均计入 TPM,即使其中某些项的消耗较低。.
已核对的 Grok 4.3 和 4.6 型号页面提供了上下文大小,但未单独列出硬性最大输出值。当前的 响应端点参考 定义 max_output_tokens 作为输出与推理的合并配额:若未设置,默认值为 128,000;为生成更长的内容,可设置更大的值。该默认值并不保证会生成 128,000 个可见的答案令牌,也不意味着上下文配额无限。请显式设置配额,并检查不完整的响应。.
xAI 计费文档 将预付费额度与按月开票计费区分开来,后者默认处于禁用状态。自动充值功能可补充预付费额度,并设有独立的阈值和每月限额。按月开票计费限额用于控制后付费的使用;它与针对预付费购买、充值和请求设置的单一综合上限并非同一概念。.
在进行首次集成时,请先使用有限的预付金额,并仔细检查任何自动充值设置。若想在不编写集成代码的情况下进行日常聊天,可使用独立的 Grok 使用指南 涵盖了产品工作流。聊天订阅和 API 团队的控制机制各不相同。.
两项真实的 Grok 4.6 任务:使用记录揭示了什么
我们通过 Broly 聚合 API,重新使用了 2026 年 9 月 7 日的两项已完成测试,地址为 https://anywhere.broly.ai/v1, ,使用“聊天补全”功能。无论是请求还是返回的 grok-4.6; ;上游模型的身份尚未经过独立验证。这些是 Grok 4.6 网关的测试结果,并非原始的 Grok 4 测试结果,也不是不同模型之间的对比结果。.
每个任务运行了一次,使用 温度=0, max_tokens=2048 和 stream=false简体中文(大陆). 未发送任何工具或明确的推理努力设置。这两个请求都使用了相同的系统指令:
