Grok 4 API 定价:费用、限额及入门指南

是开发应用程序还是为代理制定预算?请从您实际要运行的模型开始。该 2026年5月15日迁移通知 指出,原始的 Grok 4 ID 现在只需简单的推理即可解析为 Grok 4.3。成功调用旧的 ID 已不再能证明该 ID 由原始模型提供。.

API 的使用量与 Grok 的消费者订阅分开计费。. Grok 订阅和访问定价 涵盖了聊天套餐;这些月费并非用于直接集成xAI的代币积分。.

想在将提示词集成到应用中之前先试用一下吗? 在 GlobalGPT 上尝试 Grok 4.6 用于基于聊天的流程。使用 xAI API 密钥进行自定义集成,并直接通过 xAI 进行结算。本文由 GlobalGPT 发布;产品链接包含推荐追踪功能。.

Grok 4 API定价:当前费率及已停用的原始费率

下表使用了 xAI 建议零售价(2026年9月8日核查). 每个金额均为每百万代币的美元金额。输入、缓存输入和输出属于不同的计费类别,因此单一的混合“每百万代币价格”掩盖了工作负载的实际成本。.

每100万枚代币的美元金额 · 标准处理

grok-4.3

原始 Grok 4 个重定向目标

背景: 1,000,000 代币

提示词 < 200K

输入
$1.25
缓存输入
$0.20
输出 / 推理
$2.50

提示词 >= 200K

输入
$2.50
缓存输入
$0.40
输出 / 推理
$5.00

grok-4.6

当前旗舰

背景: 500,000 个代币

提示词 < 200K

输入
$2.00
缓存输入
$0.50
输出 / 推理
$6.00

提示词 >= 200K

输入
$4.00
缓存输入
$1.00
输出 / 推理
$12.00

grok-4.5

当前一代的早期选项

背景: 500,000 个代币

提示词 < 200K

输入
$2.00
缓存输入
$0.30
输出 / 推理
$6.00

提示词 >= 200K

输入
$4.00
缓存输入
$0.60
输出 / 推理
$12.00

一旦提示词达到 200K 个令牌,长上下文费率将适用于该请求中的所有令牌,包括输出。.

其他列出的 Grok 第 4 家族 ID 包括: grok-4.20-0309-reasoning, grok-4.20-0309-非推理版grok-4.20-multi-agent-0309. 每个模型均采用100万令牌的上下文窗口,且其短令牌/长令牌速率与Grok 4.3中列出的相同。匹配的单价并不意味着匹配的总令牌消耗量,特别是在多代理任务中。.

如果需要一种专门针对编程的替代方案,, grok-build-0.1 具有 256K 的上下文窗口,短上下文的输入/缓存/输出速率分别为 $1.00/$0.20/$2.00, 在200K提示词阈值下,这些速率将升至$2.00/$0.20/$2.00。有关更广泛的行为和使用场景,请参阅我们的 Grok 4.6 评测.

xAI 官方文档中列出了 Grok 4.6,包括其模型 ID、50 万字节的上下文容量以及可配置的推理功能。.
官方 xAI 模型目录, ,于2026年9月7日采集,并于9月8日重新核对。$2/$6的标题为“Grok 4.6 短上下文输入/输出定价”;缓存和长上下文速率如上所示。.

最初的 $3 / $15 价格怎么了?

较早的参考文献,包括我们的 Grok 4 API 集成指南, ,原版 Grok 的报价为:每百万输入代币 $3,每百万输出代币 $15。请将此视为历史报价,而非已停用的 ID 当前的账单。 旧的官方型号网址现已跳转至通用型号目录,因此这并非一份新验证的存档价格表。.

"(《世界人权宣言》) 原始 Grok 4 公告 描述了一个包含 256,000 个令牌的上下文窗口。该历史容量,以及较早版本的 Fast 模型价格或阈值,绝不能被复制到替换方案的预算中。关于 grok-4-0709 目前为 Grok 4.3,推理工作量较低,按 Grok 4.3 的费率计费。.

列出 grok-4-0709 及其重定向至 grok-4.3 的官方停用通知
xAI 停用通知, ,2026年9月7日收录;9月8日重新核对文本。所列的原始条目“Grok 4 ID”重定向至“Grok 4.3”。完整通知中另行列出了针对编码和图像模型的例外情况。.

Grok 4 是一个型号,而 Grok 也是某款消费类产品的名称。我们的 关于“Grok 4”的说明 提供了该产品的背景信息。对于新代码,请明确选择受支持的模型,而不是依赖于停用重定向,或假设提供商的别名保持不变。.

输入、缓存输入和推理如何影响账单

一项请求,三次象征性收费

未缓存的输入

(I – C) × 输入速率

I = 所有提示符令牌;C = 缓存的提示符令牌。.

缓存输入

C × 缓存速率

缓存的令牌是输入的一部分,而不是额外的输入。.

可计费产出

O × 产出率

O 包括在端点将其包含在输出中时进行的推理。.

代币估算值(以美元计)= [(I – C) × 输入费率 + C × 缓存输入费率 + O × 输出费率] / 1,000,000。. 然后加上相应的工具费、仓储费或其他费用。在进行计算之前,请使用包含缓存令牌的“总计”提示,选择长上下文费率。.

输入包括发送给模型的消息、指令和对话历史记录。缓存机制会在不同请求间复用相同的起始前缀;该机制是自动的,xAI 会推荐一个对话标识符以提高复用率。外观相似的提示词并不一定能保证缓存命中。该 提示词缓存文档 解释了匹配行为。.

在“聊天补全”中,阅读 prompt_tokens_details.cached_tokens; ;在“回复”中,请阅读 input_tokens_details.cached_tokens. .......。 缓存使用及定价参考 bills 按完全完成率计算推理代币。如果输出总数中已包含推理,则添加 推理令牌 再次计算的话就会出现重复计算。.

Grok 4.6 支持低、中、高和 x高 推理开销;其文档记录的默认值为高,且无法禁用推理功能。Grok 4.3 支持无、低、中和高。 因此,对于严格的提取任务,值得评估将推理难度设为“无”的 Grok 4.3 版本;而 Grok 4.6 即使在可见答案较短的情况下,也可能消耗更多的令牌。参见 推理设置 以及上文提到的 Grok 4.3 的型号条目。.

工具调用、批处理任务和优先级请求

根据 官方工具价格表, 网页搜索、X 搜索和代码执行每 1,000 次调用分别消耗 $5,即每次调用消耗 $0.005,此外还需消耗代币。一个请求可以多次调用这些工具。 十次搜索调用会在模型代币消耗之前增加 $0.05;启用某项工具并不能预知该工具将被使用多少次。.

附件检索费用为每1,000次查询$10;馆藏检索费用为每1,000次查询$2.50。存储的文件和馆藏还需支付每日存储费和下载费。 图片和视频采用独立的计价单位,因此在仅文本的代币估算中请勿将其纳入计算。我们的 Grok 图像和视频工作流教程 涵盖了这一独立的发电路径。.

"(《世界人权宣言》) 批处理应用程序接口 针对 Grok 4.3 以及所列出的三种 Grok 4.20 变体,提供 20% 令牌折扣。 该折扣适用于输入、缓存输入、输出和推理令牌。Grok 4.6 的模型页面注明不支持批量 API。请勿一概适用 50% 的折扣,也不要假设列表中的每个模型都支持批量处理。.

优先处理 当返回时,其消耗的令牌数量为标准令牌费率的 2 倍,包括缓存令牌和推理令牌, 服务等级 证实 优先级. 若回退到默认层级,则适用标准费率。优先级仅适用于聊天完成和回复,不适用于批量 API。.

三个透明的API成本示例

这些是建议零售价的估算值,并非实际发票金额。以下所有请求均采用标准处理流程,仅限文本,不使用任何工具,不提供存储空间,不进行重试,且不含税。“输出”包括任何可计费的推理内容。前两个工作负载假设提示词长度低于200K个令牌。.

每次请求的成本和每10,000次请求的成本

Grok 4.3 · 无缓存

$0.005 / 次请求

2,000 个输入 × $1.25 + 1,000 个输出 × $2.50,除以 1M。10,000 个请求 = $50。.

Grok 4.6 · 无缓存

$0.010 / 次请求

2,000 个输入 × $2 + 1,000 个输出 × $6,除以 1M。10,000 个请求 = $100。.

Grok 4.6 · 90% 已缓存

$0.0073 / 请求

200 个未缓存 × $2 + 1,800 个已缓存 × $0.50 + 1,000 个输出 × $6,除以 1M。10,000 个请求 = $73。.

当输入在工作负载中占主导地位时,较高的缓存命中率最为有效。 在那个 Grok 4.6 的示例中,尽管有 90% 的输入令牌被缓存,但缓存仍可为每次调用节省 $0.0027,即总量的 27%。 输出开销保持在 $0.006。评估节省效果时应以整个请求为基准,而不仅仅是缓存部分。.

200K的提示词阈值可能会改变整个请求

又有一个输入令牌突破了价格门槛

199,999 个提示令牌

$0.459998

Grok 4.6:(199,999 × $2 + 10,000 输出 × $6) / 1M。无缓存。.

200,000 个提示令牌

$0.920000

Grok 4.6:(200,000 × $4 + 10,000 输出 × $12) / 1M。无缓存。.

主要 定价表中明确使用了“长文本 >= 200k 个令牌”这一表述” 并指出,一旦提示词达到阈值,所有令牌都将按较高费率计费。部分模型详情文本中提到“超过”20万。若预算设定为恰好200,000,请使用定价表中明确的阈值;切勿假设仍适用较低费率。.

对于月度预测,请分别针对每个工作负载、上下文区间、缓存命中模式和推理设置,估算请求量。加上预期的重试次数和工具调用次数。然后将该估算值与您在小型试点后获得的实际成本数据进行对比。每呼叫几美分的成本数据只有在假设条件与生产环境相符时才有参考价值。.

上下文、输出、速率限制和支出限制是不同的

调整规模前需检查的四个限制条件

上下文窗口

应要求

Grok 4.3:100万代币。Grok 4.6:50万。这并非每月配额。.

输出预算

每条回复

设置一个受支持的输出上限。上下文容量并不能保证能产生如此明显的输出效果。.

RPS / TPM

吞吐量

每秒请求数和每分钟令牌数。两者都必须保持在团队层级范围内。.

支出控制

金钱

预付余额、自动充值和账单结算限额分别控制不同的充值行为。.

公众 速率限制表 其中,Grok 4.3 的 Tier 0 规格为每秒 37 次请求、每分钟 1000 万个令牌;Grok 4.6 的规格为每秒 150 次请求、每分钟 5000 万个令牌。 这些是已发布的层级条目,并不保证每个密钥都具有相同的可用容量。您团队的控制台才是其当前模型访问权限和限制的权威来源。.

分级标准基于自2026年1月1日以来的累计API支出: 第0至第4层分别为$0、$50、$250、$1,000和$5,000。 请求限流按每秒计算,计算方式为每分钟请求配额除以 60,因此您无法在一次突发请求中耗尽整整一分钟的配额。输入、输出、推理和缓存令牌均计入 TPM,即使其中某些项的消耗较低。.

已核对的 Grok 4.3 和 4.6 型号页面提供了上下文大小,但未单独列出硬性最大输出值。当前的 响应端点参考 定义 max_output_tokens 作为输出与推理的合并配额:若未设置,默认值为 128,000;为生成更长的内容,可设置更大的值。该默认值并不保证会生成 128,000 个可见的答案令牌,也不意味着上下文配额无限。请显式设置配额,并检查不完整的响应。.

xAI 计费文档 将预付费额度与按月开票计费区分开来,后者默认处于禁用状态。自动充值功能可补充预付费额度,并设有独立的阈值和每月限额。按月开票计费限额用于控制后付费的使用;它与针对预付费购买、充值和请求设置的单一综合上限并非同一概念。.

在进行首次集成时,请先使用有限的预付金额,并仔细检查任何自动充值设置。若想在不编写集成代码的情况下进行日常聊天,可使用独立的 Grok 使用指南 涵盖了产品工作流。聊天订阅和 API 团队的控制机制各不相同。.

两项真实的 Grok 4.6 任务:使用记录揭示了什么

我们通过 Broly 聚合 API,重新使用了 2026 年 9 月 7 日的两项已完成测试,地址为 https://anywhere.broly.ai/v1, ,使用“聊天补全”功能。无论是请求还是返回的 grok-4.6; ;上游模型的身份尚未经过独立验证。这些是 Grok 4.6 网关的测试结果,并非原始的 Grok 4 测试结果,也不是不同模型之间的对比结果。.

每个任务运行了一次,使用 温度=0, max_tokens=2048stream=false简体中文(大陆). 未发送任何工具或明确的推理努力设置。这两个请求都使用了相同的系统指令:

共享系统说明

费用提取

该任务将五张合成费用单转换为格式规范的JSON数据,其中分值以整数形式表示,并包含一笔负数退款。响应保留了所有请求字段,并正确计算出了$209.00的净总额。.

确切的提示词:费用提取

完整的返回结果:费用提取

{
  "currency": "USD",
  "items": [
    {
 "label": "火车",
 "amount_cents": 4680
    },
    {
 "label": "酒店",
 "amount_cents": 12800
    },
    {
      "label": "晚餐",
 "amount_cents": 2745
    },
    {
 "label": "退款",
 "amount_cents": -1250
    },
    {
 "label": "出租车",
 "amount_cents": 1925
    }
  ],
  "net_total_cents": 20900
}

报告的使用情况 · 费用提取

输入 / 已缓存

364 / 192

缓存的令牌计入输入总数。.

完成 / 推理

991 / 857

推理过程会在完成详情中予以说明。.

墙上时钟显示的时间

22.753秒

包括网络和网关开销;一次运行。.

带约束排程

该任务要求在八小时的预算内,在满足先决条件的情况下选择不可分割的工作。给出的答案选中了A、B、C和E,总计八小时,值为24。我们独立枚举了所有64个子集:其中17个是可行的,而这正是唯一的最优解。.

确切的提示:受约束调度

完整的返回结果:受约束调度

{
  "selected": ["A", "B", "C", "E"],
  "order": ["A", "B", "C", "E"],
  "total_hours": 8,
  "total_value": 24
}

报告的使用情况 · 受限调度

输入 / 已缓存

428 / 192

缓存的令牌计入输入总数。.

完成 / 推理

4267 / 4217

推理过程会在完成详情中予以说明。.

墙上时钟显示的时间

61.980秒

包括网络和网关开销;一次运行。.

该调度结果的长度比费用 JSON 更短,但其报告的总消耗量为 4,267 个令牌,其中包括 4,217 个推理令牌。这就是预算管理中的一个教训:可见结果的长度并不能很好地反映推理模型的消耗情况。这两个任务是使用模式的有用示例,而非延迟基准测试或通用质量排名。.

网关使用示例:受限调度

{
  "prompt_tokens": 428,
  "completion_tokens": 4267,
  "total_tokens": 4695,
  "提示词令牌详情": {
    "缓存令牌": 192
  },
  "生成令牌详情": {
    "推理令牌": 4217
  }
}

该网关还返回了值为零的 input_tokensoutput_tokens 字段,尽管“聊天补全”计数器不为零。对于这些记录,我们使用了 提示词片段completion_tokens. 我们没有将零值别名视为免费请求,也没有根据其他零值字段推断可见令牌的数量。.

采用官方费率但不将其称为发票

如果按照 Grok 4.6 当前的短上下文 xAI 建议零售价对这些网关计数进行计费,则该提取任务的费用将为 [(364 – 192) × $2 + 192 × $0.50 + 991 × $6] / 1M = $0.006386简体中文(大陆). 排程将如下: [(428 – 192) × $2 + 192 × $0.50 + 4,267 × $6] / 1M = $0.026170简体中文(大陆). 这些是假设性的xAI速率估计值,并非在布罗利观测到的数据。.

尽管请求中发送的是……,但调度响应报告了 4,267 个完成标记 max_tokens=2048. 该网关的上限语义尚未经过验证。这一差异并不能说明 xAI 自身的输出上限是如何运作的,且所请求的上限不能被视为该网关已证实的支出上限。.

Direct xAI 的回复包含更有用的计费信号: cost_in_usd_ticks. 官方文档将 1 USD 定义为 10,000,000,000 个 tick,并指出该字段包含该请求的代币费用、折扣以及服务器端工具调用费用。重复使用的网关响应中不包含该字段。 对于会话,应将每次请求的 tick 值相加,而不是假设每个响应都包含会话总计。.

独立API用户注意到了什么

2026年8月21日,Hacker News用户 mediaman 指出,Grok 4.6 的 $0.50/百万缓存输入率是其 $2 非缓存输入率的 25%。他们担心的是代理式工作中重复的缓存读取。 这两个 Grok 速率与当前官方数据表一致;评论者更广泛的比较和推测均为其个人评估。.

Hacker News 用户 mediaman 讨论 Grok API 缓存定价
mediaman 关于 Grok 4.6 缓存定价的评论,2026 年 8 月 21 日。个人成本评估;比较和推测均为评论者本人观点。2026 年 9 月 8 日存档。.

此前,在2025年11月9日,, XCSme 文中描述了使用Grok 4 Fast通过API进行数据解析和提取,称其“经济实惠且快速”。这是一份关于现已停产的Fast型号的历史报告。 该报告并未说明当前 Grok 4.3 或 Grok 4.6 的价格、速度或质量。.

XCSme 在 Hacker News 上讨论 Grok API 数据提取
XCSme 关于使用 Grok 4 Fast 进行提取的讨论,2025年11月9日。关于一款现已停产机型的个人历史经验。2026年9月8日记录。.

这两段个人经历引发了一些有用的初步问题:你的代码开销中有多少来自缓存上下文,又有多少来自推理和重试?这些经历并不能形成开发者共识。如果你也在比较由此产生的工作量,我们的 Grok 与 ChatGPT 的工作、搜索和编码对比 针对该项单独决定作出的处理。.

如何开始使用官方 xAI API

"(《世界人权宣言》) xAI 官方快速入门指南 使用位于 https://api.x.ai/v1/responses. 这与我们在9月7日测试中使用的聚合平台所使用的端点和账户不同。.

  1. 创建或登录您的 xAI Console 账户,然后选择正确的团队。.
  2. 添加 API 积分并查看支出设置。确认所选模型对您的团队开放。.
  3. 创建一个 API 密钥,并将其作为 XAI_API_KEY 传递给服务器进程。请勿将该密钥包含在浏览器代码、源代码控制、屏幕截图和日志中。.
  4. 使用明确的当前模型 ID 发送一个小型请求,然后记录返回的模型、使用情况、服务层级和请求标识符。.

下面的示例使用 Node.js 18 或更高版本及其内置的 fetch 功能,因此无需安装 SDK。运行前请在进程环境中设置 XAI_API_KEY。该示例采用当前官方的 Responses 请求格式,并使用低推理强度;代码已在本地经过验证,未发送额外的付费 API 请求。.

首个官方请求 · Node.js

在进行扩容之前,请确认状态已变为“已完成”,并检查使用对象。本示例通过官方的 Responses 字段预留了 2,048 个输出和推理令牌。超时仅是客户端的截止时间,并不意味着服务器端的工作已被取消或未计费。 该示例不会自动重试;令牌上限并非针对同时发送输入或调用工具的应用程序所设的全面美元上限。.

对于兼容 OpenAI 的 SDK,其基础 URL 为 https://api.x.ai/v1 而且凭证仍然是您的 xAI API 密钥。Responses API 使用 输入理由:{ 努力程度:"低" }; “聊天自动补全”功能使用 信息 以及其自身的参数名称。即使两个端点都支持 JSON,将网关请求原样复制到另一个端点时,也可能导致请求失败。.

常见的集成错误与成本控制

  • 401 未经授权: 请检查 Bearer 头、密钥和运行环境。403 错误可能表明存在团队权限或访问限制。重复发送相同的不有效请求并不能解决问题。.
  • 404 未找到:请检查确切的端点和模型 ID。区分无效的 ID 与已记录的已停用 ID(后者仍可通过重定向解析)。.
  • 400 或 422:请验证请求架构和支持的设置。例如,当前的推理文档不支持对推理模型应用“存在性/频率”惩罚和停止设置。.
  • 429 请求过多:将请求加入队列,平滑突发请求,并使用带抖动的有限指数退避算法。同时跟踪 RPS 和 TPM,并将重试次数计入工作负载预算中。.
  • 输出结果异常或状态不完整:请检查响应、推理设置和适用的输出上限。在使用机器可读的输出结果之前,请先对其进行验证;成功的 HTTP 响应并不保证任务质量。.

为了控制成本,请选择能够通过您自身任务测试且价格最低的模型和推理设置;在开始时保持稳定的指令以实现缓存复用;删除无关的历史记录;监控20万字的提示符限制;并限制代理工具循环的次数。仅当该模型支持批处理且任务可以延后处理时,才使用批处理。将优先级视为一项独立的采购决策。.

请保留令牌估算值以供规划,并保留已返回的成本增量值以便进行对账。在汇总大量请求时,请存储整数增量值,并将请求总数与控制台的使用情况及账单进行对比。成本字段缺失表示“未知”,而非零;回复中显示的数值较小,并不意味着账单金额也小。.

关于今日 Grok 4 API 的定价,请根据实际处理请求的模型、提示词的价格区间以及总计费输出量来制定预算。建议先发起一个规模较小的正式请求,检查其使用情况和费用字段,然后根据通过您自身审核的工作负载进行扩展。若要在聊天工作区中探索提示词,, 在 GlobalGPT 上打开 Grok 4.6.

Grok 4 API 定价常见问题解答

Grok 4 API 现在多少钱?

截至2026年9月8日,已停用的grok-4-0709 ID会重定向至Grok 4.3。 当提示词令牌数低于20万时,其每百万美元的费率分别为:输入端$1.25、缓存输入端$0.20以及输出端$2.50。长上下文的费率翻倍。.

原版 Grok 4 API 还有货吗?

原始的 grok-4-0709 模型已于 2026 年 5 月 15 日从 xAI API 中移除。该模型的 ID 仍可解析,但请求将由 Grok 4.3 处理,其推理开销较低,且按替代费率计费。.

Grok 4.6 API 的价格是多少?

Grok 4.6 的费用为:每百万个提示词令牌(低于 200K 提示词令牌时),消耗 $2 的输入、$0.50 的缓存输入和 $6 的输出。 当提示词令牌数达到200K或以上时,消耗率分别为$4、$1和$12。工具调用费及其他适用费用另计。.

推理令牌需要付费吗?

是的。xAI 根据完成率对推理代币进行计费。当推理已包含在报告的输出或完成总量中时,请勿在估算中重复计算。.

缓存的输入是否计入20万阈值?

是的。请将整个提示词(包括缓存的令牌)都计入其中。根据官方定价表,200K个令牌及以上的提示词属于“长上下文”范畴,且该请求中的所有令牌均适用更高的费率。.

订阅聊天服务后,是否会提供免费的 Grok API 配额?

请不要以为聊天订阅包含 xAI API 积分。官方 API 快速入门指南使用的是独立的控制台账户和积分。任何促销活动都必须针对该 API 团队进行验证;面向消费者的免费访问是另一项优惠。.

Grok API 的速率限制有哪些?

限制取决于模型和团队等级。所查阅的 0 级表格中列出了 Grok 4.3(37 RPS 和 10M TPM)以及 Grok 4.6(150 RPS 和 50M TPM)。 请使用您的团队控制台确认适用于您密钥的限制。.

我可以在 GlobalGPT 上使用 Grok 4.6 吗?

是的。GlobalGPT 包含一个经过验证的 Grok 4.6 聊天条目。这属于一个独立的平台工作流;它不会取代 xAI API 密钥、直接 API 计费或您在 xAI 控制台中的控制功能。.

如何查看 xAI 请求的实际费用?

从官方响应中读取 usage.cost_in_usd_ticks,并除以 10,000,000,000 以转换为美元。该字段涵盖了该请求的相关费用,包括代币折扣和服务器端工具的费用。将各请求的费用相加即可追踪整个对话的总费用。.

分享帖子:

相关帖子