Создаете приложение или составляете бюджет для агента? Начните с той модели, которую вы действительно будете использовать. Уведомление о миграции от 15 мая 2026 года говорится, что исходный идентификатор Grok 4 теперь без особых усилий сопоставляется с Grok 4.3. Успешный вызов по старому идентификатору больше не доказывает, что его обслуживала исходная модель.
Использование API тарифицируется отдельно от потребительских подписок Grok. Стоимость подписки и доступа к Grok охватывает тарифные планы на чат; эти ежемесячные платежи не являются кредитами для прямой интеграции с xAI.
Хотите опробовать подсказку, прежде чем интегрировать её в приложение? Попробуйте Grok 4.6 на GlobalGPT для рабочего процесса на основе чата. Используйте ключ API xAI для собственной интеграции и прямого выставления счетов xAI. Эта статья опубликована компанией GlobalGPT; ссылки на продукты содержат код отслеживания рефералов.
Grok 4 Цены по API: текущие тарифы и утративший силу первоначальный вариант
В приведенной ниже таблице используются Цены xAI по прейскуранту, проверенные 8 сентября 2026 года. Каждая сумма указана в долларах США за один миллион токенов. Входные данные, кешированные входные данные и выходные данные относятся к отдельным категориям, за которые взимается плата, поэтому единая совокупная “цена за миллион” скрывает фактическую стоимость обработки данных.
USD за 1 млн токенов · стандартная обработка
grok-4.3
Оригинальный Grok, 4 цели перенаправления
Контекст: 1 000 000 токенов
Подсказка < 200K
- Вход
- $1.25
- Кэшированный ввод
- $0.20
- Результат / обоснование
- $2.50
Подсказка >= 200K
- Вход
- $2.50
- Кэшированный ввод
- $0.40
- Результат / обоснование
- $5.00
grok-4.6
Текущий флагман
Контекст: 500 000 токенов
Подсказка < 200K
- Вход
- $2.00
- Кэшированный ввод
- $0.50
- Результат / обоснование
- $6.00
Подсказка >= 200K
- Вход
- $4.00
- Кэшированный ввод
- $1.00
- Результат / обоснование
- $12.00
grok-4.5
Предыдущая версия текущего поколения
Контекст: 500 000 токенов
Подсказка < 200K
- Вход
- $2.00
- Кэшированный ввод
- $0.30
- Результат / обоснование
- $6.00
Подсказка >= 200K
- Вход
- $4.00
- Кэшированный ввод
- $0.60
- Результат / обоснование
- $12.00
Как только объем запроса достигает 200 тыс. токенов, тарифы на обработку длинных контекстов начинают применяться ко всем токенам в данном запросе, включая выходные данные.
Другие указанные идентификаторы семейства Grok 4 включают: grok-4.20-0309-reasoning, grok-4.20-0309-без-вывода и grok-4.20-multi-agent-0309. Каждый из них имеет контекстное окно размером 1 млн токенов и те же коэффициенты коротких/длинных токенов, что и в Grok 4.3. Соответствующая удельная цена не означает соответствия общего потребления токенов, особенно при работе с несколькими агентами.
Если вам нужен вариант, ориентированный на программирование, grok-build-0.1 имеет контекстное окно объёмом 256K, а скорости ввода/кэширования/вывода с коротким контекстом составляют $1.00/$0.20/$2.00, которые увеличиваются до $2,00/$0,40/$4,00 при пороговом значении подсказки 200K. Более подробную информацию о поведении системы и сценариях использования см. в нашем Обзор Grok 4.6.

А что стало с первоначальной ценой на модели $3 / $15?
Более старые источники, в том числе наши Руководство по интеграции Grok 4 API, котировка $3 за миллион входных токенов и $15 за миллион выходных токенов для исходного Grok 4. Рассматривайте это как историческую котировку, а не как сегодняшний счет по выведенному из обращения идентификатору. Старый официальный URL модели теперь ведёт в общий каталог моделей, поэтому это не является недавно подтверждённым архивным прайс-листом.
Сайт оригинальное объявление Grok 4 описывает контекстное окно размером 256 000 токенов. Эта историческая емкость, а также старые цены или пороговые значения модели Fast не должны копироваться в бюджет на замену. Точное правило для grok-4-0709 теперь составляет Grok 4.3 с низкой степенью сложности рассуждений; оплата производится по тарифам Grok 4.3.

Grok 4 — это название поколения моделей, тогда как Grok — это также название потребительского продукта. Наш объяснение того, что такое Grok 4 содержит эту справочную информацию о продукте. При создании нового кода следует явно выбирать поддерживаемую модель, а не полагаться на перенаправление при снятии с производства или исходить из того, что псевдоним поставщика останется неизменным.
Как ввод данных, кэшированные данные и логические выводы влияют на законопроект
Один запрос, три символических списания
Некешированные входные данные
(I – C) × скорость подачи
I = все токены подсказки; C = токены подсказки из кэша.
Кэшированный ввод
C × частота кэша
Кэшированные токены являются частью входных данных, а не дополнительными входными данными.
Объем работ, подлежащих оплате
O × скорость выхода
O учитывает логику, когда конечная точка сообщает об этом в выводе.
Расчетная стоимость токена в долларах США = [(I – C) × ставка за ввод данных + C × ставка за кэшированный ввод + O × ставка за вывод данных] / 1 000 000. Затем добавьте соответствующие расходы на инструменты, хранение или прочие расходы. Перед выполнением вычислений выберите тарифы с учетом длительного контекста, используя запрос на общую сумму, включая токены из кэша.
Входные данные включают сообщения, инструкции и историю диалога, отправленные модели. При кэшировании для всех запросов повторно используется один и тот же начальный префикс; этот процесс происходит автоматически, и xAI рекомендует использовать идентификатор диалога для более эффективного повторного использования. Наличие внешне похожего запроса не гарантирует попадания в кэш. Документация по кэшированию подсказок объясняет, как происходит сопоставление.
В разделе «Автозаполнение в чате» прочитайте prompt_tokens_details.cached_tokens; в разделе «Ответы» читайте: input_tokens_details.cached_tokens. . Справочник по использованию кэша и ценам счета, учитывающие токены за логические выводы по полной ставке. Если в итоговой сумме вывода уже учтены логические выводы, добавление tokenы_рассуждений это снова привело бы к двойному учету.
Версия Grok 4.6 поддерживает уровни сложности вывода «низкий», «средний», «высокий» и «очень высокий»; по умолчанию задокументированным значением является «высокий», и вывод отключить невозможно. Версия Grok 4.3 поддерживает уровни «отсутствует», «низкий», «средний» и «высокий». Поэтому версия Grok 4.3 с уровнем «none» заслуживает внимания для задач строгого извлечения, в то время как версия Grok 4.6 может затрачивать больше токенов даже при коротком видимом ответе. См. параметры логики и запись о модели Grok 4.3, приведенную выше.
Вызовы инструментов, пакетная обработка и запросы с приоритетом
Согласно официальный прайс-лист на инструменты, «Веб-поиск», «X-поиск» и «Выполнение кода» стоят $5 за каждую 1 000 запросов, или $0,005 за один запрос, плюс расход токенов. Один запрос может вызывать инструменты более одного раза. Десять запросов на поиск добавляют $0.05 до токенов модели; включение инструмента не указывает, сколько раз он будет использован.
Поиск по вложениям файлов стоит $10 за 1 000 запросов; поиск по коллекциям — $2,50 за 1 000. За хранение и скачивание файлов и коллекций также взимается ежедневная плата. Для изображений и видео используются собственные единицы измерения стоимости, поэтому их следует исключать из расчёта токенов, относящегося только к тексту. Наш Руководство по рабочему процессу с изображениями и видео в Grok покрывает этот отдельный маршрут генерации.
Сайт Пакетный API предусматривает скидку в размере 20% токенов для версии Grok 4.3 и трёх указанных вариантов версии Grok 4.20. Скидка распространяется на токены ввода, кэшированного ввода, вывода и вывода заключений. На странице модели Grok 4.6 указано, что Batch API не поддерживается. Не применяйте общую скидку 50% и не предполагайте, что каждая перечисленная модель поддерживает пакетную обработку.
Приоритетная обработка стоит в 2 раза дороже стандартной стоимости токенов, включая токены кэширования и рассуждений, когда возвращаемый уровень_обслуживания подтверждает приоритет. При переходе на уровень по умолчанию применяются стандартные тарифы. Приоритет распространяется на завершение чатов и ответы, но не на пакетный API.
Три наглядных примера расчета стоимости API
Это ориентировочные цены по прейскуранту, а не фактические суммы счетов. Все приведенные ниже запросы обрабатываются по стандартной схеме: только текст, без использования инструментов, без хранения данных, без повторных попыток и без учета налогов. “Результат” включает в себя любую часть, подлежащую оплате. Первые две рабочие нагрузки предполагают длину запросов менее 200 тыс. токенов.
Стоимость одного запроса и 10 000 запросов
Grok 4,3 · без кэша
$0.005 / запрос
2 000 входов × $1.25 + 1 000 выходов × $2.50, деленное на 1 млн. 10 000 запросов = $50.
Grok 4,6 · без кэша
$0.010 / запрос
2 000 входов × $2 + 1 000 выходов × $6, деленное на 1 млн. 10 000 запросов = $100.
Grok 4,6 · 90% — данные ввода кэшированы
$0.0073 / запрос
200 без кэширования × $2 + 1 800 с кэшированием × $0,50 + 1 000 на выходе × $6, деленное на 1 млн. 10 000 запросов = $73.
Высокий коэффициент попадания в кэш наиболее эффективен в тех случаях, когда основную часть рабочей нагрузки составляет ввод данных. В примере Grok 4.6 кэширование экономит $0.0027 на каждый вызов, или 27% от общего объема, даже несмотря на то, что в кэше находится 90% входных токенов. Нагрузка на вывод остается на уровне $0.006. Оценивайте экономию по отношению ко всему запросу, а не только к кэшированной части.
Пороговое значение запроса в 200K может изменить весь запрос
Еще один входной токен превысил ценовой порог
199 999 токенов «prompt»
$0.459998
Grok 4.6: (199 999 × $2 + 10 000 выходных данных × $6) / 1M. Без кэша.
200 000 токенов «prompt»
$0.920000
Grok 4.6: (200 000 × $4 + 10 000 выходов × $12) / 1M. Без кэша.
Основной В таблице цен явно указано: “Длинный контекст >= 200 тыс. токенов” и указывает, что для всех токенов будет применяться более высокий тариф, как только показатель достигнет порогового значения. В описании модели указано, что показатель “превышает” 200 тыс. При составлении бюджета ровно на 200 000 используйте четко указанный порог из таблицы цен; не следует полагать, что по-прежнему действует более низкий тариф.
Для составления ежемесячного прогноза оцените объем запросов отдельно для каждой рабочей нагрузки, диапазона контекста, схемы попаданий в кэш и настройки логики. Добавьте ожидаемое количество повторных попыток и вызовов инструмента. Затем сравните эту оценку с вашими собственными данными о затратах, полученными по итогам небольшого пилотного проекта. Показатель «центы за вызов» имеет смысл только в том случае, если лежащие в его основе допущения соответствуют реальным условиям эксплуатации.
Контекст, выходные данные, ограничения скорости и лимиты расходов — это разные понятия
Четыре ограничения, которые необходимо проверить перед масштабированием
Окно контекста
По запросу
Grok 4.3: 1 млн токенов. Grok 4.6: 500 тыс. Это не ежемесячный лимит.
Бюджет на выплаты
За каждый ответ
Установите допустимую мощность выхода. Номинальная мощность не гарантирует столь значительного видимого выхода.
RPS / TPM
Пропускная способность
Количество запросов в секунду и токенов в минуту. Оба показателя должны укладываться в лимит, установленный для уровня команды.
Контроль расходов
Деньги
Лимиты по балансу предоплаты, автоматическому пополнению и выставлению счетов определяют различные режимы пополнения счета.
Общественность таблица ограничений скорости В таблице для модели Grok 4.3 указаны показатели уровня 0: 37 запросов в секунду и 10 миллионов токенов в минуту; для модели Grok 4.6 указаны показатели: 150 запросов в секунду и 50 миллионов токенов в минуту. Это устаревшие данные о уровнях, опубликованные ранее, а не гарантия того, что каждый ключ обладает одинаковой полезной пропускной способностью. Консоль вашей команды является авторитетным источником информации о доступе и ограничениях для текущей модели.
Уровни определяются на основе совокупных расходов на API с 1 января 2026 года: $0, $50, $250, $1 000 и $5 000 для уровней с 0 по 4. Ограничение количества запросов в секунду осуществляется путем деления минутного лимита запросов на 60, поэтому вы не можете использовать весь лимит за одну минуту за один раз. Токены ввода, вывода, вывода заключений и кэшированные токены учитываются при подсчете TPM, даже если стоимость некоторых из них ниже.
На проверенных страницах моделей Grok 4.3 и 4.6 приведены размеры контекста без указания отдельного максимального значения выходной мощности. Текущие Справочник по конечным точкам ответов определяет max_output_tokens в качестве совокупного бюджета на вывод и рассуждения: по умолчанию он равен 128 000, если не задан, и допускает более высокое значение для более длинных поколений. Это значение по умолчанию не гарантирует 128 000 видимых токенов ответа или неограниченный объем контекста. Задайте явный бюджет и проанализируйте неполные ответы.
Документация по выставлению счетов xAI разделяет предоплаченные средства и ежемесячное выставление счетов, которое по умолчанию отключено. Функция автоматического пополнения позволяет пополнять предоплаченные средства и имеет собственные пороговые значения и ежемесячный лимит. Лимит по выставлению счетов регулирует использование услуг по постоплате; это не то же самое, что единый общий лимит на покупки, пополнения и запросы в рамках предоплаты.
При первой интеграции начните с небольшой суммы на счете и внимательно проверьте все настройки автоматического пополнения. Для повседневного доступа к чату без написания кода интеграции можно использовать отдельный Руководство по использованию Grok охватывает весь рабочий процесс продукта. У подписки на чат и у команды API предусмотрены разные средства управления.
Две реальные задачи Grok 4.6: что показывают данные об использовании
Мы повторно использовали два завершенных теста от 7 сентября 2026 года через API агрегации Broly по адресу https://anywhere.broly.ai/v1, с помощью функции автодополнения в чате. Как запрошенные, так и возвращенные grok-4.6; идентичность модели выше по цепочке не была подтверждена независимо. Это результаты тестирования шлюза Grok 4.6, а не результаты исходных тестов Grok 4 или сравнение различных моделей.
Каждая задача выполнялась один раз с температура=0, max_tokens=2048 и stream=false. Никаких инструментов или явно заданных параметров для рассуждений не передавалось. Для обоих запросов использовалась одна и та же системная инструкция:
