Ingin membuat aplikasi atau menyusun anggaran untuk agen? Mulailah dengan model yang benar-benar akan Anda jalankan. Yang Pemberitahuan migrasi tanggal 15 Mei 2026 disebutkan bahwa ID asli Grok 4 kini dipetakan ke Grok 4.3 dengan upaya penalaran yang minimal. Panggilan yang berhasil ke ID lama tidak lagi membuktikan bahwa model aslinya yang melayaninya.
Penggunaan API dihitung secara terpisah dari langganan konsumen Grok. Harga langganan dan akses Grok mencakup paket obrolan; biaya bulanan tersebut bukanlah kredit simbolis untuk integrasi langsung dengan xAI.
Ingin mencoba prompt sebelum mengintegrasikannya ke dalam aplikasi? Coba Grok 4,6 pada GlobalGPT untuk alur kerja berbasis obrolan. Gunakan kunci API xAI untuk integrasi Anda sendiri dan penagihan langsung melalui xAI. Artikel ini diterbitkan oleh GlobalGPT; tautan produk menggunakan sistem pelacakan rujukan.
Grok 4 Harga API: tarif saat ini dan tarif asli yang sudah tidak berlaku lagi
Tabel di bawah ini menggunakan Harga katalog xAI yang diperiksa pada 8 September 2026. Setiap jumlah dinyatakan dalam USD per satu juta token. Input, input yang disimpan dalam cache, dan output merupakan kategori penagihan yang terpisah, sehingga “harga per juta” gabungan tunggal tersebut menyembunyikan biaya beban kerja yang sebenarnya.
USD per 1 juta token · pemrosesan standar
grok-4.3
Target pengalihan Grok 4 yang asli
Konteks: 1.000.000 token
Prompt < 200 ribu
- Masukan
- $1.25
- Masukan yang disimpan dalam cache
- $0.20
- Hasil / penalaran
- $2.50
Prompt >= 200K
- Masukan
- $2.50
- Masukan yang disimpan dalam cache
- $0.40
- Hasil / penalaran
- $5.00
grok-4.6
Unggulan saat ini
Konteks: 500.000 token
Prompt < 200 ribu
- Masukan
- $2.00
- Masukan yang disimpan dalam cache
- $0.50
- Hasil / penalaran
- $6.00
Prompt >= 200K
- Masukan
- $4.00
- Masukan yang disimpan dalam cache
- $1.00
- Hasil / penalaran
- $12.00
grok-4.5
Pilihan generasi saat ini yang lebih lama
Konteks: 500.000 token
Prompt < 200 ribu
- Masukan
- $2.00
- Masukan yang disimpan dalam cache
- $0.30
- Hasil / penalaran
- $6.00
Prompt >= 200K
- Masukan
- $4.00
- Masukan yang disimpan dalam cache
- $0.60
- Hasil / penalaran
- $12.00
Begitu prompt mencapai 200 ribu token, tarif konteks panjang akan berlaku untuk semua token dalam permintaan tersebut, termasuk hasilnya.
ID keluarga 4 Grok lainnya yang tercantum adalah grok-4.20-0309-penalaran, grok-4.20-0309-tanpa-penalaran dan grok-4.20-multi-agen-0309. Masing-masing memiliki jendela konteks sebesar 1 juta token dan tingkat token pendek/panjang yang tercantum sama seperti pada Grok 4.3. Harga satuan yang sama tidak berarti konsumsi token total yang sama, terutama untuk pekerjaan multi-agen.
Untuk alternatif yang khusus untuk pemrograman, grok-build-0.1 memiliki jendela konteks sebesar 256K dan laju masukan/cache/keluaran konteks pendek sebesar $1.00/$0.20/$2.00, meningkat menjadi $2.00/$0.40/$4.00 pada ambang batas prompt 200K. Untuk perilaku dan kasus penggunaan yang lebih luas, lihat Ulasan Grok 4.6.

Bagaimana dengan harga asli $3 / $15?
Referensi yang lebih lama, termasuk milik kami Grok 4 Panduan Integrasi API, harga $3 per juta token masukan dan $15 per juta token keluaran untuk model asli Grok 4. Anggaplah itu sebagai harga historis, bukan tagihan hari ini untuk ID yang sudah tidak berlaku. URL model resmi yang lama kini mengarah ke katalog model umum, sehingga ini bukanlah lembar harga arsip yang baru diverifikasi.
The pengumuman asli Grok 4 menjelaskan jendela konteks berukuran 256.000 token. Kapasitas historis tersebut, serta harga atau ambang batas model Fast yang lebih lama, tidak boleh dimasukkan ke dalam anggaran untuk penggantian tersebut. Aturan yang tepat untuk grok-4-0709 sekarang menjadi Grok 4.3 dengan tingkat upaya penalaran rendah, dan ditagih sesuai tarif Grok 4.3.

Grok 4 merupakan generasi model, sedangkan Grok juga merupakan nama produk konsumen. Kami penjelasan mengenai apa itu Grok 4 memberikan informasi latar belakang produk tersebut. Untuk kode baru, pilihlah model yang didukung secara eksplisit, alih-alih mengandalkan pengalihan akibat penghentian dukungan atau berasumsi bahwa alias penyedia akan tetap sama.
Bagaimana masukan, masukan yang tersimpan dalam cache, dan penalaran memengaruhi tagihan
Satu permintaan, tiga kali penagihan simbolis
Masukan yang tidak disimpan dalam cache
(I – C) × laju masukan
I = semua token prompt; C = token prompt yang disimpan dalam cache.
Masukan yang disimpan dalam cache
C × laju cache
Token yang disimpan dalam cache merupakan bagian dari input, bukan input tambahan.
Hasil yang dapat ditagih
O × laju keluaran
O mencakup penalaran ketika titik akhir melaporkannya di dalam keluaran.
Perkiraan jumlah token dalam USD = [(I – C) × laju input + C × laju input yang disimpan dalam cache + O × laju output] / 1.000.000. Kemudian tambahkan biaya alat, penyimpanan, atau biaya lain yang berlaku. Pilih tarif konteks panjang menggunakan prompt total, termasuk token yang tersimpan dalam cache, sebelum melakukan perhitungan.
Input mencakup pesan, instruksi, dan riwayat percakapan yang dikirimkan ke model. Penyimpanan dalam cache menggunakan kembali awalan awal yang sama di seluruh permintaan; proses ini berlangsung secara otomatis, dan xAI merekomendasikan penggunaan pengenal percakapan untuk meningkatkan pemanfaatan ulang. Prompt yang tampak serupa tidak menjamin terjadinya cache hit. Hal ini dokumentasi penyimpanan sementara prompt menjelaskan pola pencocokan tersebut.
Di bagian "Penyelesaian Obrolan", baca prompt_tokens_details.token_yang_disimpan_dalam_cache; di bagian Tanggapan, baca input_tokens_details.token_yang_tersimpan_di_cache. The panduan penggunaan cache dan harga tagihan token penalaran dengan tingkat penyelesaian penuh. Jika total keluaran sudah mencakup penalaran, penambahan token_penalaran Lagi-lagi hal itu akan menyebabkan penghitungan ganda.
Grok 4.6 mendukung tingkat upaya penalaran rendah, sedang, tinggi, dan sangat tinggi; pengaturan default yang tercantum adalah tinggi, dan fungsi penalaran tidak dapat dinonaktifkan. Grok 4.3 mendukung tidak ada, rendah, sedang, dan tinggi. Hal ini membuat Grok 4.3 dengan tingkat "none" layak dievaluasi untuk tugas ekstraksi yang ketat, sementara Grok 4.6 mungkin menggunakan lebih banyak token meskipun jawaban yang terlihat singkat. Lihat pengaturan penalaran dan entri model Grok 4.3 di atas.
Panggilan alat, pekerjaan batch, dan permintaan prioritas
Sesuai dengan daftar harga alat resmi, Pencarian Web, Pencarian X, dan Eksekusi Kode masing-masing dikenakan biaya $5 per 1.000 panggilan, atau $0,005 per panggilan, ditambah konsumsi token. Sebuah permintaan dapat memanggil alat-alat tersebut lebih dari sekali. Sepuluh panggilan pencarian menambah $0,05 sebelum token model; mengaktifkan suatu alat tidak menunjukkan berapa kali alat tersebut akan digunakan.
Biaya pencarian lampiran berkas sebesar $10 per 1.000 panggilan; biaya pencarian koleksi sebesar $2,50 per 1.000. Berkas dan koleksi yang disimpan juga dikenakan biaya penyimpanan dan unduhan harian. Gambar dan video menggunakan satuan harga tersendiri, jadi jangan sertakan keduanya dalam perkiraan token teks saja. Kami Tutorial alur kerja gambar dan video Grok mencakup jalur pembangkitan listrik yang terpisah tersebut.
The Antrian API menawarkan diskon token sebesar 20% untuk Grok 4.3 dan ketiga varian Grok 4.20 yang tercantum. Diskon ini mencakup token input, input yang disimpan dalam cache, output, dan penalaran. Halaman model Grok 4.6 menandai Batch API sebagai fitur yang tidak didukung. Jangan menerapkan diskon 50% secara seragam atau menganggap bahwa setiap model yang tercantum mendukung pemrosesan batch.
Pemrosesan prioritas biayanya 2 kali lipat dari tarif token standar, termasuk token cache dan token penalaran, ketika hasil yang dikembalikan tingkat_layanan menegaskan prioritas. Jika beralih ke tingkatan default, tarif standar akan berlaku. Prioritas berlaku untuk Penyelesaian Obrolan dan Tanggapan, bukan API Batch.
Tiga contoh biaya API yang transparan
Ini adalah perkiraan harga katalog, bukan faktur yang sebenarnya. Semua permintaan di bawah ini menggunakan proses standar, hanya teks, tanpa alat bantu, tanpa penyimpanan, tanpa upaya ulang, dan tanpa pajak. “Hasil” mencakup semua alasan yang dapat ditagih. Dua beban kerja pertama mengasumsikan prompt di bawah 200 ribu token.
Biaya per permintaan dan per 10.000 permintaan
Grok 4,3 · tanpa cache
$0.005 / permintaan
2.000 input × $1.25 + 1.000 output × $2.50, dibagi 1M. 10.000 permintaan = $50.
Grok 4,6 · tanpa cache
$0.010 / permintaan
2.000 input × $2 + 1.000 output × $6, dibagi 1M. 10.000 permintaan = $100.
Grok 4,6 · 90% disimpan dalam cache
$0.0073 / permintaan
200 yang tidak disimpan dalam cache × $2 + 1.800 yang disimpan dalam cache × $0,50 + 1.000 keluaran × $6, dibagi 1M. 10.000 permintaan = $73.
Tingkat cache-hit yang tinggi paling bermanfaat ketika input mendominasi beban kerja. Dalam contoh Grok 4.6 tersebut, caching menghemat $0.0027 per panggilan, atau 27% dari total, meskipun 90% token input disimpan dalam cache. Biaya output tetap pada $0.006. Nilai penghematan berdasarkan keseluruhan permintaan, bukan hanya bagian yang disimpan dalam cache.
Ambang batas prompt sebesar 200K dapat mengubah seluruh permintaan
Satu token input lagi melampaui ambang batas harga
199.999 token prompt
$0.459998
Grok 4.6: (199.999 × $2 + 10.000 keluaran × $6) / 1M. Tanpa cache.
200.000 token prompt
$0.920000
Grok 4.6: (200.000 × $4 + 10.000 keluaran × $12) / 1M. Tanpa cache.
Yang utama Tabel harga secara eksplisit menggunakan frasa “Konteks panjang >= 200 ribu token” dan menyebutkan bahwa semua token akan dikenakan tarif yang lebih tinggi begitu prompt mencapai ambang batas. Sebagian teks detail model menyebutkan “melebihi” 200K. Untuk penganggaran tepat sebesar 200.000, gunakan batas tabel harga yang tercantum secara eksplisit; jangan berasumsi bahwa tarif yang lebih murah masih berlaku.
Untuk perkiraan bulanan, hitunglah volume permintaan secara terpisah untuk setiap beban kerja, rentang konteks, pola cache-hit, dan pengaturan penalaran. Tambahkan perkiraan jumlah percobaan ulang dan pemanggilan alat. Kemudian bandingkan perkiraan tersebut dengan data biaya yang Anda peroleh sendiri setelah uji coba skala kecil. Angka dalam satuan sen per panggilan hanya berguna jika asumsi yang mendasarinya sesuai dengan kondisi produksi.
Konteks, hasil, batas laju, dan batas pengeluaran adalah hal yang berbeda
Empat batasan yang perlu diperiksa sebelum melakukan penskalaan
Jendela konteks
Sesuai permintaan
Grok 4.3: 1 juta token. Grok 4.6: 500 ribu. Ini bukanlah kuota bulanan.
Anggaran keluaran
Per tanggapan
Tentukan batas keluaran yang didukung. Kapasitas konteks tidak menjamin keluaran yang terlihat sebanyak itu.
RPS / TPM
Laju pengolahan
Permintaan per detik dan token per menit. Keduanya harus tetap berada dalam batas tingkat tim.
Pengendalian pengeluaran
Uang
Saldo prabayar, pengisian ulang otomatis, dan batas tagihan berdasarkan faktur mengatur pola pengisian saldo secara terpisah.
Masyarakat tabel pembatasan laju Tingkat 0 tercantum dengan 37 permintaan per detik dan 10 juta token per menit untuk Grok 4.3; sedangkan Grok 4.6 tercantum dengan 150 permintaan per detik dan 50 juta token per menit. Ini adalah entri tingkatan yang diterbitkan berdasarkan tanggal, bukan jaminan bahwa setiap kunci memiliki kapasitas yang dapat digunakan yang sama. Konsol tim Anda adalah sumber informasi resmi mengenai akses dan batasan model saat ini.
Tingkat keanggotaan ditentukan berdasarkan total pengeluaran API sejak 1 Januari 2026: $0, $50, $250, $1.000, dan $5.000 untuk Tingkat 0 hingga 4. Permintaan dibatasi per detik menggunakan anggaran permintaan per menit yang dibagi 60, sehingga Anda tidak dapat menghabiskan alokasi satu menit penuh dalam satu kali permintaan. Token input, output, penalaran, dan yang disimpan dalam cache semuanya dihitung dalam TPM, meskipun beberapa di antaranya biayanya lebih rendah.
Halaman model Grok 4.3 dan 4.6 yang telah dicentang mencantumkan ukuran konteks tanpa angka keluaran maksimum yang ditetapkan secara tegas. Saat ini Referensi titik akhir respons mendefinisikan max_output_token sebagai anggaran gabungan untuk output dan penalaran: nilainya secara default adalah 128.000 jika tidak ditentukan, dan dapat diatur ke nilai yang lebih besar untuk menghasilkan generasi yang lebih panjang. Nilai default tersebut tidak menjamin adanya 128.000 token jawaban yang terlihat atau kuota konteks yang tak terbatas. Tetapkan anggaran secara eksplisit dan periksa respons yang belum lengkap.
Dokumentasi penagihan xAI memisahkan pulsa prabayar dari penagihan bulanan, yang dinonaktifkan secara default. Fitur isi ulang otomatis dapat mengisi ulang pulsa prabayar dan memiliki batas serta kuota bulanan tersendiri. Batas penagihan bulanan mengatur penggunaan pascabayar; hal ini berbeda dengan batas tunggal yang mencakup semua pembelian, isi ulang, dan permintaan pada layanan prabayar.
Untuk integrasi pertama Anda, mulailah dengan saldo prabayar dalam jumlah terbatas dan periksa dengan cermat setiap pengaturan pengisian ulang otomatis. Untuk mengakses obrolan sehari-hari tanpa perlu membuat integrasi, gunakan fitur terpisah Panduan Cara Menggunakan Grok mencakup alur kerja produk. Langganan obrolan dan tim API memiliki pengaturan yang berbeda.
Dua tugas Grok 4.6 yang sebenarnya: apa yang terungkap dari catatan penggunaannya
Kami menggunakan kembali dua tes yang telah selesai dari tanggal 7 September 2026 melalui API agregasi Broly di https://anywhere.broly.ai/v1, dengan menggunakan fitur Pelengkapan Obrolan. Baik yang diminta maupun yang dikembalikan grok-4.6; keabsahan model hulu tersebut belum diverifikasi secara independen. Ini adalah hasil pengujian gateway Grok 4.6, bukan hasil pengujian Grok 4 asli atau perbandingan antar model.
Setiap tugas dijalankan satu kali dengan suhu=0, max_tokens=2048 dan stream=false. Tidak ada alat maupun pengaturan upaya penalaran eksplisit yang dikirimkan. Instruksi sistem yang sama digunakan untuk kedua permintaan tersebut:
