Grok 4 Harga API: Biaya, Batasan, dan Cara Memulainya

Ingin membuat aplikasi atau menyusun anggaran untuk agen? Mulailah dengan model yang benar-benar akan Anda jalankan. Yang Pemberitahuan migrasi tanggal 15 Mei 2026 disebutkan bahwa ID asli Grok 4 kini dipetakan ke Grok 4.3 dengan upaya penalaran yang minimal. Panggilan yang berhasil ke ID lama tidak lagi membuktikan bahwa model aslinya yang melayaninya.

Penggunaan API dihitung secara terpisah dari langganan konsumen Grok. Harga langganan dan akses Grok mencakup paket obrolan; biaya bulanan tersebut bukanlah kredit simbolis untuk integrasi langsung dengan xAI.

Ingin mencoba prompt sebelum mengintegrasikannya ke dalam aplikasi? Coba Grok 4,6 pada GlobalGPT untuk alur kerja berbasis obrolan. Gunakan kunci API xAI untuk integrasi Anda sendiri dan penagihan langsung melalui xAI. Artikel ini diterbitkan oleh GlobalGPT; tautan produk menggunakan sistem pelacakan rujukan.

Grok 4 Harga API: tarif saat ini dan tarif asli yang sudah tidak berlaku lagi

Tabel di bawah ini menggunakan Harga katalog xAI yang diperiksa pada 8 September 2026. Setiap jumlah dinyatakan dalam USD per satu juta token. Input, input yang disimpan dalam cache, dan output merupakan kategori penagihan yang terpisah, sehingga “harga per juta” gabungan tunggal tersebut menyembunyikan biaya beban kerja yang sebenarnya.

USD per 1 juta token · pemrosesan standar

grok-4.3

Target pengalihan Grok 4 yang asli

Konteks: 1.000.000 token

Prompt < 200 ribu

Masukan
$1.25
Masukan yang disimpan dalam cache
$0.20
Hasil / penalaran
$2.50

Prompt >= 200K

Masukan
$2.50
Masukan yang disimpan dalam cache
$0.40
Hasil / penalaran
$5.00

grok-4.6

Unggulan saat ini

Konteks: 500.000 token

Prompt < 200 ribu

Masukan
$2.00
Masukan yang disimpan dalam cache
$0.50
Hasil / penalaran
$6.00

Prompt >= 200K

Masukan
$4.00
Masukan yang disimpan dalam cache
$1.00
Hasil / penalaran
$12.00

grok-4.5

Pilihan generasi saat ini yang lebih lama

Konteks: 500.000 token

Prompt < 200 ribu

Masukan
$2.00
Masukan yang disimpan dalam cache
$0.30
Hasil / penalaran
$6.00

Prompt >= 200K

Masukan
$4.00
Masukan yang disimpan dalam cache
$0.60
Hasil / penalaran
$12.00

Begitu prompt mencapai 200 ribu token, tarif konteks panjang akan berlaku untuk semua token dalam permintaan tersebut, termasuk hasilnya.

ID keluarga 4 Grok lainnya yang tercantum adalah grok-4.20-0309-penalaran, grok-4.20-0309-tanpa-penalaran dan grok-4.20-multi-agen-0309. Masing-masing memiliki jendela konteks sebesar 1 juta token dan tingkat token pendek/panjang yang tercantum sama seperti pada Grok 4.3. Harga satuan yang sama tidak berarti konsumsi token total yang sama, terutama untuk pekerjaan multi-agen.

Untuk alternatif yang khusus untuk pemrograman, grok-build-0.1 memiliki jendela konteks sebesar 256K dan laju masukan/cache/keluaran konteks pendek sebesar $1.00/$0.20/$2.00, meningkat menjadi $2.00/$0.40/$4.00 pada ambang batas prompt 200K. Untuk perilaku dan kasus penggunaan yang lebih luas, lihat Ulasan Grok 4.6.

Dokumentasi resmi xAI yang mencantumkan Grok 4.6, ID modelnya, konteks 500 ribu, dan kemampuan penalaran yang dapat dikonfigurasi.
Katalog resmi model xAI, diambil pada 7 September dan diperiksa kembali pada 8 September 2026. Judul $2/$6 adalah harga input/output konteks pendek Grok 4,6; tarif cache dan konteks panjang tercantum di atas.

Bagaimana dengan harga asli $3 / $15?

Referensi yang lebih lama, termasuk milik kami Grok 4 Panduan Integrasi API, harga $3 per juta token masukan dan $15 per juta token keluaran untuk model asli Grok 4. Anggaplah itu sebagai harga historis, bukan tagihan hari ini untuk ID yang sudah tidak berlaku. URL model resmi yang lama kini mengarah ke katalog model umum, sehingga ini bukanlah lembar harga arsip yang baru diverifikasi.

The pengumuman asli Grok 4 menjelaskan jendela konteks berukuran 256.000 token. Kapasitas historis tersebut, serta harga atau ambang batas model Fast yang lebih lama, tidak boleh dimasukkan ke dalam anggaran untuk penggantian tersebut. Aturan yang tepat untuk grok-4-0709 sekarang menjadi Grok 4.3 dengan tingkat upaya penalaran rendah, dan ditagih sesuai tarif Grok 4.3.

Pemberitahuan resmi mengenai penghentian layanan yang mencantumkan grok-4-0709 beserta pengalihan ke grok-4.3
Pemberitahuan Pensiun xAI, diambil pada 7 September 2026; teks diperiksa kembali pada 8 September. Pengalihan ID asli Grok 4 yang tercantum mengarah ke Grok 4.3. Pemberitahuan lengkap tersebut secara terpisah menyebutkan pengecualian untuk model pengkodean dan model gambar.

Grok 4 merupakan generasi model, sedangkan Grok juga merupakan nama produk konsumen. Kami penjelasan mengenai apa itu Grok 4 memberikan informasi latar belakang produk tersebut. Untuk kode baru, pilihlah model yang didukung secara eksplisit, alih-alih mengandalkan pengalihan akibat penghentian dukungan atau berasumsi bahwa alias penyedia akan tetap sama.

Bagaimana masukan, masukan yang tersimpan dalam cache, dan penalaran memengaruhi tagihan

Satu permintaan, tiga kali penagihan simbolis

Masukan yang tidak disimpan dalam cache

(I – C) × laju masukan

I = semua token prompt; C = token prompt yang disimpan dalam cache.

Masukan yang disimpan dalam cache

C × laju cache

Token yang disimpan dalam cache merupakan bagian dari input, bukan input tambahan.

Hasil yang dapat ditagih

O × laju keluaran

O mencakup penalaran ketika titik akhir melaporkannya di dalam keluaran.

Perkiraan jumlah token dalam USD = [(I – C) × laju input + C × laju input yang disimpan dalam cache + O × laju output] / 1.000.000. Kemudian tambahkan biaya alat, penyimpanan, atau biaya lain yang berlaku. Pilih tarif konteks panjang menggunakan prompt total, termasuk token yang tersimpan dalam cache, sebelum melakukan perhitungan.

Input mencakup pesan, instruksi, dan riwayat percakapan yang dikirimkan ke model. Penyimpanan dalam cache menggunakan kembali awalan awal yang sama di seluruh permintaan; proses ini berlangsung secara otomatis, dan xAI merekomendasikan penggunaan pengenal percakapan untuk meningkatkan pemanfaatan ulang. Prompt yang tampak serupa tidak menjamin terjadinya cache hit. Hal ini dokumentasi penyimpanan sementara prompt menjelaskan pola pencocokan tersebut.

Di bagian "Penyelesaian Obrolan", baca prompt_tokens_details.token_yang_disimpan_dalam_cache; di bagian Tanggapan, baca input_tokens_details.token_yang_tersimpan_di_cache. The panduan penggunaan cache dan harga tagihan token penalaran dengan tingkat penyelesaian penuh. Jika total keluaran sudah mencakup penalaran, penambahan token_penalaran Lagi-lagi hal itu akan menyebabkan penghitungan ganda.

Grok 4.6 mendukung tingkat upaya penalaran rendah, sedang, tinggi, dan sangat tinggi; pengaturan default yang tercantum adalah tinggi, dan fungsi penalaran tidak dapat dinonaktifkan. Grok 4.3 mendukung tidak ada, rendah, sedang, dan tinggi. Hal ini membuat Grok 4.3 dengan tingkat "none" layak dievaluasi untuk tugas ekstraksi yang ketat, sementara Grok 4.6 mungkin menggunakan lebih banyak token meskipun jawaban yang terlihat singkat. Lihat pengaturan penalaran dan entri model Grok 4.3 di atas.

Panggilan alat, pekerjaan batch, dan permintaan prioritas

Sesuai dengan daftar harga alat resmi, Pencarian Web, Pencarian X, dan Eksekusi Kode masing-masing dikenakan biaya $5 per 1.000 panggilan, atau $0,005 per panggilan, ditambah konsumsi token. Sebuah permintaan dapat memanggil alat-alat tersebut lebih dari sekali. Sepuluh panggilan pencarian menambah $0,05 sebelum token model; mengaktifkan suatu alat tidak menunjukkan berapa kali alat tersebut akan digunakan.

Biaya pencarian lampiran berkas sebesar $10 per 1.000 panggilan; biaya pencarian koleksi sebesar $2,50 per 1.000. Berkas dan koleksi yang disimpan juga dikenakan biaya penyimpanan dan unduhan harian. Gambar dan video menggunakan satuan harga tersendiri, jadi jangan sertakan keduanya dalam perkiraan token teks saja. Kami Tutorial alur kerja gambar dan video Grok mencakup jalur pembangkitan listrik yang terpisah tersebut.

The Antrian API menawarkan diskon token sebesar 20% untuk Grok 4.3 dan ketiga varian Grok 4.20 yang tercantum. Diskon ini mencakup token input, input yang disimpan dalam cache, output, dan penalaran. Halaman model Grok 4.6 menandai Batch API sebagai fitur yang tidak didukung. Jangan menerapkan diskon 50% secara seragam atau menganggap bahwa setiap model yang tercantum mendukung pemrosesan batch.

Pemrosesan prioritas biayanya 2 kali lipat dari tarif token standar, termasuk token cache dan token penalaran, ketika hasil yang dikembalikan tingkat_layanan menegaskan prioritas. Jika beralih ke tingkatan default, tarif standar akan berlaku. Prioritas berlaku untuk Penyelesaian Obrolan dan Tanggapan, bukan API Batch.

Tiga contoh biaya API yang transparan

Ini adalah perkiraan harga katalog, bukan faktur yang sebenarnya. Semua permintaan di bawah ini menggunakan proses standar, hanya teks, tanpa alat bantu, tanpa penyimpanan, tanpa upaya ulang, dan tanpa pajak. “Hasil” mencakup semua alasan yang dapat ditagih. Dua beban kerja pertama mengasumsikan prompt di bawah 200 ribu token.

Biaya per permintaan dan per 10.000 permintaan

Grok 4,3 · tanpa cache

$0.005 / permintaan

2.000 input × $1.25 + 1.000 output × $2.50, dibagi 1M. 10.000 permintaan = $50.

Grok 4,6 · tanpa cache

$0.010 / permintaan

2.000 input × $2 + 1.000 output × $6, dibagi 1M. 10.000 permintaan = $100.

Grok 4,6 · 90% disimpan dalam cache

$0.0073 / permintaan

200 yang tidak disimpan dalam cache × $2 + 1.800 yang disimpan dalam cache × $0,50 + 1.000 keluaran × $6, dibagi 1M. 10.000 permintaan = $73.

Tingkat cache-hit yang tinggi paling bermanfaat ketika input mendominasi beban kerja. Dalam contoh Grok 4.6 tersebut, caching menghemat $0.0027 per panggilan, atau 27% dari total, meskipun 90% token input disimpan dalam cache. Biaya output tetap pada $0.006. Nilai penghematan berdasarkan keseluruhan permintaan, bukan hanya bagian yang disimpan dalam cache.

Ambang batas prompt sebesar 200K dapat mengubah seluruh permintaan

Satu token input lagi melampaui ambang batas harga

199.999 token prompt

$0.459998

Grok 4.6: (199.999 × $2 + 10.000 keluaran × $6) / 1M. Tanpa cache.

200.000 token prompt

$0.920000

Grok 4.6: (200.000 × $4 + 10.000 keluaran × $12) / 1M. Tanpa cache.

Yang utama Tabel harga secara eksplisit menggunakan frasa “Konteks panjang >= 200 ribu token” dan menyebutkan bahwa semua token akan dikenakan tarif yang lebih tinggi begitu prompt mencapai ambang batas. Sebagian teks detail model menyebutkan “melebihi” 200K. Untuk penganggaran tepat sebesar 200.000, gunakan batas tabel harga yang tercantum secara eksplisit; jangan berasumsi bahwa tarif yang lebih murah masih berlaku.

Untuk perkiraan bulanan, hitunglah volume permintaan secara terpisah untuk setiap beban kerja, rentang konteks, pola cache-hit, dan pengaturan penalaran. Tambahkan perkiraan jumlah percobaan ulang dan pemanggilan alat. Kemudian bandingkan perkiraan tersebut dengan data biaya yang Anda peroleh sendiri setelah uji coba skala kecil. Angka dalam satuan sen per panggilan hanya berguna jika asumsi yang mendasarinya sesuai dengan kondisi produksi.

Konteks, hasil, batas laju, dan batas pengeluaran adalah hal yang berbeda

Empat batasan yang perlu diperiksa sebelum melakukan penskalaan

Jendela konteks

Sesuai permintaan

Grok 4.3: 1 juta token. Grok 4.6: 500 ribu. Ini bukanlah kuota bulanan.

Anggaran keluaran

Per tanggapan

Tentukan batas keluaran yang didukung. Kapasitas konteks tidak menjamin keluaran yang terlihat sebanyak itu.

RPS / TPM

Laju pengolahan

Permintaan per detik dan token per menit. Keduanya harus tetap berada dalam batas tingkat tim.

Pengendalian pengeluaran

Uang

Saldo prabayar, pengisian ulang otomatis, dan batas tagihan berdasarkan faktur mengatur pola pengisian saldo secara terpisah.

Masyarakat tabel pembatasan laju Tingkat 0 tercantum dengan 37 permintaan per detik dan 10 juta token per menit untuk Grok 4.3; sedangkan Grok 4.6 tercantum dengan 150 permintaan per detik dan 50 juta token per menit. Ini adalah entri tingkatan yang diterbitkan berdasarkan tanggal, bukan jaminan bahwa setiap kunci memiliki kapasitas yang dapat digunakan yang sama. Konsol tim Anda adalah sumber informasi resmi mengenai akses dan batasan model saat ini.

Tingkat keanggotaan ditentukan berdasarkan total pengeluaran API sejak 1 Januari 2026: $0, $50, $250, $1.000, dan $5.000 untuk Tingkat 0 hingga 4. Permintaan dibatasi per detik menggunakan anggaran permintaan per menit yang dibagi 60, sehingga Anda tidak dapat menghabiskan alokasi satu menit penuh dalam satu kali permintaan. Token input, output, penalaran, dan yang disimpan dalam cache semuanya dihitung dalam TPM, meskipun beberapa di antaranya biayanya lebih rendah.

Halaman model Grok 4.3 dan 4.6 yang telah dicentang mencantumkan ukuran konteks tanpa angka keluaran maksimum yang ditetapkan secara tegas. Saat ini Referensi titik akhir respons mendefinisikan max_output_token sebagai anggaran gabungan untuk output dan penalaran: nilainya secara default adalah 128.000 jika tidak ditentukan, dan dapat diatur ke nilai yang lebih besar untuk menghasilkan generasi yang lebih panjang. Nilai default tersebut tidak menjamin adanya 128.000 token jawaban yang terlihat atau kuota konteks yang tak terbatas. Tetapkan anggaran secara eksplisit dan periksa respons yang belum lengkap.

Dokumentasi penagihan xAI memisahkan pulsa prabayar dari penagihan bulanan, yang dinonaktifkan secara default. Fitur isi ulang otomatis dapat mengisi ulang pulsa prabayar dan memiliki batas serta kuota bulanan tersendiri. Batas penagihan bulanan mengatur penggunaan pascabayar; hal ini berbeda dengan batas tunggal yang mencakup semua pembelian, isi ulang, dan permintaan pada layanan prabayar.

Untuk integrasi pertama Anda, mulailah dengan saldo prabayar dalam jumlah terbatas dan periksa dengan cermat setiap pengaturan pengisian ulang otomatis. Untuk mengakses obrolan sehari-hari tanpa perlu membuat integrasi, gunakan fitur terpisah Panduan Cara Menggunakan Grok mencakup alur kerja produk. Langganan obrolan dan tim API memiliki pengaturan yang berbeda.

Dua tugas Grok 4.6 yang sebenarnya: apa yang terungkap dari catatan penggunaannya

Kami menggunakan kembali dua tes yang telah selesai dari tanggal 7 September 2026 melalui API agregasi Broly di https://anywhere.broly.ai/v1, dengan menggunakan fitur Pelengkapan Obrolan. Baik yang diminta maupun yang dikembalikan grok-4.6; keabsahan model hulu tersebut belum diverifikasi secara independen. Ini adalah hasil pengujian gateway Grok 4.6, bukan hasil pengujian Grok 4 asli atau perbandingan antar model.

Setiap tugas dijalankan satu kali dengan suhu=0, max_tokens=2048 dan stream=false. Tidak ada alat maupun pengaturan upaya penalaran eksplisit yang dikirimkan. Instruksi sistem yang sama digunakan untuk kedua permintaan tersebut:

Petunjuk sistem bersama

Pengambilan data pengeluaran

Tugas ini mengubah lima nota pengeluaran sintetis menjadi format JSON yang terstruktur dengan nilai sen dalam bentuk bilangan bulat, termasuk pengembalian dana bernilai negatif. Responsnya mempertahankan setiap bidang yang diminta dan menghasilkan total bersih $209.00 yang benar.

Perintah tepat: Ekstraksi pengeluaran

Hasil keluaran lengkap: Ekstraksi pengeluaran

{
  "mata_uang": "USD",
  "item": [
    {
 "label": "kereta api",
 "jumlah_sen": 4680
    },
    {
 "label": "hotel",
 "amount_cents": 12800
    },
    {
      "label": "makan malam",
 "amount_cents": 2745
    },
    {
 "label": "pengembalian dana",
 "amount_cents": -1250
    },
    {
 "label": "taksi",
 "amount_cents": 1925
    }
  ],
  "net_total_cents": 20900
}

Laporan penggunaan · Ekstraksi pengeluaran

Masukan / tersimpan dalam cache

364 / 192

Token yang disimpan dalam cache termasuk dalam jumlah input.

Penyelesaian / penalaran

991 / 857

Alasan tersebut tercantum dalam rincian penyelesaian.

Waktu menurut jam dinding

22,753 detik

Termasuk beban jaringan dan gateway; satu kali eksekusi.

Penjadwalan dengan batasan

Tugas tersebut meminta untuk memilih pekerjaan-pekerjaan yang tidak dapat dibagi dalam batas waktu delapan jam dengan persyaratan tertentu. Jawaban yang dipilih adalah A, B, C, dan E, dengan total waktu delapan jam dan nilai 24. Kami secara terpisah menghitung semua 64 himpunan bagian: 17 di antaranya layak, dan inilah himpunan optimal yang unik.

Perintah tepat: Penjadwalan dengan batasan

Hasil keluaran lengkap: Penjadwalan dengan batasan

{
  "selected": ["A", "B", "C", "E"],
  "order": ["A", "B", "C", "E"],
  "total_hours": 8,
  "total_value": 24
}

Penggunaan yang dilaporkan · Penjadwalan dengan batasan

Masukan / tersimpan dalam cache

428 / 192

Token yang disimpan dalam cache termasuk dalam jumlah input.

Penyelesaian / penalaran

4267 / 4217

Alasan tersebut tercantum dalam rincian penyelesaian.

Waktu menurut jam dinding

61,980 detik

Termasuk beban jaringan dan gateway; satu kali eksekusi.

Jawaban penjadwalan lebih pendek daripada JSON pengeluaran, namun total penyelesaian yang dilaporkan adalah 4.267 token, termasuk 4.217 token penalaran. Inilah pelajaran yang dapat dipetik terkait penganggaran: panjang jawaban yang terlihat bukanlah indikator yang baik untuk mengukur konsumsi model penalaran. Kedua tugas ini merupakan contoh yang berguna mengenai pola penggunaan, bukan tolok ukur latensi atau peringkat kualitas secara umum.

Kutipan mengenai penggunaan gateway: penjadwalan terbatas

{
  "prompt_tokens": 428,
  "completion_tokens": 4267,
  "total_tokens": 4695,
  "rincian_token_prompt": {
    "token_yang_disimpan_di_cache": 192
  },
  "rincian_token_penyelesaian": {
    "token_penalaran": 4217
  }
}

Gerbang tersebut juga mengembalikan nilai nol token_masukan dan output_tokens kolom, meskipun penghitung Chat Completions-nya tidak nol. Untuk catatan-catatan ini, kami menggunakan token_prompt dan token_penyelesaian. Kami tidak menganggap nilai nol sebagai permintaan gratis, dan juga tidak menyimpulkan jumlah token yang terlihat berdasarkan bidang lain yang bernilai nol.

Menerapkan tarif resmi tanpa menyebutnya sebagai faktur

Jika jumlah gateway ini ditagih menggunakan harga katalog xAI konteks pendek versi Grok 4.6 yang berlaku saat ini, maka tugas ekstraksi tersebut akan menjadi [(364 – 192) × $2 + 192 × $0,50 + 991 × $6] / 1M = $0,006386. Penjadwalan akan dilakukan [(428 – 192) × $2 + 192 × $0,50 + 4.267 × $6] / 1M = $0,026170. Ini adalah perkiraan tingkat xAI yang bersifat hipotetis, bukan tarif yang teramati di Broly.

Respons penjadwalan melaporkan 4.267 token penyelesaian meskipun permintaan yang dikirim max_tokens=2048. Semantik batas pada gateway tersebut belum diverifikasi. Ketidaksesuaian ini tidak menjelaskan bagaimana batas keluaran xAI itu sendiri bekerja, dan batas yang diminta tidak dapat dianggap sebagai batas pengeluaran yang telah terbukti untuk gateway ini.

Respons langsung xAI memiliki sinyal penagihan yang lebih berguna: biaya_dalam_USD_ticks. Dokumentasi resmi mendefinisikan 1 USD sebagai 10.000.000.000 tick dan menyebutkan bahwa bidang tersebut mencakup biaya token, diskon, serta panggilan alat di sisi server untuk permintaan tersebut. Respons gateway yang digunakan kembali tidak memuat bidang tersebut. Untuk suatu sesi, jumlahkan nilai tick per permintaan, bukan mengasumsikan bahwa setiap respons berisi total sesi.

Apa yang diperhatikan oleh pengguna API independen

Pada tanggal 21 Agustus 2026, seorang pengguna Hacker News mediaman menunjukkan bahwa laju input yang disimpan dalam cache sebesar $0,50 per juta pada Grok 4.6 setara dengan 25% dari laju input yang tidak disimpan dalam cache pada $2. Kekhawatiran mereka terkait dengan pembacaan yang disimpan dalam cache secara berulang dalam pekerjaan yang bersifat agen. Kedua laju Grok tersebut sesuai dengan tabel resmi saat ini; perbandingan yang lebih luas dan spekulasi dari komentator tersebut merupakan penilaian pribadi.

mediaman di Hacker News membahas penetapan harga cache API Grok
mediaman mengenai harga cache Grok 4.6, 21 Agustus 2026. Analisis biaya pribadi; perbandingan dan spekulasi merupakan pandangan si pengomentator. Diarsipkan pada 8 September 2026.

Sebelumnya, pada tanggal 9 November 2025, XCSme dijelaskan menggunakan Grok 4 Fast melalui API untuk pemrosesan dan ekstraksi data, dengan menyebutnya sebagai layanan yang murah dan cepat. Itu adalah laporan historis mengenai model Fast yang kini sudah tidak diproduksi lagi. Laporan tersebut tidak menyebutkan harga, kecepatan, atau kualitas saat ini untuk model Grok 4.3 atau Grok 4.6.

XCSme di Hacker News membahas ekstraksi data API Grok
XCSme mengenai penggunaan Grok 4 Fast untuk ekstraksi, 9 November 2025. Pengalaman pribadi di masa lalu dengan model yang kini sudah tidak diproduksi lagi. Diarsipkan pada 8 September 2026.

Kedua pengalaman pribadi ini mengemukakan pertanyaan awal yang bermanfaat: seberapa besar porsi tagihan Anda yang berasal dari konteks yang disimpan dalam cache, dan seberapa besar yang berasal dari proses penalaran dan upaya ulang? Keduanya belum menghasilkan konsensus di kalangan pengembang. Jika Anda juga membandingkan hasil kerja yang dihasilkan, kami Perbandingan kinerja, pencarian, dan pemrograman antara Grok dan ChatGPT membahas keputusan terpisah tersebut.

Cara memulai menggunakan API resmi xAI

The Panduan Cepat Resmi xAI menggunakan API Respons di https://api.x.ai/v1/responses. Ini adalah titik akhir dan akun yang berbeda dari platform agregasi yang digunakan dalam pengujian kami pada tanggal 7 September.

  1. Buat atau masuk ke akun xAI Console Anda, lalu pilih tim yang tepat.
  2. Tambahkan kredit API dan periksa pengaturan pengeluaran. Pastikan model yang dipilih tersedia untuk tim Anda.
  3. Buat kunci API dan masukkan ke dalam proses server Anda sebagai XAI_API_KEY. Jangan cantumkan kunci tersebut dalam kode browser, sistem kontrol versi, tangkapan layar, maupun log.
  4. Kirimkan permintaan kecil dengan menggunakan ID model saat ini secara eksplisit, lalu catat model yang dikembalikan, penggunaan, tingkatan layanan, dan pengenal permintaan.

Contoh di bawah ini menggunakan Node.js 18 atau yang lebih baru beserta fitur `fetch` bawaan, sehingga tidak perlu menginstal SDK. Atur variabel lingkungan XAI_API_KEY pada proses Anda sebelum menjalankannya. Contoh ini menggunakan format permintaan Responses resmi terkini dan tingkat upaya penalaran yang rendah; kode ini telah diuji secara lokal tanpa mengirimkan permintaan API berbayar lainnya.

Permintaan resmi pertama · Node.js

Pastikan statusnya sudah "selesai" dan periksa objek penggunaan sebelum meningkatkan kapasitas. Contoh ini mengalokasikan 2.048 token output-and-reasoning melalui bidang Responses resmi. Batas waktu (timeout) adalah batas waktu di sisi klien, bukan bukti bahwa proses di sisi server dibatalkan atau tidak ditagih. Contoh ini tidak melakukan percobaan ulang secara otomatis; batas token bukanlah batas dolar yang mencakup seluruh biaya pada aplikasi yang juga mengirimkan input atau memanggil alat.

Untuk SDK yang kompatibel dengan OpenAI, URL dasarnya adalah https://api.x.ai/v1 dan kredensialnya masih milik Anda xAI Kunci API. API Respons menggunakan masukan dan alasan: { upaya: "rendah" }; Fitur Pelengkapan Obrolan menggunakan pesan dan nama parameternya sendiri. Menyalin permintaan gateway tanpa perubahan ke titik akhir yang berbeda dapat gagal, meskipun keduanya mendukung JSON.

Kesalahan integrasi yang umum dan pengendalian biaya

  • 401 Tidak sah: periksa header Bearer, kunci, dan lingkungan pemrosesan. Kode status 403 dapat menandakan masalah izin tim atau pembatasan akses. Mengulangi permintaan yang sama yang tidak valid tidak akan memperbaikinya.
  • 404 Tidak Ditemukan: periksa endpoint dan ID model yang tepat. Bedakan antara ID yang tidak valid dengan ID yang telah dinonaktifkan sesuai dokumentasi namun masih dapat diakses melalui pengalihan.
  • 400 atau 422: validasi skema permintaan dan pengaturan yang didukung. Sebagai contoh, dokumentasi penalaran saat ini tidak mengakui penalti kehadiran/frekuensi dan pengaturan penghentian untuk model penalaran.
  • 429 Terlalu Banyak Permintaan: antrekan pekerjaan, atur lonjakan beban agar berjalan lancar, dan gunakan metode backoff eksponensial terbatas dengan jitter. Pantau baik RPS maupun TPM, dan sertakan upaya percobaan ulang dalam anggaran beban kerja.
  • Hasil yang tidak terduga atau status yang tidak lengkap: periksa respons, pengaturan penalaran, dan batas keluaran yang berlaku. Validasi keluaran yang dapat dibaca mesin sebelum menggunakannya; respons HTTP yang berhasil bukanlah jaminan kualitas tugas.

Untuk pengendalian biaya, pilihlah model dan pengaturan penalaran termurah yang lolos uji tugas Anda sendiri, pertahankan instruksi yang stabil di awal untuk pemanfaatan ulang cache, hapus riwayat yang tidak relevan, pantau batas 200K prompt, dan batasi loop alat agen. Gunakan pemrosesan batch hanya jika model tersebut mendukungnya dan pekerjaan tersebut dapat ditunda. Anggap prioritas sebagai pilihan pembelian tersendiri.

Simpan perkiraan token untuk perencanaan dan catatan biaya yang dikembalikan untuk rekonsiliasi. Simpan catatan bilangan bulat saat menggabungkan banyak permintaan, lalu bandingkan total permintaan dengan data penggunaan di Konsol dan tagihan. Kolom biaya yang kosong berarti “tidak diketahui,” bukan nol; balasan yang terlihat kecil tidak menjamin tagihan yang kecil.

Untuk penetapan harga API Grok 4 hari ini, susunlah anggaran Anda berdasarkan model yang benar-benar digunakan untuk memenuhi permintaan, kisaran harga prompt, dan total output yang dikenakan biaya. Mulailah dengan permintaan resmi dalam skala kecil, periksa bidang penggunaan dan biayanya, lalu sesuaikan skala beban kerja yang telah lolos pemeriksaan Anda sendiri. Untuk menjelajahi prompt di ruang obrolan, buka Grok 4,6 pada GlobalGPT.

Grok 4 Pertanyaan Umum (FAQ) tentang Penetapan Harga API

Berapa harga Grok 4 API saat ini?

Per 8 September 2026, ID grok-4-0709 yang sudah tidak digunakan lagi dialihkan ke Grok 4.3. Di bawah 200 ribu token prompt, tarif per juta USD-nya adalah $1,25 untuk input, $0,20 untuk input yang disimpan dalam cache, dan $2,50 untuk output. Tarif untuk konteks panjang dua kali lipat.

Apakah API Grok 4 versi asli masih tersedia?

Model grok-4-0709 versi asli telah dihentikan penggunaannya dari API xAI pada tanggal 15 Mei 2026. ID-nya masih dapat diakses, namun permintaan akan diproses oleh Grok 4.3 dengan tingkat upaya penalaran yang rendah dan akan ditagih sesuai tarif pengganti.

Berapa harga Grok 4.6 API?

Grok 4.6 memerlukan biaya $2 untuk input, $0,50 untuk input yang disimpan dalam cache, dan $6 untuk output per satu juta token di bawah 200 ribu token prompt. Pada 200K atau lebih, tarifnya adalah $4, $1, dan $12. Panggilan alat dan biaya lain yang berlaku dibebankan terpisah.

Apakah token penalaran dikenakan biaya?

Ya. xAI membebankan biaya token penalaran berdasarkan tingkat penyelesaian. Jika penalaran sudah termasuk dalam total keluaran atau total penyelesaian yang dilaporkan, jangan tambahkan lagi dalam perkiraan Anda.

Apakah input yang disimpan dalam cache dihitung dalam batas 200 ribu?

Ya. Hitung seluruh prompt, termasuk token yang tersimpan dalam cache. Berdasarkan tabel harga resmi, prompt dengan 200 ribu token atau lebih termasuk dalam kategori konteks panjang, dan tarif yang lebih tinggi berlaku untuk semua token dalam permintaan tersebut.

Apakah ada kuota API Grok gratis yang disertakan dalam langganan layanan obrolan?

Jangan berasumsi bahwa langganan obrolan sudah mencakup kredit API xAI. Panduan cepat API resmi menggunakan akun Console dan kredit yang terpisah. Setiap promosi harus diverifikasi oleh tim API yang bersangkutan; akses gratis bagi pengguna umum merupakan penawaran yang berbeda.

Apa saja batasan laju API untuk Grok?

Batas-batas tersebut bergantung pada model dan tingkatan tim. Tabel Tier 0 yang telah diperiksa mencantumkan Grok 4.3 pada 37 RPS dan 10M TPM, serta Grok 4.6 pada 150 RPS dan 50M TPM. Gunakan Konsol tim Anda untuk memastikan batas yang berlaku untuk kunci Anda.

Apakah saya bisa menggunakan Grok 4.6 pada GlobalGPT?

Ya. GlobalGPT memiliki entri obrolan Grok 4.6 yang telah diverifikasi. Itu merupakan alur kerja platform yang terpisah; hal tersebut tidak menggantikan kunci API xAI, penagihan API langsung, atau pengaturan di Konsol xAI Anda.

Bagaimana cara memeriksa biaya sebenarnya dari sebuah permintaan xAI?

Baca nilai usage.cost_in_usd_ticks dari respons resmi, lalu bagi dengan 10.000.000.000 untuk mendapatkan nilai dalam USD. Bidang tersebut mencakup permintaan tersebut, termasuk diskon token dan alat sisi server. Jumlahkan semua permintaan untuk melacak percakapan.

Bagikan Postingan:

Postingan Terkait