PANDUAN API AUDIO · DIUPDATE PADA 29 SEPTEMBER 2026
Perlu mengubah rekaman menjadi teks, menambahkan narasi ke video, atau memungkinkan pelanggan berbicara dengan asisten AI? The API Audio OpenAI memberikan para pengembang beberapa cara untuk mengelola suara, namun setiap layanan menggunakan model, permintaan, dan satuan penagihan yang berbeda.
Mulailah dengan tugas yang ingin Anda selesaikan. Di bawah ini, Anda akan menemukan titik akhir utama, pilihan model saat ini, contoh kode Python, dan perhitungan harga. Jika aplikasi Anda juga membutuhkan suara, model obrolan, gambar, atau video dari penyedia lain, maka API GlobalGPT menawarkan alternatif lain: satu titik masuk API yang mencakup tugas-tugas audio bersamaan dengan layanan-layanan tersebut.
Jawaban singkat: Gunakan OpenAI /v1/audio/transkripsi untuk rekaman suara, /v1/audio/ucapan untuk ucapan yang dihasilkan, dan /v1/audio/terjemahan untuk menerjemahkan rekaman menjadi teks bahasa Inggris. Untuk percakapan lisan yang sedang berlangsung, pilih sesi suara langsung. GlobalGPT juga menyediakan API tugas audio, lengkap dengan katalog model dan format permintaan tersendiri.
Di halaman ini
Apa itu OpenAI Audio API?
API Audio OpenAI adalah sekumpulan antarmuka pengembang untuk memproses dan menghasilkan ucapan. Aplikasi Anda mengirimkan teks atau audio ke OpenAI, memilih model, dan menerima audio ucapan atau teks sebagai hasilnya. API ini dapat digunakan untuk mendukung aplikasi transkripsi, artikel dengan narasi, alat subtitle, atau fitur ucapan pada asisten digital yang lebih besar.
OpenAI Referensi API Audio memisahkan proses pembangkitan ucapan, transkripsi, dan penerjemahan. Ini merupakan komponen dasar yang berguna: transkripsi menghasilkan kata-kata dari rekaman; model teks terpisah dapat mengubah kata-kata tersebut menjadi ringkasan, dan model ucapan dapat membacakan ringkasan tersebut dengan suara keras.
Tiga permintaan, tiga hasil yang berbeda
Rekaman → transkrip
Wawancara, rapat, ceramah, atau catatan suara
/audio/transkrip
Naskah → rekaman suara
Narasi, audio aksesibilitas, atau respons aplikasi
/audio/ucapan
Rekaman dalam bahasa asing → Teks dalam bahasa Inggris
Terjemahan bahasa Inggris dari rekaman ucapan
/audio/terjemahan
ChatGPT adalah aplikasi yang dapat Anda gunakan secara langsung; API-nya memungkinkan Anda menambahkan model ke aplikasi Anda sendiri. Jika Anda hanya ingin berinteraksi dengan ChatGPT, mulailah dengan ChatGPT Akses suara dan batasan. Sebuah proyek API memerlukan anggaran tersendiri untuk pengaturan dan penggunaannya.
Titik akhir audio dan model mana yang sebaiknya Anda gunakan?
Pilihlah sesuai dengan hasil yang dibutuhkan aplikasi Anda. Berkas teks subtitle, transkrip dengan label pembicara, dan percakapan langsung adalah hasil akhir yang berbeda, meskipun ketiganya dimulai dengan seseorang yang sedang berbicara.
Arus panduan transkripsi berkas merekomendasikan gpt-transcribe untuk rekaman biasa. Untuk transkrip podcast, mulailah dari sana. Jika Anda memerlukan penanda waktu per kata atau format subtitle, periksa opsi khusus model sebelum memilih model; tingkat dukungannya bervariasi.
Tanggal migrasi yang perlu diperhitungkan: Daftar OpenAI bisikan-1, gpt-4o-transcribe, gpt-4o-mini-transcribe, dan gpt-4o-transcribe-diarize terkait penghentian API pada 26 Februari 2027. Integrasi terjemahan, subtitle, dan diarisasi yang sudah ada sebaiknya mengikuti panduan resmi mengenai penghentian dukungan daripada menganggap bahwa model baru tersebut menerima semua parameter lama.
Penyiaran ucapan berbeda dengan percakapan langsung
Fitur streaming text-to-speech mulai memutar respons sebelum file audio selesai sepenuhnya dihasilkan. Fitur ini, dengan sendirinya, tidak memungkinkan aplikasi Anda mendeteksi interupsi dari pengguna atau mengelola panggilan yang sedang berlangsung. Demikian pula, streaming transkrip dari file yang sudah selesai tidak akan memulai sesi mikrofon langsung.
Untuk aplikasi suara percakapan baru, OpenAI’s audio dan panduan suara mengarah ke GPT-Live. Model suaranya menangani percakapan sementara agen backend melakukan riset atau menggunakan berbagai alat. Realtime API tetap menjadi opsi terpisah jika Anda membutuhkan model sesi dan alatnya.
Cara Menggunakan API Audio OpenAI
Untuk contoh-contoh di bawah ini, buat proyek API OpenAI, konfigurasikan penagihan API, dan simpan kunci Anda di OPENAI_API_KEY variabel lingkungan di server Anda atau mesin pengembangan lokal. Instal SDK Python dengan pip install openai. Jangan mencantumkan kunci API permanen di halaman web publik atau paket aplikasi seluler.
Mulailah dengan file atau skrip yang pendek agar Anda dapat memeriksa responsnya sebelum menambahkan permintaan tersebut ke aplikasi Anda.
1. Transkripsikan rekaman tersebut
Simpan rekaman sebagai pertemuan.mp3, lalu jalankan skrip ini dari folder yang sama. Hasil yang dikembalikan teks Ini adalah transkrip, bukan ringkasan rapat atau daftar tindakan yang harus dilakukan.
dari openai impor OpenAI
client = OpenAI()
with open("meeting.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
)
print(transcript.text)
Untuk nama produk atau istilah-istilah dalam industri, berikan konteks yang relevan alih-alih mengharapkan model menebak ejaannya. Panduan transkripsi saat ini mendukung perintah, ditambah petunjuk kata kunci dan bahasa yang spesifik untuk model tertentu. Uji opsi-opsi tersebut pada sampel singkat dari rekaman yang benar-benar diproses oleh aplikasi Anda.
Jika sumber Anda berupa rekaman demo atau video wawancara, panduan kami mengenai menyalin transkrip audio dari sebuah video menjelaskan persiapan bahan serta langkah-langkah yang harus dilalui mulai dari memperoleh transkrip hingga menghasilkan ringkasan yang bermanfaat.
2. Mengubah naskah menjadi rekaman suara
Pilih suara yang didukung dan jelaskan cara pemutarannya. Contoh ini menyimpan berkas MP3 ke komputer Anda; berkas tersebut tidak diputar secara otomatis.
from pathlib import Path
from openai import OpenAI
client = OpenAI()
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="coral",
input="Ringkasan rapat Anda sudah siap. Berikut adalah langkah-langkah selanjutnya.",
instructions="Gunakan nada yang tenang dan jelas serta kecepatan bicara yang teratur.",
) as response:
response.stream_to_file(Path("narration.mp3"))
The panduan teks-ke-suara Kontrol dokumen untuk nada, kecepatan, intonasi, dan pilihan penyampaian lainnya. MP3 adalah format keluaran default; format lain yang didukung antara lain WAV, PCM, Opus, AAC, dan FLAC. Pilihan suara bergantung pada modelnya. OpenAI juga mewajibkan adanya pernyataan yang jelas bahwa suara tersebut dihasilkan oleh AI.
Untuk narasi sesekali, Anda mungkin lebih memilih menggunakan alat berbasis browser daripada menulis kode. Panduan kami mengenai alat dan alur kerja text-to-speech mencakup hal-hal tersebut, termasuk hal-hal yang perlu diperiksa sebelum mengekspor rekaman suara.
3. Terjemahkan ucapan yang direkam menjadi teks dalam bahasa Inggris
Titik akhir terjemahan menggunakan bisikan-1 dan menghasilkan teks dalam bahasa Inggris. Untuk integrasi yang sudah ada, permintaan tersebut terlihat seperti ini. Pertimbangkan pensiun pada Februari 2027 sebelum membangun ketergantungan jangka panjang baru terhadapnya.
dari openai impor OpenAI
client = OpenAI()
with open("interview.mp3", "rb") as audio_file:
translation = client.audio.translations.create(
model="whisper-1",
file=audio_file,
)
print(translation.text)
Permintaan ini tidak menghasilkan audio bahasa Inggris yang telah disulihsuarakan. Proses sulihsuara memerlukan langkah-langkah tambahan, termasuk pembuatan ucapan dan—tergantung pada proyeknya—penyesuaian waktu serta penyelarasan video. Untuk penerjemahan ke bahasa sasaran yang berbeda, gunakan metode penerjemahan yang secara eksplisit mendukung bahasa tersebut.
Berapa harga API Audio OpenAI?
Tidak ada tarif tunggal untuk Audio API. Transkripsi file, pembangkitan ucapan, dan sesi langsung menggunakan satuan penagihan yang berbeda-beda. Angka-angka di bawah ini bersumber dari Harga API OpenAI, diperiksa pada tanggal 29 September 2026. Biaya tersebut adalah biaya OpenAI, yang terpisah dari harga GlobalGPT.
Baris transkripsi tersebut menggunakan data yang dipublikasikan oleh OpenAI perkiraan biaya Angka-angka. Contoh token TTS ini merupakan ilustrasi aritmatika yang didasarkan pada dua jumlah penggunaan yang ditentukan; ini bukanlah prediksi bahwa sebuah skrip akan menghasilkan jumlah token masukan dan keluaran yang sama. Karakter, token teks, dan token audio adalah satuan yang berbeda.
Anggaran transkripsi sebesar 1.000 menit
Sekitar 16 jam 40 menit rekaman audio, berdasarkan perkiraan per menit yang dipublikasikan oleh OpenAI.
File rekaman · gpt-transcribe · ≈ $4.50
Transkripsi langsung · gpt-live-transcribe · ≈ $17.00
Untuk memperkirakan biaya proyek yang sebenarnya, hitung juga beban kerja setelah proses transkripsi. Seorang asisten rapat mungkin memerlukan transkrip, ringkasan, daftar tindakan, dan rekaman ulang percakapan. Setiap panggilan model dapat menambah biaya. Seorang agen layanan suara mungkin juga menggunakan fitur pencarian atau alat bantu lainnya saat percakapan berlangsung.
Khusus untuk GPT-Live, halaman model penetapan harga memisahkan durasi sesi dari biaya model backend dan biaya alat. Panggilan selama satu jam yang dikenakan biaya $3 untuk sesi suara belum tentu berarti total biaya aplikasi sebesar $3.
GlobalGPT juga memiliki API untuk audio, obrolan, gambar, dan video
Jika audio merupakan salah satu bagian dari produk yang lebih luas, GlobalGPT menawarkan opsi yang berguna. Fiturnya Gambaran Umum API menjadi titik masuk bersama untuk berbagai kategori model: permintaan obrolan menggunakan /v1/chat/completions atau /v1/respons, sedangkan pembuatan gambar, video, dan audio menggunakan /v1/tugas.
Sebagai contoh, sebuah aplikasi konten dapat menyusun naskah menggunakan model percakapan, membuat trek narasi, menghasilkan ilustrasi, dan memproduksi video pendek. Ketika membangun alur kerja multi-model, berikan tugas yang jelas kepada setiap model dan sampaikan hasil yang telah ditinjau antar tahap.
GlobalGPT yang terbuka untuk umum katalog model audio termasuk Eleven v3, Eleven Multilingual v2, Qwen Audio 3.0, dan Seed Audio 1.0 untuk pembuatan konten berbasis suara, serta Scribe dan AI Note Taker untuk tugas transkripsi. Silakan periksa katalog API akun tersebut untuk mengetahui model-model spesifik yang tersedia untuk integrasi Anda.
Untuk skrip yang lebih panjang, Ulasan Eleven Multilingual v2 membahas narasi, dukungan bahasa, serta perbedaannya dengan model-model ElevenLabs lainnya.
Untuk audio kreatif yang mencakup suara bicara dan suara latar, Panduan Suara dan Efek Suara dari Seed Audio membahas tugas yang lebih luas daripada sekadar membacakan teks dengan suara keras. Pilihlah berdasarkan jenis audio yang ingin Anda sampaikan.
Cara Memulai Menggunakan API GlobalGPT
- Buka area API GlobalGPT dan buat kunci di bawah API → Kunci API → Buat kunci. Simpanlah dengan aman saat informasi tersebut ditampilkan.
- Baca katalog model untuk mengetahui ID model dan harga untuk tugas yang Anda butuhkan.
- Gunakan parameter yang tercantum dalam dokumentasi model yang dipilih. Ikuti format permintaan tugas audio untuk
/v1/tugas, daripada menyalin dan menempelkan OpenAI/audio/ucapanmuatan tetap sama. - Mulailah dengan sampel pendek. Periksa hasil audio, status penyelesaian, dan penggunaan yang ditagihkan sebelum memproses batch yang lebih besar.
URL dasar API yang tercantum adalah https://api2.glbgpt.com/ai-api/open/v1. Permintaan katalog yang hanya dapat dibaca ini merupakan titik awal setelah Anda menyimpan kunci Anda di GLOBALGPT_API_KEY:
curl "https://api2.glbgpt.com/ai-api/open/v1/models" \
-H "Authorization: Bearer $GLOBALGPT_API_KEY"
Gunakan harga yang tercantum pada model yang benar-benar Anda pilih. Harga langganan situs web GlobalGPT, saldo kredit, dan tarif per menit OpenAI bukanlah perkiraan yang dapat saling menggantikan untuk permintaan yang sama.
Batas integrasi: GlobalGPT menyediakan API audio miliknya sendiri. Dokumentasi publiknya tidak menyebutkan dukungan untuk titik akhir audio bawaan OpenAI, sesi GPT-Live, atau semua model suara OpenAI. Jika aplikasi Anda saat ini bergantung pada salah satu fitur tersebut, pastikan untuk memeriksa persyaratan spesifik tersebut sebelum beralih penyedia layanan.
Kesalahan Umum dalam Menggunakan API Audio dan Cara Menghindarinya
Sebelum memutuskan kualitas suara, uji sampel singkat yang mencakup kosakata yang sebenarnya Anda gunakan: nama produk, angka, singkatan, dan bahasa yang digunakan pengguna Anda. Untuk transkripsi, periksa kata-kata dan penentuan pembicara. Untuk narasi, perhatikan pengucapan, jeda, kecepatan, serta apakah nada yang diinginkan tetap terjaga dalam paragraf yang lebih panjang.
Gunakan rekaman yang Anda memiliki izin untuk mengolahnya, simpan kunci enkripsi di server tepercaya, dan tinjau ketentuan data untuk layanan yang menerima rekaman audio Anda. Untuk produk yang ditujukan bagi pelanggan, sertakan informasi mengenai rekaman dan suara AI sebagai bagian dari antarmuka.
Rute API mana yang sebaiknya Anda pilih?
Choose OpenAI directly when your app needs a specific OpenAI speech model, a documented transcription option, or a native live voice session. Start with the model suited to the task and design around its actual request and billing rules.
Pertimbangkan GlobalGPT when your product combines audio with models from several providers, or when you want to explore voice generation alongside chat, images, and video. Begin with the API catalog, select an available model, and validate a small task before scaling up.
Music, narration, and transcription call for different model choices. Our comparison on choosing an audio model by task helps separate song generation, spoken narration, and more complex audio scenes.
For a single voiceover or meeting transcript, a web tool may be enough. An API becomes useful when your own application must trigger the task repeatedly, pass results to another step, or serve the result to your users.
Pertanyaan yang Sering Diajukan
Apakah API Audio OpenAI merupakan satu model?
Tidak. Ini adalah serangkaian antarmuka audio. Pembangkitan ucapan, transkripsi berkas, dan penerjemahan berkas menggunakan titik akhir dan pilihan model yang berbeda-beda. GPT-Live dan Realtime menyediakan opsi berbasis sesi terpisah untuk aplikasi audio langsung.
Apakah API Audio OpenAI dapat mengubah teks menjadi suara?
Ya. Endpoint ucapan ini menerima teks, model, dan sampel suara, lalu menghasilkan audio. Dengan gpt-4o-mini-tts, Anda juga dapat memberikan petunjuk mengenai cara penyampaian, seperti intonasi dan kecepatan bicara. MP3 adalah format keluaran default.
Model mana yang sebaiknya saya gunakan untuk aplikasi transkripsi baru?
Panduan transkripsi berkas OpenAI saat ini merekomendasikan gpt-transcribe untuk rekaman suara umum. Periksa secara terpisah untuk persyaratan khusus seperti cap waktu kata, format teks terjemahan, atau label pembicara, karena dukungan yang tersedia bervariasi tergantung pada modelnya.
Apakah Whisper akan dihentikan?
OpenAI mengumumkan bahwa model API Whisper-1 yang dihostingnya akan dihentikan pada 26 Februari 2027, bersamaan dengan tiga model transkripsi GPT-4o yang lebih lama. Ini merupakan penghentian model API, bukan pernyataan bahwa seluruh perangkat lunak Whisper atau seluruh layanan audio OpenAI akan ditutup.
Apakah terjemahan audio menghasilkan audio yang diucapkan?
Tidak. Titik akhir terjemahan berkas menghasilkan teks dalam bahasa Inggris dari rekaman ucapan. Untuk menghasilkan ucapan yang telah diterjemahkan, Anda memerlukan langkah tambahan untuk menghasilkan ucapan atau layanan terjemahan ucapan khusus.
Apakah saya bisa menggunakan Audio API untuk asisten suara langsung?
Anda dapat menggabungkan transkripsi, model teks, dan pembangkitan ucapan ke dalam sebuah asisten suara, namun penanganan giliran percakapan secara langsung memerlukan desain tambahan. OpenAI merekomendasikan GPT-Live sebagai titik awal untuk aplikasi suara percakapan baru; platform ini juga mendokumentasikan API Realtime yang terpisah.
Apakah GlobalGPT memiliki API audio?
Ya. Dokumen ikhtisar API GlobalGPT menjelaskan proses pembuatan audio melalui titik akhir (endpoint) “tasks”, selain pembuatan gambar dan video. Titik akhir (endpoint) “models” mencantumkan ID model dan harganya. Periksa ketersediaan dan parameter model yang dipilih sebelum mengirimkan permintaan.
Apakah API audio pada GlobalGPT sama dengan yang ada pada OpenAI?
Keduanya mendokumentasikan jalur audio yang berbeda: OpenAI menyediakan titik akhir audio khusus, sedangkan GlobalGPT mengarahkan pembangkitan audio melalui API tugasnya. Gunakan ID model dan bidang permintaan dari penyedia yang dipilih; kompatibilitas titik akhir OpenAI serta dukungan suara langsung harus diverifikasi secara terpisah.
Build audio into a broader AI app
Explore GlobalGPT’s API for audio, chat, image, and video tasks. Check the model catalog and pricing, then start with the task your users need most.



