音频 API 指南 · 更新于 2026 年 9 月 29 日
需要将录音转为文字、为视频添加旁白,还是让客户与AI助手对话?该 OpenAI 音频 API 为开发者提供了多种处理语音的方式,但每项任务使用的模型、请求和计费单位各不相同。.
请从您想要完成的任务开始。下面列出了主要端点、当前可选的模型、Python 示例以及定价计算。如果您的应用还需要其他提供商提供的语音、聊天模型、图像或视频,那么 GlobalGPT API 提供了一种另一种方案:一个API入口点,其中包含音频任务以及相关服务。.
快速回答: 使用 OpenAI 的 /v1/audio/transcriptions 对于录音,, /v1/audio/speech简体中文(大陆) 对于生成的语音,以及 /v1/audio/translations 用于将录音转换为英文文本。若需处理实时对话,请选择“实时语音会话”。GlobalGPT 还提供了一个音频任务 API,该 API 拥有独立的模型目录和请求格式。.
本页内容
什么是 OpenAI 音频 API?
OpenAI 音频 API 是一套用于处理和生成语音的开发者接口。您的应用程序将文本或音频发送至 OpenAI,选择一个模型,然后接收生成的语音或文本作为返回结果。它可为转录应用、文章朗读、字幕工具,或大型语音助手的语音处理环节提供支持。.
OpenAI 的 音频 API 参考 将语音生成、转录和翻译分开展开。这些都是有用的基础组件:转录功能可将录音转换为文字;独立的文本模型能将这些文字转化为摘要;而语音模型则能将摘要朗读出来。.
三个请求,三种不同的输出结果
录音 → 文字记录
采访、会议、讲座或语音备忘录
/audio/文字记录
脚本 → 语音录音
旁白、无障碍语音或应用程序响应
/audio/speech简体中文(大陆)
外语录音 → 英文文本
录音内容的英文译文
/audio/translations
ChatGPT 是一款可直接使用的应用程序;其 API 允许您将模型集成到自己的应用程序中。如果您只想与 ChatGPT 进行交互,请从以下内容开始: ChatGPT 语音访问及限制. 一个 API 项目需要专门的部署和使用预算。.
应该使用哪个音频端点和模型?
请根据您的应用所需的输出形式进行选择。字幕文件、带发言人标签的文字记录以及实时对话是三种不同的交付成果,即使这三者都是以某人发言开始的。.
当前的 文件转录指南 建议 gpt-transcribe 适用于普通录音。若需制作播客文字稿,请从该处开始。若需要单词时间戳或字幕格式,请在选择模型前查看该模型的具体选项;不同模型的支持情况各不相同。.
需安排计划的迁移日期: OpenAI 列表 whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe, 和 gpt-4o-transcribe-diarize 关于 API 停用的 2027年2月26日. 现有的翻译、字幕和日记化集成应遵循 官方弃用指南 而不是假设新模型会接受所有旧参数。.
语音直播与现场对话有所不同
流式文本转语音会在音频文件生成完成之前就开始播放响应内容。它本身并不能让您的应用监听用户的中断操作,也无法管理正在进行的通话。同样,从已生成的文件中流式传输转录文本也不会建立实时麦克风会话。.
对于一款全新的对话式语音应用,OpenAI的 音频和语音导览 指向 GPT-Live。其语音模型负责处理对话,同时后端代理会进行信息检索或使用工具。当您需要其实例和工具模型时,实时 API 仍可作为独立选项使用。.
如何使用 OpenAI 音频 API
对于下面的示例,请创建一个 OpenAI API 项目,配置 API 计费,并将您的密钥保存在 OPENAI_API_KEY 服务器或本地开发机上的环境变量。使用以下命令安装 Python SDK: pip install openai. 请勿将永久 API 密钥放置在公共网页或移动应用程序包中。.
建议先从一个简短的文件或脚本开始,这样在将请求添加到应用程序之前,你可以先检查响应。.
1. 转录录音
将录音另存为 meeting.mp3, 然后在同一文件夹中运行此脚本。返回的 文本 这是会议记录,而不是会议摘要或待办事项清单。.
from openai import OpenAI
client = OpenAI()
with open("meeting.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
)
print(transcript.text)
对于产品名称或行业术语,请提供相关上下文,而不是指望模型去猜测拼写。当前的转录指南支持 推动, ,以及针对特定模型的关键词和语言提示。请使用您应用实际处理的录音中的简短片段来测试这些选项。.
如果您的素材是录制的演示视频或采访视频,请参考我们的指南: 将视频中的音频转录成文字 解释了资料准备工作,以及从获得文字记录到整理出有用的摘要之间的各个步骤。.
2. 将脚本转换为语音录音
选择一种受支持的语音,并描述其播放效果。此示例会将一个 MP3 文件写入您的计算机;它不会自动播放该文件。.
from pathlib import Path
from openai import OpenAI
client = OpenAI()
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="coral",
input="您的会议摘要已准备就绪。以下是后续步骤。",
instructions="请使用沉稳、清晰的语调,并保持适中的语速。",
) as response:
response.stream_to_file(Path("narration.mp3"))
"(《世界人权宣言》) 文本转语音指南 该文档规定了语调、语速、语调及其他表达方式的控制要求。默认输出格式为 MP3;其他支持的格式包括 WAV、PCM、Opus、AAC 和 FLAC。语音选项因型号而异。OpenAI 还要求明确标注该语音由人工智能生成。.
对于偶尔需要进行旁白的情况,您可能更倾向于使用浏览器工具,而不是编写代码。我们的指南介绍 文本转语音工具和工作流程 涵盖了这一流程,包括在导出旁白前需要检查的事项。.
3. 将录音转换为英文文本
翻译端点使用 whisper-1 并输出英文文本。对于现有的集成,请求如下所示。在建立新的长期依赖关系之前,请考虑2027年2月的停用计划。.
from openai import OpenAI
client = OpenAI()
with open("interview.mp3", "rb") as audio_file:
translation = client.audio.translations.create(
model="whisper-1",
file=audio_file,
)
print(translation.text)
此请求不会生成英语配音。配音需要额外的步骤,包括语音生成,以及根据项目情况进行的时间同步和视频对齐。若需翻译成其他目标语言,请使用明确支持该语言的翻译方法。.
OpenAI 音频 API 的价格是多少?
Audio API 没有统一的定价。文件转录、语音生成和实时会话采用不同的计费单位。下文中的数据来自 OpenAI 的 API 定价, ,查阅于2026年9月29日。这些是OpenAI的费用,与GlobalGPT的价格是分开的。.
转录行使用了 OpenAI 已发表的 预计费用 这很正常。TTS 令牌示例是一个基于两个指定使用总数的算术说明;它并非预测脚本会产生相等的输入和输出令牌数量。字符、文本令牌和音频令牌是不同的单位。.
1,000分钟的转录预算
根据 OpenAI 公布的每分钟估算值,音频时长约为 16 小时 40 分钟。.
录音文件 · gpt-transcribe · ≈ $4.50
实时转录 · gpt-live-transcribe · ≈ $17.00
在估算实际项目时,也要将转录后的工作量计算在内。会议助理可能需要转录稿、摘要、待办事项以及语音回放。每次调用模型都会增加费用。语音客服在对话进行过程中,也可能使用搜索或其他工具。.
就GPT-Live而言, 车型定价页面 将会话时长与后端模型及工具费用区分开来。一小时通话的语音会话费用为 $3,但这并不一定意味着应用程序的总成本就是 $3。.
GlobalGPT 还提供用于音频、聊天、图片和视频的 API
如果音频只是更广泛产品中的一部分,GlobalGPT 提供了一个实用的选择。它的 API 概述 记录了多个模型类别的通用入口点:聊天请求使用 /v1/chat/completions 或 /v1/responses, ,而图像、视频和音频的生成则使用 /v1/tasks.
例如,一款内容应用可能会利用聊天模型起草剧本、制作旁白音轨、生成插图,并制作一段短视频。当 构建多模型工作流, ,为每个模型分配明确的任务,并在各个步骤之间传递经过审核的结果。.
GlobalGPT的公开内容 音频模型目录 其中包括用于语音相关创作的 Eleven v3、Eleven Multilingual v2、Qwen Audio 3.0 和 Seed Audio 1.0,以及用于转录任务的 Scribe 和 AI Note Taker。请查看该账户的 API 目录,了解可用于您集成的具体模型。.
对于较长的脚本, Eleven Multilingual v2 评测 探讨了叙述、语言支持,以及它与其他ElevenLabs模型的区别。.
对于包含人声和环境音效的创意音频,, Seed Audio 的语音和音效指南 探讨的内容比单纯地朗读文本更为广泛。请根据您需要呈现的音频类型进行选择。.
如何开始使用 GlobalGPT API
- 打开 GlobalGPT API 区域,并在以下位置创建一个密钥: API → API 密钥 → 创建密钥. 当它显示出来时,请将其安全地保存好。.
- 请查阅型号目录,查找您所需任务对应的型号 ID 和价格。.
- 使用所选模型的文档中记录的参数。请遵循音频任务请求格式,用于
/v1/tasks, ,而不是粘贴一个 OpenAI/audio/speech简体中文(大陆)有效载荷未变。. - 先从一个简短的样本开始。在处理更大批量之前,请检查返回的音频、完成状态以及计费使用情况。.
文档中记录的 API 基础 URL 是 https://api2.glbgpt.com/ai-api/open/v1. 将密钥存储到 GLOBALGPT_API_KEY:
curl "https://api2.glbgpt.com/ai-api/open/v1/models" \
-H "Authorization: Bearer $GLOBALGPT_API_KEY"
请使用您实际选定的模型所对应的价格。GlobalGPT 网站订阅价格、信用余额以及 OpenAI 的每分钟费率,不能作为同一请求的互换估算值。.
积分边界: GlobalGPT 提供了自有的音频 API。其公开文档中并未明确支持 OpenAI 的原生音频端点、GPT-Live 会话或所有 OpenAI 语音模型。如果您的现有应用依赖于上述任一功能,请在更换服务提供商之前确认该具体要求。.
音频 API 的常见错误及避免方法
在选择语音质量之前,请测试一段包含您实际用词的短片段:产品名称、数字、缩写以及用户使用的语言。对于转录内容,请检查词汇和说话人分配情况。对于旁白,请注意发音、停顿、语速,以及在较长的段落中是否能保持预期的语气。.
请仅使用已获得处理授权的录音,将密钥存储在可信服务器上,并仔细阅读接收您音频的服务所规定的数据条款。对于面向客户的产品,请在界面中明确标注有关录音和AI语音的相关声明。.
应该选择哪个 API 路由?
直接选择 OpenAI 当您的应用需要特定的 OpenAI 语音模型、已记录的转录选项或原生实时语音会话时,请从适合该任务的模型入手,并根据其实际请求和计费规则进行设计。.
考虑 GlobalGPT 当您的产品将音频与多家提供商的模型相结合时,或者当您希望在聊天、图像和视频功能之外探索语音生成功能时。请从 API 目录开始,选择一个可用的模型,并在进行大规模部署前先验证一个小型任务。.
音乐、旁白和转录需要选择不同的模型。我们针对 根据任务选择音频模型 有助于区分歌曲生成、旁白以及更复杂的音频场景。.
对于单个配音文件或会议记录,一个网页工具可能就足够了。当您的应用程序需要反复触发该任务、将结果传递到下一步,或者将结果提供给用户时,API 就会派上用场。.
常见问题
OpenAI 音频 API 是一个模型吗?
不,这是一套音频接口。语音生成、文件转录和文件翻译使用不同的端点和模型选项。GPT-Live 和 Realtime 为实时音频应用提供了独立的基于会话的选项。.
OpenAI 音频 API 能否将文本转换为语音?
是的。语音端点接受文本、模型和语音输入,然后返回音频。使用 gpt-4o-mini-tts 时,您还可以提供朗读指示,例如语调和语速。MP3 是默认的输出格式。.
我应该为一款新的转录应用选用哪种模型?
OpenAI 的当前文件转录指南建议对普通录音使用 gpt-transcribe。对于单词时间戳、字幕格式或发言人标签等特殊要求,请单独核查,因为不同模型的支持情况各不相同。.
Whisper 要停用了吗?
OpenAI 宣布其托管的 Whisper-1 API 模型将于 2027 年 2 月 26 日停止服务,同时停用的还有三个较早的 GPT-4o 转录模型。此次仅涉及 API 模型的停用,并不意味着所有 Whisper 软件或所有 OpenAI 音频服务都将停止运营。.
音频翻译会返回语音内容吗?
不。文件翻译端点会将录制的语音转换为英文文本。若要生成翻译后的语音,您需要额外进行语音生成步骤,或者使用专门的语音翻译服务。.
我可以在实时语音助手中使用 Audio API 吗?
您可以将转录、文本模型和语音生成功能整合到语音助手中,但实时对话处理需要额外的设计。OpenAI 建议将 GPT-Live 作为新建对话式语音应用程序的起点;此外,它还提供了独立的实时 API 文档。.
GlobalGPT 是否有音频 API?
是的。GlobalGPT 的 API 概述文档介绍了通过其任务端点生成音频的方法,以及图像和视频的生成方法。其模型端点列出了模型 ID 和价格。在发送请求之前,请先确认所选模型的可用性和参数。.
GlobalGPT 的音频 API 与 OpenAI 的完全一样吗?
它们记录了不同的音频处理路径:OpenAI 提供专用的音频端点,而 GlobalGPT 则通过其任务 API 处理音频生成。请使用所选提供商的模型 ID 和请求字段;OpenAI 端点的兼容性及实时语音支持必须单独进行验证。.
将音频功能整合到更广泛的人工智能应用中
探索 GlobalGPT 用于音频、聊天、图像和视频任务的 API。查看模型目录和定价信息,然后从用户最需要的任务开始。.



