OpenAI 音频 API:功能、定价及使用方法

关于音频波形、转录和API连接的编辑插图
了解 OpenAI 音频 API 的语音、转录和翻译流程,包括当前可选模型、定价示例以及 Python requests 请求。探索 GlobalGPT 自有的 API 如何在聊天、图像和视频模型之外新增音频任务。.

音频 API 指南 · 更新于 2026 年 9 月 29 日

需要将录音转为文字、为视频添加旁白,还是让客户与AI助手对话?该 OpenAI 音频 API 为开发者提供了多种处理语音的方式,但每项任务使用的模型、请求和计费单位各不相同。.

请从您想要完成的任务开始。下面列出了主要端点、当前可选的模型、Python 示例以及定价计算。如果您的应用还需要其他提供商提供的语音、聊天模型、图像或视频,那么 GlobalGPT API 提供了一种另一种方案:一个API入口点,其中包含音频任务以及相关服务。.

快速回答: 使用 OpenAI 的 /v1/audio/transcriptions 对于录音,, /v1/audio/speech简体中文(大陆) 对于生成的语音,以及 /v1/audio/translations 用于将录音转换为英文文本。若需处理实时对话,请选择“实时语音会话”。GlobalGPT 还提供了一个音频任务 API,该 API 拥有独立的模型目录和请求格式。.

什么是 OpenAI 音频 API?

OpenAI 音频 API 是一套用于处理和生成语音的开发者接口。您的应用程序将文本或音频发送至 OpenAI,选择一个模型,然后接收生成的语音或文本作为返回结果。它可为转录应用、文章朗读、字幕工具,或大型语音助手的语音处理环节提供支持。.

OpenAI 的 音频 API 参考 将语音生成、转录和翻译分开展开。这些都是有用的基础组件:转录功能可将录音转换为文字;独立的文本模型能将这些文字转化为摘要;而语音模型则能将摘要朗读出来。.

三个请求,三种不同的输出结果

录音 → 文字记录

采访、会议、讲座或语音备忘录

/audio/文字记录

脚本 → 语音录音

旁白、无障碍语音或应用程序响应

/audio/speech简体中文(大陆)

外语录音 → 英文文本

录音内容的英文译文

/audio/translations

OpenAI 基于文件的音频任务。实时双向对话需要单独的基于会话的语音集成。.

ChatGPT 是一款可直接使用的应用程序;其 API 允许您将模型集成到自己的应用程序中。如果您只想与 ChatGPT 进行交互,请从以下内容开始: ChatGPT 语音访问及限制. 一个 API 项目需要专门的部署和使用预算。.

应该使用哪个音频端点和模型?

请根据您的应用所需的输出形式进行选择。字幕文件、带发言人标签的文字记录以及实时对话是三种不同的交付成果,即使这三者都是以某人发言开始的。.

你的任务OpenAI 航线模型或起点关键细节
将已录制的音频转录成文字/v1/audio/transcriptionsgpt-transcribeOpenAI 推荐的文件转录起点;保留口语表达。.
根据文本生成旁白/v1/audio/speech简体中文(大陆)gpt-4o-mini-tts选择一种语调,并给出表达要求,例如平和的语调或较慢的语速。.
将录音翻译成英语/v1/audio/translationswhisper-1返回英文文本。该模型已安排停用;请参阅下方的迁移说明。.
获取带有说话者标签的片段/v1/audio/transcriptionsgpt-4o-transcribe-diarize要求 diarized_json. 这也是即将停产的型号。.
显示实时字幕实时转录会话gpt-live-transcribe处理传入的音频,且助手不会进行语音反馈。.
建立持续的语音对话GPT-Live 直播环节gpt-live-1可以在通话时同时倾听,并将工作分配给后端客服人员。.

当前的 文件转录指南 建议 gpt-transcribe 适用于普通录音。若需制作播客文字稿,请从该处开始。若需要单词时间戳或字幕格式,请在选择模型前查看该模型的具体选项;不同模型的支持情况各不相同。.

需安排计划的迁移日期: OpenAI 列表 whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe, 和 gpt-4o-transcribe-diarize 关于 API 停用的 2027年2月26日. 现有的翻译、字幕和日记化集成应遵循 官方弃用指南 而不是假设新模型会接受所有旧参数。.

语音直播与现场对话有所不同

流式文本转语音会在音频文件生成完成之前就开始播放响应内容。它本身并不能让您的应用监听用户的中断操作,也无法管理正在进行的通话。同样,从已生成的文件中流式传输转录文本也不会建立实时麦克风会话。.

对于一款全新的对话式语音应用,OpenAI的 音频和语音导览 指向 GPT-Live。其语音模型负责处理对话,同时后端代理会进行信息检索或使用工具。当您需要其实例和工具模型时,实时 API 仍可作为独立选项使用。.

如何使用 OpenAI 音频 API

对于下面的示例,请创建一个 OpenAI API 项目,配置 API 计费,并将您的密钥保存在 OPENAI_API_KEY 服务器或本地开发机上的环境变量。使用以下命令安装 Python SDK: pip install openai. 请勿将永久 API 密钥放置在公共网页或移动应用程序包中。.

建议先从一个简短的文件或脚本开始,这样在将请求添加到应用程序之前,你可以先检查响应。.

1. 转录录音

将录音另存为 meeting.mp3, 然后在同一文件夹中运行此脚本。返回的 文本 这是会议记录,而不是会议摘要或待办事项清单。.

from openai import OpenAI

client = OpenAI()

with open("meeting.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
 model="gpt-transcribe",
 file=audio_file,
    )

print(transcript.text)

对于产品名称或行业术语,请提供相关上下文,而不是指望模型去猜测拼写。当前的转录指南支持 推动, ,以及针对特定模型的关键词和语言提示。请使用您应用实际处理的录音中的简短片段来测试这些选项。.

如果您的素材是录制的演示视频或采访视频,请参考我们的指南: 将视频中的音频转录成文字 解释了资料准备工作,以及从获得文字记录到整理出有用的摘要之间的各个步骤。.

2. 将脚本转换为语音录音

选择一种受支持的语音,并描述其播放效果。此示例会将一个 MP3 文件写入您的计算机;它不会自动播放该文件。.

from pathlib import Path
from openai import OpenAI

client = OpenAI()

with client.audio.speech.with_streaming_response.create(
    model="gpt-4o-mini-tts",
    voice="coral",
    input="您的会议摘要已准备就绪。以下是后续步骤。",
    instructions="请使用沉稳、清晰的语调,并保持适中的语速。",
) as response:
    response.stream_to_file(Path("narration.mp3"))

"(《世界人权宣言》) 文本转语音指南 该文档规定了语调、语速、语调及其他表达方式的控制要求。默认输出格式为 MP3;其他支持的格式包括 WAV、PCM、Opus、AAC 和 FLAC。语音选项因型号而异。OpenAI 还要求明确标注该语音由人工智能生成。.

对于偶尔需要进行旁白的情况,您可能更倾向于使用浏览器工具,而不是编写代码。我们的指南介绍 文本转语音工具和工作流程 涵盖了这一流程,包括在导出旁白前需要检查的事项。.

3. 将录音转换为英文文本

翻译端点使用 whisper-1 并输出英文文本。对于现有的集成,请求如下所示。在建立新的长期依赖关系之前,请考虑2027年2月的停用计划。.

from openai import OpenAI

client = OpenAI()

with open("interview.mp3", "rb") as audio_file:
    translation = client.audio.translations.create(
    model="whisper-1",
    file=audio_file,
    )

print(translation.text)

此请求不会生成英语配音。配音需要额外的步骤,包括语音生成,以及根据项目情况进行的时间同步和视频对齐。若需翻译成其他目标语言,请使用明确支持该语言的翻译方法。.

OpenAI 音频 API 的价格是多少?

Audio API 没有统一的定价。文件转录、语音生成和实时会话采用不同的计费单位。下文中的数据来自 OpenAI 的 API 定价, ,查阅于2026年9月29日。这些是OpenAI的费用,与GlobalGPT的价格是分开的。.

型号或服务已发布的账单信息预算示例
gpt-transcribe预计费用: 每分钟 $0.00451,000 分钟 ≈ $4.50
gpt-live-transcribe预计费用: 每分钟 $0.0171,000 分钟 ≈ $17.00
whisper-1 · 淘汰转录/翻译模型预计费用: 每分钟 $0.00660分钟 ≈ $0.36; 请在2027年2月26日之前规划迁移事宜
gpt-4o-mini-tts$0.60 / 1M 文本输入令牌 加号 $12 / 1M 音频输出令牌100,000 个输入令牌 + 100,000 个输出音频令牌 = $1.26
tts-1$15 / 1M 个字符100,000个字符 = $1.50
tts-1-hd$30 / 1M个字符100,000个字符 = $3.00
gpt-live-1 语音会话每分钟 $0.05, 按秒计费60分钟 = $3.00, ,以及后端模型和工具的使用

转录行使用了 OpenAI 已发表的 预计费用 这很正常。TTS 令牌示例是一个基于两个指定使用总数的算术说明;它并非预测脚本会产生相等的输入和输出令牌数量。字符、文本令牌和音频令牌是不同的单位。.

1,000分钟的转录预算

根据 OpenAI 公布的每分钟估算值,音频时长约为 16 小时 40 分钟。.

录音文件 · gpt-transcribe · ≈ $4.50

实时转录 · gpt-live-transcribe · ≈ $17.00

不同的输入模式,并非准确率排名。计算中未包含额外的文本模型处理、存储、应用托管及重试等环节。.

在估算实际项目时,也要将转录后的工作量计算在内。会议助理可能需要转录稿、摘要、待办事项以及语音回放。每次调用模型都会增加费用。语音客服在对话进行过程中,也可能使用搜索或其他工具。.

就GPT-Live而言, 车型定价页面 将会话时长与后端模型及工具费用区分开来。一小时通话的语音会话费用为 $3,但这并不一定意味着应用程序的总成本就是 $3。.

GlobalGPT 还提供用于音频、聊天、图片和视频的 API

如果音频只是更广泛产品中的一部分,GlobalGPT 提供了一个实用的选择。它的 API 概述 记录了多个模型类别的通用入口点:聊天请求使用 /v1/chat/completions 或 /v1/responses, ,而图像、视频和音频的生成则使用 /v1/tasks.

例如,一款内容应用可能会利用聊天模型起草剧本、制作旁白音轨、生成插图,并制作一段短视频。当 构建多模型工作流, ,为每个模型分配明确的任务,并在各个步骤之间传递经过审核的结果。.

问题OpenAI 直接 APIGlobalGPT API
哪些音频模型是相关的?OpenAI 型号,包括 gpt-transcribe 和 gpt-4o-mini-tts.请查看该账户的 API 模型目录。该平台的音频工具包括 Eleven、Qwen、Seed 和 Scribe 等条目;需针对每个 API 模型分别核查其可用性和参数。.
音频请求是如何发送的?针对特定任务的 /v1/audio/… 端点;实时语音使用会话 API。.API 概述将音频生成路由至 /v1/tasks.
如何查询价格?OpenAI 的产品和 API 定价页面。.GlobalGPT API 概述中写道: GET /v1/models 列出了带价格的型号ID。.
在什么情况下这是一个有用的选择?您需要特定的 OpenAI 音频模型或其文档中记载的语音会话功能。.您希望在多家供应商的聊天、图像和视频模型之外,还能支持音频功能。.

GlobalGPT的公开内容 音频模型目录 其中包括用于语音相关创作的 Eleven v3、Eleven Multilingual v2、Qwen Audio 3.0 和 Seed Audio 1.0,以及用于转录任务的 Scribe 和 AI Note Taker。请查看该账户的 API 目录,了解可用于您集成的具体模型。.

对于较长的脚本, Eleven Multilingual v2 评测 探讨了叙述、语言支持,以及它与其他ElevenLabs模型的区别。.

对于包含人声和环境音效的创意音频,, Seed Audio 的语音和音效指南 探讨的内容比单纯地朗读文本更为广泛。请根据您需要呈现的音频类型进行选择。.

如何开始使用 GlobalGPT API

  1. 打开 GlobalGPT API 区域,并在以下位置创建一个密钥: API → API 密钥 → 创建密钥. 当它显示出来时,请将其安全地保存好。.
  2. 请查阅型号目录,查找您所需任务对应的型号 ID 和价格。.
  3. 使用所选模型的文档中记录的参数。请遵循音频任务请求格式,用于 /v1/tasks, ,而不是粘贴一个 OpenAI /audio/speech简体中文(大陆) 有效载荷未变。.
  4. 先从一个简短的样本开始。在处理更大批量之前,请检查返回的音频、完成状态以及计费使用情况。.

文档中记录的 API 基础 URL 是 https://api2.glbgpt.com/ai-api/open/v1. 将密钥存储到 GLOBALGPT_API_KEY:

curl "https://api2.glbgpt.com/ai-api/open/v1/models" \
  -H "Authorization: Bearer $GLOBALGPT_API_KEY"

请使用您实际选定的模型所对应的价格。GlobalGPT 网站订阅价格、信用余额以及 OpenAI 的每分钟费率,不能作为同一请求的互换估算值。.

积分边界: GlobalGPT 提供了自有的音频 API。其公开文档中并未明确支持 OpenAI 的原生音频端点、GPT-Live 会话或所有 OpenAI 语音模型。如果您的现有应用依赖于上述任一功能,请在更换服务提供商之前确认该具体要求。.

音频 API 的常见错误及避免方法

问题需要检查的内容切实可行的下一步措施
无法上传录音文件大小和实际编码。.进行 OpenAI 文件转录时,请确保每次上传的文件大小不超过 25 MB,并使用 MP3、MP4、MPEG、MPGA、M4A、WAV 或 WebM 格式。若文件较大,请在自然的停顿处进行压缩或分割。.
该响应中没有发言者标签所选模型和响应格式是否支持日记化。.对于现有的日记化集成,请提交请求 diarized_json; 为该车型已公布的停产做好准备。.
翻译是英文的,但你想要另一种语言端点对目标语言的支持情况。.文件翻译端点返回的是英文文本。请使用单独的翻译步骤,或使用支持目标语言的服务。.
音频可以播放,但语音助手无法处理中断情况无论您是构建了流媒体播放功能,还是对话会话。.当您的应用在说话的同时还需要进行监听时,请使用实时语音架构。.
一个 OpenAI 示例在与另一个提供商进行测试时失败基础 URL、端点、模型 ID 和请求字段。.请遵循该服务提供商提供的音频文档。即使 SDK 的配置相似,也不能保证音频路径完全一致。.

在选择语音质量之前,请测试一段包含您实际用词的短片段:产品名称、数字、缩写以及用户使用的语言。对于转录内容,请检查词汇和说话人分配情况。对于旁白,请注意发音、停顿、语速,以及在较长的段落中是否能保持预期的语气。.

请仅使用已获得处理授权的录音,将密钥存储在可信服务器上,并仔细阅读接收您音频的服务所规定的数据条款。对于面向客户的产品,请在界面中明确标注有关录音和AI语音的相关声明。.

应该选择哪个 API 路由?

直接选择 OpenAI 当您的应用需要特定的 OpenAI 语音模型、已记录的转录选项或原生实时语音会话时,请从适合该任务的模型入手,并根据其实际请求和计费规则进行设计。.

考虑 GlobalGPT 当您的产品将音频与多家提供商的模型相结合时,或者当您希望在聊天、图像和视频功能之外探索语音生成功能时。请从 API 目录开始,选择一个可用的模型,并在进行大规模部署前先验证一个小型任务。.

音乐、旁白和转录需要选择不同的模型。我们针对 根据任务选择音频模型 有助于区分歌曲生成、旁白以及更复杂的音频场景。.

对于单个配音文件或会议记录,一个网页工具可能就足够了。当您的应用程序需要反复触发该任务、将结果传递到下一步,或者将结果提供给用户时,API 就会派上用场。.

常见问题

OpenAI 音频 API 是一个模型吗?

不,这是一套音频接口。语音生成、文件转录和文件翻译使用不同的端点和模型选项。GPT-Live 和 Realtime 为实时音频应用提供了独立的基于会话的选项。.

OpenAI 音频 API 能否将文本转换为语音?

是的。语音端点接受文本、模型和语音输入,然后返回音频。使用 gpt-4o-mini-tts 时,您还可以提供朗读指示,例如语调和语速。MP3 是默认的输出格式。.

我应该为一款新的转录应用选用哪种模型?

OpenAI 的当前文件转录指南建议对普通录音使用 gpt-transcribe。对于单词时间戳、字幕格式或发言人标签等特殊要求,请单独核查,因为不同模型的支持情况各不相同。.

Whisper 要停用了吗?

OpenAI 宣布其托管的 Whisper-1 API 模型将于 2027 年 2 月 26 日停止服务,同时停用的还有三个较早的 GPT-4o 转录模型。此次仅涉及 API 模型的停用,并不意味着所有 Whisper 软件或所有 OpenAI 音频服务都将停止运营。.

音频翻译会返回语音内容吗?

不。文件翻译端点会将录制的语音转换为英文文本。若要生成翻译后的语音,您需要额外进行语音生成步骤,或者使用专门的语音翻译服务。.

我可以在实时语音助手中使用 Audio API 吗?

您可以将转录、文本模型和语音生成功能整合到语音助手中,但实时对话处理需要额外的设计。OpenAI 建议将 GPT-Live 作为新建对话式语音应用程序的起点;此外,它还提供了独立的实时 API 文档。.

GlobalGPT 是否有音频 API?

是的。GlobalGPT 的 API 概述文档介绍了通过其任务端点生成音频的方法,以及图像和视频的生成方法。其模型端点列出了模型 ID 和价格。在发送请求之前,请先确认所选模型的可用性和参数。.

GlobalGPT 的音频 API 与 OpenAI 的完全一样吗?

它们记录了不同的音频处理路径:OpenAI 提供专用的音频端点,而 GlobalGPT 则通过其任务 API 处理音频生成。请使用所选提供商的模型 ID 和请求字段;OpenAI 端点的兼容性及实时语音支持必须单独进行验证。.

将音频功能整合到更广泛的人工智能应用中

探索 GlobalGPT 用于音频、聊天、图像和视频任务的 API。查看模型目录和定价信息,然后从用户最需要的任务开始。.

探索 GlobalGPT API →

打开您的 GlobalGPT 工作区

分享帖子:

相关帖子