All models

gpt-transcribe

OpenAIAudio
0.001 Credits
Get your API key
gpt-transcribe

把录音转为可检索、可整理的文字素材

gpt-transcribe 是用于音频转文字的 OpenAI 转写服务,适合将访谈、课程、会议和口述内容整理为文本素材。它围绕录音文件开展工作,交付识别文字,而不是生成语音或进行普通聊天。使用时可结合语言信息与文本提示组织请求,再把转写结果接入搜索、编辑或摘要流程。

OpenAI模型品牌
音频模型类型
音频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

任务类型
音频转写:录音输入,文字输出
调用入口
POST /v1/audio/transcriptions;显式指定 model=gpt-transcribe
输入方式
file 必填,使用二进制音频文件
基础结果
默认请求格式为 json;JSON 响应以 text 字段承载文字
提示配置
入口提供 language、prompt,以及 languages[]、keywords[] 参数
输出配置
入口列有 text、srt、verbose_json、vtt 等格式选项,按任务验证适用性
计量方式
按音频秒计量

以上为服务入口的输入输出与配置范围,不代表独立的原生版本规格,字幕、时间戳等扩展选项需针对任务验证。

核心能力

了解 gpt-transcribe 能为你的工作带来什么。

从声音到文字素材

gpt-transcribe 的核心用途是把录音中的口述内容转成文字,让音频进入可搜索、可复制、可编辑的工作流。应用可以读取 JSON 中的 text 字段,保存为访谈稿、课程笔记素材或会议记录初稿;摘要、分类与观点提炼则适合作为后续处理步骤。

为专业内容准备提示

处理带有行业术语、产品名称或特定语言的录音时,可利用入口的语言与提示字段提供背景。建议先整理简洁的术语表和语境说明,再用代表性片段测试效果。这些配置服务于转写任务,不应当成强制替换规则,也不能替代对关键名称的人工校对。

衔接文本与字幕流程

基础文本适合归档和检索;需要进入视频编辑流程时,可围绕入口提供的字幕格式与时间戳选项设计交付。应先确认所选配置能返回所需结构,再处理完整素材。转写文字、字幕切分和画面同步是不同环节,不宜把获得文字直接等同于字幕制作完成。

适用场景

从具体任务出发,找到模型发挥作用的位置。

采访录音整理

输入采访录音,并准备受访者姓名、机构名及主题术语,获得可编辑的文字初稿。编辑人员可据此搜索原话、标记引用段落和整理问题脉络;正式发表前,再回听涉及数字、专有名词和关键表述的片段,保留受访者原意而非依赖自动改写。

课程与讲座归档

将课程或讲座音频转写为文本,按课程名称、主题和录音批次保存,便于学习者检索概念与回顾内容。交付物可以是正文素材和检索索引;章节划分、知识点总结及练习题需要另行组织,不应把一次转写请求当成完整的课程内容生成流程。

视频口述稿准备

对视频配套录音或旁白素材进行转写,先获得文字底稿,再进入校对、断句与字幕编辑。需要字幕文件时,先用短片段测试格式与时间对齐,再批量处理。背景音乐、多人重叠讲话和剪辑接点应重点回听,避免把识别文本未经检查就直接发布。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

按转写任务选择,而非按名称推断升级

需要把已有录音转换为文字时,可以选择 gpt-transcribe。它与 whisper-1 在客户端中分别作为转写选项出现,选型时应使用同一批录音比较术语识别、文本可读性及输出配置适配情况,不宜仅凭名称判断速度或准确率差异,也不要把它直接等同于 gpt-4o-transcribe 的某个版本。

区分转写、理解与语音生成

若交付物是录音文字稿,优先使用转写工作流;若要从文字稿提炼行动项、撰写摘要或回答内容问题,可在转写后增加文本处理环节。若目标是把文字读成声音,则应选择语音合成服务。这样拆分任务,能够分别检查识别错误与内容加工结果,便于定位问题。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 转写结果不等于经过审核的逐字记录。弱音、背景噪声、口音和多人同时讲话可能增加校对负担;涉及姓名、金额、日期或专业结论时,应保留原始录音并回听关键位置,不宜只凭文字稿作最终判断。
  • 不要预设结果会自动区分说话人、翻译成另一种语言或给出每个词的可信程度。需要这些交付物时,应单独设计识别、复核或后处理环节;会议纪要中的责任人和行动项也不能仅依靠转写文字自动确定。
  • 文件转写与实时语音对话是不同工作方式。stream 和时间戳配置不等于持续麦克风输入、双向通话或自动字幕同步;长录音宜先用短样本确认上传、输出及断句表现,再安排完整处理与结果合并。

常见问题

解答使用 gpt-transcribe 时的常见疑问。

gpt-transcribe 就是 gpt-4o-transcribe 吗?

使用时应把 gpt-transcribe 作为独立调用 ID,不要自行替换为 gpt-4o-transcribe 或 gpt-4o-mini-transcribe。名称相近不意味着版本一致,选型更应关注自己的录音样本和所需交付格式。

直接调用时怎样提交音频?

向 /v1/audio/transcriptions 提交二进制 file,并显式填写 model=gpt-transcribe。不要依赖省略模型后的默认选择。若通过 MCP 的音频转写工具提交 URL,则按该工具的输入方式操作,不要直接把 URL 字符串当作上传文件。

能直接生成 SRT 或 VTT 字幕吗?

入口提供 srt 和 vtt 请求选项,可以先用短录音测试是否得到符合需求的字幕结果。正式交付还应检查断句、时间对齐和专有名词;如果工作流以基础文本为主,也可以先转写,再在字幕编辑环节安排时间轴。

专业词汇很多时,怎样准备请求?

可以围绕 language、prompt 或 keywords[] 准备简洁的语言信息与术语背景,先测试常见名称和易混淆词。提示不是保证正确识别的词典,也不适合夹带改写指令;关键术语仍应与原录音逐项核对。

能边说话边得到实时回答吗?

gpt-transcribe 的主要工作流是音频文件转写,输出的是识别文字,而不是对话回答。即使使用流式配置,也不应等同于实时双向语音会话;需要边听边回答时,还需另外设计音频采集、对话处理和语音播放环节。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 gpt-transcribe 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。