知识卡片:OpenAI推出两套语音转录模型,实时与文件分线计费
一句话结论:OpenAI 将语音转录拆为文件转录(GPT-Transcribe)和实时转录(GPT-Live-Transcribe)两条独立产品线,实时定价约为文件的 3.8 倍,均支持三类上下文提示,但暂不支持 Batch API 折扣。
事件概述
2026 年 7 月 30 日,OpenAI 发布两套语音转文字模型:GPT-Transcribe(面向录音文件)和 GPT-Live-Transcribe(面向实时音频),正式将文件转录与实时转录拆分为两条独立产品线,并采用差异定价。
方法/产品要点
- 模型分工:GPT-Transcribe 处理录音文件转录;GPT-Live-Transcribe 处理实时音频流转录。
- 定价差异:实时模型每分钟 0.017 美元,文件转录每分钟 0.0045 美元,实时价格为文件的 3.8 倍。价差对应持续音频接入、增量输出与更低延迟。
- 上下文提示:两套模型均支持三类提示:prompt(提示词)、keywords(关键词)和 languages(语言指定)。
- 限制:音频转录暂不适用 Batch API 的折扣与额度。
主要结果或产业意义
- 将实时与文件转录独立定价,为不同使用场景(如会议实时字幕 vs. 录音文件批量处理)提供更精准的计费选择。
- 实时转录定价显著高于文件转录,反映 OpenAI 对低延迟、持续音频流服务的价值认定。
- 上下文提示功能的统一支持降低了开发者迁移成本,但 Batch API 折扣的缺失可能影响高频批量用户的经济性。
为什么重要
- 语音转录是生成式 AI 的关键应用场景之一,OpenAI 此举进一步细化了 API 产品矩阵,为开发者提供按需选择的灵活度。
- 实时转录与文件转录的价差(3.8 倍)为行业定价策略提供了参考锚点,可能推动其他厂商跟进分线计费模式。
局限与不确定性
- 材料未说明模型的具体性能指标(如词错误率、支持语言数量、实时延迟数值),这些待核实。
- 未提及模型是否支持多说话人识别、标点恢复、自定义词汇表等高级功能,需进一步确认。
- Batch API 折扣的缺失是临时限制还是长期策略,待核实。
可用于图书/PPT/简报的角度
- 定价策略分析:实时 vs. 文件转录的 3.8 倍价差,可用于讲解 API 产品的价值分层与成本结构。
- 产品线拆分逻辑:从单一转录模型拆为两条产品线,展示如何针对场景差异优化计费与功能。
- 产业趋势:语音转录走向专业化、场景化,类似 OpenAI 的分线做法可能成为行业标配。
原始材料
- 来源:搜狐转载腾讯研究院AI速递(2026-07-30)
- URL:https://m.sohu.com/a/1056423726_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=3
- 英文标题:OpenAI Launches Two Speech-to-Text Models with Separate Pricing for Real-Time vs. Files
- 英文关键词:OpenAI, speech-to-text, GPT-Transcribe, GPT-Live-Transcribe, transcription pricing