OpenAI 引入两种转录模型:低延迟、更好理解上下文
浏览13次
点赞0次
收藏0次
感谢网友 华南吴彦祖 的线索投递!
7 月 29 日消息,OpenAI 公司今天(7 月 29 日)在 X 平台发布公告,宣布推出 GPT-Live-Transcribe 和 GPT-Transcribe 两种转录模型,并支持通过 API 方式调用。

调用费用方面
GPT-Live-Transcribe 转录费用为每分钟 0.017 美元(注:现汇率约合 0.12 元人民币)
GPT-Transcribe 转录费用为每分钟 0.0045 美元(现汇率约合 0.03 元人民币)
OpenAI 官方表示相比公司此前模型,上述两种转录模型可以更好地理解上下文,并能在各种口音和语言的真实世界音频上提供更准确的转录,包括短语、数字、专业术语以及带有响亮背景噪音的语音。
GPT-Live-Transcribe 是专为低延迟实时转录而构建;而 GPT-Transcribe 可以优化已完成音频文件和批量工作负载的异步转录。

在 Context Aware ASR 基准测试上,GPT-Transcribe 语义准确率从无自由形式上下文的 41.6% 提高到有上下文的 45.2%。

在 Common Voice 的 22 种语言上,GPT-Transcribe 的转录错误率为 19.27%,而 Whisper (whisper-1) 为 40.37%。在真实世界音频录制基准的九种语言上,它实现了 8.98% 的转录错误率,而 Whisper (whisper-1) 为 15.21%。
声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社