GPT Transcribe 发布,语音识别精度对标行业
OpenAI 发布新一代语音识别 API,但误差率仍落后于 ElevenLabs、Google。对需要语音功能的开发者有参考价值。
OpenAI 发布新一代语音识别 API,但误差率仍落后于 ElevenLabs、Google。对需要语音功能的开发者有参考价值。
OpenAI 发布了 GPT Transcribe 和 GPT Live Transcribe,两个新的语音识别模型,可通过其 API 获得。GPT Transcribe 用于处理预录制音频文件,处理速度比实时快约 34 倍。GPT Live Transcribe 为实时流处理而构建,具有低延迟特性。
根据运行 AA-WER 基准的 Artificial Analysis,GPT Transcribe 的字错率为 3.31%。相比一年前的旧版本 GPT-4o Transcribe,这提高了 0.7 个百分点。同时价格下降了 25%,现为每分钟音频 0.0045 美元。两个模型都支持文本作为转录上下文、关键词和多种输入语言。
在 AA-WER 排名中,OpenAI 仍然落后于几个竞争对手。ElevenLabs Scribe v2 以 2.3% 的错误率领先,其次是 Google 的 Gemini 3 Pro(2.9%)和 Mistral 的 Voxtral Small(3%)。Mistral 最近通过推出 Voxtral Transcribe V2 降低了市场价格,仅需每分钟 0.003 美元。
完整详情请见 OpenAI 的 Transcription Guide。这些新的转录模型补充了 OpenAI 最近宣布的 Realtime 模型生成功能,其中还包括实时转录模型 GPT-Realtime-Whisper。
订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、我们每年六次的独家"AI Radar"前沿报告、完整档案访问权限以及评论区访问权限。