DeepFloodbeta

OpenAI 推出其最先进、最经济的语音转语音模型 GPT-realtime

OpenAI 声称,这款新模型能够更好地解读系统消息和开发者提示。Realtime API 去年发布时,自带 6 种不同的声音,后来又添加了两种。今天,OpenAI 宣布推出两种新声音:Marin 和 Cedar。除了新增声音外,现有的 6 种声音也进行了更新,使其听起来更加自然。

OpenAI 提到,这个新的 GPT-realtime 模型可以更好地理解音频,并且准确率更高,在基准测试中的表现也更好:

Big Bench Audio:gpt-realtime 的准确率达到了 82.8%,超过了 2024 年 12 月推出的上一代实时模型(准确率 65.6%)。

MultiChallenge 音频基准测试:gpt-realtime 得分为 30.5%,与 2024 年 12 月的上一代型号(得分为 20.6%)相比有显著提升。

ComplexFuncBench 音频评估:gpt-realtime 得分为 66.5%,而 2024 年 12 月的上一代型号得分为 49.7%。

除了新模型和语音之外,OpenAI 还宣布了 API 的多项更新。实时 API 现在支持远程 MCP 服务器、图像输入以及通过会话发起协议 (SIP) 进行电话呼叫。最后,开发人员现在可以保存和重复使用提示。

海外cnbeta上的新消息。
https://www.cnbeta.com.tw/articles/tech/1521526.htm

OpenAI前两个月似乎被谷歌的Gemini超越,但是这几大公司力量追得比INTEL和AMD还狠。也许以后可以边吐个想法,AI工具们就直接把我们的想法生成语音对话发到DF上来了。

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

📈用户数目📈

目前论坛共有13137位用户

🎉欢迎新用户🎉