OpenAI 将实时全双工语音模型 GPT-Live-1 以 API 的形式发布

OpenAI 已将其最新的实时全双工语音模型(GPT-Live-1)以 API 的形式发布,使软件开发人员能够实现响应更迅速的语音应用和对话工作流程。

GPT-Live-1于 7 月首次亮相,它提供了一种通过语音提示和回复而非文本输入进行交互的方式。最初,该语音模型可通过 ChatGPT 界面使用,现在也可通过 API 调用访问。

作为一款全双工型号,GPT-Live-1 可以同时监听和生成语音,从而有助于流畅的沟通。人们经常会互相打断,如果像使用半双工手持对讲机那样轮流发言和收听,可能会让人感到沮丧。

OpenAI 表示,它一直致力于让实现 GPT-Live-1 的开发者能够自定义企业应用程序用户体验语音交互和相关工作流程的方式。

该公司表示:“GPT-Live-1 的一项核心优势(流畅的中断处理)已经带来了业务影响:在早期评估中,Speak发现 GPT-Live-1 让学习者在语言导师做出回应之前有更多时间思考,与之前的轮流系统相比,中断减少了近 80%。”

GPT-Live-1 旨在处理口语对话,而后端模型(例如 GPT-6 Astra 或更经济实惠的重复性任务选项)则处理信息查找、工具使用和任务管理。

它比 OpenAI 的Realtime API更进一步,后者于 2024 年首次亮相。在 Tau3 语音代理智能基准测试中(该测试评估与航空公司、零售商和电信公司相关的语音客户服务任务),GPT-Live-1 的得分为 86.2%,而 GPT-Realtime-2.1 的得分为 45.7%,GPT-Realtime-2 的得分为 42.4%。

OpenAI 援引自己的评估结果称,GPT-Live-1 在全双工基准测试性能方面比 GPT-Realtime-2.1 提高了 30%,同时在轮流延迟和交互行为方面也优于其前代产品。

Yelp 一直在 Yelp Host 服务中使用 GPT-Live-1,并且对该技术在公司 AI 餐厅预订系统中的应用给予了高度评价。 

OpenAI 将实时全双工语音模型 GPT-Live-1 以 API 的形式发布

Yelp 首席产品官 Akhil Kuduvalli Ramesh 在一份声明中表示:“借助 GPT-Live-1,每一次通话都更加自然流畅,响应也更加迅速。Yelp Host 现在为餐厅提供先进的语音 AI,能够带来卓越的顾客体验,抓住原本可能错失的盈利机会,并帮助员工专注于服务顾客,而不是接听电话。”

Yelp 没有说明餐厅顾客在预订时是欢迎这种更自由的机器人聊天,还是仅仅因为比等待接通人工客服要好而接受它。

GPT-Live-1 的使用费用为每分钟 0.05 美元,此费用不包含任何后端模型的费用。您可以与 OpenAI 销售团队协商定制语音。该语音模型也可通过OpenAI Presence(该公司的企业级代理平台)获取。

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/71903.html

(0)

相关推荐