OpenAI新模型 押注语音即AI入口 迈入实时对话时代
GPT-Live覆盖网页、iOS和安卓平台,未来接入API。它能实时翻译、听写、调整语速,还能后台无缝调用GPT-5.5等模型完成复杂推理和联网搜索,首发尚不支持视频和屏幕共享语音。两版本Live-1和Live-1
mini分别默认面向付费和免费用户,5-10分钟一对一盲测中性能均明显优于Advanced Voice
Mode。OpenAI同时强化语音安全机制,高风险情况下可主动结束对话,家长可收到提醒;称每周已有超1.5亿人使用语音功能与ChatGPT交流。
OpenAI正进一步押注语音交互。
美东时间8日周三,OpenAI发布全新的语音模型GPT-Live,同步升级ChatGPT语音模式(ChatGPT
Voice)。新模型采用原生实时架构,可实现人类与AI之间更加自然的双向语音交流,不仅支持打断、停顿理解、实时翻译、听写等能力,还能够在后台无缝调用GPT-5.5等模型完成复杂推理和联网搜索,将语音打造为ChatGPT新的统一交互入口。
OpenAI公告称,GPT-Live包括GPT-Live-1和GPT-Live-1
mini两个版本,目前已开始向全球ChatGPT用户陆续开放,覆盖网页、iOS和安卓平台,并计划未来数周向API开放,开发者和企业用户可提前登记获取通知。
此次发布意味着,OpenAI正进一步押注语音将成为AI时代最重要的人机交互方式。OpenAI在发布新模型时透露,目前每周已有超过1.5亿人使用ChatGPT
Voice、Dictation等语音功能与ChatGPT交流。媒体评论认为,OpenAI希望未来用户越来越少依赖键盘输入,而更多直接与AI“说话”。
ChatGPT Voice 产品负责人 Atty
Eleti说,此次发布语音模型“仅仅是个开始。我们认为,随着时间的推移,这将使语音成为与计算设备交互的主要方式。”
它还可以用于“管理日益复杂、耗...








