数码影音频道 频道

OpenAI深夜放出GPT-Live: ChatGPT终于像真人一样说话

“AI摘要”

OpenAI于7月9日发布新一代全双工语音模型GPT-Live,将ChatGPT Voice升级至“实时对话”时代。该模型基于全双工架构,支持同时听说、自然打断和实时翻译,后台由GPT-5.5驱动,可将深度任务委派给后端处理,同时保持对话流畅。性能评估显示,GPT-Live在专家推理、网页搜索和客服任务等方面均优于前代Advanced Voice Mode。新体验包括更自然的对话、智能回答、可视化回复及九种声音,面向全球ChatGPT用户推出。

  北京时间7月9日凌晨,OpenAI突然上线新一代全双工语音模型GPT-Live,将ChatGPT Voice推向全新高度。该模型基于全双工架构,支持同时听说、自然打断、实时翻译,后台由GPT-5.5驱动,标志着AI语音交互从"回合制"正式迈入"实时对话"时代。

  全双工架构:从"你说完我再说"到"边听边聊"

  在GPT-Live之前,ChatGPT的语音交互经历了两个阶段。最初的级联式语音系统需要依次完成语音转文本、大模型生成、文本转语音三个步骤,响应缓慢且生硬。后来的Advanced Voice Mode虽在单一模型中处理音频,降低了延迟,但仍遵循一来一回的轮次机制——模型需要等用户停止说话后才能开始回应。

  GPT-Live则从根本上改变了这一范式。它基于全双工架构设计,处理的不是彼此独立的消息,而是在生成输出的同时持续处理输入。模型可以在每秒内多次做出交互决策,包括是否开口、继续倾听、暂停、插话或调用工具。

  在对话过程中,GPT-Live可以用"mhmm"或"yeah"这样的回应表示自己正在听,当用户需要思考时它会保持安静,用户可以随时打断插话提问。最终的体验是:人与AI的交流更像一场真正的对话。

  深度任务委派:前台聊天,后台"搬砖"

  GPT-Live的另一项关键创新是将持续交互与深层任务处理解耦。当问题需要搜索、推理或更强的智能体能力时,GPT-Live可以把任务委派给GPT-5.5这样的后端模型处理,同时继续维持对话流畅性。

  这意味着即使用户提出了需要联网搜索或复杂推理的问题,GPT-Live也不会"卡住"等你——它会一边和你保持交流,一边在后台完成深度任务,最终把结果带回对话中。

  发布时,GPT-Live后台调用的模型是GPT-5.5。随着OpenAI后续推出新的前沿模型,后台引擎也将持续更新,让GPT-Live始终获得最新的智能能力加持。

  性能评估:全方位超越前代

  OpenAI构建了全新的人类评估体系来衡量对话的愉悦感和流畅度。在一对一对比测试中,GPT-Live-1和GPT-Live-1 mini在5到10分钟的对话中,相比Advanced Voice Mode明显更受偏好。评估维度涵盖整体偏好、轮次衔接、打断情况、对话流畅度以及交互自然程度。

  在具体基准测试中:

  GPQA(专家级科学推理):GPT-Live-1显著优于Advanced Voice Mode

  BrowseComp(智能体式网页搜索):GPT-Live-1取得明显提升

  τ³-Voice Telecom(真实多轮电信客服任务):GPT-Live-1优于Advanced Voice Mode

  全新ChatGPT Voice体验

  每周有超过1.5亿人通过Voice和Dictation等功能与ChatGPT对话。从7月9日起,点击Voice按钮将获得由GPT-Live驱动的全新升级体验:

  更自然的对话:可以随时插话提问、停下来整理思路、让ChatGPT放慢语速。AI会用"mhmm"或"got it"表示在听。团队针对GPT-Live重新制作了九种不同的声音

  更智能的回答:可调用OpenAI最新前沿模型,支持Instant(快速响应)、Medium和High三种推理强度

  更好的倾听能力:用户思考时AI会等待而非插话,背景噪声干扰显著降低

  可视化回复:语音对话中可展示天气、股票、体育等可视化卡片,同时支持搜索、记忆、图片和文件上传

  GPT-Live目前正在面向全球ChatGPT用户推出,覆盖iOS、Android和ChatGPT.com。GPT-Live-1将成为Go、Plus和Pro用户的默认语音模型,GPT-Live-1 mini将成为Free用户的默认模型。

0
相关文章