OpenAI深夜放出GPT-Live: ChatGPT终于像真人一样说话
北京时间7月9日凌晨,OpenAI突然上线新一代全双工语音模型GPT-Live,将ChatGPT Voice推向全新高度。该模型基于全双工架构,支持同时听说、自然打断、实时翻译,后台由GPT-5.5驱动,标志着AI语音交互从"回合制"正式迈入"实时对话"时代。
全双工架构:从"你说完我再说"到"边听边聊"
在GPT-Live之前,ChatGPT的语音交互经历了两个阶段。最初的级联式语音系统需要依次完成语音转文本、大模型生成、文本转语音三个步骤,响应缓慢且生硬。后来的Advanced Voice Mode虽在单一模型中处理音频,降低了延迟,但仍遵循一来一回的轮次机制——模型需要等用户停止说话后才能开始回应。
GPT-Live则从根本上改变了这一范式。它基于全双工架构设计,处理的不是彼此独立的消息,而是在生成输出的同时持续处理输入。模型可以在每秒内多次做出交互决策,包括是否开口、继续倾听、暂停、插话或调用工具。
在对话过程中,GPT-Live可以用"mhmm"或"yeah"这样的回应表示自己正在听,当用户需要思考时它会保持安静,用户可以随时打断插话提问。最终的体验是:人与AI的交流更像一场真正的对话。
深度任务委派:前台聊天,后台"搬砖"
GPT-Live的另一项关键创新是将持续交互与深层任务处理解耦。当问题需要搜索、推理或更强的智能体能力时,GPT-Live可以把任务委派给GPT-5.5这样的后端模型处理,同时继续维持对话流畅性。
这意味着即使用户提出了需要联网搜索或复杂推理的问题,GPT-Live也不会"卡住"等你——它会一边和你保持交流,一边在后台完成深度任务,最终把结果带回对话中。
发布时,GPT-Live后台调用的模型是GPT-5.5。随着OpenAI后续推出新的前沿模型,后台引擎也将持续更新,让GPT-Live始终获得最新的智能能力加持。
性能评估:全方位超越前代
OpenAI构建了全新的人类评估体系来衡量对话的愉悦感和流畅度。在一对一对比测试中,GPT-Live-1和GPT-Live-1 mini在5到10分钟的对话中,相比Advanced Voice Mode明显更受偏好。评估维度涵盖整体偏好、轮次衔接、打断情况、对话流畅度以及交互自然程度。
在具体基准测试中:
GPQA(专家级科学推理):GPT-Live-1显著优于Advanced Voice Mode
BrowseComp(智能体式网页搜索):GPT-Live-1取得明显提升
τ³-Voice Telecom(真实多轮电信客服任务):GPT-Live-1优于Advanced Voice Mode
全新ChatGPT Voice体验
每周有超过1.5亿人通过Voice和Dictation等功能与ChatGPT对话。从7月9日起,点击Voice按钮将获得由GPT-Live驱动的全新升级体验:
更自然的对话:可以随时插话提问、停下来整理思路、让ChatGPT放慢语速。AI会用"mhmm"或"got it"表示在听。团队针对GPT-Live重新制作了九种不同的声音
更智能的回答:可调用OpenAI最新前沿模型,支持Instant(快速响应)、Medium和High三种推理强度
更好的倾听能力:用户思考时AI会等待而非插话,背景噪声干扰显著降低
可视化回复:语音对话中可展示天气、股票、体育等可视化卡片,同时支持搜索、记忆、图片和文件上传
GPT-Live目前正在面向全球ChatGPT用户推出,覆盖iOS、Android和ChatGPT.com。GPT-Live-1将成为Go、Plus和Pro用户的默认语音模型,GPT-Live-1 mini将成为Free用户的默认模型。