OpenAI 发布 GPT-Live:边听边说,还能把难题交给 GPT-5.5 处理
全双工架构让 AI 语音对话不再「你说完我再说」,复杂问题后台交给 GPT-5.5 处理,对话不中断。
一分钟速览
- GPT-Live 是 OpenAI 新一代语音模型,支持全双工交互——边听边说,不再等你说完。
- 遇到需要搜索或深度推理的问题,GPT-Live 会后台委托 GPT-5.5 处理,同时保持对话流畅。
- 两个版本:GPT-Live-1(Plus/Pro 用户)和 GPT-Live-1 mini(免费用户)。
- 在人类偏好评测中,GPT-Live 在对话流畅度、自然度、打断处理上全面优于 Advanced Voice Mode。
- 已上线 ChatGPT iOS/Android/Web,API 即将开放。
1·发布 · 是什么
OpenAI 今天发布 GPT-Live,一个全双工语音模型。和之前的语音模式最大的区别:它不再等你说完再回答,而是可以边听边说。
这意味着你可以在它说话的时候打断它,可以暂停思考,可以说「嗯」表示你在听——就像和真人对话一样。
语音 AI 过去最大的问题是「回合感」——你说完,它说完,像打乒乓球。GPT-Live 把这种回合制变成了连续交互,同时把深度推理外包给 GPT-5.5,让「自然对话」和「聪明回答」不再冲突。
2·机制 · 怎么做到的
GPT-Live 的核心是两个架构变化。
全双工架构:不再处理一条消息、回复一条消息,而是持续处理输入同时生成输出。模型每秒做多次决策:该说话、该继续听、该暂停、该打断、该调用工具。
委托机制:遇到需要搜索、推理或复杂任务时,GPT-Live 把任务委托给 GPT-5.5 后台处理,同时保持对话流畅。等结果回来,再自然地接入对话。
三代语音架构对比
级联语音系统(旧)
语音→文字→LLM→文字→语音,三步串联。信息在模型间丢失,响应慢且生硬。
GPT-Live(新)
全双工架构,边听边说。持续交互 + 后台委托,对话流畅且聪明。
3·数据 · 表现如何
在人类偏好评测中,GPT-Live 在对话流畅度、自然度、打断处理上全面优于 Advanced Voice Mode。
- GPQA(专家级科学推理):GPT-Live-1 大幅优于 Advanced Voice Mode
- BrowseComp(网页搜索):GPT-Live-1 显著优于 Advanced Voice Mode
- τ³-Voice Telecom(电信客服任务):GPT-Live-1 优于 Advanced Voice Mode
4·落地 · 对我有什么用
谁能用
- Free 用户:GPT-Live-1 mini
- Go / Plus / Pro 用户:GPT-Live-1
- API:即将开放,开发者可注册候补
一句话结论:GPT-Live 把语音 AI 从「回合制」变成了「连续交互」。
全双工 + 委托机制,让「自然对话」和「聪明回答」不再冲突。这是语音 AI 的一个重要里程碑。
"Our vision is to enable truly natural human–AI interaction: a world where collaborating with AI feels as fluid and responsive as working with another person."