ChatGPT 桌面端装上了"真人口吻":GPT-Live 语音上线,你说话它就在后台干活
来源:互联网
时间:2026-07-25 14:56:28
OpenAI 桌面版 ChatGPT 迎来语音大升级:GPT-Live 驱动,三板块协同
OpenAI 近日对 ChatGPT 桌面应用进行了一次重要升级——这个已经与 Codex 合并的客户端,正式引入了由 GPT-Live 模型驱动的语音模式。用户现在可以在聊天(Chat)、办公(Work)和编程(Codex)三个板块中,直接用语音发起、检查或调整任务,将多线程工作协同从敲键盘变为动嘴皮。

升级背景:从语音识别到全双工对话
这条升级路线并不短。OpenAI 在 2024 年首次为 ChatGPT 加入语音识别功能,随后一路猛攻语音技术。直到最新发布的 GPT-Live 模型,才真正将全双工能力跑通——它能一边聆听、一边说话,让 AI 对话的体感更贴近真人。OpenAI 在声明中明确表示:未来用户只需口述需求,ChatGPT 就能顺着你的思路,快速推进多项任务。
新语音模式的核心能力:多任务并行与后台执行
新语音模式最关键的改变是:
支持用户从单一对话中启动多个工作流程
- 你可以让 ChatGPT 翻看日历,查找时间冲突;
- 同时扫描收件箱,确认航班是否有变动;
- 顺手把会议记录准备妥当;
而这一切,都发生在“你冲咖啡或者干别的”的工夫里。比起单纯把语音当作输入框,这种“你说话、它办事、彼此不耽误”的交互方式,正是 GPT-Live 想要拉开差距的地方。
三板块语音协同:Chat、Work、Codex 全覆盖
升级后的桌面应用将语音功能整合到三个核心板块中:
- :日常对话、信息查询,直接语音提问获取答案。
Chat(聊天)
- :文档编写、会议安排、邮件处理,语音下达指令即可执行。
Work(办公)
- :代码编写、调试、审查,口述需求即可生成或修改代码。
Codex(编程)
用户可以在任意板块中随时切换语音模式,无需手动输入,大幅提升工作效率。
使用小提示
- 提示1:在语音对话中,你可以同时下达多个任务,例如“帮我查一下明天的会议时间,顺便把上周的周报摘要发给我”,ChatGPT 会分步处理并在后台完成。
- 提示2:如果语音识别出现偏差,可以直接用语音纠正,无需重新开始对话。
- 提示3:确保麦克风权限已开启,并在安静环境中使用,以获得最佳识别效果。
常见问题
问:新语音模式需要单独付费吗?
答:目前该功能已整合到 ChatGPT 桌面应用中,具体收费情况请参考 OpenAI 官方定价。通常 GPT-Live 模型对 Plus/Pro 用户开放,免费用户可能有限制。问:语音对话是否支持多语言?
答:GPT-Live 模型支持多种语言,包括中文、英文、日文等,但识别准确度因语言而异。推荐使用英文或中文进行测试。问:在 Codex 板块中,语音能直接生成代码吗?
答:可以。你可以口述编程需求,如“写一个 Python 函数,用于计算斐波那契数列”,ChatGPT 会生成对应代码,并支持后续修改。问:后台执行任务时,对话会中断吗?
答:不会。你可以在任务执行过程中继续与 ChatGPT 对话,它会在后台处理任务,并在完成后提醒你。
总结:语音交互的新篇章
OpenAI 此次升级,将 ChatGPT 桌面应用的交互方式从“键盘输入”推向“语音驱动”,并借助 GPT-Live 的强大全双工能力,实现了多任务并行与后台执行。未来,随着语音技术的进一步成熟,用户或许只需动嘴,就能完成从日常聊天到复杂编程的全部工作。