ChatGPT 上线语音操控电脑:开口就能让 AI 写代码提交 PR

ChatGPT 语音操控电脑成为 8 月 9 日 AI 领域关注点。据本地新闻简报,OpenAI 桌面端 ChatGPT 正式上线语音交互功能,基于新语音模型系列 ChatGPT-Live,支持 ChatGPT Work 和 Codex:演示中开发者一句语音指令即可让 ChatGPT 创建代码线程、提交 Pull Request 并定位 Bug 根因;macOS 上可通过 Appshots 读取屏幕内容,iOS 应用支持远程访问 Codex 中使用语音。
语音从"聊天"升级为"干活"
过去语音助手停留在查询层面——问天气、设闹钟。ChatGPT-Live 的关键变化是语音可以执行多步骤任务:创建代码、提交 PR、定位 Bug,全程只需开口。VentureBeat 称这标志着"Agent 编程进入免提时代"。
功能要点:一是新语音模型 ChatGPT-Live 支持全双工对话,可随时打断追问;二是兼容 ChatGPT Work 与 Codex,覆盖办公与编程场景;三是 macOS 的 Appshots 可读取屏幕内容,让 AI"看见"你的电脑;四是 iOS 支持远程语音访问 Codex,人在外面也能指挥 Agent。
电影里的桥段成真
这一幕,科幻电影早预告过:《钢铁侠》里托尼·斯塔克对贾维斯说话,贾维斯就操控战甲、分析数据、执行任务——人说话、AI 动手,正是 ChatGPT-Live 的人机协作模式;New Atlas 评测记者甚至直言被"ChatGPT Voice 像贾维斯"的程度惊到。
《碟中谍》系列则是"穿戴设备提升效率"的范本:伊森·亨特靠智能眼镜、加密耳机实时调动团队信息、临场决策。ChatGPT 的 Appshots 读屏加语音操控,正把这种"随身信息协同"搬进普通电脑——屏幕是 AI 的眼睛,语音是耳朵,指令就是行动命令。
对开发者和行业的影响
对开发者,语音指挥 Agent 意味着双手可以离开键盘,效率链路缩短,结对编程从"打字"变成"对话";对普通用户,"开口即执行"降低了不少操作门槛;对行业,语音入口的出现意味着 Agent 竞争从模型能力延伸到交互方式,谁能让人更自然地指挥 AI,谁就占得先机。
使用提醒
也要看到:语音识别、意图理解、操作执行三层都可能出错;能读屏、能提交代码意味着权限与风险同步放大;办公环境噪音也会影响体验。功能细节以 OpenAI 官方发布为准,实际体验有待验证。
对准备尝鲜的用户,建议先在低风险场景试用,比如让 ChatGPT 梳理代码思路、生成测试用例,等熟悉了再逐步放开"提交 PR"这类高权限操作。同时注意留意 OpenAI 官方文档中关于语音功能的支持范围、可用地区与限制说明。
来源丨本地《AI 最新资讯·2026-08-09 08:00》、VentureBeat、New Atlas 等公开报道综合整理。
话题:#ChatGPT #OpenAI #语音交互 #Codex #AI编程
SEO 关键词:ChatGPT 语音、ChatGPT-Live、语音操控电脑、Codex、OpenAI 桌面端
建议发布时间:工作日 11:30—13:00 或 19:30—21:00
AI 生成内容标识提醒:本文由 AI 辅助生成,发布时请按平台要求添加 AI 生成内容标识,并人工复核功能与时效。