知识卡片:OpenAI为Codex上线实时语音功能
一句话结论:OpenAI 为桌面端 Codex 上线基于 GPT-Live 的实时语音控制功能,允许开发者离开键盘、通过语音指挥多个 Agent 并读取活动窗口画面,标志着“vibe coding”从自然语言写代码迈向将想法与画面直接交给 Agent 的新阶段。
事件概述
2026年7月,OpenAI 为 ChatGPT 桌面端(Codex 环境)上线了基于 GPT-Live 的实时语音功能。开发者佩戴耳机后即可脱离键盘和鼠标,通过语音指挥多个 Agent 执行代码任务,并随时查询进度、修改需求。同时新增 Appshots 功能,Codex 能够读取当前活动窗口的画面与文字,无需用户手动截图即可理解报错信息或界面状态,并直接进行修改。
方法/产品要点
- 实时语音控制:基于 GPT-Live 模型,支持在 Codex 中通过自然语言语音同时指挥多个 Agent,可离开电脑实时交互。
- Appshots 功能:Codex 可直接捕获活动窗口的像素与文字内容,自动理解报错、UI 布局等,无需用户手动截图或描述。
- Karpathy 观点:语音输入更适合复杂任务,能够低成本地倒出完整上下文;vibe coding 正在从“自然语言写代码”演进为“把想法与画面直接交给 Agent”。
主要结果或产业意义
- 大幅降低编程对键盘操作的依赖,使开发者在移动或非桌面场景下也能高效管理代码任务。
- Appshots 将视觉感知能力直接融入编码 Agent,缩短了从“看到问题”到“修改代码”的反馈循环。
- Karpathy 的评论暗示,语音+视觉的多模态 Agent 交互可能成为下一代编程范式的关键入口。
为什么重要
本条是对“编码智能体”和“视觉提示 Agent”类工具(如 Cursor Design Mode)的延续和升级。相比已有卡片中 Cursor 通过点击/绘制/语音直接在浏览器中修改 UI,OpenAI Codex 的实时语音和 Appshots 更侧重完整的开发环境控制,并能同时指挥多个 Agent,在复杂任务场景下更具生产力优势。
局限与不确定性
- 实时语音功能是否支持多语言(特别是中文)识别与交互?材料未明确说明。
- Appshots 的窗口捕获精度和对复杂界面的理解能力有待验证(待核实)。
- 功能目前仅针对 ChatGPT 桌面端 Codex 环境推出,其他平台或工具的可用性未知(待核实)。
- 材料未提及是否有任何数据隐私或安全限制(例如语音录音是否本地处理)。
可用于图书/PPT/简报的角度
- “语音编程”何时成为主流? 对比 CLI 时代、IDE 时代、自然语言时代,语音+视觉 Agent 可能是下一跳点。
- Agent 交互的多模态化:从文本聊天到语音+屏幕感知,如何改变程序员的工作流。
- Vibe coding 的演进路径:Karpathy 提出的趋势——从写代码到说话,再到“直接把想法和画面交给 Agent”。
原始材料
- 来源:搜狐转载腾讯研究院AI速递
- 标题:OpenAI为Codex上线实时语音,写代码可脱离键盘操作
- URL:https://m.sohu.com/a/1055048777_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4
- 英文标题:OpenAI Codex Real-time Voice
- 英文关键词:OpenAI, Codex, GPT-Live, real-time voice, Appshots, agent, vibe coding