近日,andrej karpathy分享了一个他私藏已久的高效技巧:想让ai高效执行任务,却懒得逐字敲出清晰指令?
他的解法简单粗暴——往后一靠,切到语音模式,意识流全开,随口讲上10分钟,逻辑混乱、语序颠倒、重复啰嗦,统统没关系。
有时开场还会先跟AI打个招呼:“现在切换语音识别,错别字请自动忽略。”
令人惊讶的是,AI反而特别擅长从这种杂乱无章的口语流中提取核心意图,并输出比你原始表达更精准、更结构化的回应——你脑中那团混沌的念头,被它悄然梳理成清晰路径;反复确认、来回修正的次数也大幅减少。
这正是Karpathy与AI协作时最得心应手的方式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

用他自己的话说,这种方式能显著提升人与模型之间的「心智对齐度」。人类本就常因繁琐而放弃把前因后果一字一句敲清楚,那不如干脆开口,把整团思维毛线一股脑甩给AI。
语音的价值,不在于解放双手,而在于以高带宽方式,将完整上下文一次性注入AI。
就在本周,OpenAI已将这套「动嘴不动手」的交互范式,正式植入桌面端。
桌面版ChatGPT,现已支持语音指挥
7月23日,OpenAI正式将ChatGPT Voice功能落地至桌面App的Work与Codex两大核心场景。

即日起,macOS与Windows平台开始分批推送,覆盖Plus、Pro、Business、Edu、Enterprise全部订阅层级;Android版本紧随其后,iOS则通过Remote配对实现远程语音接入。
其底层驱动,是7月8日刚发布的全新语音模型GPT-Live——具备实时听辨与即时响应能力:你能随时打断,AI立刻承接你最新一句话继续推进,彻底告别旧式“录完→转文字→生成→回复”的延迟链路。
更重要的是,此次语音升级并非仅用于闲聊。
在Work与Codex环境中,你张嘴即可启动任务、查询进度、查看智能体当前状态,甚至在同一会话内并行调度多个Agent,各司其职、协同推进。
任务后台持续运行,你中途插一句就能调整方向;当卡点出现或任务完成,AI会主动语音提示,或在屏幕上弹出轻量提醒。
它还能无缝衔接你手头正在进行的工作:调取已有项目上下文,接入本地文档、日历、联系人及通讯记录,帮你把半途而废的事收尾。
官方列举了若干日常高频场景:查日程是否冲突、翻邮箱确认航班变更、顺手整理会议纪要……这些事,「趁你泡咖啡或处理其他事务时」,已在后台悄然完成。
macOS额外支持Appshots与屏幕上下文识别,可直接读取当前最前台窗口内容,并结合本地文件与代码库综合理解;热键亦支持自定义。
目前,Codex叠加ChatGPT Work的周活跃用户已突破1000万。
OpenAI发布的一支宣传片里有个耐人寻味的画面:几位工程师围在同一台电脑前,面向同一段桌面会话,各自发出不同指令——一个AI,多人共管,指令交错却不冲突。
这或许就是他们构想中的「群体编程派对」。

OpenAI用一段居家办公场景演示ChatGPT Voice:开口向桌面版Codex交代待办事项,它随即在后台自主推进。
打字是AI输入瓶颈,语音却不是
这显然不是OpenAI的单点突进。
几乎同一周,三位行业重量级人物不约而同地为「语音交互」投下关键一票。
Karpathy在X平台发文坦言:当上下文庞杂、打字成本过高时,他习惯用自由发言的方式“倒垃圾”,再交由AI做信息萃取与逻辑重构。
一位Grok忠实用户转发该帖并附言:“早用惯了Grok语音转写,现在打字像受刑”;还顺带调侃Anthropic的语音输入“仍停留在基础阶段”。
马斯克随即转发,并补充道:“你可以像吩咐同事一样,用Grok Build把任务直接托付给Grok去执行。”

奥特曼也顺势推介自家新一代语音模型GPT-Live。
他坦白自己长期偏好打字而非语音对话,但如今与ChatGPT的交流中,“说话的频次已远超打字”。

他还特别强调:当你需要一次性灌入大量背景信息时,语音是最自然、最高效的通道。
ChatGPT Atlas(macOS)可在浏览网页时提供即时回复、内容总结与任务辅助。它支持智能建议、信息整理及多场景交互,同时配备可控隐私设置,让用户在使用过程中更加安全安心。针对 macOS 平台优化后,带来流畅自然的浏览体验,适用于办公、学习、创作及日常信息查询等多种场景。
令三人共同振奋的,并非“终于能开口说话”这一表层变化。
其深层逻辑在于:随着智能体能力持续跃升,人类需传达的意图日趋复杂,而键盘这条输入管道正日益堵塞——
你越想省事简写,AI接收到的信号就越稀薄、越易失真。
反观语音,天生具备高吞吐特性:你能一口气倾泻来龙去脉、隐含顾虑、个人偏好,哪怕表达凌乱,AI也能兜底接收,并替你完成意识流的再结构化。
社区实测数据显示:语音平均语速约每分钟240词,而打字极限仅70–80词,效率差距达3–4倍。
GPT-Live将推理重担交由后台GPT-5.5、GPT-5.6等大模型承担,前台专注保障对话流畅性与响应即时性——这种前后端解耦设计,正是为了让人可以毫无负担地“随便开口”。
归根结底,人脑思维本就是并行、跳跃、非线性的,键盘却强制将其压缩为单线性文本流。
语音正在松动这堵墙:它正从一种“图省事的输入替代方案”,进化为一条“高保真上下文注入通道”。
一句话总结:打字是AI输入的瓶颈,语音却不是。
语音背后,是「用嘴管理项目」
OpenAI此次真正嵌入桌面版的,是让语音成为AI项目的“指挥中枢”。
据官方FAQ,在Work与Codex中,开口即可完成:任务启动、多任务优先级排序、执行中打断与转向——所有操作均不影响后台持续运行。
更进一步,它支持跨对话、跨项目协调多个智能体协同作业。你说一句“先跑A,B暂挂,C出结果立刻通知我”,系统便会据此动态重排执行队列。
它还能延续上次中断的工作流。依托项目上下文记忆,以及深度集成的文档、日历、联系人、通讯记录等工具链,实现真正的任务续跑。
当任务阻塞或完结,AI会通过语音播报或屏幕浮层主动同步状态。
这早已超越传统语音输入法范畴,它更像一个分布式智能体调度中心。
同样是开口对话,过去的目标是“让AI听懂你”,如今的目标已是“让AI替你做事”。
ChatGPT瞄准的,是你的「AI工作操作系统」
一个语音功能背后,暗藏一条宏大演进路径:OpenAI正推动ChatGPT蜕变为用户的「AI工作操作系统」。
近几个月,桌面版ChatGPT已完成重大重构——Chat、Work、Codex三大模块统一入口、一键切换,且后台长期驻留、持续服务。
Codex本身也已升级为支持多智能体并行、长周期任务执行、全项目上下文理解的通用智能平台。
为何选择桌面端而非移动端作为主战场?
答案很现实:手机那方寸聊天框,只适合碎片化问答;而真正让AI联动你的文件、代码、浏览器及全套办公软件,把一件事从立项到交付全程闭环,必须扎根于电脑——
桌面环境才拥有真实文件系统、IDE开发环境、浏览器生态与企业级办公套件,这才是智能体施展拳脚的核心战场。
这背后,是一场人机交互范式的根本性迁移。
过去你使用AI,本质是在「操作软件」:打开→输入→等待,回合制交互。
如今你更像一位项目经理:开口分派任务,人与AI的关系,正悄然从“你问它答”,转向“你说它做”。
一位深度用户直言:“这套体验,基本就是现实版贾维斯。”
他甚至为Codex定制了快捷键,一声令下,即可在三台设备、多块屏幕间无缝切换任务视图。
回到最初那个画面——真正点燃马斯克、奥特曼、Karpathy等人热情的,从来不是“能不用键盘了”,而是当输入不再成为枷锁,人类得以把省下的认知资源,重新投入到真正需要深思熟虑的环节:决策本身。
因此,下一个关键问题,并非“你能否开口”,而是——当你面前站着一支召之即来、来之能战的AI军团,你究竟希望它们,为你做什么?
参考资料:
https://www.php.cn/link/b4a8354aea91d32c34ee891ded2715e6
https://www.php.cn/link/92cd84e399a513f3cccdfb9f5859ba07
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。










