要点速览 本文梳理了openai与google deepmind近期发布的两份重要报告,揭示ai agent正从底层逻辑重塑工作范式,并持续延展人类在职业实践与科学研究中的能力疆界。 openai数据显示,其内部ai agent工具codex已深度融入全公司运作——目前承担了每周输出token总量的99.8%。一方面,任务复杂度显著提升,80.6%的用户曾交付需人工耗时30分钟以上的任务;另一方面,因agent大幅降低技术门槛,非技术人员正快速跨越职能壁垒,独立完成原本依赖工程师支持的工作。 google deepmind在《自然》期刊发表co-scientist研究,该基于gemini构建的多智能体系统通过模拟科学思维闭环,在真实科研场景中已产出可验证成果。参与科学家指出,agent作为协作伙伴,有望将关键科学发现的周期压缩至原有水平的十分之一甚至更短。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

“AI Agent正在重构知识劳动的基本单位——不再是一次性问答,而是可托付、能自主运行数小时乃至更久的完整任务。”
这是OpenAI最新报告开篇提出的判断。报告指出,Agent已具备长时间连续运行能力:主动调用外部工具、实时感知环境变化、动态调整策略并反复优化,直至目标达成。这一质变,使其跃升为组织中最核心的AI生产力载体。
几乎同步,Google DeepMind在《自然》杂志正式发布Co-Scientist项目——一个由Gemini驱动的多角色Agent协同系统,覆盖假设生成、批判评估与迭代进化全过程。研究文档详述多个实证案例,证实该系统已在生物医药、衰老机制、材料科学等多个前沿领域催生实质性进展。
AI Agent的价值,远不止于“提速”;它正悄然重写人类工作的定义边界,同时拓展科研探索的物理与认知极限。
工作形态发生了哪些根本性转变?
OpenAI以自身为观察样本,完整记录了Codex从边缘工具成长为组织级基础设施的演进路径。
Codex公开初期,即便在OpenAI内部,ChatGPT仍是绝大多数员工的首选AI助手。截至2025年8月,普通员工在Codex上的token消耗占比尚不足10%。但此后发展呈现爆发式增长。
至2026年,Codex已成为公司所有职能部门——包括法务、财务、人力资源、品牌传播等非技术部门——日常工作的主力AI工具。当前,其承载了公司每周总输出token量的99.8%。OpenAI认为,这一现象并非偶然,而是预示着未来组织运作的新常态:随着Agent能力持续增强、使用成本不断下降,跨职能普及将成为必然趋势。

任务复杂度指标同步攀升。报告按“等效人工耗时”对Codex请求进行建模分析。截至2026年5月,80.6%的用户曾提交需人类投入超30分钟方可完成的任务;70.2%的用户提交过等效工时超过1小时的请求;而对应8小时以上工作量的任务,其提交增速最为迅猛。

早期Codex主要被用于即时答疑、片段化代码补全;如今,用户越来越多地将其视为“任务代理人”——委托其完成整套流程:信息搜集、数据清洗、方案比选、原型搭建、结果复盘。OpenAI指出,随着Codex在长上下文理解、自主规划与错误恢复等方面能力持续突破,用户行为模式也发生本质迁移:从碎片化交互,转向系统性任务委托。
与此同时,岗位能力边界正被重新锚定。程序员率先大规模采用Codex,符合预期;但更具启示意义的是,自2025年8月以来,个人用户中非开发者使用量激增137倍,企业用户中非开发者增幅达189倍。更值得注意的是,在法务、财务、运营等非技术岗员工产出的内容中,有超25%属于编程、自动化脚本、数据管道搭建或调试类工作。这意味着,过去必须协调IT团队介入的数字化任务,如今可由业务人员直接发起并闭环交付。

Gemini Notebook网页版是一款基于AI的智能笔记工具,其核心功能是让用户上传个人文档(如PDF、文本等),并以此为基础进行交互。它能针对你的资料进行总结、解答疑问、生成新内容,让信息处理更高效。该版本为在线使用,无需下载安装。
这些结构性变化,为企业重构岗位设计、帮助员工识别高价值能力、协助政策制定者研判AI对就业结构的长期影响,提供了极具现实意义的观测窗口。OpenAI强调:当强大Agent工具触手可及,人们会本能地将其应用于周期更长、逻辑更复杂、横跨更多专业领域的任务之中。这种自发演进,或将定义下一代职场的基本形态。
科研副驾驶:当Agent成为科学共同体一员
若OpenAI的报告刻画了知识工作交付方式的范式迁移,那么Google DeepMind在《自然》刊发的Co-Scientist研究,则展示了AI Agent如何真正嵌入科学发现的核心环节。
DeepMind指出,Co-Scientist旨在攻克科研中最棘手的挑战之一:在指数级增长的文献与数据海洋中,精准定位具有突破潜力的初始假设——“每一项颠覆性发现,都始于一个恰到好处的问题”。
该系统基于Gemini构建,由多个专业化Agent构成协同网络,完整复现科学思维的三阶段循环:假设生成 → 批判检验 → 方向进化。具体分为三大模块:
- 生成层:多Agent并行提出初始假设,并按语义与机制多样性聚类;
- 辩论层:虚拟同行评审团对假设展开逻辑推演、证据核查与反事实挑战;
-
进化层:依据辩论结果动态加权、筛选、融合高潜力方向,输出待验证的研究提案。
整个流程由顶层“督导Agent”统一调度,将宏观科研目标拆解为可执行子任务,驱动各模块并行探索。

Co-Scientist最具创新性的设计在于其验证机制。它借鉴AlphaGo的对抗学习框架,但应用场景升级为“科学思辨”——系统将全部候选假设投入一场“创意锦标赛”,通过成对辩论、多轮淘汰与动态演化持续优化;同时深度融合PubMed、ChemBL、UniProt等权威数据库,确保留存假设既逻辑自洽,又具备扎实的实证基础。计算资源的最大投入,正集中于这一高强度验证环节。
报告披露的多个真实案例印证了其实际效能:某肝病研究团队借助Co-Scientist重新评估既有药物库,成功识别出一种此前未被关注的抗纤维化候选分子;某细胞衰老项目将海量化合物筛选分析周期从数月压缩至72小时内;一家专注衰老生物学的初创企业,基于系统生成的新机制假说开展实验,最终在体外模型中获得阳性验证。
参与项目的科学家普遍反馈,AI Agent带来的最大价值并非替代判断,而是显著加速关键决策节点的抵达速度,从而将科学突破的平均周期缩短一个数量级以上。
Google DeepMind在官方博客明确表态:其开发目标是让AI成为“值得信赖的研究协作者”,而非取代科学家的专业直觉与临床经验。而OpenAI则在报告中强调:Agent的意义不在于替代人力,而在于扩展每个个体所能驾驭的任务尺度与专业纵深。二者共同指向同一结论:人机协同的新范式,正在催生更高阶的工作形态。
但协同的边界,注定持续流动。当Agent能稳定承接原属专家领域的任务,流程该如何重组?当传统职能划分逐渐模糊,哪些能力将跃升为核心竞争力?当假设生成效率呈指数级增长,哪些学科可能率先迎来“发现爆炸期”?
终极命题始终如一:人,究竟该把注意力聚焦于何处。
本文来自微信公众号“红杉汇”(ID:Sequoiacap),作者:洪衫,36氪经授权发布。










