Google要把AI大模型「刻」进芯片里

夜伟酱_1729

夜伟酱_1729

2026-07-22

955人浏览

原创

经历一轮人才流失与产品延期后,google 一项最早要到 2028 年才揭晓的隐秘项目悄然浮出水面。

据 The Information 援引多位直接知情人士透露,Google 正在秘密推进一款代号为 Frozen v2 的服务器级 AI 芯片,专为 Gemini 大模型深度优化。参与该项目的工程师表示,若以每瓦特所能生成的 token 数为衡量标准,其能效有望达到 Google 当前最新一代 TPU 的 6 至 10 倍。

“Frozen”这一命名,正源于其核心构想:将 Gemini 模型的部分结构永久性“固化”于芯片硬件之中。

大模型芯片:让模型架构“长”进硅基

要读懂 Frozen v2,需先回溯通用芯片的基本逻辑。

1945 年,宾夕法尼亚大学莫尔学院启动 EDVAC(电子离散变量自动计算机)的设计工作,它是早期存储程序式计算机的里程碑。在此之前,修改一段程序往往意味着重新插拔线路、拨动物理开关,整个过程耗时且极易出错。

数学家约翰·冯·诺依曼作为项目顾问,在团队讨论基础上撰写了《First Draft of a Report on the EDVAC》,首次系统提出“存储程序”概念:指令与数据共存于内存中,由处理器按序读取、解析并执行。

此后,“冯·诺依曼架构”成为通用计算设备的底层范式。

而指令集,正是这套范式的通用语——软件通过加法、加载、跳转等基础指令向处理器下达任务,处理器则依次完成取指、译码、执行三步流程。同一颗芯片,只需更换软件,就能从处理表格切换至渲染视频或运行游戏。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Google要把AI大模型「刻」进芯片里

过去八十年,计算机的灵活性,正建立在这种软硬分离的基础之上。

但灵活,也意味着冗余。

大模型每生成一个 token,本质是反复调用矩阵乘、注意力机制等有限几类运算。而通用处理器却必须保留应对各类应用所需的控制单元、分支预测器、缓存一致性协议等复杂模块——其中许多部件,在纯推理场景下几乎完全闲置。

更关键的是,处理器与内存物理分离,导致大量数据在两者之间高频搬运。一旦算力提升速度远超内存带宽增长,芯片性能便会卡在“内存墙”上,难以继续突破。

为缓解这一瓶颈,行业先后催生了 GPU(专注图形并行计算)与 NPU/TPU(聚焦神经网络张量操作)。尽管它们已大幅优化特定负载,但仍需兼顾模型多样性,因此设计上仍保留相当程度的可编程性与通用性。

而 Google 选择了一条更激进的路径——Frozen v2 将围绕 Gemini 的固定拓扑结构,定制化布局计算单元、片上存储与数据通路,使硬件提前“预知”下一步最可能发生的运算,从而实现极致效率跃升。

简言之,Google 计划在芯片中“雕刻”Gemini 的架构层。

一个大语言模型通常由两部分构成:架构(定义信息流动方式,如 Transformer 的层叠结构)与权重(训练所得参数,决定输出内容)。
据悉,Frozen v2 将固化更多架构层面的逻辑,同时保留权重动态加载能力。它依然需要执行指令、访问内存,只是部分数据路径已被硬件预先锁定。

Google要把AI大模型「刻」进芯片里

Frozen 系列项目由 Google 首席科学家 Jeff Dean 主导。作为 Google Brain 联合创始人、TensorFlow 核心设计者之一,他长期处于 Google 分布式系统与 AI 基础设施交汇的关键位置。

Google要把AI大模型「刻」进芯片里

初代 Frozen 曾尝试将模型权重也一并固化进芯片,但由此带来的代价极为高昂:一颗芯片仅适配单一版本 Gemini。待芯片完成设计、流片、封装、部署,对应模型早已迭代数轮,硬件迅速过时。该项目一度因此搁浅。

Frozen v2 吸收了这一教训,明确保留权重更新通道。只要下一代 Gemini 维持相近的基础架构,该芯片即可持续服役。这不仅是技术路线的调整,更是 Google 对 Gemini 长期战略投入的公开信号。

Google要把AI大模型「刻」进芯片里

大模型厂商,集体转向芯片自研

就在不久前,OpenAI 已用实际行动验证了“模型驱动芯片设计”的可行性。

2026 年 6 月,OpenAI 与 Broadcom 联合发布自研推理芯片 Jalapeño。该芯片并非凭空构想,而是基于 ChatGPT、Codex 及 API 实际负载建模,并引入 OpenAI 自身模型辅助完成部分电路布局与功耗优化。

Google Workspace
Google Workspace

Google Workspace 自动化,支持 Gmail、日历、Drive、表格,可通过服务账户或 OAuth 完成读取、写入、发送并管理整个 Google 套件。

下载

从立项到流片仅耗时九个月,工程样片已稳定运行真实模型负载,预计将于 2026 年底起逐步上线部署。

Google要把AI大模型「刻」进芯片里

Anthropic 与 DeepSeek 同样被曝正推进自研芯片计划。尽管各家在专用程度上存在差异,但方向高度一致:掌握模型的公司,正将日复一日高频重复的计算模式,直接“翻译”为硬件逻辑。

我们已然步入“模型定义芯片”的新阶段。

那么,为何几乎所有头部大模型公司,都押注于自研芯片?

答案直截了当:压降算力成本。

以 Google 公开提供调用的旗舰模型 Gemini 3.1 Pro Preview 为例:在 20 万 token 以内,标准 API 定价为每百万输入 token 2 美元、每百万输出 token 12 美元。

假设一次中等强度请求含 5000 token 输入与 1000 token 输出,单次费用约为 2.2 美分。若此类请求日均发生 1 亿次,则每日支出达 220 万美元,年成本逼近 8 亿美元。

考虑到 Gemini 应用月活跃用户已突破 9 亿,哪怕单位算力成本微降 10%,乘以近十亿级调用量,也将带来数十亿美元级别的年度节省——对任何大模型厂商而言,这都是不可忽视的核心生存命题。

这场硬件豪赌,恰发生在 Google AI 业务跌宕起伏的关键节点。

2022 年 11 月,ChatGPT 横空出世。三周后,Google 高管层启动“红色警报”,CEO Sundar Pichai 亲自接管 AI 战略统筹。彼时的 Google 手握 Transformer 原始论文、全球最强搜索生态与海量数据中心资源,却在生成式 AI 入口之战中意外失速,被 OpenAI 抢先确立用户心智。

三年之后,战局一度逆转:Gemini 3 系列发布,Nano Banana 引发刷屏热潮,Google 重夺技术话语权,甚至被视为最接近 AGI 的科技巨头。

Google要把AI大模型「刻」进芯片里

然而近几个月,Google 内部再度震荡加剧——

Gemini 联合负责人 Noam Shazeer 离职加盟 OpenAI;John Jumper 与多名核心研究员转投 Anthropic;原定于 6 月发布的 Gemini 3.5 Pro 被证实严重滞后,编码能力未达内部预期,Alphabet 股价随之连续下挫。

多位离职研究人员坦言,算力资源分配紧张是重要诱因。The Information 报道称,算力短缺曾迫使 Google Cloud 暂停承接部分外部客户订单;即便在 Google 内部,AI 团队申请算力也常需排队等待。

但 Google 手中,仍握有一张对手难以复制的王牌——从 Gemini 模型、TPU 芯片、Google Cloud 数据中心,到 Gmail、YouTube、Android 等庞大生态,整条技术栈均由同一主体掌控。这意味着,模型与硬件可围绕同一套目标协同演进,无需妥协。

顶尖人才或可被挖角,旗舰模型或会延期,但 Google 十年磨一剑打造的 TPU 架构、XLA 编译器栈、数据中心调度系统,不会因一次人事变动而瓦解。这是 Google 在 AI 时代最扎实的护城河之一。

Google要把AI大模型「刻」进芯片里

当然,风险同样不容低估。

据消息人士透露,Frozen v2 芯片最早要等到 2028 年才进入实际部署阶段。而截至目前,Google 仍在权衡:究竟该在芯片中固化多少模型结构?这也构成了“Frozen”一词的第二重含义——为换取芯片级性能飞跃,Google 准备主动冻结 Gemini 的一部分演进自由度。

把大模型“刻”进芯片,是否真为最优解?答案或许要等到两年后才能水落石出。但留给 Gemini 加速追赶的时间窗口,确已所剩无几。

本文来自微信公众号“爱范儿”,作者:肖钦鹏,36氪经授权发布。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Golang 入门学习路线:从零基础到上手开发
Golang 入门学习路线:从零基础到上手开发

Golang 入门路线涵盖从零到上手的核心路径:首先打牢基础语法与切片等底层机制;随后攻克 Go 的灵魂——接口设计与 Goroutine 并发模型;接着通过 Gin 框架与 GORM 深入 Web 开发实战;最后在微服务与云原生工具开发中进阶,旨在培养具备高性能并发处理能力的后端工程师。

2026.02.24

206

7

Golang 疑难杂症解决指南:常见问题排查与优化
Golang 疑难杂症解决指南:常见问题排查与优化

《Golang 疑难杂症解决指南》聚焦开发过程中常见却棘手的问题,从并发模型、内存管理、性能瓶颈到工程化实践逐步拆解。通过真实案例与调试思路,帮助开发者定位问题根因,建立系统化排查方法。不只给出答案,更强调分析路径与工具使用,让你在复杂 Go 项目中具备持续解决问题的能力。

2026.02.24

113

7

Golang 运行与部署实战:从本地到云端
Golang 运行与部署实战:从本地到云端

《Golang 运行与部署实战》围绕 Go 应用从开发完成到稳定上线的完整流程展开,系统讲解编译构建、环境配置、日志与配置管理、容器化部署以及常见运维问题处理。结合真实项目场景,拆解自动化构建与持续部署思路,帮助开发者建立可靠的发布流程,提升服务稳定性与可维护性。

2026.02.24

617

10

Golang 面试题精选:高频问题与解答
Golang 面试题精选:高频问题与解答

Golang 面试题精选》系统整理企业常见 Go 技术面试问题,覆盖语言基础、并发模型、内存与调度机制、网络编程、工程实践与性能优化等核心知识点。每道题不仅给出答案,还拆解背后的设计原理与考察思路,帮助读者建立完整知识结构,在面试与实际开发中都能更从容应对复杂问题。

2026.02.24

198

7

Golang 性能优化专题:提升应用效率
Golang 性能优化专题:提升应用效率

《Golang 性能优化专题》聚焦 Go 应用在高并发与大规模服务中的性能问题,从 profiling、内存分配、Goroutine 调度、GC 机制到 I/O 与锁竞争逐层分析。结合真实案例讲解定位瓶颈的方法与优化策略,帮助开发者建立系统化性能调优思维,在保证代码可维护性的同时显著提升服务吞吐与稳定性。

2026.02.24

457

7

Golang 生态工具与框架:扩展开发能力
Golang 生态工具与框架:扩展开发能力

《Golang 生态工具与框架》系统梳理 Go 语言在实际工程中的主流工具链与框架选型思路,涵盖 Web 框架、RPC 通信、依赖管理、测试工具、代码生成与项目结构设计等内容。通过真实项目场景解析不同工具的适用边界与组合方式,帮助开发者构建高效、可维护的 Go 工程体系,并提升团队协作与交付效率。

2026.02.24

188

7

Golang 并发编程专题:掌握多核时代的核心技能
Golang 并发编程专题:掌握多核时代的核心技能

《Golang 并发编程专题:掌握多核时代的核心技能》系统讲解 Go 在并发领域的设计哲学与实践方法,深入剖析 goroutine、channel、调度模型与并发安全机制,结合真实场景与性能思维,帮助开发者构建高吞吐、低延迟、可扩展的并发程序,全面提升多核时代的工程能力。

2026.02.26

544

7

Golang Web 开发路线:构建高效后端服务
Golang Web 开发路线:构建高效后端服务

《Golang Web 开发路线:构建高效后端服务》围绕 Go 在后端领域的工程实践,系统讲解 Web 框架选型、路由设计、中间件机制、数据库访问与接口规范,结合高并发与可维护性思维,逐步构建稳定、高性能、易扩展的后端服务体系,帮助开发者形成完整的 Go Web 架构能力。

2026.02.26

225

7

Golang 实际项目案例:从需求到上线
Golang 实际项目案例:从需求到上线

《Golang 实际项目案例:从需求到上线》以真实业务场景为主线,完整覆盖需求分析、架构设计、模块拆分、编码实现、性能优化与部署上线全过程,强调工程规范与实践决策,帮助开发者打通从技术实现到系统交付的关键路径,提升独立完成 Go 项目的综合能力。

2026.02.26

62

7

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Gemini Notebook官方手册
Gemini Notebook官方手册

共0课时 | 0人学习

Google Cloud开发者文档
Google Cloud开发者文档

共0课时 | 0人学习

Veo 3 官方文档
Veo 3 官方文档

共0课时 | 0人学习