最近两年,围绕ai基础设施最常被提及的计量单位,是一个字母——p。
比如某家企业的算力规模达多少P、某座智算中心部署了多少张GPU卡,已悄然成为衡量技术实力最直观的标尺。地方政府规划智算中心,大模型企业采购算力资源,也普遍以芯片数量与总算力为决策核心。
然而迈入Agent时代,这一传统度量方式正悄然重构。IDC数据显示:2025年1月,中国企业级MaaS市场日均Token消耗量约为1.6万亿;至同年12月底,该数值飙升至9.6万亿;而2026年全年预计消耗量将达40000万亿,相当于2025年的20倍,折合日均近110万亿。
驱动这一爆发式增长的核心动力,来自多模态模型持续成熟与Agent应用规模化落地。Agent所承担的角色早已超越被动问答,需处理更长上下文、调用搜索接口、数据库及外部工具,并执行任务分解与多轮推理。
对此,商汤大装置事业群首席科学家张行程在采访中指出:过去聊天场景下模型输入短、输出长;进入Agent阶段后,输入与输出比例可能高达100∶1甚至更高,上下文长度也从数万Token跃升至数十万乃至百万级。
这意味着,企业真正采购的不再是抽象的“算力”,而是算力最终可交付的“Token”。由此催生一系列新问题:同等预算能生成多少Token?每度电可支撑多少次推理?模型迁移到新芯片需耗时多久?高并发下系统是否稳定?这些正逐步演化为新一代算力经济账本。
据36氪了解,在WAIC 2026期间,商汤大装置正式发布异构混合推理、全栈适配、算电协同Agent及国产生态四大计划。其核心命题是:当国产AI芯片加速涌现,如何将不同架构、不同性能的芯片高效整合,构建一套稳定、低成本、可持续盈利的Token生产体系?所有动作,皆指向“最懂大模型的AI基础设施”这一战略定位。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

国产算力跨越盈亏临界点,靠的不是单卡性能突破
早年间,国产算力首要解决的是“有无”问题。随着国产AI芯片厂商陆续迈入商业化阶段,焦点已转向“如何用好”。不同芯片采用差异化的硬件架构、编译器、算子库、通信协议及软件工具链。一个已在NVIDIA平台稳定运行的模型,迁移至某款国产芯片,往往需重新适配;换另一款芯片,又得重复踩坑。
张行程将这项工作称为“苦活”。商汤自2018年起启动国产芯片适配工程,逐步联合芯片原厂、内部研发团队、高校与科研机构,共建统一技术体系,并携手上海人工智能实验室推动DeepLink开源项目,实现跨芯片的算子统一、编译器兼容与异构通信标准化。
与此同时,Agent技术也开始反哺基础设施自身优化。过去依赖工程师人工完成的算子迁移、开发调试与性能调优,如今正由AI辅助实现。芯片厂商提供底层算子后,商汤大装置平台可自动完成迁移、融合与性能优化,显著降低国产芯片接入新模型、新业务的技术门槛。
但适配仅是起点。今年上半年,商汤大装置将一项已验证成熟的技术推向规模化商用——异构混合推理。大模型推理通常分为Prefill(预填充)与Decode(解码)两大阶段:Prefill负责解析用户输入的海量上下文,属计算密集型;Decode则逐Token生成结果,对显存带宽、延迟与系统稳定性要求更高。
传统方案中,这两个阶段均由同类型GPU承担。商汤大装置另辟路径:将Prefill交由通用国产芯片处理,Decode则由高端芯片承接,并通过统一网络调度、缓存协同机制实现无缝衔接。借助PD分离、异构组网与系统级优化,在控制硬件投入的前提下,大幅提升整体Token产出效率。
值得注意的是,此类组合式优化之所以能真正落地,离不开商汤大装置自建并自主运营的超大规模AIDC智算中心。商汤科技大装置事业群CTO宣善明强调:国产算力优化绝非简单将模型“搬上一张国产卡”。依托自建的临港AIDC,商汤可同步改造硬件组合、网络拓扑与软件栈,灵活尝试各类国产芯片与高端芯片的异构搭配。“单点优势或许有限,但组合起来,便形成平台级竞争力。”相较之下,多数算力运营方缺乏机房物理改造权限,纯软件厂商亦难以打通硬件与网络层,异构混推往往止步于概念。
这套策略的关键逻辑,恰恰在于放弃“一卡通吃”的幻想。商汤科技联合创始人、大装置事业群总裁杨帆以铁人三项作喻:一名游泳选手独自完成三项赛事未必最优,若允许三名专精不同项目的运动员接力协作,整体成绩反而更佳。
同理,AI基础设施亦需分工协作。大语言模型、视频生成、世界模型、具身智能与AI for Science等任务,对计算密度、显存容量与通信带宽的需求各不相同。即便未来高端国产芯片全面接管Decode任务,旧一代芯片仍可在Prefill或数据合成环节发挥价值,新一代芯片专注复杂推理——异构组合不会因芯片迭代而消失。
在商汤看来,异构并非国产芯片尚不成熟的过渡方案,而是应对模型快速演进、硬件持续迭代、需求尚未收敛这一现实挑战的系统性最优解。其商业成效已初步显现:据杨帆透露,当前国产混推集群已实现正向毛利率。
商汤大装置Token服务能力亦持续扩张。据估算,日均服务量将从2026年初约4000亿Token,攀升至7月底的2.42万亿,年底目标达10万亿,较年初增长25倍。
宣善明坦言,国产算力商业化进程在训练与推理环节并不同步。目前,国产芯片在大模型训练领域仍面临较大技术挑战,闭环较成熟的场景集中于视频、图文等模型。相比之下,推理环节更易率先放量:通过PD分离与异构混推,让不同芯片各司其职,既提升整体吞吐能力,也加速国产芯片融入真实业务流。
商汤“最懂大模型”的定位,正根植于这种深度任务拆解能力。杨帆指出,技术知识扩散极快,单一能力难以维持两年以上护城河;真正可持续的壁垒,在于组织能否始终领先半步,预判下游模型演进方向,并反向驱动基础设施升级。相较于其他AI企业,商汤具备独特组织优势:模型研发与基础设施团队高度协同。例如,张行程既担任大装置首席科学家,也深度参与商汤研究院工作;双方通过轮岗机制与联合研发,确保模型负载变化能实时传导至芯片选型、网络设计、缓存策略与调度系统。
这种端到端能力亦延伸至电力系统。商汤临港AIDC于2024年获评全国首个5A级智算中心。该认证综合评估理论算力、有效算力、算力能效及业务支撑能力等多项指标。
传统数据中心惯用PUE衡量能效,但PUE仅反映IT设备用电占比,无法回答“每度电究竟产出多少有效Token”。极端情况下,为美化PUE指标,机房可能加大风扇转速降温,却导致GPU因温控或功耗限制降频——局部指标向好,实际算力产出反遭削弱。为此,商汤大装置提出TPW(Token Per Watt)指标:即单位电力成本所能支撑的Token产量。

在临港基地,商汤大装置打通储能系统、机房管理平台与算力运营中台,依据任务实时性、电价波动及电网负荷动态调度算力资源。离线推理、模型评测及部分预训练任务无需即时响应,可灵活迁移至低谷用电时段。例如今年7月上海电网开展需求响应期间,临港数据中心两小时内释放75%用电容量,节约电量约4.6万度。商汤大装置希望借此证明:智算中心不必只是电网“耗电大户”,亦可成为具备调节弹性的“容量池”。
不过,电费并非当前国内Token业务盈利的决定性变量。杨帆判断,算电协同在国内约可带来10个百分点的成本优化空间;而在电价更高的东南亚、中东等海外市场,其价值将更为凸显。
区域布局、场景创新、生态共建——三箭齐发,让Token工厂真正普惠可用
事实上,中国并不缺乏智算中心建设者,但大量项目参与者呈现明显分层与割裂:机房提供商、服务器集成商、网络服务商、算力包销方、终端客户服务商……每一环都需盈利,却无一主体能掌握全局数据,更难在模型、芯片、网络、电力与客户任务之间开展联合优化。
杨帆认为,唯有直面终端流量,基于客户画像、模型特性与任务类型实施精细化调度,才可能挖掘出Token成本的真实优化空间。
这也构成了商汤大装置与互联网大厂的本质差异。阿里、火山等巨头虽同样具备从数据中心到模型应用的端到端能力,但其优质资源优先保障自有电商、内容与云业务。商汤大装置则明确聚焦AI公司、科研机构与产业客户,提供高稳定性、高弹性、可扩展的端到端系统服务。
按杨帆披露的规划,商汤将建设至少5个万卡级国产集群,服务超200家AI初创组织。选择5种差异化组合的万卡集群,而非打造单一架构的十万卡巨无霸,正是为保留面向多元模型与场景的适应弹性。
区域项目则肩负商业模式验证使命。盐城智算中心一期规划3000P算力,旨在引入AI企业、产业链资源与产业基金,构建“基础设施—本地优势产业—AI应用”的闭环生态。中国香港项目计划于2026年底建成首批算力集群,目标在2030年前建成总规模达40000P的智算中心。
沙特项目尚处早期市场验证阶段。杨帆坦言,2026年AI基础设施出海重心在于路径打通与战略布局,东南亚、中东当前仅有零星试点,规模化营收或将延至下一阶段。
除海外落地外,商汤大装置正加速探索更具想象力的新场景,不断拓展国产算力边界——例如太空算力。在2026 WAIC大会上,商汤大装置与国星宇航联合发布“商汤算力星座”计划,启动卫星搭载初步验证。尽管未来两年太空算力仍以技术储备与预研为主,但在中国具备极高潜在价值:可服务于海外弱网地区、卫星直连场景下的AI服务覆盖。
为加速国产软硬件协同演进,商汤大装置还联合芯片厂商、核心零部件供应商与AI Infra生态伙伴发起“银河计划”。该计划聚焦两大核心命题:
第一,国产化不应止步于GPU。一台服务器即使采用国产GPU,其CPU、内存、光模块、交换机等仍可能依赖进口;国产CPU与GPU之间亦存在适配与联调难题。真正的“全国产”需经由软件、模型与真实业务共同验证,否则极易沦为设备清单上的纸面概念。
第二,为国产算力构建可持续需求池。具身智能、世界模型、视频生成与AI for Science等领域企业亟需算力,却往往缺乏芯片适配、集群运维与性能调优能力。商汤希望为其提供算力资源、Token服务与开发工具,并推动其深度参与城市智能化、科研数字化与产业转型升级项目。
东吴证券指出,2026年或将被定义为“国产AI基础设施规模化商用元年”。从需求侧看,Token市场呈爆发式增长,供需缺口持续扩大;DeepSeek V4主动深度适配国产算力,亦为国产基础设施加速崛起奠定关键基础。
一家国产AI基础设施服务商,正以异构混合推理能力与端到端服务体系,让更多人看见国产算力的现实曙光。
但对整个国产AI基础设施生态而言,前路依然漫长。更大挑战在于:国产集群能否长期稳定运行?Token成本能否持续下降?智算中心利用率能否维持高位?客户是否愿意持续付费?
对商汤大装置而言,“最懂大模型的AI基础设施”不该只是一句口号,而应转化为一笔清晰的经济账:每一张卡、每一个机柜、每一度电,最终能兑换成多少用户愿为之付费的高质量Token。











