☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

AI大模型正持续突破智能边界,而支撑其运行的物理基础却日益承压。
花旗于7月24日发布的最新研报指出,月之暗面Kimi K3以57分位列全球第三,仅比闭源榜首Claude Fable 5低3分。与此同时,以Kimi K3为代表的中国头部模型服务价格单周飙升45%,Blackwell架构GPU租赁费用较年初上涨27%,更有实验室豪掷10亿美元采购专用发电机组。
花旗研判,AI产业的投资回报重心正快速向底层基础设施迁移;未来模型竞争的核心壁垒,将不再局限于“能否拿到算力”,而转向“能否高效产出+是否掌握专有数据”。
01 分差仅剩3分
据花旗报告,Kimi K3是当前公开可获取的最大规模开源模型。此前,开源阵营最高智能评分为51分(Z.ai GLM-5.2),而Kimi K3一举跃升至57分,紧随Claude Fable 5(60分)与OpenAI GPT-5.6 Sol(59分)之后。
全行业进步节奏明显加快。前20家模型提供商的中位智能得分,由六周前的34分攀升至43分。在开源阵营中,DeepSeek V4 Pro(44分)每百万token报价已降至0.03美元——性能逼近前沿水平,成本却仅为头部闭源方案的百分之一。
闭源厂商亦未放缓步伐。Google于7月21日推出Gemini 3.6 Flash,并同步披露Gemini 3.5 Pro尚处测试阶段,而Gemini 4的预训练工作早已启动——三代模型并行推进。不过,花旗指出,“Flash先行、Pro延后”的发布策略释放出关键信号:顶尖模型的研发难度正在显著提升——这与多家企业在基建交付上频频延期的现象高度吻合,也印证了行业试图压缩迭代周期却屡屡受阻的现实困境。
模型参数量级越大、能力越强,其运行所需的资源消耗便呈指数级增长。
02 瓶颈悄然转移
万亿级参数模型正在重新定义“算力”的内涵。
花旗分析显示,此类超大规模模型在实际推理过程中,大量时间被消耗在HBM内存与GPU互联网络之间的权重及KV-cache数据搬运上,而非核心矩阵运算本身。性能瓶颈已从“计算快不快”(FLOPs)全面转向“数据搬得动不动”——即内存带宽、GPU间互连效率与电力供给能力。
GPU需求依旧旺盛,Blackwell架构租赁价格年内累计上涨27%。但单纯堆叠GPU数量已难解燃眉之急。
部分实验室开始向上游能源端延伸:SpaceX于7月15日斥资10亿美元订购1GW移动燃气轮机发电机组;Georgia Power则于7月22日签署配套服务协议。AI实验室自购发电设备——这一在一年前尚属天方夜谭的操作,如今正成为真实发生的趋势。
模型服务定价直接映射产能紧张程度。中国前沿模型混合单价由每百万token跳涨至0.87美元,周环比与月环比均激增45%,为近两月首次大幅波动;全球前沿模型均价周涨6.8%、月涨11.3%;美欧市场虽相对平稳(周环比微跌0.5%),但月度涨幅亦达4.1%。
花旗预计,随着新增基础设施逐步投产,价格压力终将趋缓。届时,高质量专有数据与任务定制化性能,将成为比单纯算力获取更具长期价值的竞争护城河。
03 Agent突破沙箱
模型能力持续跃升,而运行其上的智能体(Agent)也在加速脱离可控边界。
花旗报告使用了一个意味深长的类比:自主AI Agent逃逸沙箱的实际风险,已从4月时的“打断午餐”升级为7月的“渗透Hugging Face基础设施”。
开源模型越强大、越易获取,安全威胁的扩散范围就越广。AI监管讨论仍在进行中——英伟达(7月24日)与美国财长贝森特(7月22日)近期均有表态——但短期内难形成统一框架。即便监管细则尚未落地,企业自建模型运行体系所面临的合规要求已在显著提高。
更严峻的是,即便是模型训练方自身,仍难以完全理解模型决策逻辑。可解释性问题,至今仍未破题。
然而安全隐忧并未拖慢Agent商业化脚步。METR于7月21日发布的数据显示,AI Agent与人类劳动力之间的经济性差距正持续收窄。当Agent愈发自主、愈发具备经济可行性,token消耗速率将持续攀升——进而进一步推高对底层基础设施的需求。
能力越强,约束越严;约束越严,基建需求越旺。这一正向循环,目前毫无减速迹象。
本文来自微信公众号“硬AI”,作者:专注科技产研的,36氪经授权发布。











