当kimi正式推出2.8万亿参数开源模型k3时,全球科技界迎来了一次强烈的思想震荡。
硅谷的研究人员感到震惊:中国AI企业既没有顶尖的算力资源,也缺乏高付费意愿的用户基础,却为何能达成如此突破?
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

华尔街同样难以置信:我在美股市场深耕多年,投入巨额资金、组建庞大团队,如今你告诉我——300亿就能干成这件事?
这不仅是一场开源社区的技术实力展示,更是对硅谷主导的AI叙事逻辑的一次正面挑战。
01、算法突围:刺破AI登月背后的全球租界幻象
过去一年间,OpenAI与Anthropic等头部厂商凭借海量算力构建起高耸的闭源API壁垒,牢牢掌控着全球顶级AI能力的定价权。
在这层裹着科技理想主义外衣的“AI登月”神话之下,实则运行着一套高度排他的全球租界机制。欧美科技巨头试图以天量资本投入和超大规模算力基建为门槛,在技术制高点上打造一个密不透风的黑箱系统。
在此闭环中,全球大量中小企业、垂直领域开发者乃至二次创业的技术团队,被迫沦为闭源API下游的数字劳工。高昂的Token调用单价、完全不可见的底层权重、以及随时可能因上游模型迭代而被降维打击的平台锁定风险,构成了压在开发者头顶的三重枷锁。这种商业模式非但未能推动AI普惠化落地,反而抑制了大量本可在应用层蓬勃生长的微创新。
面对先进芯片获取受限、超大规模集群建设成本高昂的现实约束,中国AI公司无法照搬动辄十万张H100堆叠的粗放路径,转而走上一条极致工程优化之路。K3在特定维度上的开源领先,恰恰印证了——通过MoE架构深度调优与高质量数据精炼,完全可以在关键场景实现对标甚至超越。

以K3高达2.8万亿参数的规模为例,传统稠密模型每次推理需激活全部参数,在算力受限环境下几乎不可行。而K3采用高度定制化的动态路由机制,确保每个具体任务仅调用全网中极小比例的相关专家模块。这意味着在同等甚至更优推理效果前提下,其显存占用与实时计算开销被压缩数个数量级。这种对算法结构的极致瘦身,让原本只有顶级财团才能驾驭的庞然大物,得以在有限规模的国产算力集群上高效运转。
与此同时,中国AI产业在高熵值高质量数据清洗及合成数据飞轮构建方面的认知,已从早期粗放式抓取跃升至精密制造阶段。硅基流动、无问芯穹等基础设施服务商正依托异构集群调度与推理加速能力,将大模型落地成本压至极限。须知:训练仅是一次性固定支出,真正持续消耗的是上线后的推理部署环节。国产Infra力量通过深度重构底层推理引擎,全面普及vLLM投机采样、PagedAttention显存管理机制,并实现低比特量化技术的无损商用落地,硬生生将单次推理成本推至物理边界。他们甚至打通不同品牌、不同代际芯片之间的池化调度,榨干每一滴闲置算力。
中国开源生态的蓬勃发展,正以极高性价比吸引全球中长尾开发者,从应用端倒逼闭源厂商让渡溢价空间。当一款来自中国的开源模型能以极低成本完成相同任务,全球大模型产业的付费根基正在发生结构性偏移。
02、认知跃迁:以慢思考瓦解闭源高价垄断
K3的亮相只是反击序曲。决定这场科技博弈终局的关键,是即将登场的国产Fable级模型。
在大模型发展的初始阶段,全球技术竞技场被简化为一场关于预训练参数规模的单向竞赛。然而,随着Scaling Law在纯无监督预训练阶段逐步逼近高质量人类语料枯竭与算力转化效率拐点,行业共识正快速转向:真正的认知跃升,不再依赖盲目扩大通用语料规模,而是取决于强化学习能力与复杂问题求解过程中的推理时间延展。这意味着模型智能必须从依赖直觉的“快思考”,迈向层层拆解、多步推演的“慢思考”深水区,从而重塑高级认知能力的价值标尺。

K3发布后短短一个月内,中国AI迎来密集火力覆盖:阿里重磅发布2.4万亿参数Qwen3.8;DeepSeek依托R系列架构大幅下探推理成本;智谱GLM、MiniMax持续强化长序列逻辑建模能力——国产大模型正撕掉“套壳模仿”的标签,昂首挺立于全球前沿技术角力最前线。
尽管在超长视频生成与原生多模态底层架构方面,中美仍存在客观的时间差,但在极度依赖强化学习精度与合成数据质量的推理平权赛道上,月之暗面、百川智能、阶跃星辰等国内头部独角兽正加速追赶。而在原生视频生成、高动态物理世界模拟等领域,底层扩散架构与大规模多模态预训练仍需庞大算力支撑,这一差距必须理性正视。
但在当前商业化需求最迫切的逻辑验证赛道,绝对算力垄断正迅速失效。在这个高度考验奖励建模精细度与蒙特卡洛搜索树推理优化的战场上,具备反思能力与自我纠错机制的慢思考模型,正在抹平由GPU集群数量差异造成的表面鸿沟。当模型遭遇复杂问题时,不再仓促输出模糊答案,而是自动后台拆解步骤、交叉验证、反复试错、推翻重构。

一旦这些企业在高阶推理能力上取得结构性突破,并将单位Token成本击穿临界线,B端Agent商业化落地的最大障碍将被彻底清除。长期以来,海外闭源巨头的核心护城河,正是高端复杂的长链条逻辑推理能力,并据此收取惊人费用。
若国产大模型可将该级别认知能力的单次调用成本压缩至海外对手的十分之一甚至百分之一,则欧美厂商在高级认知智力上残存的高价壁垒将被彻底击碎。这种能力平权,正是全球B端Agent爆发的唯一前提。复杂的业务流程自动化,要求系统进行多步规划、工具调用与试错回滚,倘若推理成本居高不下且错误频发,企业部署AI的投资回报率必然为负。中国AI企业通过打穿高阶推理成本,实则为全球企业级数字员工铺设了一条廉价且无限供给的高速公路,使AI真正深入、无缝嵌入最严苛的业务流程底层。
03、底座再造:以全栈自主打赢终极战役
然而,再惊艳的算法突破,若无坚实物理底座支撑,终究如空中楼阁。
业内心知肚明:当前国内多数AI企业的繁荣,仍高度依赖海外芯片与国产算力混合部署的过渡架构。时至今日,在底层硬件集群建设层面,头部企业依然严重依赖存量合规海外高端GPU与国产AI加速卡混搭的异构方案。在极端外部技术封锁与持续加码的出口管制背景下,当现有海外硬件生命周期终结,当面向百亿级、十万卡规模集群的调度需求迫在眉睫,若本土产业链无法完成真正意义上的物理底座替代,中国AI产业整座大厦将始终面临基石被一键抽离的致命威胁。这是一场无退路、无捷径的跨世纪攻坚。
在AI算力体系中,HBM存储与底层软件生态堪称真正的阿喀琉斯之踵。全栈国产化的破局,没有奇迹般的逆袭剧本,唯有悲壮的“结硬寨、打呆仗”。我们所要攻克的不仅是单卡性能,更是良率爬坡、先进封装、异构互联的系统性突围。
进入大模型时代,系统面临的根本物理瓶颈,早已不止于“算得快不快”,更致命的是“带得宽不宽”。参数加载与推理计算如同用极细吸管汲取巨型水库,这就要求底层存储必须采用将多个DRAM裸片垂直堆叠并通过硅通孔微米级互联的HBM技术。重构HBM与先进封装链条的艰难程度,丝毫不亚于在荒漠中徒手重建特高压电网。我们面对的是从先进半导体材料、纳米级封装工艺,到内存颗粒堆叠过程中的极端良率爬坡、严峻散热控制,直至集群互联通信协议的高速无损传输。
这最难一役,恰恰是最无捷径可走的一役。长鑫存储在HBM量产与良率上的死磕,华为昇腾、壁仞、燧原等国产GPU厂商在其独立软件栈(如CANN)上一行行调试算子、做生态适配的血泪攻坚,揭示了底层重构的真实图景:我们并非在等待一个现成的国产CUDA,而是在荒漠中亲手搭建一套全新的特高压电网。
英伟达的牢不可破,从来不只是靠芯片本身,更是二十年来近百万开发者用代码铸就的CUDA闭源生态。面对这座高墙,中国异构芯片产业高度分散。国内系统架构师与底层工程师必须走出舒适区,沉入硬件指令集深处,亲手重写算子、深度定制内存分配架构、逐行优化分布式通信原语。将频繁报错的本土软硬件栈,打磨至工业级稳定水准,这是一场需要全行业共同忍受数年沉默的生死险关。
所有在此领域挥洒的汗水与心血,都承载着深刻的时代印记。各大国产GPU独角兽在生态适配上的昼夜奋战,本质上是在为中国整个互联网与数字经济底座,彻底拆除埋藏数十年的“卡脖子”暗雷。
随着国产半导体在HBM良率上的稳步提升,以及国产异构芯片在基础软件栈上的长期沉淀与融合,中国AI底座在物理层面实现安全闭环的拐点必将到来。
上层的工程极限压缩、中层的推理能力平权、底层的硬件血泪攻坚——这三重维度,共同勾勒出中国AI最真实、最坚韧的产业轮廓。
在这场科技博弈中,中国科技产业最动人的特质,并非宏大叙事的编织能力,而是惊人的韧性:即便开局受制于人,也能在极端约束条件下,一砖一瓦垒起属于自己的算力长城。资本市场的目光,终将穿透浮躁的应用泡沫,向这群真正啃硬骨头的硬核“卖水人”致以敬意。
本文来自微信公众号 “科技新知”(ID:kejixinzhi),作者:凤梨,36氪经授权发布。











