曾经token管够的公司,如今纷纷开始精打细算过日子了。
最近,美国Agent公司Lindy将100%托管Agent流量,从Claude全面迁移至DeepSeek V4。
原因很实在:此举可节省数百万美元推理成本,迁移后流量支出下降约90%。
这并非孤例。
一批美国开发者与中小型企业正加速转向中国模型——它们在大量常规任务中表现“够用且极具性价比”。
据外媒披露,西门子(Siemens)、雷诺(Renault)、法国电信Orange、ChapsVision等欧洲企业,已普遍采用混合策略:同时调用美国、中国与欧洲本地模型。
回望过去一年,不少企业曾大力倡导员工“多用AI”,仿佛Token烧得越猛,就越能彰显“AI优先”的决心。
然而当月度账单真实摆在财务桌上,全球企业仿佛默契达成共识,集体开启理性复盘:该省则省,该投则投。
一场以“小模型经济学”为名的务实风潮,正悄然席卷产业一线。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Token无节制使用的代价
所谓小模型经济学,本质是拒绝“凡事都请最贵专家”。
以往企业接入AI,常默认启用最强模型:
写代码用Claude,构建Agent也用Claude,无论任务复杂与否,一律先上前沿大模型。
但现实是,顶尖模型堪称“Token粉碎机”——每多加载一段上下文、每多执行一轮Agent循环,账单数字就令人头皮发麻。
于是人们开始反思:难道所有任务都非得动用旗舰级模型?
答案逐渐清晰:简单任务交给高性价比模型,关键环节再启用高价强模型,整体效果同样稳健。
这套“按需分配”的省钱逻辑,被业内亲切称为“小模型经济学”。
它并非空想产物,而是被真实账单倒逼出的生存策略。
Uber就是一个典型缩影。
该公司曾鼓励工程师广泛使用AI编程工具,Claude Code、Cursor等一度被视为提效利器。
结果短短数月,AI编程预算即告耗尽。
Uber COO Andrew Macdonald后来公开坦言:很难将Claude Code的使用量,与“多交付25%有效用户功能”建立直接因果关联。
随后,公司迅速出台管控措施:为每位员工、每类工具设定每月1500美元Token上限,超支须经审批。
亚马逊的故事更具讽刺意味。
为响应集团AI倡议,内部员工自发搭建KiroRank排行榜,比拼谁消耗Token最多。
不料很快有人钻空子——无需解决实际问题,只需让Agent反复执行低价值指令,排名照样飙升。
最终,高级副总裁Dave Treadwell亲自发声:“别为了用AI而用AI。”该榜单随即悄然下线。
Meta内部也曾推出类似机制,甚至起名“Claudeonomics”,把“经济学”都搬进命名里,却同样栽在同一坑中。
如今,头部科技公司已普遍收紧Token使用权限。
微软被曝大幅削减Claude Code直连许可,转而主推GitHub Copilot CLI,并推动Copilot由包年订阅转向按量计费模式。
Meta亦从“Token最大化”战略,全面转向“Token最小化”运营。
外媒报道称,Meta正计划限制员工AI调用量,因内部AI开销预计将达到数十亿美元量级。
这些转变传递出明确信号:企业终于意识到,Token支出与业务产出之间并不存在线性正相关,“盲目烧钱”的时代已然终结。
小模型经济学,正在变成一门真生意
仅靠企业内部抠预算远远不够。真正让“小模型经济学”站稳脚跟的,是供给侧发生了实质性进化——便宜模型,真的好用了。
DeepSeek V4系列便是最直观的代表。
同等任务下,DeepSeek V4 Flash的定价仅为Anthropic同类模型的1/20至1/50。
在Ramp发布的《企业软件采购趋势榜》中,DeepSeek一度跃居榜首。
Vercel AI网关数据更显震撼:
其生产环境中,DeepSeek的Token占比在一个月内从不足1%,飙升至17%。
就连微软也在认真评估:是否可用DeepSeek V4微调版本,替代Copilot Cowork中原本运行于Anthropic与OpenAI之上的核心模块。
由此,行业内部形成了一套心照不宣的分层实践逻辑:
- 预算充裕或任务高度复杂时,继续选用OpenAI、Anthropic旗舰模型;
- 若追求投入产出比,则果断切换至DeepSeek、Kimi、智谱GLM、MiniMax等“够用且低价”阵营。
双轨并行,按需调度。
开源项目ClawRouter实测显示,采用该分层组合方案后,平均成本可从每百万Token 25美元,压缩至约2美元。
在此背景下,OpenRouter这类模型路由服务商突然变得炙手可热。
OpenRouter并不训练模型,而是打造智能调度中枢,协助企业与开发者在OpenAI、Anthropic、Google、DeepSeek、Mistral等数百个模型间动态分配请求。
价格、延迟、稳定性、上下文长度……皆为其调度决策的关键维度。
外媒消息称,OpenRouter今年完成1.13亿美元B轮融资,估值达13亿美元;周处理Token量激增5倍至25万亿,注册用户突破800万。
Vercel数据亦印证这一趋势:成熟AI应用早已告别“单模型通吃”。
在其AI Gateway平台中,月请求量超千万次的团队,平均同时调用35个不同模型。
有的专司意图识别,有的专注信息检索,有的负责摘要生成,有的承担复杂推理——AI应用正演化为一条分工精细、各司其职的智能流水线。
LiteLLM、Helicone等工具,则进一步将模型路由升级为“财务操作系统”:
支持按团队、项目、模型设置预算阈值,实时监控各接口Token消耗;一旦某家供应商涨价或变慢,系统即可自动切流。
云厂商亦快速跟进。
AWS Bedrock推出的Intelligent Prompt Routing,已能在同一模型家族内实现请求智能分流。
内部测试表明:在Claude Haiku与Sonnet之间动态调度,可在不牺牲质量前提下,降低48%–56%推理成本。
这场由成本驱动的产业变革,正让“帮企业省钱”的小模型经济学,蜕变为一门可持续增长的新生意。
企业如何落地执行?
道理谁都懂,“该省省、该花花”听起来简单,但落到技术层面,企业面对的是实实在在的工程挑战:
这一次请求,究竟该交给便宜模型,还是贵模型?
这绝非简单地把Claude替换成DeepSeek,而是要把一个完整AI任务,拆解为多个可分级处理的子步骤。
例如一个电商客服Agent,当用户提问“我的订单到哪了”,背后模型协作流程大致如下:
- 先由低成本模型判断用户意图:属物流查询,非投诉、非退换货;
- 再由同档模型精准抽取订单号,并调用物流API获取状态;
- 最后仅需中等能力模型,将原始数据润色成自然语言回复。
用户看到的仍是那句:“您的包裹已抵达杭州转运中心”,而企业已在后台规避了大量昂贵推理。
AI编程场景同样适用此逻辑。
Coding Agent无需全程依赖顶级模型:
- 读取目录结构、归纳文件关系、生成基础测试用例、撰写PR摘要——这些均可交由轻量模型完成;
- 而涉及跨文件重构、全局依赖分析、安全敏感代码审查等高风险环节,则再交由Claude、GPT等强模型兜底。
从技术实现角度看,主流模型路由方案通常包括以下几类:
最基础的是规则路由:例如,订单类查询走小模型+API直连,法律合规类问题则强制路由至强模型+人工复核。
更常见的是级联路由:先由低价模型尝试回答,若格式校验失败、事实核查存疑、置信度低于阈值,则自动升级至高价模型重试。
进阶形态则是学习型路由:系统基于提示词难度、历史响应质量、当前预算余额与延迟要求,实时决策最优模型路径。
近两年,这类工程实践已从工程师口耳相传的经验,上升为严肃学术课题。
例如,ParetoBandit聚焦于动态环境下的预算感知路由——模型价格浮动、性能悄然衰减、新模型持续入场,系统如何在控制总预算的同时,持续在线优化调度策略?
Budget-Aware Agentic Routing则专攻Agent长链任务场景:每一步都调用强模型不可持续,因此必须在每个节点实时判断——此刻该省钱,还是该加码?
当企业主动剥离“Token管够”的幻想,拥抱更理性的“小模型经济学”,恰恰标志着AI规模化落地,真正迈入深水区。
本文来自微信公众号“世界模型工场”,作者:世界模型工场,36氪经授权发布。











