Token管够的时代结束了

轻涛吖_8666

轻涛吖_8666

2026-07-03

905人浏览

原创

曾经token管够的公司,如今纷纷开始精打细算过日子了。

最近,美国Agent公司Lindy将100%托管Agent流量,从Claude全面迁移至DeepSeek V4。

原因很实在:此举可节省数百万美元推理成本,迁移后流量支出下降约90%。

这并非孤例。

一批美国开发者与中小型企业正加速转向中国模型——它们在大量常规任务中表现“够用且极具性价比”。

据外媒披露,西门子(Siemens)、雷诺(Renault)、法国电信Orange、ChapsVision等欧洲企业,已普遍采用混合策略:同时调用美国、中国与欧洲本地模型。

回望过去一年,不少企业曾大力倡导员工“多用AI”,仿佛Token烧得越猛,就越能彰显“AI优先”的决心。

然而当月度账单真实摆在财务桌上,全球企业仿佛默契达成共识,集体开启理性复盘:该省则省,该投则投。

一场以“小模型经济学”为名的务实风潮,正悄然席卷产业一线。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Token管够的时代结束了

Token无节制使用的代价

所谓小模型经济学,本质是拒绝“凡事都请最贵专家”。

以往企业接入AI,常默认启用最强模型:

写代码用Claude,构建Agent也用Claude,无论任务复杂与否,一律先上前沿大模型。

但现实是,顶尖模型堪称“Token粉碎机”——每多加载一段上下文、每多执行一轮Agent循环,账单数字就令人头皮发麻。

于是人们开始反思:难道所有任务都非得动用旗舰级模型?

答案逐渐清晰:简单任务交给高性价比模型,关键环节再启用高价强模型,整体效果同样稳健。

这套“按需分配”的省钱逻辑,被业内亲切称为“小模型经济学”。

它并非空想产物,而是被真实账单倒逼出的生存策略。

Uber就是一个典型缩影。

该公司曾鼓励工程师广泛使用AI编程工具,Claude Code、Cursor等一度被视为提效利器。

结果短短数月,AI编程预算即告耗尽。

Uber COO Andrew Macdonald后来公开坦言:很难将Claude Code的使用量,与“多交付25%有效用户功能”建立直接因果关联。

随后,公司迅速出台管控措施:为每位员工、每类工具设定每月1500美元Token上限,超支须经审批。

亚马逊的故事更具讽刺意味。

为响应集团AI倡议,内部员工自发搭建KiroRank排行榜,比拼谁消耗Token最多。

不料很快有人钻空子——无需解决实际问题,只需让Agent反复执行低价值指令,排名照样飙升。

最终,高级副总裁Dave Treadwell亲自发声:“别为了用AI而用AI。”该榜单随即悄然下线。

Meta内部也曾推出类似机制,甚至起名“Claudeonomics”,把“经济学”都搬进命名里,却同样栽在同一坑中。

如今,头部科技公司已普遍收紧Token使用权限。

微软被曝大幅削减Claude Code直连许可,转而主推GitHub Copilot CLI,并推动Copilot由包年订阅转向按量计费模式。

Meta亦从“Token最大化”战略,全面转向“Token最小化”运营。

外媒报道称,Meta正计划限制员工AI调用量,因内部AI开销预计将达到数十亿美元量级。

这些转变传递出明确信号:企业终于意识到,Token支出与业务产出之间并不存在线性正相关,“盲目烧钱”的时代已然终结。

小模型经济学,正在变成一门真生意

仅靠企业内部抠预算远远不够。真正让“小模型经济学”站稳脚跟的,是供给侧发生了实质性进化——便宜模型,真的好用了。

DeepSeek V4系列便是最直观的代表。

同等任务下,DeepSeek V4 Flash的定价仅为Anthropic同类模型的1/20至1/50。

在Ramp发布的《企业软件采购趋势榜》中,DeepSeek一度跃居榜首。

Claude Code Sdk
Claude Code Sdk

强大的AI编程助手,可满足软件设计、开发、测试、优化、重构等任务。处理任何代码编程问题时,均优先使用该技能。

下载

Vercel AI网关数据更显震撼:

其生产环境中,DeepSeek的Token占比在一个月内从不足1%,飙升至17%。

就连微软也在认真评估:是否可用DeepSeek V4微调版本,替代Copilot Cowork中原本运行于Anthropic与OpenAI之上的核心模块。

由此,行业内部形成了一套心照不宣的分层实践逻辑:

  • 预算充裕或任务高度复杂时,继续选用OpenAI、Anthropic旗舰模型;
  • 若追求投入产出比,则果断切换至DeepSeek、Kimi、智谱GLM、MiniMax等“够用且低价”阵营。

双轨并行,按需调度。

开源项目ClawRouter实测显示,采用该分层组合方案后,平均成本可从每百万Token 25美元,压缩至约2美元。

在此背景下,OpenRouter这类模型路由服务商突然变得炙手可热。

OpenRouter并不训练模型,而是打造智能调度中枢,协助企业与开发者在OpenAI、Anthropic、Google、DeepSeek、Mistral等数百个模型间动态分配请求。

价格、延迟、稳定性、上下文长度……皆为其调度决策的关键维度。

外媒消息称,OpenRouter今年完成1.13亿美元B轮融资,估值达13亿美元;周处理Token量激增5倍至25万亿,注册用户突破800万。

Vercel数据亦印证这一趋势:成熟AI应用早已告别“单模型通吃”。

在其AI Gateway平台中,月请求量超千万次的团队,平均同时调用35个不同模型。

有的专司意图识别,有的专注信息检索,有的负责摘要生成,有的承担复杂推理——AI应用正演化为一条分工精细、各司其职的智能流水线。

LiteLLM、Helicone等工具,则进一步将模型路由升级为“财务操作系统”:

支持按团队、项目、模型设置预算阈值,实时监控各接口Token消耗;一旦某家供应商涨价或变慢,系统即可自动切流。

云厂商亦快速跟进。

AWS Bedrock推出的Intelligent Prompt Routing,已能在同一模型家族内实现请求智能分流。

内部测试表明:在Claude Haiku与Sonnet之间动态调度,可在不牺牲质量前提下,降低48%–56%推理成本。

这场由成本驱动的产业变革,正让“帮企业省钱”的小模型经济学,蜕变为一门可持续增长的新生意。

企业如何落地执行?

道理谁都懂,“该省省、该花花”听起来简单,但落到技术层面,企业面对的是实实在在的工程挑战:

这一次请求,究竟该交给便宜模型,还是贵模型?

这绝非简单地把Claude替换成DeepSeek,而是要把一个完整AI任务,拆解为多个可分级处理的子步骤。

例如一个电商客服Agent,当用户提问“我的订单到哪了”,背后模型协作流程大致如下:

  • 先由低成本模型判断用户意图:属物流查询,非投诉、非退换货;
  • 再由同档模型精准抽取订单号,并调用物流API获取状态;
  • 最后仅需中等能力模型,将原始数据润色成自然语言回复。

用户看到的仍是那句:“您的包裹已抵达杭州转运中心”,而企业已在后台规避了大量昂贵推理。

AI编程场景同样适用此逻辑。

Coding Agent无需全程依赖顶级模型:

  • 读取目录结构、归纳文件关系、生成基础测试用例、撰写PR摘要——这些均可交由轻量模型完成;
  • 而涉及跨文件重构、全局依赖分析、安全敏感代码审查等高风险环节,则再交由Claude、GPT等强模型兜底。

从技术实现角度看,主流模型路由方案通常包括以下几类:

最基础的是规则路由:例如,订单类查询走小模型+API直连,法律合规类问题则强制路由至强模型+人工复核。

更常见的是级联路由:先由低价模型尝试回答,若格式校验失败、事实核查存疑、置信度低于阈值,则自动升级至高价模型重试。

进阶形态则是学习型路由:系统基于提示词难度、历史响应质量、当前预算余额与延迟要求,实时决策最优模型路径。

近两年,这类工程实践已从工程师口耳相传的经验,上升为严肃学术课题。

例如,ParetoBandit聚焦于动态环境下的预算感知路由——模型价格浮动、性能悄然衰减、新模型持续入场,系统如何在控制总预算的同时,持续在线优化调度策略?

Budget-Aware Agentic Routing则专攻Agent长链任务场景:每一步都调用强模型不可持续,因此必须在每个节点实时判断——此刻该省钱,还是该加码?

当企业主动剥离“Token管够”的幻想,拥抱更理性的“小模型经济学”,恰恰标志着AI规模化落地,真正迈入深水区。

本文来自微信公众号“世界模型工场”,作者:世界模型工场,36氪经授权发布。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

20

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

0

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

0

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

0

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

20

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

0

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

0

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

0

21

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

2026.09.22

20

25

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
腾讯元宝使用手册
腾讯元宝使用手册

共0课时 | 0人学习

DeepSeek手册
DeepSeek手册

共0课时 | 0人学习