智谱清言免费额度实际为glm-4-flash免费无限+glm-4-air每月200万,高级模型不走免费池;需通过开放平台配额管理确认真实可用额度,并严格配置glm-4-flash或glm-4-air模型调用。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你充了50块,5分钟烧光;你注册了账号,却只用了不到1%的免费额度——这不是运气差,是没摸清智谱清言免费Token的真实消耗逻辑。官方说每月200万Token免费,但实际到账的是“GLM-4-Flash免费+GLM-4-Air 200万”,且GLM-4-Plus、GLM-5-Turbo等高级模型完全不走免费池,默认从你的充值余额扣费,一不留神就秒变负数。
确认当前账户真实可用的免费额度类型
打开智谱开放平台(不是清言App或bigmodel.cn网页版),登录后进入【控制台→配额管理】。这里显示的才是你API调用时真正生效的额度池。
注意:网页版智谱清言对话界面右上角显示的“剩余次数”或“今日额度”,仅对应清影/清言App端的独立日配额,与API调用完全无关。API调用只认开放平台里的“Token配额”和“模型专属额度”。
检查三项关键数据:① GLM-4-Flash 是否标注“免费无限”;② GLM-4-Air 是否显示“200万/月”且状态为“已激活”;③ GLM-4-Plus 或 GLM-5 是否显示“0”或“未开通”。若后两者有数值,那一定是你手动充值过的,不是赠送额度。
三步锁定免费模型,杜绝误扣
第一步:在Dify或任何调用方配置模型时,模型名称必须严格填写为 glm-4-flash 或 glm-4-air(全小写、带短横线、无空格)。
第二步:在请求体中显式指定 model 字段,不要依赖默认值。例如 Python 请求中必须包含:"model": "glm-4-flash"。
第三步:测试阶段,先用最简请求验证——只发一句“你好”,观察返回头中的 X-Used-Tokens 和 X-Remaining-Quota。如果返回中出现 X-Balance: -0.5 或 X-Used-Tokens 超过1000,说明你已掉进GLM-4-Plus陷阱,立刻停用并重查配置。
让免费额度撑得更久的实操技巧
方法一:用GLM-4-Flash做预筛,再用GLM-4-Air做精修
对批量任务(如100条客服话术分类),先用glm-4-flash跑第一遍:输入“判断以下每句话是否含投诉意图,只回答是/否,不要解释”,输出纯布尔值。这一步几乎零成本。再把标记为“是”的20条挑出来,用glm-4-air生成详细处理建议。这样可节省80%以上Air额度。
方法二:强制截断输入,避免上下文溢出
GLM-4-Air的上下文窗口是128K tokens,但免费额度只有200万/月。如果你传入一篇500KB的PDF文本(约30万tokens),单次调用就吃掉15%额度。正确做法是:用Python先按段落切分,每段≤8000 tokens,加一句“仅基于本段内容回答,忽略其余部分”,再逐段调用。这比一次性喂全文省3倍以上Token。
方法三:关闭历史记录,禁用多轮会话
在Dify工作流或API请求中,绝对不要开启history字段。哪怕只保留最近3轮对话,每轮平均200 tokens,100次调用就额外耗掉6万tokens。对非对话类任务(如摘要、改写、提取),始终使用单次无状态请求。











