智谱清言api正确调用需严格规范参数:必填model(如glm-4-flash)和messages(含role为"user"/"system"/"assistant"且content为非空字符串的对象);temperature设0.1~0.95,max_tokens按中文1字≈1.3 token计算;启用沉思模式须用thinking_mode:true(仅/auto-think/completions接口)或sdk的thinking_enabled=true(仅auto-glm系列);stream=true启用流式需匹配对应接口路径,否则报405。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要让智谱清言API正确返回结果,必须按规范填写请求参数,少一个字段可能直接报400错误,错填类型(比如把字符串当数字传)会导致模型静默失败。
基础必填参数怎么写
所有调用都必须包含 model 和 messages 两个字段,缺一不可。
第一步:model 字段填官方支持的模型名,如 【glm-4-flash】、glm-4-air 或 auto-glm-05;不能写成 glm4、glmv4 或带空格的 “glm-4 flash”。
第二步:messages 是个数组,至少含一个 role 为 user 的对象;role 只接受 "system"、"user"、"assistant" 三种值,写成 "User" 或 "SYSTEM" 会报错。
第三步:每个 message 对象里必须有 content 字段,且类型为 string;若传空字符串 "",部分模型会拒绝响应而非返回空结果。
温度与长度控制参数
temperature 控制输出随机性,建议设在 0.1~0.95 区间。设为 0 时输出确定性强但易重复,设为 1.2 会触发服务端截断并返回 422 错误。
max_tokens 指模型最多生成的 token 数,不是字数。中文平均 1 个字 ≈ 1.3 token,所以想输出 500 字,max_tokens 至少设为 650。
top_p 是另一个多样性参数,和 temperature 二选一用即可;同时设置可能削弱控制效果。
启用沉思模式的写法
方法一:使用官方 SDK(推荐)
在 create() 调用中加入 thinking_enabled=True 参数,仅对 auto-glm 系列模型生效;glm-4 等通用模型传该参数会被忽略。
方法二:用 requests 直接 POST
在 JSON payload 中添加 【"thinking_mode": true】,注意字段名是 thinking_mode 不是 thinking_enabled,且只在 /auto-think/completions 接口有效。
方法三:在 prompt 末尾加 [THINK] 触发词
仅限 Web 端或部分兼容接口,API 调用时不依赖此方式,且 [THINK] 必须紧贴 prompt 结尾,中间有空格或换行将失效。
流式输出与完整返回切换
stream 参数决定响应格式:设为 True 时,返回的是 Chunk 流,需循环读取;设为 False 或不传,response.json() 直接返回完整 answer 字段。
注意:使用 zhipuai SDK 时,stream=False 是默认行为;但用 requests 手动构造请求时,该参数不存在,必须靠后端接口路径区分——/chat/completions 默认非流式,/auto-think/completions 默认流式。
若误在非流式接口加 stream=true,服务器会返回 405 Method Not Allowed。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!











