腾讯混元api需启用流式调用实现低延迟响应,确认模型如hunyuan-standard支持stream=true,python sdk需设req.stream=true并遍历event流提取delta.content,openai兼容方式传stream=true即可,http请求须设"stream": true且响应头为text/event-stream。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要让腾讯混元API逐段返回结果,而不是等全部生成完才给完整回答,这样才能实现低延迟响应或边打字边显示的效果。
确认模型支持流式调用
并非所有混元模型都默认开启流式能力。调用前必须确认你选用的模型明确支持 Stream=True,例如 hunyuan-standard、hunyuan-turbo、hunyuan-pro 均支持;但 hunyuan-lite(轻量版)在部分部署环境可能禁用流式,需以实际接口文档为准。
查看腾讯云控制台中该模型的服务说明页,或直接发起一次试探性请求:设置 Stream=True 后若返回 400 错误且 message 中含 “stream not supported”,说明当前模型或版本不支持。
Python SDK 中开启流式输出
方法一:使用 tencentcloud-sdk-python(官方SDK)
第一步:初始化请求对象,并显式设置 req.Stream = True
第二步:调用 client.ChatCompletions(req),返回一个可迭代的响应对象,不是普通 JSON
第三步:遍历 event 流,提取 Delta.Content 并拼接
注意:【必须检查 event.Choices 和 event.Choices[0].Delta 是否存在,否则会触发 AttributeError】
方法二:使用 OpenAI 兼容方式(通过 base_url 指向混元 endpoint)
只需在 chat.completions.create() 调用中传入 stream=True 参数,其余逻辑与 OpenAI 官方流式用法完全一致,返回一个 StreamingResponse 对象,可用 for chunk in response 迭代读取。
HTTP 请求手动构造流式调用
向 https://api.hunyuan.cloud.tencent.com/v1/chat/completions 发起 POST 请求
在 JSON body 中必须包含字段 "stream": true,且 Content-Type 为 application/json
响应头中应包含 content-type: text/event-stream,表示服务端启用 SSE 协议推送
客户端需按 SSE 格式解析每行 data: {...},跳过注释行(以 : 开头)、空行和 [DONE] 标记
【若收到非 text/event-stream 响应头,说明后端未启用流式,或请求体中 stream 字段缺失/类型错误(如写成 "stream": "true" 字符串)】











