统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
要在360智脑开放平台启用流式输出,必须显式声明stream=true及response_format="sse"或"text",且仅支持【stream:true】的模型(如qwen-max-stream);非流式模型传stream=true将返回400错误。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在360智脑开放平台启用流式输出,必须在调用API时显式声明响应格式与流控参数,否则默认返回完整JSON结构体,无法实现逐token渲染或实时语音合成等低延迟交互场景。
确认模型是否支持流式能力
登录360智脑开放平台→进入「我的应用」→点击对应应用的「详情」→查看「支持能力」栏。只有标注【stream:true】的模型(如qwen-max-stream、360gpt-pro-stream)才允许开启流式响应;调用非流式模型时传入stream=true将直接报错400。
注意:部分轻量模型(如qwen-turbo)虽在文档中提及“兼容流式”,但实际仅支持response_format=“text”下的chunk分块,不支持SSE协议,需按文本流方式手动解析换行分隔符。
API请求中启用流式传输
方法一:使用curl发送带stream参数的POST请求
在请求体JSON中加入"stream": true字段,并确保"response_format"设为"text"或"sse"(后者需服务端明确支持)。示例:
curl -X POST "https://api.360.cn/v1/chat/completions" \<br> -H "Authorization: Bearer YOUR_API_KEY" \<br> -H "Content-Type: application/json" \<br> -d '{<br> "model": "qwen-max-stream",<br> "messages": [{"role": "user", "content": "你好"}],<br> "stream": true,<br> "response_format": "sse"<br> }'
方法二:在OneAPI统一网关中配置渠道流式开关
登录OneAPI后台→「渠道」→编辑已添加的360智脑渠道→展开「高级配置」→勾选「启用流式响应」→保存。该设置会自动为所有经此渠道转发的请求注入stream=true和Accept: text/event-stream头,无需修改上游业务代码。
客户端正确解析SSE流响应
第一步:设置HTTP请求头Accept: text/event-stream且禁用响应体缓存(如fetch中加cache: 'no-cache');
第二步:监听message事件,而非等待response.json()——流式响应不会返回完整JSON对象,而是以data: {...}格式逐行推送;
第三步:对每条data字段做JSON.parse(),提取choices[0].delta.content拼接输出;遇到data: [DONE]即终止监听。
⚠️关键提醒:若未设置response_format="sse"却用SSE方式解析,服务器将返回普通JSON并混入换行符,导致JSON.parse()直接崩溃。










