必须关闭proxy_buffering以实现打字机效果,还需配合sse或分块传输、禁用gzip与proxy_cache、设置no-cache和x-accel-buffering:no响应头,并用eventsource或readablestream前端消费。

将 proxy_buffering off 设置为 off 是实现 ChatGPT 风格流式响应(即“打字机效果”)的关键一步,但仅靠它并不“完美”——它只是必要条件,还需配合后端响应格式、传输编码和客户端处理。下面说清楚怎么做才真正生效。
为什么 proxy_buffering off 是必须的
Nginx 默认开启 proxy_buffering,会缓存上游(如你的 Flask/FastAPI 服务)返回的响应体,等全部收完再一次性发给浏览器。这对普通页面没问题,但对逐字/逐 token 流式输出的 AI 接口来说,会导致用户看到整段回复“突然弹出”,完全失去打字机体验。
设为 off 后,Nginx 不做缓冲,收到一点数据就立刻转发,是流式传输的基础。
- 在 location 块中明确写:
proxy_buffering off; - 同时建议关闭 gzip 压缩:
gzip off;(否则 Nginx 可能因压缩逻辑再次缓冲) - 确保
proxy_cache未启用,或显式禁用:proxy_cache off;
后端必须按 SSE 或分块传输规范输出
光关 buffering 不够——后端得真正“边生成边发”。常见可靠方式有两种:
-
Server-Sent Events (SSE):响应头设
Content-Type: text/event-stream,每条消息以data: ...\n\n格式发送,末尾双换行。Nginx 对 SSE 兼容良好,且天然支持流式。 -
Chunked Transfer Encoding:不设
Content-Length,用Transfer-Encoding: chunked分块输出(如 FastAPI 的StreamingResponse)。注意:某些旧版 Nginx 在高并发下可能提前关闭连接,建议用 1.19+ 版本。
避免使用普通 JSON 响应 + flush():很多框架的 flush 并不保证底层 TCP 立即写出,尤其在 Nginx 代理链路中容易失效。
关键响应头不能少
即使 buffering 关了、后端流式发了,缺少以下响应头仍可能导致浏览器或中间件吞掉流数据:
-
Cache-Control: no-cache(防 CDN 或浏览器缓存整个流) -
Connection: keep-alive(维持长连接) -
X-Accel-Buffering: no(Nginx 专属头,强制禁用其内部缓冲,比 proxy_buffering 更底层,推荐加上) - SSE 场景额外加:
Content-Type: text/event-stream和Access-Control-Allow-Origin: *(若跨域)
客户端要正确消费流数据
前端 JS 必须用支持流式读取的 API,而不是 fetch().then(res => res.json()) 这种等待完整响应的方式:
- SSE 方案:用
EventSource,监听message事件,逐条更新 UI - Fetch + ReadableStream:用
response.body.getReader()循环读 chunk,解码后拼接、渲染(注意 UTF-8 多字节边界) - 避免在 React/Vue 中高频 setState —— 可合并小块文本或节流渲染,防止重绘卡顿
测试时用 curl 或浏览器 Network → Response 面板观察是否“实时滚动输出”,而非等几秒后整块出现。











