应使用response包裹生成器函数实现流式传输,避免open().read()一次性加载导致oom;生成器需分块yield bytes并设content_type,部署时还需配置gunicorn和nginx禁用缓冲。

用 Response 配合生成器函数返回大文件流
Flask 默认会把整个响应体加载进内存再发给客户端,遇到几百 MB 以上的日志、导出 CSV 或备份文件时极易 OOM。正确做法是绕过 render_template 和字符串拼接,直接用 Response 包裹一个生成器函数。
关键不是“怎么返回”,而是“谁来分块读取并 yield”。Flask 不负责读文件,你得自己控制 chunk 大小和读取逻辑。
- 生成器函数每次
yield一个bytes对象(如b"row1\nrow2\n"),不能是str -
Response必须显式设置content_type,否则浏览器可能乱码或触发下载失败 - 避免在生成器里做耗时操作(如数据库查询),否则会阻塞整个响应流
from flask import Flask, Response
<p>app = Flask(<strong>name</strong>)</p><p>def generate_large_csv():</p><h1>每次 yield 一行(或固定大小的 bytes)</h1><pre class="brush:python;toolbar:false;">for i in range(1000000):
yield f"{i},data_{i}\n".encode("utf-8")@app.route("/export.csv") def stream_csv(): return Response( generate_large_csv(), mimetype="text/csv", headers={"Content-Disposition": "attachment; filename=export.csv"} )
用 send_file 的 as_attachment=True + conditional=True 更省心
如果你只是想传一个已存在的大文件(比如用户上传后要下载),send_file 内部已基于 wsgi.file_wrapper 或 sendfile 系统调用做了优化,比手写生成器更可靠、更省内存。
但要注意:默认行为会读完整个文件进内存,必须显式启用流式支持。
- Flask ≥ 2.0:直接传
use_x_sendfile=False并确保as_attachment=True,底层会走FileWrapper - 务必加
conditional=True,否则不支持断点续传、If-Range等 HTTP 范围请求 - 路径必须是绝对路径,相对路径可能在不同部署环境下失效
from flask import send_file
import os
<p>@app.route("/download/<filename>")
def download_file(filename):
file_path = os.path.abspath(os.path.join("/var/data", filename))
return send_file(
file_path,
as_attachment=True,
conditional=True,
download_name=filename # Flask ≥ 2.2;旧版用 attachment_filename
)</filename></p>
为什么 stream_with_context 多数时候是多余的
新手常看到文档里推荐用 stream_with_context 包裹生成器,以为“不加就无法流式”。其实它只解决一个特定问题:生成器内部需要访问 request、g 或数据库连接等上下文对象时,Flask 请求上下文在响应开始后会被销毁。
如果你的生成器纯计算或读本地文件,完全不需要它。加了反而增加开销,还可能掩盖资源未释放的问题。
- 仅当生成器内调用了
db.session.query(...).yield_per(n)或request.args.get("format")才需要 - 用了
stream_with_context后,仍需手动关闭 DB 连接或文件句柄,它不帮你做清理 - 若生成器抛异常,上下文不会自动回滚事务,这点容易被忽略
生产环境必须检查 WSGI 服务器是否真正支持流
本地开发用 Flask 自带的 dev server 看起来能流,但上线后如果用的是 Gunicorn + sync worker,或者 Nginx 没配好,所有数据仍会被缓冲,最终还是吃光内存。
- Gunicorn:必须用
--worker-class=gthread或gevent,sync worker 会等生成器结束才发响应头 - Nginx:要禁用
proxy_buffering,并设proxy_buffer_size 128k防止截断 - Cloudflare / CDN:默认缓存整个响应体,大文件流式响应会被它们“终结”——这类服务不适合直接代理流式接口
最简单的验证方式:用 curl -v http://yourdomain/export.csv | head -c 200,看是否秒出前 200 字节,而不是卡住几秒后才吐。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











