asyncio需借助aiofiles实现异步文件i/o,必须显式await所有i/o操作;并发时须用semaphore限流,大文件应分块读取(64kb),python 3.11推荐使用taskgroup替代gather以避免资源泄漏。

asyncio 本身不直接支持异步文件 I/O,必须依赖 aiofiles 这类第三方库。Python 3.11 的性能提升不会自动让同步 open() 变成异步——你得显式改写逻辑,否则仍是阻塞的。
用 aiofiles.open() 替代 open(),但别漏掉 await
常见错误是只把 open 换成 aiofiles.open,却忘了在 read()、write() 前加 await:
❌ 错误写法:async with aiofiles.open('data.txt') as f: content = f.read()(没 await,返回的是协程对象,不是字符串)
✅ 正确写法:async with aiofiles.open('data.txt') as f: content = await f.read()
注意:aiofiles 的接口几乎和内置 open 一致,但所有 I/O 方法都变成 await-able;不加 await 不会报错,但后续操作会出 TypeError: object bytes can't be used in 'await' expression 或静默失败。
并发读写大量小文件时,必须用 asyncio.Semaphore 限流
Python 3.11 的 asyncio.gather() 调度更快,反而会让未加限制的并发迅速触发系统级限制:
• 触发 OSError: [Errno 24] Too many open files
• 在 macOS/Linux 上默认 ulimit -n 是 256 或 1024
• 即使 SSD 也扛不住数千个同时打开的文件句柄
建议做法:
- 创建
sem = asyncio.Semaphore(16)(数值按实际磁盘随机 I/O 能力调,SSD 通常 8–32 合适) - 每个文件操作包在
async with sem:块里 - 避免直接
await asyncio.gather(*[read_one(f) for f in files])
大文件分块读取,缓冲区大小设为 65536(64KB)而非默认 8192
aiofiles 默认使用 8KB 缓冲,对大文件(>10MB)效率偏低:
• 小缓冲 → 更多次系统调用 → 更多事件循环调度开销
• Python 3.11 的帧优化对此类高频小调用收益有限
实测中,将 read(65536) 替代 read() 全量加载,可降低内存峰值 70% 且总耗时减少 20%+(SSD 环境):async with aiofiles.open('big.log', 'rb') as f: while True: chunk = await f.read(65536) if not chunk: break
注意:不要盲目设到 1MB 以上——Python 3.11 的内存分配优化对超大 buffer 收益递减,还可能挤占其他协程内存。
升级到 Python 3.11 后,优先用 asyncio.TaskGroup 替代 gather
这不是“性能更好”,而是避免资源泄漏:
• asyncio.gather() 遇到异常会立即取消其余任务,async with 里的文件句柄可能来不及关闭
• asyncio.TaskGroup(3.11 新增)强制等待子任务完成清理再聚合异常
正确写法:async with asyncio.TaskGroup() as tg: for path in paths: tg.create_task(process_file(path))
其中 process_file() 必须包含自己的 async with aiofiles.open(...)。
⚠️ 别忽略:TaskGroup 抛出的是 ExceptionGroup,捕获要写 except* ValueError:,普通 except ValueError: 会漏掉。
真正卡住性能的往往不是协程本身,而是操作系统层面的文件句柄数、磁盘队列深度、以及你是否让 3.11 的快速调度反向放大了资源争抢。写完 async def 只是第一步,控制并发、分块读写、用对结构化异常,才是让异步文件操作跑起来的关键。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











