
本文介绍如何在不加载整个csv文件的前提下,快速、低内存地读取多个大csv文件的末尾若干行,适用于处理千个以上、每文件十万行的场景。
本文介绍如何在不加载整个csv文件的前提下,快速、低内存地读取多个大csv文件的末尾若干行,适用于处理千个以上、每文件十万行的场景。
当面对1000+个、每个含约10万行的CSV文件时,逐个用 pandas.read_csv() 全量加载不仅耗时(I/O + 解析),还会造成显著内存压力。核心优化思路是:跳过前N行,只解析末尾目标行数——前提是CSV结构规整(无嵌入换行符、无引号内换行等复杂情况)。
✅ 推荐方案:skiprows + 行数预估(最快、最轻量)
若所有CSV文件行数大致固定(如均为100,000行),可直接用 skiprows 参数跳过前 total_rows - desired_lines 行:
import pandas as pd
import os
directory = "/tmp/path/to/csv/"
out = []
DESIRED_LINES = 100
ESTIMATED_TOTAL_ROWS = 100_000 # 需提前知悉或通过一次采样获取
for filename in os.listdir(directory):
if not filename.endswith('.csv'):
continue
file_path = os.path.join(directory, filename)
# 跳过前 (100000 - 100) = 99900 行,仅读最后100行
try:
df = pd.read_csv(file_path, skiprows=range(1, ESTIMATED_TOTAL_ROWS - DESIRED_LINES))
# 注意:iloc[-1] 可能越界,建议先检查 len(df) >= 1
if len(df) > 0 and (df.iloc[-1] <blockquote>
<p>⚠️ 注意事项: </p><div class="aritcle_card flexRow artxards">
<div class="artcardd flexRow">
<a class="aritcle_card_img" rel="nofollow" href="/xiazai/gongju/2506" title="Python 3.14.2"><img
src="https://img.php.cn/upload/manual/001/221/864/6a696c31dfa4a111.webp" alt="Python 3.14.2" onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
<div class="aritcle_card_info flexColumn">
<a rel="nofollow" href="/xiazai/gongju/2506" title="Python 3.14.2" class="overflowclass">Python 3.14.2</a>
<p class="overflowclass">Python 3.14.2是Python编程语言在2025年12月5日发布的稳定版本,属于3.14系列的第二个维护更新。该版本包含了18项修复,重点解决了多进程、数据类及正则表达式等模块的回归问题,并修复了CVE-2025-12084等安全漏洞。此版本标志着自由线程模式(移除GIL)正式获得官方支持,是Python发展的重要里程碑。</p>
</div>
<a rel="nofollow" href="/xiazai/gongju/2506" title="Python 3.14.2" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span>
</a>
</div>
</div>
<ul>
<li>skiprows 接收整数(跳过前N行)或可迭代对象(如 range(1, N)),后者更灵活,可跳过表头+前N行; </li>
<li>此法依赖<strong>已知总行数</strong>。若行数不固定,需先用 wc -l(Linux/macOS)或逐行计数(Python)估算,但会增加单文件开销; </li>
<li>不支持含多行字段(如 "text\nmore")的CSV,因底层按行切分,非按逻辑记录解析。</li>
</ul>
</blockquote><h3>? 进阶方案:流式读取末尾N行(跨平台、无需预知行数)</h3><p>对行数不固定的场景,推荐使用 deque 流式缓存最后N行(内存占用恒定,O(1)空间):</p><pre class="brush:php;toolbar:false;">from collections import deque
def tail_lines(filepath, n=100):
"""高效读取文件末尾n行(类似Unix tail命令)"""
with open(filepath, 'rb') as f:
f.seek(0, 2) # 移动到文件末尾
file_size = f.tell()
if file_size == 0:
return []
lines = deque(maxlen=n)
buffer = bytearray()
pos = file_size - 1
while pos >= 0 and len(lines) 0 and (df.iloc[-1] <h3>✅ 性能对比与选型建议</h3>
| 方法 | 时间复杂度 | 内存占用 | 适用场景 | 是否需预知行数 |
|---|---|---|---|---|
| skiprows(固定行数) | O(1) I/O | ~O(100×列宽) | 行数稳定、格式规范 | ✅ 必须 |
| tail_lines + StringIO | O(N) 字节扫描 | ~O(100×平均行长) | 行数不一、兼容性优先 | ❌ 无需 |
总结:
- 若CSV来自可控数据管道(如ETL导出),优先采用 skiprows 方案,性能最优;
- 若需健壮性与通用性,tail_lines 是更安全的选择;
- 永远避免 pd.read_csv().tail(n) —— 它仍会全量解析,仅丢弃中间结果,纯属浪费。
通过合理选择底层读取策略,千级大CSV的末尾校验任务可从分钟级降至秒级,内存占用降低95%以上。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










