np.savetxt()是numpy导出纯数值数组最直接可控的方式,支持delimiter设分隔符、fmt控精度(如'%d'或'%.3f'),但不支持列名与混合类型,含nan/inf需指定nanstr/infstr,中文路径须用open+encoding='utf-8-sig'传入文件对象。

用 np.savetxt() 是最直接且可控的方式
NumPy 自带的 np.savetxt() 就是为此设计的,不依赖 Pandas,开销小,适合纯数值数组导出。它默认以空格分隔,但通过 delimiter 参数可轻松切换为逗号。
常见错误是忽略 fmt 参数导致精度丢失或科学计数法输出(比如 1.23456789e+02),尤其在处理整数或固定小数位数据时明显。
- 导出整数数组:用
fmt='%d'避免小数点和尾随零 - 导出浮点数并保留 3 位小数:用
fmt='%.3f' - 若数组含
nan或inf,需配合nanstr和infstr参数,否则会写入nan字符串(可能被 Excel 当文本读取) - 注意
np.savetxt()不写列名,如需表头,得手动写入或换用 Pandas
当需要表头或混合类型时,pandas.DataFrame.to_csv() 更稳妥
NumPy 数组本身不支持列名或异构类型(如同时含字符串和数字),硬用 np.savetxt() 会报错或静默截断。这时转成 pandas.DataFrame 再导出更可靠。
性能上会有轻微开销(构造 DataFrame + 类型推断),但对百万级以下数据几乎无感;真正影响速度的是磁盘 I/O 和格式化逻辑,而非中间转换。
- 单列数组:用
pd.DataFrame(arr).to_csv('out.csv', index=False, header=['col_name']) - 多维数组:先确认是否需展平(
arr.ravel())或按行/列导出(pd.DataFrame(arr)默认每行为一记录) - 避免
index=True(默认行为),否则第一列是行号,容易误读 - 大数组慎用
float_format='%.6f',它会在 Python 层逐元素格式化,比np.savetxt(fmt='%.6f')慢约 2–3 倍
内存受限时,避免一次性加载整个数组到内存再写入
如果数组极大(比如 (10M, 10) 形状),np.savetxt() 和 to_csv() 都会尝试全量格式化,可能触发内存溢出或 swap 颠簸。
此时应分块处理:用 np.nditer() 或切片生成器逐行/逐块写入,绕过中间字符串拼接。
- 简单分块写法:
with open('out.csv', 'w') as f: f.write('col1,col2,col3\n') # 手动写头 for i in range(0, arr.shape[0], 10000): chunk = arr[i:i+10000] np.savetxt(f, chunk, delimiter=',', fmt='%.6f', newline='\n') - 注意
np.savetxt()的newline参数必须设为'\n'(默认是'\n',但显式声明更安全),否则 Windows 下可能混用\r\n - 不要用
print(..., file=f)拼接 CSV 行——无转义、不处理逗号/换行符,极易损坏文件
中文路径或含特殊字符时,encoding 必须显式指定
Windows 默认编码是 gbk,而 CSV 标准推荐 utf-8;如果路径含中文或数据含中文字段,不指定编码会导致 UnicodeEncodeError 或乱码。
这个坑在 Linux/macOS 上不明显(默认 UTF-8),但一到 Windows 就暴露,且错误信息常指向“无法写入文件”,掩盖了真实原因。
- 统一用
encoding='utf-8-sig'(尤其要兼容 Excel 打开) -
np.savetxt()不支持encoding参数,必须用open()手动传入文件对象:with open('测试数据.csv', 'w', encoding='utf-8-sig') as f: np.savetxt(f, arr, delimiter=',', fmt='%.3f') - Pandas 的
to_csv()支持encoding参数,但utf-8-sig要显式写全,不能简写为utf8
实际导出时,最容易被跳过的其实是分隔符一致性与缺失值表示——CSV 解析器对 nan、空字符串、NULL 的处理差异很大,务必提前确认下游系统(比如 Excel、R、数据库导入工具)期望的格式。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











