excel 里要把多个文件夹下的同类数据一次性汇总、清洗并合并,最省事的做法不是一份份复制粘贴,而是直接用 power query 读取文件夹,再在查询编辑器里统一做筛选、拆分、改类型和追加。这样以后只要把新文件继续放进同一个文件夹,刷新一次就能更新结果,特别适合日报、门店明细、销售台账和财务流水这类反复汇总的数据场景。
先把同类源文件整理进同一个文件夹,字段结构尽量保持一致
开始用 Power Query 前,先把要合并的文件整理好最重要。常见做法是把同一批 Excel、CSV 或文本表全部放进一个独立文件夹里,并尽量保证它们的列名、字段顺序和表头结构一致。这样后面文件夹合并时,Power Query 才能稳定识别每个文件里的内容,不会一刷新就因为某个文件格式不统一而报错。

在 Excel 里从文件夹导入,让 Power Query 一次读取整批文件
源文件准备好以后,直接在 Excel 的数据入口里选择“从文件夹”导入。这里的关键不是先打开某一份样本表,而是让 Power Query 先看到整个文件夹清单,这样后面它才能按同一规则把所有文件一起拉进来。对于每月新增、每天递增的数据目录,这一步能一下子省掉大量重复导入动作。

在查询编辑器里先做基础清洗,再统一合并
导入后不要急着直接关闭加载,先在查询编辑器里把基础清洗做好更稳。常见动作包括删除无用列、筛掉空行、统一日期格式、修正数字类型,或者把某些合并单元格遗留问题处理掉。先清洗再合并的好处是后面形成的汇总表更干净,刷新时也不容易因为源数据细节不一致而出现类型混乱。

将 PySpark .show() 输出转为 Tab 分隔文本,方便粘贴 Excel。触发词:pyspark、数据转excel、表格整理、venus数据、show输出、复制到excel、数据格式化。
用样本文件规则展开数据,确保每个文件都按同一套逻辑处理
文件夹合并时,Power Query 通常会先生成一个样本文件处理逻辑,再把同样的步骤套用到整批文件上。这里要重点检查样本文件的展开方式是不是正确,比如表头提升、工作表选择、列展开范围和字段名称是否都符合预期。只要样本规则定准了,后面几十份、上百份文件都会按同一套逻辑自动处理。

回到结果表后再补字段校验,确认合并后的数据能直接用
查询加载回 Excel 以后,别急着就把这张汇总表拿去分析,最好再做一轮字段检查。重点看日期列是不是都变成了日期类型,金额、数量这些数字列有没有混进文本,以及来源文件名或月份标记有没有保留。只要这一步校验过关,后面无论继续做数据透视表、图表还是导出给同事使用,都会顺很多。

以后新增文件只要丢进文件夹,刷新一次就能自动更新
这套流程真正省时间的地方就在这里:后面再有新文件,不需要重新搭一遍查询,只要把新文件继续放进同一个文件夹,然后在 Excel 里点一次刷新,整张表就会按原来的清洗和合并规则自动更新。对固定周期反复汇总的数据工作来说,这一步往往比第一次建查询本身更有价值。











