如何在Python中将多层嵌套的字典列表平铺为扁平化的DataFrame?

梦涛姑娘_1073

梦涛姑娘_1073

2026-08-01

860人浏览

原创

pandas.json_normalize是处理嵌套字典列表的正确方法,能自动展开层级、处理缺失值和混合类型,优于手动展平或直接dataframe构造。

如何在python中将多层嵌套的字典列表平铺为扁平化的dataframe?

用 pandas.json_normalize 处理嵌套字典列表最直接

多数人卡在 pd.DataFrame() 直接构造失败,因为嵌套结构里存在不等长的字典、None 值或混合类型字段。真正该用的是 pandas.json_normalize——它专为这种场景设计,能自动展开层级、处理缺失、生成带点号分隔的列名。

常见错误是把嵌套数据先手动递归展平再转 DataFrame,既易出错又慢。而 json_normalize 内部已优化过路径解析和空值填充逻辑。

  • 对纯字典列表(无顶层 key),直接传入:pd.json_normalize(data)
  • 若数据包在某个 key 下(如 {"results": [...]}),用 record_path 指定路径:pd.json_normalize(data, record_path="results")
  • 需要保留外层字段(如 metadata)时,配合 meta 参数:pd.json_normalize(data, record_path="results", meta=["id", "timestamp"])

遇到 list-of-dict 字段时必须用 sep 和 max_level 控制展开深度

当某字段值本身是 [{"a": 1}, {"a": 2}] 这类列表时,默认行为会把整个 list 当作一个 object,列内容变成 [{"a": 1}, {"a": 2}] 而非两行。这时得靠 sep 和 max_level 显式控制。

默认 sep=".",但若原始字段名含点号(如 "user.id"),建议改用 sep="_" 避免歧义;max_level=0 表示只展开一级,适合想保留某些子结构的场景。

  • 想把 "tags": [{"name": "A"}, {"name": "B"}] 拆成两行?必须加 record_path 和 meta 组合:pd.json_normalize(data, record_path=["tags"], meta=[["user", "id"], ["post", "title"]])
  • 字段名冲突(如外层和内层都有 "id")会导致列重名,json_normalize 默认加后缀 .0、.1,可提前 rename 或用 errors="ignore"

空值、None 和缺失字段会让列类型变 object,需主动转换

json_normalize 对缺失字段统一填 None,导致整列 dtype 变成 object,后续算术运算或排序会报错。这不是 bug,而是为兼容任意嵌套结构做的保守设计。

Python Testing
Python Testing

Python 测试速查:运行 pytest、使用 mock/patch、参数化、fixtures、异步、覆盖率测试。

下载

别依赖 df.fillna().astype() 一刀切——不同列可能有不同合理默认值(比如时间字段填 pd.NaT,数值字段填 -1 或 np.nan)。

  • 数值列:先 pd.to_numeric(df["col"], errors="coerce"),把非法字符串转为 NaN
  • 时间列:用 pd.to_datetime(df["col"], errors="coerce"),无效值变 NaT
  • 布尔列:注意 None 无法直接转 bool,得先 df["col"].map({True: True, False: False}) 或用 astype("boolean")(pandas 1.0+)

超深嵌套(>5 层)或动态 key 名时,json_normalize 会失效

当嵌套超过 5–6 层,或 key 名本身是变量(如 {"2023-01": {...}, "2023-02": {...}}),json_normalize 的静态路径语法就力不从心了。这时候得退回到手动递归 + pd.json_normalize 分段处理。

典型陷阱是试图用正则匹配 key 名传给 record_path——它不支持通配符或 pattern,只认确切字符串或 list of strings。

  • 动态日期 key:先用 {k: v for k, v in data.items() if k.startswith("20")} 提取,再对每个 value 单独 json_normalize
  • 混合结构(有些 item 有 "details",有些没有):先统一补全字段,或用 errors="ignore" 并接受部分列为 None
  • 性能敏感场景:避免多次调用 json_normalize,优先用 functools.reduce 合并结果,而非 pd.concat 循环追加

真正麻烦的不是怎么展开,而是展开后字段语义是否还清晰——点号分隔的列名(如 user.profile.address.city)一旦超过三层,后续写分析代码就容易漏掉层级或拼错名字。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1571

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3744

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1589

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

21517

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2647

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2707

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1083

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

576

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2083

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程