
本文介绍如何使用 Python 和 pandas 正确解析含嵌套 measurements 数组的 JSON 文件,将固定结构的元数据与可变长度的测量点(x/y 坐标)分别提取为结构化 DataFrame,避免常见 KeyError 和扁平化错误。
本文介绍如何使用 python 和 pandas 正确解析含嵌套 `measurements` 数组的 json 文件,将固定结构的元数据与可变长度的测量点(x/y 坐标)分别提取为结构化 dataframe,避免常见 keyerror 和扁平化错误。
在处理科学仪器或传感器导出的 JSON 数据时,常遇到类似结构:顶层包含版本信息,data 数组中每个元素既是元数据容器,又嵌套一个 measurements 列表(每个元素含 datax/datay 键)。直接用 pd.DataFrame(data['data']) 会导致 measurements 列被整体保留为对象,无法展开——这正是你遇到“只取到第一个值”的根本原因。
关键在于:measurements 是每个数据点内部的独立列表,必须逐层遍历、解包并重组字段。以下是两种专业、鲁棒的解决方案:
✅ 方案一:展开为扁平列(推荐用于后续数值分析)
将每个测量点的 datax 和 datay 展开为独立列(如 point_1_x, point_1_y, point_2_x…),适合需要对单个坐标点做统计或绘图的场景:
import json
import pandas as pd
with open('Filename.json') as f:
data = json.load(f)
# 遍历每个数据点,解包 measurements 并注入新字段
for d in data["data"]:
# 使用 enumerate 从 1 开始编号,避免索引混淆
for i, measurement in enumerate(d.pop("measurements"), 1):
d[f"point_{i}_x"] = measurement["datax"]
d[f"point_{i}_y"] = measurement["datay"]
df = pd.DataFrame(data["data"])
print(df)
输出示例(自动适配任意长度的 measurements):
metadata1 metadata2 metadata3 metadata4 metadata5 point_1_x point_1_y point_2_x point_2_y point_3_x ... 0 1.1 2.1 3.1 4.1 5.5 0.0 10.0 0.3 15.0 0.7 ... 1 1.2 2.2 3.2 4.4 5.5 1.0 20.0 2.3 35.0 3.7 ...
⚠️ 注意:此方案要求所有 measurements 列表长度一致(如均为 5 个点),否则缺失值会自动填充为 NaN,需配合 df.dropna() 或插值处理。
✅ 方案二:保留为列表列(推荐用于分组操作或序列建模)
将每组 measurements 转为两个独立列表列(如 datax1, datay1, datax2…),适合需保持原始序列结构、进行时间序列分析或批量绘图:
for i, d in enumerate(data["data"], 1):
datax_list, datay_list = [], []
for m in d.pop("measurements"):
datax_list.append(m["datax"])
datay_list.append(m["datay"])
d[f"datax{i}"] = datax_list
d[f"datay{i}"] = datay_list
df = pd.DataFrame(data["data"])
print(df)
输出示例(每列存储完整坐标序列):
metadata1 ... datax1 datay1 datax2 datay2 0 1.1 ... [0.0, 0.3, 0.7, 1.1, 1.7] [10.0, 15.0, 25.0, 40.0, 55.0] NaN NaN 1 1.2 ... NaN NaN [1.0, 2.3, 3.7, 4.1, 5.7] [20.0, 35.0, 25.0, 30.0, 32.0]
? 提示:若需进一步展开列表列(如将 datax1 拆为多列),可使用 df.explode(['datax1', 'datay1']);若需统一长度,可用 pd.json_normalize() + pd.concat() 组合处理。
? 安全实践建议
- 始终校验键存在性:生产环境应添加 if "measurements" in d: 判断,避免 KeyError;
- 处理空 measurements:在循环前检查 if not d.get("measurements"): 并赋予默认空列表;
- 类型一致性:json.load() 默认将数字转为 float,如需整数精度,可在 json.load() 后用 pd.to_numeric() 强制转换;
- 大文件优化:若 JSON 文件超百 MB,改用 ijson 库流式解析,避免内存溢出。
通过以上方法,你不仅能精准分离元数据与多维测量数据,还能灵活适配后续分析需求——告别手动索引错误,让嵌套 JSON 成为可计算的结构化资产。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











