
本文介绍使用xarray高效提取era5全球网格数据中指定地理区域(如巴基斯坦)多变量时间序列的完整流程,涵盖坐标预处理、区域裁剪、时空维度重构及dataframe转换等关键步骤。
本文介绍使用xarray高效提取era5全球网格数据中指定地理区域(如巴基斯坦)多变量时间序列的完整流程,涵盖坐标预处理、区域裁剪、时空维度重构及dataframe转换等关键步骤。
ERA5再分析数据以经纬度网格形式存储,常存在两个典型坐标问题:纬度倒序(90° → −90°)和经度偏移(0°–360°而非−180°–180°)。若直接使用 .sel() 按地理范围切片,将因坐标未对齐而返回空结果或报错。因此,提取区域时间序列前必须完成标准化预处理。
✅ 第一步:坐标标准化
import xarray as xr
# 加载数据(示例)
ds = xr.open_dataset("era5_pakistan_2008-2024.nc")
# 1. 纬度升序排序(关键!否则 slice(23.5, 37.0) 会失效)
ds = ds.sortby("latitude")
# 2. 经度转换为 -180° ~ +180° 并排序
ds = ds.assign_coords(longitude=(((ds.longitude + 180) % 360) - 180))
ds = ds.sortby("longitude")
⚠️ 注意:
sortby()是必须操作——xarray 的slice()要求维度单调递增,否则无法正确识别地理区间。
✅ 第二步:地理区域裁剪
根据地理知识,巴基斯坦主体范围约为 23.5°N–37.0°N,60.5°E–77.5°E(可依实际需求微调):
ds_pak = ds.sel(
latitude=slice(23.5, 37.0),
longitude=slice(60.5, 77.5)
)
该操作保留所有时间步长(2008–2024),仅筛选出目标格点子集,不丢失任何原始数据点,完全满足建模对数据完整性的要求。
✅ 第三步:构建宽格式时间序列 DataFrame(推荐)
为适配机器学习/时序建模(如LSTM、XGBoost),建议将每个 (lat, lon) 格点上的各变量展开为独立列:
# 将空间维度合并为单一索引
stacked = ds_pak.stack(latlon=("latitude", "longitude"))
# 转为DataFrame,自动以 time 为行索引
df = stacked.to_dataframe().reset_index()
# 生成带坐标的列名,例如 'tp_30.25_65.75', 't2m_30.25_65.75'
df["lat_lon"] = df.apply(lambda r: f"{r['latitude']:.2f}_{r['longitude']:.2f}", axis=1)
df_wide = df.pivot_table(
index="time",
columns=["lat_lon", "variable"],
values="value"
).rename(columns=lambda x: f"{x[1]}_{x[0]}") # 如 'tp_30.25_65.75'
# 重置索引,获得标准表格结构
df_result = df_wide.reset_index()
print(f"Shape: {df_result.shape} → {len(df_result)} timesteps × {len(df_result.columns)-1} features")
✅ 输出 df_result 即为标准时间序列表格:每行为一个时间戳(time),每列为某变量在某格点的值(如 tp_30.25_65.75, t2m_33.50_72.25),可直接输入至scikit-learn、PyTorch等框架。
? 替代方案:长格式(适用于分组分析或绘图)
若需按变量+位置分组统计或可视化,可用长格式:
df_long = (
ds_pak
.to_dataframe()
.reset_index()
.assign(lat_lon=lambda d: d.latitude.round(2).astype(str) + "_" + d.longitude.round(2).astype(str))
.melt(id_vars=["time", "lat_lon"],
value_vars=["tp", "sf", "cc", "t2m"], # 替换为你的变量名
var_name="variable", value_name="value")
)
? 关键总结
-
务必先
sortby("latitude")和标准化经度,否则.sel(slice(...))失效; - 使用
stack()+pivot_table()是生成建模就绪宽表的最简洁、内存友好的方式; - 所有操作均为惰性计算(lazy evaluation),大数据集无需加载到内存;
- 若后续需空间插值(如提取站点值),可在裁剪后用
interp();但本方案保留原始格点,避免信息损失。
通过以上流程,你将获得高保真、结构清晰、即用型的巴基斯坦区域多变量时间序列数据集,为降水预测、气候异常检测等任务奠定坚实基础。










