
本文介绍如何使用 pandas 高效完成日期区间价格匹配,通过布尔索引快速定位目标价格,兼顾代码简洁性与执行效率,适用于能源消费分析等场景。
本文介绍如何使用 pandas 高效完成日期区间价格匹配,通过布尔索引快速定位目标价格,兼顾代码简洁性与执行效率,适用于能源消费分析等场景。
在能源数据分析中,电价常按连续日期区间分段定价(如季度调价),而实际用电数据则按日记录。为准确计算每日电费,需将每条用电记录匹配到对应的价格区间。手动遍历比对每个日期显然低效且易出错;而借助 pandas 的向量化操作,可实现清晰、健壮且高效的区间查找。
核心思路:布尔索引 + 时间范围过滤
假设价格数据存储在文本文件 prices.txt 中(含表头与分隔线),我们首先用 pd.read_fwf() 按固定列宽解析,并自动转换日期列:
import pandas as pd
import datetime
df = pd.read_fwf(
'prices.txt',
widths=[15, 15, 10],
names=['start_date', 'end_date', 'unit_cost'],
skiprows=2,
parse_dates=['start_date', 'end_date']
)
关键在于:对任意查询日期 test_date,只需一行布尔表达式即可定位所属区间:
test_date = datetime.date(2023, 3, 1) # 或 datetime.datetime matching_row = df[(df['start_date'] = test_date)] price = matching_row['unit_cost'].iloc[0] if not matching_row.empty else None
✅ 优势说明:
- 简洁性:无需自定义函数或循环,逻辑一目了然;
- 安全性:利用 pandas 内置的日期比较(自动处理时区、精度),避免手动字符串解析风险;
- 可扩展性:支持批量查询——将 test_date 替换为 pd.Series(如每日用电日期列),直接广播运算,一次性匹配全部记录;
- 鲁棒性:若区间严格连续无重叠,也可仅保留 start_date 并用 pd.cut() 或 pd.merge_asof() 进一步优化(见进阶提示)。
进阶建议:提升大规模匹配性能
当用电数据量达数万行以上时,推荐改用 pd.merge_asof()(要求价格表按 start_date 排序,且仅依赖左边界):
# 构建仅含起始日期的价格参考表(升序)
price_ref = df[['start_date', 'unit_cost']].sort_values('start_date')
# 假设 daily_usage 是含 'date' 列的 DataFrame
daily_usage = pd.DataFrame({
'date': pd.date_range('2023-01-01', '2024-01-31', freq='D'),
'kwh': [1.2, 1.5, ...] # 示例用电量
})
# 向前填充:每个日期匹配其最近的、不晚于该日期的起始价
result = pd.merge_asof(
daily_usage.sort_values('date'),
price_ref,
left_on='date',
right_on='start_date',
direction='backward'
)
result['cost_total'] = result['kwh'] * result['unit_cost']
⚠️ 注意事项:
- 确保 start_date 和 end_date 已正确解析为 datetime64 类型(parse_dates 参数必不可少);
- 若原始数据存在空缺或重叠区间,务必先校验:df['start_date'].diff().dt.days > 0 或使用 df['end_date'].shift(1) == df['start_date'] - pd.Timedelta(days=1) 验证连续性;
- 对于实时高频查询场景,可将价格区间预构建为 IntervalIndex 并用 .get_indexer() 实现 O(log n) 查找。
综上,pandas 不仅提供了直观的布尔索引方案,还通过 merge_asof 和 IntervalIndex 等工具,为不同规模与精度需求提供了专业级解决方案——真正实现“短、清、快”的 Pythonic 实践。











