
本文介绍如何基于 Pass_ID 字符串字段对 DataFrame 分组,并精准筛选出所有时间戳均落在指定时段(如 10:00–13:00)内的完整组,兼顾简洁性与逻辑严谨性。
本文介绍如何基于 pass_id 字符串字段对 dataframe 分组,并精准筛选出所有时间戳均落在指定时段(如 10:00–13:00)内的完整组,兼顾简洁性与逻辑严谨性。
在时间序列分析中,常需按业务标识(如 Pass_ID)分组后,进一步判断该组是否“完全属于”某一时段(例如工作日午间),而非仅存在部分记录满足条件。Pandas 提供了 between_time 方法用于时间范围筛选,但其直接作用于 DataFrame 索引,因此需合理结合 set_index、groupby 和 filter 实现目标。
✅ 正确做法:筛选「全组时间均在指定区间内」的 Pass_ID
假设你的 Date_Time 列已是 datetime64[ns] 类型(若非如此,请先转换):
import pandas as pd # 确保 Date_Time 为 datetime 类型(如有必要) df["Date_Time"] = pd.to_datetime(df["Date_Time"])
方案一:获取满足条件的 Pass_ID 列表(推荐)
此方法最简洁高效,适用于只需识别符合条件 ID 的场景:
# 将 Date_Time 设为索引,用 between_time 筛选时段内所有记录,再提取唯一 Pass_ID
pass_ids_in_window = (
df.set_index("Date_Time")
.between_time("10:00", "13:00")["Pass_ID"]
.unique()
)
print(pass_ids_in_window) # 输出: ['B']
⚠️ 注意:该方法返回的是至少有一条记录落在 10:00–13:00 内的 Pass_ID,即“部分匹配”。若需“全组匹配”,请采用方案二。
方案二:严格筛选「组内所有时间均在指定时段内」
这是问题本质诉求——仅保留 Pass_ID 对应的所有 Date_Time 都落在 10:00–13:00 的组:
filtered_groups = df.groupby("Pass_ID").filter(
lambda group: (
group.set_index("Date_Time")
.between_time("10:00", "13:00")
.shape[0] == group.shape[0]
)
)
result_pass_ids = filtered_groups["Pass_ID"].unique()
print(result_pass_ids) # 输出: ['B']
✅ 原理说明:
- groupby("Pass_ID").filter(...) 对每个 Pass_ID 子集应用判断函数;
- group.set_index("Date_Time").between_time(...) 返回该组中处于目标时段的行;
- 比较其长度是否等于原组长度,确保无一行超出时段范围。
? 补充:支持跨日时段(如 22:00–02:00)
between_time 默认不支持跨日(如晚上 10 点到凌晨 2 点)。若需支持,请改用布尔索引:
# 定义时间范围(以 time 对象表示)
start_time = pd.to_datetime("22:00").time()
end_time = pd.to_datetime("02:00").time()
# 提取时间部分并判断(注意跨日逻辑)
def in_crossday_range(series):
times = pd.to_datetime(series).dt.time
return ((times >= start_time) | (times <h3>? 总结建议</h3>
- 若只需「组内存在时段内记录」→ 用 set_index + between_time + unique();
- 若要求「组内所有记录均在时段内」→ 必须用 groupby().filter() 配合长度校验;
- 时间列务必为 datetime64 类型,否则 between_time 会报错;
- between_time 仅作用于 DatetimeIndex,不可直接用于列;
- 跨日时段需手动实现逻辑,避免依赖 between_time。
通过以上方法,你可精准、可扩展地完成基于字符串分组 + 时间窗口约束的筛选任务。











