
本文介绍如何将具有 MultiIndex 列的 DataFrame(如按 widget 和 time step 分层)高效转换为结构化嵌套列表,每个子列表对应一个 widget,内层列表按时间步组织,元素为 (machine_id, duration) 元组。
本文介绍如何将具有 multiindex 列的 dataframe(如按 widget 和 time step 分层)高效转换为结构化嵌套列表,每个子列表对应一个 widget,内层列表按时间步组织,元素为 `(machine_id, duration)` 元组。
在工业调度、生产建模或离散事件仿真中,常需将稀疏的资源-任务-时间矩阵(以 MultiIndex DataFrame 形式存储)转化为便于算法消费的嵌套 Python 结构。典型场景如:多个工件(Widget A/B/C)在不同时间步(t1–t15)被分配至不同机器(m_1–m_12),每个单元格记录加工时长(duration),缺失值表示未分配。目标是将其转为 components 列表——三层嵌套结构:[ [widget_A_tasks], [widget_B_tasks], [widget_C_tasks] ],其中每个 widget_X_tasks 是长度为时间步数的列表,每个位置包含该时间步所有 (machine_id, duration) 元组。
以下函数封装了完整流程,适用于任意规模的同类 MultiIndex DataFrame:
import pandas as pd
import numpy as np
def df_to_components(df: pd.DataFrame) -> list:
"""
将 MultiIndex 列(一级为 widget,二级为 time step)的 DataFrame
转换为嵌套元组列表 components。
Returns:
List[List[List[Tuple[int, float]]]]:
components[i][j] = [(machine_id, duration), ...]
对应第 i 个 widget 的第 j 个 time step 的所有分配。
"""
# 1. 重置行索引(保留原 'resources' 名称),熔化为长格式
melted = (df
.reset_index()
.melt(id_vars=df.index.names[0] or 'resources', # 确保资源列名正确
var_name=['widget', 'timestep'],
value_name='duration')
.dropna(subset='duration')) # 过滤 NaN 值
# 2. 提取 machine_id:从 'resources' 列(如 'm_1')解析数字
melted['machine_id'] = (
melted[df.index.names[0]]
.str.extract(r'm_(\d+)', expand=False)
.astype(int)
)
# 3. 构造 (machine_id, duration) 元组列
melted['assignment'] = list(zip(melted['machine_id'], melted['duration']))
# 4. 按 widget → timestep 分组,聚合为元组列表
by_widget_timestep = (
melted
.groupby(['widget', 'timestep'], sort=False)['assignment']
.apply(list)
)
# 5. 按 widget 再次分组,将各 timestep 列表组合为 widget 级列表
components = (
by_widget_timestep
.groupby('widget', sort=False)
.apply(lambda x: x.tolist())
.tolist()
)
return components
使用示例:
# 构造最小可复现示例(与问题中 Fig 1 结构一致)
data = [[10, np.nan, np.nan, np.nan],
[np.nan, np.nan, 15, np.nan],
[np.nan, np.nan, 23, np.nan],
[np.nan, np.nan, 27, np.nan]]
m_idx = pd.MultiIndex.from_tuples([
('Widget A (idx = 0)', 't1'),
('Widget A (idx = 0)', 't2'),
('Widget A (idx = 0)', 't3'),
('Widget A (idx = 0)', 't4')
])
df = pd.DataFrame(data, columns=m_idx, index=[f'm_{i}' for i in range(1, 5)])
components = df_to_components(df)
print(components)
# 输出示例(简化):
# [
# [[(1, 10.0)], [], [(2, 15.0), (3, 23.0), (4, 27.0)], []],
# ]
关键注意事项:
- ✅ 顺序保持:
sort=False确保 widget 和 timestep 的原始顺序(如 A→B→C、t1→t2→...)不被破坏,这对时序敏感任务至关重要; - ✅ 鲁棒性:自动识别
resources行索引名,支持m_1,machine_12等命名变体(正则r'm_(\d+)'可按需调整); - ⚠️ 数据类型:
duration默认保留原始 dtype(如float64),若需整数可添加.astype(int);空时间步将生成空列表[],符合 Fig 2 的结构约定; - ? 调试建议:若结果异常,可分步检查
meltedDataFrame 是否正确提取了widget、timestep和machine_id,尤其注意 MultiIndex 列名是否含空格或括号(Pandas 通常能自动处理)。
该方案避免了显式循环,全程基于向量化操作,兼顾可读性与性能,可直接集成至调度系统预处理模块。










