
本文介绍如何将多赛季横向堆叠的英超积分榜数据(每赛季占一行)重塑为标准纵向表格,通过 itertools 与 pandas 链式操作解析嵌套列表、拆分字段并统一列名,最终生成含位置、球队、赛绩、积分及近期战绩的规范 DataFrame。
本文介绍如何将多赛季横向堆叠的英超积分榜数据(每赛季占一行)重塑为标准纵向表格,通过 `itertools` 与 `pandas` 链式操作解析嵌套列表、拆分字段并统一列名,最终生成含位置、球队、赛绩、积分及近期战绩的规范 dataframe。
在使用 Selenium 爬取多个赛季的英超积分榜时,常见结果是将每个赛季的所有球队信息(20支 × 每队8字段)压缩为单行,导致 DataFrame 呈现为“宽而扁”的结构(如 3 行 × 160 列),难以直接分析。解决这一问题的关键不在于简单转置,而是按逻辑单元重切分原始嵌套列表,再逐字段解析。
核心思路:扁平化 → 分块 → 解析 → 组合
原始 table_data 是一个包含 3 个子列表的列表,每个子列表含 20 支球队的数据,每队对应 8 个字段(排名、队名、统计字符串、5 场近期战绩)。因此总长度为 3 × 20 × 8 = 480 个元素。我们需将其扁平化后按每 8 个元素一组重新分块,得到 60 行(3赛季 × 20队)的标准二维结构。
以下是完整、可复用的处理流程:
基于“创意扇形排列卡片画廊”制作的前端特效源码,包含扇形卡片、旋转展开、层级聚焦、键盘切换,打开 index.html 即可直接查看效果,可替换标题、颜色和图形元素复用。 下载包已经整理好特效舞台、样式变量、动画规则和必要脚本,适合用于学习当前效果的实现方式,也方便替换文字、颜色、图形或图片后直接复用。
import pandas as pd
from itertools import chain, batched # Python ≥3.12
# 假设 table_data 已加载
df = (
pd.DataFrame(batched(chain.from_iterable(table_data), 8))
.pipe(lambda raw: pd.concat([
raw.iloc[:, :2], # 第0列(排名)、第1列(队名)
raw[2].str.split(expand=True).astype(int), # 第2列:拆分 "33 23 5 5 77 26 51 74" → 8列整数
raw.iloc[:, 3:].agg(" ".join, axis=1), # 第3–7列:合并为单字段 "W W D L W"
], axis=1))
.set_axis([
"Position", "Club", "Played", "Won", "Draw", "Lost",
"GF", "GA", "GD", "Points", "Form"
], axis=1)
)
✅ 关键步骤说明:
- chain.from_iterable(table_data) 将三层嵌套(赛季→球队→字段)彻底展平为一维序列;
- batched(..., 8) 按每组 8 个元素切分,精准还原“每队一条记录”;
- raw[2].str.split(expand=True) 对统计字符串(如 '33 23 5 5 77 26 51 74')进行空格分割,并转为整型,自动对应 Played, Won, Draw, Lost, GF, GA, GD, Points;
- raw.iloc[:, 3:].agg(" ".join, axis=1) 将后续 5 列(各场胜负标记)合并为统一 Form 字段,便于后续分析(如统计连胜/连败)。
⚠️ 注意事项:
- 若使用 Python
- 建议在最终 DataFrame 中添加赛季标识列(如 Season = ['2021/22', '2022/23', '2023/24'] * 20),避免跨赛季数据混淆;
- 若原始数据存在缺失或格式异常(如某队 Form 不足5项),应在 .str.split() 后添加 fillna('') 或校验逻辑,防止 astype(int) 报错。
执行后,你将获得一个结构清晰、符合常规分析习惯的 60 行 × 11 列 DataFrame,可直接用于排序、筛选、可视化或时间序列对比——真正实现从“爬虫输出”到“分析就绪”的跃迁。










