如何在 PySpark 中正确提取每周的首尾日期并避免 JSON 序列化错误

夜瑶同学_7890

夜瑶同学_7890

2026-10-05

672人浏览

原创

如何在 PySpark 中正确提取每周的首尾日期并避免 JSON 序列化错误

本文详解 PySpark 中 DataFrame 无法 JSON 序列化的常见原因,并提供安全、高效地提取分组后最小/最大日期的正确方法,避免误用 .toPandas() 或不当 RDD 转换导致的运行时错误。

本文详解 pyspark 中 `dataframe` 无法 json 序列化 的常见原因,并提供安全、高效地提取分组后最小/最大日期的正确方法,避免误用 `.topandas()` 或不当 rdd 转换导致的运行时错误。

该报错 <class>: Object of type 'DataFrame' is not JSON serializable</class> 并非源于数据本身,而是调用链中某处试图将 PySpark DataFrame(而非纯 Python 对象)直接传入需 JSON 序列化的上下文——例如 Web API 响应、json.dumps()、某些 UI 框架渲染逻辑,或误将未执行计算的 DataFrame 对象当作结果返回。

你最初的尝试:

list_date_week = list(df.select(col('date')).toPandas()['date'])

看似合理,但隐患在于:.toPandas() 会将全量数据拉取到 Driver 内存,当数据量大时极易触发 OOM;更关键的是,若此代码嵌套在某个被自动序列化的函数中(如 Flask 视图、Databricks notebook 的 display() 后续处理),DataFrame 对象可能意外暴露给 JSON 序列化器,从而抛出该错误。

而后续两个 RDD 方案报 AttributeError: 'SparkSession' object has no attribute 'serializer',本质是混淆了 SparkContext 与 SparkSession 的 API 使用场景(如在较新 Spark 版本中 rdd 方法行为变化,或上下文初始化异常),属于低级但典型的初学者陷阱。

Feishu calendar sync, local ics to json data for AI agent
Feishu calendar sync, local ics to json data for AI agent

将ICS日历文件转为JSON格式,用于飞书日历导入导出及数据集成。

下载

✅ 正确解法:完全在分布式引擎内完成聚合,不落地、不序列化 DataFrame 对象
如答案所示,使用原生 PySpark SQL 聚合函数最简洁可靠:

from pyspark.sql.functions import min as spark_min, max as spark_max

result = df.groupBy("yearweek").agg(
    spark_min("date").alias("first_day_of_week"),
    spark_max("date").alias("last_day_of_week")
)
result.show()

输出示例:

+--------+-------------------+------------------+
|yearweek|first_day_of_week  |last_day_of_week  |
+--------+-------------------+------------------+
|2025S05 |2025-01-26         |2025-02-01        |
+--------+-------------------+------------------+

? 进阶提示:

  • 若需进一步转换为 Python 列表(仅当数据量极小且明确需要时),应在聚合后操作:
    # 安全:先 collect() 得到 Row 列表,再提取字段
    rows = result.collect()
    week_ranges = [(row.first_day_of_week, row.last_day_of_week) for row in rows]
    # 或单周示例
    first, last = rows[0]['first_day_of_week'], rows[0]['last_day_of_week']
  • 绝对避免对原始大表 .toPandas() 或 .collect();聚合后再 collect 是可接受的折中方案。
  • 所有时间字段确保为 DateType(可用 df = df.withColumn("date", col("date").cast("date")) 显式转换),否则 min/max 可能按字符串排序产生错误结果。

总结:PySpark 的核心优势在于延迟计算与分布式执行。遇到序列化错误,优先检查是否过早将 DataFrame 暴露给非 Spark 上下文;解决路径永远是——用内置聚合替代本地 Python 计算,用 collect() 获取最终轻量结果,而非中间过程对象。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

js json

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1651

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4084

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1649

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

23657

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2907

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2927

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1143

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2263

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
WEB前端教程【HTML5+CSS3+JS】
WEB前端教程【HTML5+CSS3+JS】

共101课时 | 20.8万人学习

JS进阶与BootStrap学习
JS进阶与BootStrap学习

共39课时 | 4.8万人学习