Java中 BufferedOutputStream 怎么在 Spark 算子落盘写出时降低 HDFS I/O 压力

星杰姑娘_7720

星杰姑娘_7720

2026-07-13

266人浏览

原创

在spark中直接使用bufferedoutputstream对hdfs落盘写入并不能有效降低i/o压力,因为spark通过fsdataoutputstream与hdfs交互,其内部已自带缓冲机制;手动添加bufferedoutputstream反而可能引入额外内存开销、破坏块对齐和校验逻辑,甚至导致数据损坏。

java中 bufferedoutputstream 怎么在 spark 算子落盘写出时降低 hdfs i/o 压力

在 Spark 中直接使用 BufferedOutputStream 对 HDFS 落盘写入**并不能有效降低 I/O 压力**,因为 Spark 的写入路径不走 Java 原生 IO 流,而是通过 Hadoop FileSystem API(如 FSDataOutputStream)与 HDFS 交互,底层已自带缓冲和批量写入机制。手动套一层 BufferedOutputStream 反而可能引入额外内存开销、破坏 Spark 的写入控制逻辑(如块对齐、校验和、append 支持等),甚至导致数据损坏或异常。

Spark 写 HDFS 的真实落盘路径

Spark(尤其是 saveAsTextFile、write.parquet() 等)最终调用的是:

  • Hadoop FileSystem.create() → 返回 FSDataOutputStream
  • FSDataOutputStream 内部已封装了 BufferedOutputStream(默认缓冲区大小通常为 4KB~128KB,可配置)
  • 数据经序列化(如 ParquetWriter、ORCWriter)→ 写入 FSDataOutputStream → 触发底层 DFSClient 分块上传到 DataNode

真正影响 HDFS I/O 压力的关键点

不是加不加 BufferedOutputStream,而是以下几项配置与设计:

Java Maven Secondary Analysis
Java Maven Secondary Analysis

分析ZIP压缩包或GitLab仓库中的Java Maven项目,确定二次开发范围、类数量、模块分布及生产相关指标。

下载
  • 减少小文件数量:避免每个 task 写一个极小文件。用 coalesce() 或 repartition() 控制输出分区数;启用 spark.sql.adaptive.enabled=true(AQE)自动合并小任务
  • 增大写入缓冲与块大小:调大 Hadoop 客户端参数:dfs.client.write.buffer.size(默认 4MB,可设为 8MB–32MB);dfs.blocksize(建议 128MB 或 256MB)
  • 选择高效文件格式:优先用列式格式(Parquet/ ORC),它们自带压缩、字典编码、页级缓冲,比 TextFile + BufferedOutputStream 降低 3–10 倍网络和磁盘压力
  • 关闭冗余校验与同步:生产环境可设 dfs.dfsclient.use.datanode.hostname=false(减少 DNS 解析)、dfs.client.block.write.replace-datanode-on-failure.enable=true(避免写失败重试风暴)

如果必须自定义写出逻辑(如 foreachPartition 写 HDFS)

此时才需考虑流封装,但要严格遵循 Hadoop API 规范:

  • 用 fs.create(path, overwrite) 获取 FSDataOutputStream,不要 new BufferedOutputStream(new FileOutputStream(...))(那会绕过 HDFS 协议)
  • 若需额外缓冲,可 wrap FSDataOutputStream,但缓冲区大小建议 ≤ 1MB,且必须 flush() + close() 保证块提交
  • 务必设置 fs.setDefaultBlockSize() 和 fs.setWriteBufferSize() 在 JobConf 或 SparkSession.hadoopConfiguration 中

推荐替代方案:用 Spark 原生机制压测调优

比手动干预流更可靠:

  • 用 spark-sql 的 INSERT OVERWRITE + spark.sql.files.maxRecordsPerFile 控制单文件行数
  • 开启压缩:spark.sql.parquet.compression.codec snappy(比 gzip 更快,I/O 更少)
  • 监控指标:HadoopRDD.write.time、FileSystemIO.bytesWritten、NameNode 的 TotalWriteOps,定位真实瓶颈

不复杂但容易忽略:HDFS I/O 压力本质是“请求频次 × 单次数据量 × 协议开销”,优化方向永远是合并、压缩、对齐、复用,而不是在已有缓冲链路上再叠一层缓冲。

Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

java stream

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
java
java

Java是一个通用术语,用于表示Java软件及其组件,包括“Java运行时环境 (JRE)”、“Java虚拟机 (JVM)”以及“插件”。php中文网还为大家带了Java相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

2023.06.15

10077

6

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

2023.07.05

7222

9

java自学难吗
java自学难吗

Java自学并不难。Java语言相对于其他一些编程语言而言,有着较为简洁和易读的语法,本专题为大家提供java自学难吗相关的文章,大家可以免费体验。

2023.07.31

6332

8

java配置jdk环境变量
java配置jdk环境变量

Java是一种广泛使用的高级编程语言,用于开发各种类型的应用程序。为了能够在计算机上正确运行和编译Java代码,需要正确配置Java Development Kit(JDK)环境变量。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.08.01

1104

3

java保留两位小数
java保留两位小数

Java是一种广泛应用于编程领域的高级编程语言。在Java中,保留两位小数是指在进行数值计算或输出时,限制小数部分只有两位有效数字,并将多余的位数进行四舍五入或截取。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.08.02

908

3

java基本数据类型
java基本数据类型

java基本数据类型有:1、byte;2、short;3、int;4、long;5、float;6、double;7、char;8、boolean。本专题为大家提供java基本数据类型的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.02

1336

5

java有什么用
java有什么用

java可以开发应用程序、移动应用、Web应用、企业级应用、嵌入式系统等方面。本专题为大家提供java有什么用的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.02

2649

5

java在线网站
java在线网站

Java在线网站是指提供Java编程学习、实践和交流平台的网络服务。近年来,随着Java语言在软件开发领域的广泛应用,越来越多的人对Java编程感兴趣,并希望能够通过在线网站来学习和提高自己的Java编程技能。php中文网给大家带来了相关的视频、教程以及文章,欢迎大家前来学习阅读和下载。

2023.08.03

19971

3

配置java环境变量
配置java环境变量

配置Java环境变量是为了让操作系统能够识别和使用Java的相关命令和功能。本专题为大家提供配置java环境变量相关文章,帮助大家解决问题。

2023.08.03

1175

8

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
dev.java 官方:Learn Java
dev.java 官方:Learn Java

共0课时 | 0人学习

Java JDBC数据库连接官方教程
Java JDBC数据库连接官方教程

共0课时 | 0人学习