c++ arrow数据格式 c++如何使用apache arrow进行列式数据处理

酷宇大大_7566

酷宇大大_7566

2026-03-20

233人浏览

原创

arrow c++ 库需源码构建并显式启用关键组件(如-darrow_parquet=on)、使用cmake 3.15+、内置thrift、合并chunks、对齐内存分配、正确处理parquet逻辑类型、统一内存池及谨慎管理shared_ptr生命周期。

c++ arrow数据格式 c++如何使用apache arrow进行列式数据处理

Arrow C++ 库怎么装才不踩 cmake 版本和依赖的坑

Arrow C++ 不是 apt install 一下就能用的,官方推荐从源码构建,但默认 cmake 配置会默默跳过很多关键组件(比如 IPC、JSON、Parquet),导致后续 arrow::ipc::RecordBatchFileReader 直接链接失败或运行时崩溃。

  • 必须显式开启 -DARROW_PARQUET=ON、-DARROW_IPC=ON、-DARROW_JSON=ON,否则看似编译成功,但一用序列化就报 undefined reference to arrow::ipc::ReadRecordBatch
  • cmake 3.15+ 是硬门槛,Ubuntu 20.04 自带的 3.16 可以,但 CentOS 7 默认的 2.8 会静默忽略新选项,最终生成一个“功能残缺”的库
  • 别用系统级 libthrift:Arrow 内置了 thrift 子模块,若系统已装旧版 thrift(如 0.9.3),cmake 可能误连,引发 std::bad_cast 在 arrow::ipc::ReadRecordBatch 中炸开;建议加 -DARROW_THRIFT_SOURCE=internal

如何正确创建并写入一个 Arrow Table 到内存缓冲区

很多人以为 arrow::Table::FromRecordBatches 返回的对象可以直接序列化,其实它只是逻辑容器,底层数据没做内存对齐和字节序处理,直接传给 arrow::ipc::SerializeRecordBatch 会出错。

  • 必须先用 arrow::Table::CombineChunks 合并碎片化 chunk,否则 IPC writer 可能写入无效 offset
  • 写入前务必调用 arrow::ipc::GetRecordBatchSize 预估缓冲区大小,再用 arrow::AllocateBuffer 分配对齐内存(Arrow 要求 64 字节对齐)
  • 实际写入要用 arrow::ipc::IpcWriteOptions::Defaults(),别用空构造——默认选项里 use_threads=false 和 max_recursion_depth=64 是保底安全值,改高了在嵌套 schema 下容易栈溢出

示例关键片段:

C++ Code Review Master
C++ Code Review Master

组合式C++代码评审方案,融合静态分析、AI推理、多轮迭代评审和C++专项检查,适用于PR审查、增量代码审查、全项目评审和代码质量评分,触发词包括review cpp、cpp代码评审、C++review、代码审查。

下载
auto options = arrow::ipc::IpcWriteOptions::Defaults();
int64_t size = 0;
arrow::ipc::GetRecordBatchSize(*batch, &size);
std::shared_ptr<:buffer> buffer;
arrow::AllocateBuffer(size, &buffer);
arrow::io::BufferOutputStream stream(buffer);
arrow::ipc::SerializeRecordBatch(*batch, options, &stream);</:buffer>

读取 Parquet 文件时 schema 不匹配的典型表现和修复方式

用 arrow::dataset::ScanOptions 读 Parquet,常遇到字段名存在但 arrow::Array::length() 返回 0,或者 arrow::Cast 失败报 NotImplemented: No cast implemented from int64 to timestamp[ms] —— 这不是数据坏了,而是 Parquet 的 logical type 和 Arrow 的物理 type 映射没对上。

  • Parquet 里 timestamp_ms 逻辑类型,在 Arrow 中对应 arrow::timestamp(arrow::TimeUnit::MILLI),不是 arrow::int64();必须用 arrow::dataset::ParquetFragment::Read 时传入显式 arrow::dataset::ParquetFileFormat::default_read_options(),否则 logical type 被忽略
  • 如果原始 Parquet 是用 Python pandas 写的,它默认把 string 写成 UTF8 logical type,但 Arrow C++ 读出来可能是 arrow::binary();此时需在 arrow::dataset::ScanOptions::use_threads = false 下手动 arrow::compute::Cast 到 arrow::utf8()
  • 字段缺失时,arrow::dataset::ScanOptions::use_threads=true 可能导致部分 batch 丢列;关掉线程最稳

为什么 shared_ptr<:table> 传参后突然 segfault

Arrow 对象重度依赖引用计数,但它的 shared_ptr 不是“普通”智能指针:底层 arrow::MemoryPool 默认绑定到当前线程,跨线程传递 shared_ptr<:table></:table> 后,若在另一线程调用 table->ToStructArray(),可能触发 pool 释放时访问已销毁的 TLS 变量。

  • 所有 Arrow 对象跨线程使用前,必须统一指定非默认 pool:arrow::default_memory_pool() 或自定义全局池,不能依赖线程局部池
  • 避免在 lambda 捕获中隐式拷贝 shared_ptr<:schema></:schema> 后又调用 schema->field(i)->type() —— 如果该 field 类型是 arrow::dictionary(),而 dictionary array 尚未加载,会触发延迟初始化,此时若原始 shared_ptr<:table></:table> 已析构,就崩
  • 调试时加 ARROW_LOG_LEVEL=3 环境变量,能看到 pool 分配/释放轨迹,比 gdb 单步更快定位悬挂引用

最易被忽略的一点:Arrow 的 arrow::Table::Slice 返回的是视图,不增加底层 array 引用计数;如果只保存 slice 而丢弃原 table,array 内存可能提前释放——得用 arrow::Table::CombineChunks 或显式 arrow::Array::Slice 才安全。

C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!

相关文章

c++速学教程(入门到精通)
c++速学教程(入门到精通)

c++怎么学习?c++怎么入门?c++在哪学?c++怎么学才快?不用担心,这里为大家提供了c++速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

c++

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
json数据格式
json数据格式

JSON是一种轻量级的数据交换格式。本专题为大家带来json数据格式相关文章,帮助大家解决问题。

2023.08.07

2035

5

json是什么
json是什么

JSON是一种轻量级的数据交换格式,具有简洁、易读、跨平台和语言的特点,JSON数据是通过键值对的方式进行组织,其中键是字符串,值可以是字符串、数值、布尔值、数组、对象或者null,在Web开发、数据交换和配置文件等方面得到广泛应用。本专题为大家提供json相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.23

2982

1

jquery怎么操作json
jquery怎么操作json

操作的方法有:1、“$.parseJSON(jsonString)”2、“$.getJSON(url, data, success)”;3、“$.each(obj, callback)”;4、“$.ajax()”。更多jquery怎么操作json的详细内容,可以访问本专题下面的文章。

2023.10.13

1016

3

go语言处理json数据方法
go语言处理json数据方法

本专题整合了go语言中处理json数据方法,阅读专题下面的文章了解更多详细内容。

2025.09.10

3379

7

Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

320

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

232

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

451

25

string转int
string转int

在编程中,我们经常会遇到需要将字符串(str)转换为整数(int)的情况。这可能是因为我们需要对字符串进行数值计算,或者需要将用户输入的字符串转换为整数进行处理。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.02

5819

3

lambda表达式
lambda表达式

Lambda表达式是一种匿名函数的简洁表示方式,它可以在需要函数作为参数的地方使用,并提供了一种更简洁、更灵活的编码方式,其语法为“lambda 参数列表: 表达式”,参数列表是函数的参数,可以包含一个或多个参数,用逗号分隔,表达式是函数的执行体,用于定义函数的具体操作。本专题为大家提供lambda表达式相关的文章、下载、课程内容,供大家免费下载体验。

2023.09.15

931

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Conan 2 Essentials 免费课程
Conan 2 Essentials 免费课程

共0课时 | 0人学习

CMake 与 Conan 集成实践
CMake 与 Conan 集成实践

共0课时 | 0人学习

Conan 2 高级依赖模型介绍
Conan 2 高级依赖模型介绍

共0课时 | 0人学习