C++实现海量数据位图排序算法 _ 空间开销优化与算法实现【源码】

夏枫君_7674

夏枫君_7674

2026-05-02

931人浏览

原创

位图排序适合海量整数去重+排序,因其用1 bit表示一个整数是否存在,空间比vector或哈希表低32–64倍,且排序即遍历位图,时间复杂度o(n + m);但要求数据为范围已知、非负、无重复的密集整数。

c++实现海量数据位图排序算法 _ 空间开销优化与算法实现【源码】

位图排序为什么适合海量整数去重+排序?

位图排序本质是用 1 bit 表示一个整数是否存在,空间比 std::vector<int></int> 或哈希表低 32–64 倍。它不适用于任意浮点数或字符串,但对「范围已知、非负、密集分布」的整数(比如 0~10⁷ 内的 ID 列表)效果极佳——排序即遍历位图,时间复杂度 O(N + M),其中 M 是值域上限。

关键前提:你得能接受「内存占用与值域上限线性相关」,而不是与输入数据量线性相关。如果数据范围是 0~2³²−1,直接建 512MB 位图显然不可行;这时必须分段或改用其他结构。

如何用 std::vector<uint64_t></uint64_t> 实现紧凑位图?

别手写位操作循环。C++ 标准库没提供原生位图容器,但用 std::vector<uint64_t></uint64_t> 手动管理位是最常用、最可控的方式:每个 uint64_t 存 64 个标志位,索引计算快,缓存友好。

  • set(i):bits[i / 64] |= (1ULL
  • test(i):(bits[i / 64] & (1ULL
  • 注意 i % 64 必须用 & 63 替代(编译器通常会优化,但显式写更安全)
  • 分配大小按 (max_value + 63) / 64 向上取整,别用 max_value / 64 + 1——当 max_value 是 63 的倍数时会少一单位

遇到 std::bad_alloc 怎么办?分段位图是唯一务实解法

单一块位图超 2GB 就可能在 32 位环境或某些容器中触发 std::bad_alloc,即使物理内存足够。不要强行调大堆限制,应拆成多个固定大小的子位图(例如每段覆盖 10⁶ 个整数):

C++ 算法竞赛自动化测试数据生成与校验框架
C++ 算法竞赛自动化测试数据生成与校验框架

根据原题生成新题面、验证器及完整测试数据,自动套用 testlib 模板,用于用户要求生成测试数据时。

下载
  • 设段长 SEGMENT_SIZE = 1 (约 10⁶),则第 <code>i 个数落在段 i / SEGMENT_SIZE,段内偏移 i % SEGMENT_SIZE
  • 用 std::vector<:vector>></:vector> 管理段,但只在首次写入某段时才分配该段内存(惰性分配)
  • 排序输出时,按段号从小到大遍历,每段内再按位扫描——保证全局有序
  • 这种设计下,峰值内存 ≈ 最大活跃段数 × 每段字节数,而非整个值域

读取文件后直接位图置位,别用 std::set 中转

常见错误:把几千万行数字先读进 std::set<int></int> 去重,再遍历 set 写到位图——这既浪费内存(std::set 节点含指针,至少 16 字节/数),又多一次遍历。

正确做法是边读边置位:

int x;
while (in >> x) {
    if (x >= 0 && x 
<p>注意:<code>MAX_VAL</code> 必须是你预估的最大合法值,且所有输入都需做范围检查。漏掉检查会导致 <code>bitmap.set(x)</code> 访问越界,轻则静默出错,重则段错误。</p>
<p>真正难的不是位图本身,而是值域估计和分段策略——输错一个数量级,内存就差百倍。实际部署前,务必用真实数据跑一遍内存监控,别信理论公式。</p>

C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!

相关专题

更多
c++和c语言的区别有哪些
c++和c语言的区别有哪些

c++和c语言的区别:1、面向对象编程(OOP)支持不同;2、新增特性不同;3、标准库不同;4、编译方式不同;5、命名空间不同等等。想了解更多c++的相关内容,可以阅读本专题下面的文章。

2024.03.14

2108

9

c++和python学习顺序推荐
c++和python学习顺序推荐

一般建议先学习C++,再学习Python,因为这样可以逐步从较为底层的编程语言向更高级的语言过渡。想了解更多python的相关内容,可以阅读本专题下面的文章。

2024.03.14

959

6

python和c++学习性价比分析
python和c++学习性价比分析

Python易于学习,广泛应用于Web开发、数据科学和人工智能等领域,但性能较低。C语言性能高,适用于对性能要求较高的场景,如游戏开发和系统编程,但学习曲线陡峭,错误处理复杂。想了解更多python的相关内容,可以阅读本专题下面的文章。

2024.03.14

387

5

c语言和c++一样吗
c语言和c++一样吗

c语言和c++是两种不同的编程语言,虽然有相似之处,但存在显著差异。c语言专注于过程式编程和系统级开发,以简洁、高效著称。c++作为c语言的超集,引入了面向对象编程,增强了代码组织和管理能力,但学习曲线也更陡峭。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.03.14

307

5

c语言和c++先学哪个好
c语言和c++先学哪个好

初学者选择学习c语言还是c++语言,需要根据个人学习目标、背景以及编程兴趣和预期应用方向来决定。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.03.14

366

5

c语言和c++的区别和联系
c语言和c++的区别和联系

c语言和c++是计算机科学领域应用广泛的编程语言。虽然它们有着相似的基础,但它们在语言类型、语法功能和内存管理方面存在着显著差异。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.03.14

560

5

c++软件中文更改教程
c++软件中文更改教程

对于 ide,可通过打开设置,找到语言设置,选择中文,并保存更改。对于非 ide 应用程序,可查找设置或选项,选择语言设置,更改为中文,并保存更改。想了解更多c++的相关内容,可以阅读本专题下面的文章。

2024.03.21

1389

9

python和java和c++学习性价比分析
python和java和c++学习性价比分析

Python以其易学性、丰富的库和活跃的社区而著称,适合数据科学、人工智能和Web开发。Java以其跨平台性、企业级应用开发和Android应用开发而闻名。C++以其底层控制能力、高效性能和游戏开发而著称。选择哪种语言取决于个人兴趣、职业方向和特定需求。想了解更多python和java和c++的相关内容,可以阅读本专题下面的文章。

2024.03.22

1177

7

c++和c语言学习顺序推荐
c++和c语言学习顺序推荐

对于初学者,建议先学习C语言,掌握编程基础后再转入C++,便于理解面向对象编程概念。有编程经验者可直接学习C++,快速接触高级编程技术。想了解更多c++和c语言的相关内容,可以阅读本专题下面的文章。

2024.03.25

1305

9

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Conan 2 Essentials 免费课程
Conan 2 Essentials 免费课程

共0课时 | 0人学习

CMake 与 Conan 集成实践
CMake 与 Conan 集成实践

共0课时 | 0人学习

Conan 2 高级依赖模型介绍
Conan 2 高级依赖模型介绍

共0课时 | 0人学习