怎么解决Redis Set海量数据去重时的内存溢出_改用HyperLogLog统计

陌涛君_5276

陌涛君_5276

2026-06-28

415人浏览

原创

直接换pfadd+pfcount可解决亿级uv内存爆炸问题,因hyperloglog仅需12kb,而set存1亿用户约需2gb;但需权衡语义变更、0.81%误差、不支持smembers及交集等限制。

怎么解决redis set海量数据去重时的内存溢出_改用hyperloglog统计

直接换 PFADD + PFCOUNT 就能解决内存爆炸问题,但不能无脑替换——语义、精度、能力都变了,得按场景调整。

为什么 Set 在亿级 UV 下会内存溢出

Set 存的是原始值:每个用户 ID(比如 "uid:123456789")占 16–25 字节,1 亿用户就是约 1.6GB。Redis 内存不是只存数据,还要维护哈希表结构、扩容冗余、RDB/AOF 开销,实际可能突破 2GB/键。而 HyperLogLog 固定只用 12 KB,不管你是 100 万还是 10 亿个元素。

这不是“省一点”,是差三个数量级。你查 INFO memory 时看到的 used_memory_human 突然不涨了,就是因为这个。

PFADD 插入后 PFCOUNT 始终为 0?先排查这三类问题

现象不是“没生效”,而是根本没成功初始化或被覆盖。常见原因:

Redis Skill - 高性能缓存管理
Redis Skill - 高性能缓存管理

Redis 缓存和数据结构管理技能。通过自然语言操作 Redis,支持 String、Hash、List、Set、ZSet、Stream 等数据结构操作。当用户提到 Redis、缓存、消息队列、会话存储时使用此技能。

下载
  • 客户端传了 null 或空字符串:Jedis 3.x 会静默丢弃,Lettuce 则可能抛异常;用 redis-cli 手动试 PFADD test "a" 看返回是否为 (integer) 1
  • 同名 key 被其他逻辑写成别的类型:比如误执行了 SET visitors:20260528 "init",再 PFADD 就报 WRONGTYPE Operation against a key holding the wrong kind of value
  • 管道(pipeline)里混用 DELPFADD:旧版 Redis 在 pipeline 中若 key 被删,PFADD 可能返回 0 且不报错,建议拆开或加 EXISTS 判断

SADD 迁移到 PFADD 的兼容性断点

这不是语法替换,是统计模型切换。必须确认业务是否接受以下变化:

  • SMEMBERS 不可用:HyperLogLog 不存原始值,无法反查有哪些用户;如果下游要导出“今日活跃用户列表”,不能迁
  • 误差率 0.81%:1 亿 UV 实际值在 99,190,000–100,810,000 之间;判断“是否破千万”得预留误差空间,比如改成 ≥ 9,920,000
  • PFMERGE 只支持并集:想算“连续两天登录用户”(交集),没法直接做;得回退到两个 Set + SINTERCARD,或者用布隆过滤器组合
  • 小数据量反而更费内存:1000 个用户,Set 可能只占几百字节,12 KB 的 HyperLogLog 就显得浪费

什么时候该坚持用 Set,而不是硬套 HyperLogLog

别为了“省内存”牺牲可维护性。以下情况继续用 SADD/SCARD 更稳妥:

  • 日活长期低于 10 万,内存压力根本不明显
  • 需要精确去重后做后续操作,比如发券防重领、黑名单校验——PFADD 不保证内容比对,只看哈希结果
  • 元素本身是长 URL 或 JSON 字符串:哈希计算开销上升,高频写入时 CPU 使用率比短 key 明显高
  • 业务强依赖交集、差集逻辑,又不愿引入额外组件(如布隆过滤器)

真正省空间的前提,是你只要“大概有多少个”,而且这个“大概”业务上真能兜住。否则宁可多花几 MB,别为省内存把逻辑搞复杂。

相关专题

更多
常用的数据库软件
常用的数据库软件

常用的数据库软件有MySQL、Oracle、SQL Server、PostgreSQL、MongoDB、Redis、Cassandra、Hadoop、Spark和Amazon DynamoDB。更多关于数据库软件的内容详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.02

4049

19

内存数据库有哪些
内存数据库有哪些

内存数据库有Redis、Memcached、Apache Ignite、VoltDB、TimesTen、H2 Database、Aerospike、Oracle TimesTen In-Memory Database、SAP HANA和ache Cassandra。更多关于内存数据库相关问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.14

3555

11

mongodb和redis哪个读取速度快
mongodb和redis哪个读取速度快

redis 的读取速度比 mongodb 更快。原因包括:1. redis 使用简单的键值存储,而 mongodb 存储 json 格式的数据,需要解析和反序列化。2. redis 使用哈希表快速查找数据,而 mongodb 使用 b-tree 索引。因此,redis 在需要高性能读取操作的应用程序中是一个更好的选择。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.02

6292

6

redis怎么做缓存服务器
redis怎么做缓存服务器

redis 作为缓存服务器的答案:redis 是一款开源、高性能、分布式的键值存储,可作为缓存服务器使用。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

603

6

redis怎么解决数据一致性
redis怎么解决数据一致性

redis 提供了两种一致性模型,以维护副本数据一致性:强一致性 (sync) 确保写操作仅在复制到所有从节点后才完成;最终一致性 (async) 则在主节点上写操作后认为已完成,牺牲一致性换取性能。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

716

6

mysql和redis怎么保证双写一致性
mysql和redis怎么保证双写一致性

确保 mysql 和 redis 双写一致性的技术包括:1、事务性更新:同时更新 mysql 和 redis,保证一致性;2、主从复制:mysql 主服务器更改同步到 redis 从服务器;3、基于事件的更新:mysql 记录更改并发送到 redis等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

5722

6

redis缓存一般存些什么数据
redis缓存一般存些什么数据

redis缓存中存储的数据类型包括:字符串、哈希、列表、集合、有序集合、位图、地理空间数据和hyperloglog。这些数据类型适用于存储各种数据,从简单信息到复杂对象和地理位置。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

1120

6

redis的8种数据类型有哪些
redis的8种数据类型有哪些

redis 提供 8 种数据类型:字符串(文本、数字、二进制)、哈希(键值对)、列表(有序集合)、集合(无序唯一元素)、有序集合(按分数排序)、地理空间(地理位置)、hyperloglog(估计大数据基数)和位图(位序列存储)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

936

6

redis主要作用有哪些
redis主要作用有哪些

redis 的主要作用包括:1. 缓存数据,提高访问速度;2. 充当消息队列,实现消息传递;3. 存储各种数据类型,如字符串、散列和集合;4. 管理会话信息,确保可靠性和可用性;5. 限制请求速率,防止服务器超载等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

5178

6

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
phpEnv手册
phpEnv手册

共0课时 | 0人学习

进程与SOCKET
进程与SOCKET

共6课时 | 0.5万人学习