Redis Set集合求差集性能优化_使用SDIFFSTORE减少网络传输

冬浩小哥_6425

冬浩小哥_6425

2026-05-02

337人浏览

原创

sdiffstore 比 sdiff 快在省去网络传输与客户端序列化开销,直接在服务端完成差集计算并写入目标 key,仅返回整数结果;其性能优势源于避免将大量数据(如 5–10 万 id)传回客户端再丢弃。

redis set集合求差集性能优化_使用sdiffstore减少网络传输

SDIFFSTORE 比 SDIFF 快在哪?

直接结论:用 SDIFFSTORE 替代 SDIFF 做集合差集,能显著降低客户端带宽压力和序列化开销,尤其当差集结果很大时——不是 Redis 服务端变快了,而是你省掉了把几万条数据从服务端拉到客户端再丢弃的那一步。

典型场景是定时任务里计算「今天新增但昨天没出现过的用户 ID」,结果可能有 5–10 万条。用 SDIFF 会把全部 ID 返回给客户端,而多数情况下你只是想存进另一个 key 做后续处理或缓存。

  • SDIFF key1 key2 key3:返回所有差集成员,走网络 + 客户端解析 + 可能被 GC
  • SDIFFSTORE destkey key1 key2 key3:差集直接在服务端算完写入 destkey,只返回一个整数(写入数量)
  • Redis 服务端内部执行逻辑几乎一样,差别全在响应阶段

SDIFFSTORE 的 key 顺序不能错

差集是「第一个 key 减去后面所有 key 的并集」,顺序反了结果就完全不对——这不是 bug,是定义如此。比如 SDIFFSTORE res A B C 算的是 A − (B ∪ C);如果写成 SDIFFSTORE res B A C,那就是 B − (A ∪ C),语义彻底变了。

Redis Skill - 高性能缓存管理
Redis Skill - 高性能缓存管理

Redis 缓存和数据结构管理技能。通过自然语言操作 Redis,支持 String、Hash、List、Set、ZSet、Stream 等数据结构操作。当用户提到 Redis、缓存、消息队列、会话存储时使用此技能。

下载
  • 常见错误:把「基准集合」当成最后一个参数,比如误写 SDIFFSTORE res B C A,以为是「A 相对于 B 和 C 的差集」
  • 调试技巧:先用 SDIFF A B C 在 redis-cli 里跑一遍,确认结果符合预期,再换 SDIFFSTORE
  • 如果基准集合是动态拼接的,务必在代码里加注释强调顺序,比如 // SDIFFSTORE res base_set exclude_set1 exclude_set2

目标 key 被覆盖前不加保护

SDIFFSTORE 会直接覆写 destkey,没有原子性检查、没有 exists 判断、也不支持 XX 或 NX 修饰符。如果那个 key 正在被其他逻辑读取(比如另一个服务正用 SRANDMEMBER 抽样),就会读到中间态或空数据。

  • 风险点:定时任务凌晨跑 SDIFFSTORE hot_users today_set yesterday_set,而实时接口每秒都在 SMEMBERS hot_users —— 极短时间里可能返回空结果
  • 稳妥做法:用临时 key + RENAME,例如 SDIFFSTORE hot_users_tmp today_set yesterday_set,再 RENAME hot_users_tmp hot_users(RENAME 是原子的)
  • 注意:RENAME 在集群模式下不支持跨 slot,如果 hot_users 和 hot_users_tmp 不在一个 slot,得改用 RENAMENX 配合重试,或者干脆用带 hash tag 的 key 名,比如 hot_users:{tag} 和 hot_users_tmp:{tag}

大数据量下内存和超时要一起看

SDIFFSTORE 是阻塞命令,服务端得一次性加载所有参与运算的 set 到内存里做哈希比对。如果某个 key 有上百万成员,不仅耗时长,还可能触发 client timeout 或 Redis 的 timeout 配置中断连接。

  • 现象:客户端报错 Connection closed by server 或 READONLY You can't write against a read only replica(其实是主节点卡住,从节点切主失败)
  • 查证方法:用 MEMORY USAGE keyname 看各输入 key 占多少内存,总和超过 500MB 就得警惕
  • 折中方案:拆成多轮小差集,比如先把 today_set 和 yesterday_set 差出一批,用 SSCAN 分批处理;或者改用 SET + PFADD 做概率去重,不强求精确差集

差集逻辑越靠近 Redis 服务端,越容易忽略它的内存压力和原子性边界——不是命令不够快,是你没看见它背后加载的那些 key 全都进了内存。

相关专题

更多
常用的数据库软件
常用的数据库软件

常用的数据库软件有MySQL、Oracle、SQL Server、PostgreSQL、MongoDB、Redis、Cassandra、Hadoop、Spark和Amazon DynamoDB。更多关于数据库软件的内容详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.02

4229

19

内存数据库有哪些
内存数据库有哪些

内存数据库有Redis、Memcached、Apache Ignite、VoltDB、TimesTen、H2 Database、Aerospike、Oracle TimesTen In-Memory Database、SAP HANA和ache Cassandra。更多关于内存数据库相关问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.14

3715

11

mongodb和redis哪个读取速度快
mongodb和redis哪个读取速度快

redis 的读取速度比 mongodb 更快。原因包括:1. redis 使用简单的键值存储,而 mongodb 存储 json 格式的数据,需要解析和反序列化。2. redis 使用哈希表快速查找数据,而 mongodb 使用 b-tree 索引。因此,redis 在需要高性能读取操作的应用程序中是一个更好的选择。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.02

6692

6

redis怎么做缓存服务器
redis怎么做缓存服务器

redis 作为缓存服务器的答案:redis 是一款开源、高性能、分布式的键值存储,可作为缓存服务器使用。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

623

6

redis怎么解决数据一致性
redis怎么解决数据一致性

redis 提供了两种一致性模型,以维护副本数据一致性:强一致性 (sync) 确保写操作仅在复制到所有从节点后才完成;最终一致性 (async) 则在主节点上写操作后认为已完成,牺牲一致性换取性能。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

736

6

mysql和redis怎么保证双写一致性
mysql和redis怎么保证双写一致性

确保 mysql 和 redis 双写一致性的技术包括:1、事务性更新:同时更新 mysql 和 redis,保证一致性;2、主从复制:mysql 主服务器更改同步到 redis 从服务器;3、基于事件的更新:mysql 记录更改并发送到 redis等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

6222

6

redis缓存一般存些什么数据
redis缓存一般存些什么数据

redis缓存中存储的数据类型包括:字符串、哈希、列表、集合、有序集合、位图、地理空间数据和hyperloglog。这些数据类型适用于存储各种数据,从简单信息到复杂对象和地理位置。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

1140

6

redis的8种数据类型有哪些
redis的8种数据类型有哪些

redis 提供 8 种数据类型:字符串(文本、数字、二进制)、哈希(键值对)、列表(有序集合)、集合(无序唯一元素)、有序集合(按分数排序)、地理空间(地理位置)、hyperloglog(估计大数据基数)和位图(位序列存储)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

996

6

redis主要作用有哪些
redis主要作用有哪些

redis 的主要作用包括:1. 缓存数据,提高访问速度;2. 充当消息队列,实现消息传递;3. 存储各种数据类型,如字符串、散列和集合;4. 管理会话信息,确保可靠性和可用性;5. 限制请求速率,防止服务器超载等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.04.07

5578

6

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
phpEnv手册
phpEnv手册

共0课时 | 0人学习

进程与SOCKET
进程与SOCKET

共6课时 | 0.5万人学习