Redis 09 基数

概述

Redis 在 2.8.9 版本添加了 HyperLogLog 结构，用来做基数统计的算法

其优点是，在输入元素的数量或者体积非常非常大时，计算基数所需的空间总是固定的，并且是很小的。

每个 HyperLogLog 键只需要花费 12 KB 内存，就可以计算接近 2 ^ 64 个不同元素的基数。

HyperLogLog 是一种算法，它提供了不精确的去重计数方案。

基数

比如数据集 {1, 3, 5, 7, 5, 7, 8}，那么这个数据集的基数集为 {1, 3, 5 ,7, 8}，基数（不重复元素）为 5。

基数估计就是在误差可接受的范围内，快速计算基数。

示例

比如统计网页的浏览用户数量，一天内同一个用户多次访问只算一次。

传统的解决方案是使用 Set 来保存用户 id，然后统计 Set 中的元素数量。

这种方案只能承载少量用户，一旦用户数量大起来就需要消耗大量的空间。

而且目的是统计用户数量而不是保存用户，这是个吃力不讨好的方案。

使用 HyperLogLog 最多需要 12k 就可以统计大量的用户数。

尽管它大概有 0.81% 的错误率，但对于统计用户数量这种不需要很精确的数据是可以忽略不计的。

赋值

添加元素

pfadd

pfadd key element [element ...]

127.0.0.1:6379> pfadd mykey a b c d e f g h i j
(integer) 1
127.0.0.1:6379> pfadd mykey2 a b b c
(integer) 1

取值

获取基值

pfcount

pfcount key [key ...]

127.0.0.1:6379> pfcount mykey
(integer) 10
127.0.0.1:6379> pfcount mykey2
(integer) 3

mykey2 因为 b 重复，所以基值为 3。

合并

并集合并

pfmerge

pfmerge destkey sourcekey [sourcekey ...]

127.0.0.1:6379> pfmerge mykey3 mykey mykey2
OK
127.0.0.1:6379> pfcount mykey3
(integer) 10

因为 mykey2 的元素与 mykey 中重复，所以取并集后基值依然为 10。

参考

https://www.bilibili.com/video/BV1S54y1R7SB?spm_id_from=333.999.0.0

版本

6.2.6

posted @ 2022-05-24 16:37 天航星阅读(46) 评论(0) 编辑收藏举报

刷新页面返回顶部

登录后才能查看或发表评论，立即登录或者逛逛博客园首页

相关博文：

· Redis 10 位图

· Redis 02 基础命令

· redis Hyperloglog(基数)

· Redis学习（三）：HyperLogLog

· redis学习笔记（10）HyperLogLog类型

阅读排行：
· 震惊！C++程序真的从main开始吗？99%的程序员都答错了
· 别再用vector＜bool＞了！Google高级工程师：这可能是STL最大的设计失误
· 单元测试从入门到精通
· 【硬核科普】Trae如何「偷看」你的代码？零基础破解AI编程运行原理
· 上周热点回顾（3.3-3.9）

天航星

天河有尽后为涯，星海无边前作岸。

Redis 09 基数

概述

示例

赋值

添加元素

取值

获取基值

合并

并集合并

随笔分类 (218)

阅读排行榜

目录导航