Redis特殊数据类型HyperLogLog基数统计算法讲解 - 教程之家

Redis HyperLogLog基数统计

HyperLogLog 是用来做基数统计的算法。

先了解下什么是基数。

比如数据集{1, 3, 5, 7, 5, 7, 8}，那么这个数据集的基数集为{1, 3, 5 ,7, 8}，基数(不重复元素)为5。

如果，现在需要统计一下网页的UV，那么就会涉及到去重了，这种场景就很适合用HyperLogLog。

这不就是set集合嘛？我用set来得出不重复的元素也可以呀。

没错，是可以，但是当数据量非常大的时候，你这个set是不是会占用非常大的内存呢？
如果用HyperLogLog来处理就好了，因为它计算基数所需要的空间是一定的，只要12kb，就可以计算接近 2^64 个不同元素的基数。

但是注意在这个数量级下，是会存在0.81%的错误率的，所以说具体还得看业务是否可以接受这样的错误率。
像上面说的统计UV的场景，这点错误率是可以忽略的。

将所有元素参数添加到 HyperLogLog 数据结构中。

pfadd mypf 1 2 3 a b c 3 4 5 c d a

Redis特殊数据类型HyperLogLog基数统计算法讲解

返回给定 HyperLogLog 的基数估算值。

pfcount mypf

可以看到，返回的是9，也就是不重复的元素数量有9个。

Redis特殊数据类型HyperLogLog基数统计算法讲解

将多个 HyperLogLog 合并为一个 HyperLogLog ，合并后的 HyperLogLog 的基数估算值是通过对所有给定 HyperLogLog 进行并集计算得出的。

pfmerge mypftotal mypf3 mypf4

把mypf3、mypf4合并到mypftotal 上。

Redis特殊数据类型HyperLogLog基数统计算法讲解

以上就是Redis特殊数据类型HyperLogLog基数统计算法讲解的详细内容，更多关于Redis HyperLogLog基数统计的资料请关注其它相关文章！

觉得上面的内容有用吗？快来点个赞吧！

温馨提示 : 本站内容来自会员投稿以及互联网，所有源码及教程均为作者总结编辑，请大家在使用过程中提前做好备份，以免发生无法预知的错误，源码类教程请勿直接用于生产环境！

前言：在上一篇文章中我们详细讲解了MySQL的基本查询相关的操作，内容还是挺多的，不过今天这篇文章我们就会轻松一点，在今天这篇文章中我们主要了解一下MySQL中常见的一些内置函数...

目录一、简单CASE WHEN函数：二、CASE WHEN条件表达式函数三、常用场景场景1：不同状态展示为不同的值场景2：统计不同状态下的值场景3：配合聚合函数做统计场景4：CASE W...

目录 mysql数据库双机热备份 1. 环境准备 2. 主从复制两台机器同时操作主服务器master配置从服务器slave配置测试同步 3. 主主复制服务器 A 配置（1...

PG 内核本身不包含所有扩展的文件，许多发行版将扩展拆分为独立包，仅安装 postgresql-server是不够的，启用插件之前需要在宿主机上*-contrib软件包，但是安装*-contrib软件包的话，...

目录 LazySQL 实战 sql-tap Tabularis rsql 实战 DbPaw 总结 LazySQL官网，开源（GitHub，3.7K Star，163 Fork）跨平台的终端用户界面（TUI）SQL客户端。核心理念是：将数据库...

目录前言一、ASC和DESC的基本概念 1、什么是ASC和DESC？ 2、基本语法 3、查询实战二、实际代码示例 1、建表与插入数据 2、使用ASC升序排序示例1：按分数升序排...

目录一、为什么会有一致性问题二、两种更新策略 1.先删除缓存，再更新数据库 2. 先更新数据库，再删除缓存三、延迟双删：解决先删缓存的问题四、MQ 补偿：解决删除缓存失...

首先，大部分的环境变量配置步骤都是相同的，这里我们来说说MySQL的环境变量第一步：找到安装路径并复制找到你的MySQL Server，我这里安装的是MySQL Server 8.0，安装在d盘，路径是D:\d...

目录聚簇索引：数据和索引长在一起没有聚簇索引会怎样抛出问题：为什么是 B+ 树淘汰赛：其他数据结构为什么不行选手一：有序数组选手二：二叉搜索树 / 红黑树选手三：Hash...

目录前言：一. MySQL 数据类型分类二. 数值类型 2.1 整数类型（BIT/TINYINT/INT/BIGINT） 2.1.1 TINYINT 越界测试与 Unsigned 机制 2.2.2 BIT 类型奇妙的 ASCII 显...