以mysql为例详解ToplingDB 的 UintIndex - 教程之家

前言

在 ToplingDB 的 CO-Index(Compressed Ordered Index) 家族中，Nest Succinct Trie 是最通用的。但是，伴随通用的，往往是低效。我们针对一些特殊场景，采用了特殊的实现，用以提高性能……

这里面，最特殊的一类 Index，就是 UintIndex，顾名思义，就是 Key 为 unsigned int 时的 index。

以 MySQL 为例

在 MySQL 中，我们往往会建立这样一个表：

CREATE TABLE Student(
    id INT PRIMARY KEY AUTO_INCREMENT,
    name VARCHAR(255) INDEX,
    dorm_id INT INDEX,
    -- others ...
);

这里的 PRIMARY KEY 最终体现到 MyRocks，是这样的形式：

PrefixID

通过配置，我们可以通过 keyPrefixLen 将 PrefixID 分离出去，这样，Index 中就只剩下一个 id 字段了，并且，在 SST 中，这些 id 往往都是比较紧密的范围（被删除的 id 是范围中的空洞），比如，在某个 SST 中，存储的 id 范围是 1,000,000~2,000,000。

并且，我们知道，CO-Index 会将用户 Key(在这里就是 id 字段) 映射到一个 内部ID，再用这个 内部ID 去访问 PA-Zip……

在一个 SST 中，把这一切串起来，我们就能使用简单且高效的方式来实现 Index 了：

以mysql为例详解ToplingDB 的 UintIndex

图中的 ValueOrd 就是前面说的 内部ID，Index 共有 108 个 Key，BitMap 中有 MaxKey - MinKey + 1 = 229 个 Bit。

如果这个范围中，一个空洞也没有，那么，Index 中我们只需要保存 id 的最大最小值。
- 内部ID = Student.id - MinStudentID
如果这个范围中，只有极少数的空洞，那么，Index 中我们只需要保存那些空洞 中的 id。
- 内部ID = Student.id - (Hole num before this Student.id)
如果这个范围中，有相当数量的空洞，那么，Index 中我们只需要保存一个 BitMap，其中相应 bit 的含义是这个 id 是否存在。
- 利用 Rank-Select 的思想：内部ID = BitMap.rank1(id)

进一步，在概念上，如果我们把一个空洞也没有和只有极少数的空洞也用 Rank-Select 来表达：

以mysql为例详解ToplingDB 的 UintIndex

那么，这三种情况，在形式上就可以统一起来！实际上，在代码实现中，这三种不同的 Rank-Select 实现是作为模板类 UintIndex 的模板参数的，在保持抽象的同时，又不损失性能。

应用到 MongoDB

在 MongoDB 中，也存在类似 MySQL Student.id 这样的东西：

MongoDB 有两大类 Key Value 数据，RecordStore（即 Collection）和 Index：

以mysql为例详解ToplingDB 的 UintIndex

这样，MongoDB 的 RecordStore 也可以利用 UintIndex

压缩率 & 性能

压缩率自然不用说，UintIndexAllOne 的压缩率接近于无穷大，压缩率最差的 UintIndexBitMap，其压缩率也在 30 倍以上！

性能，最关键的是性能，相比传统的块压缩，Nest Succinct Trie 最大的性能劣势在于顺序扫描（从头至尾顺序扫描，定位到某个点然后接着顺序扫描），因为对于 Nest Succinct Trie，即便是顺序扫描，它的计算也很复杂，并且内存访问非常随机。而对于 UintIndex，事情就简单多了，比 Nest Succinct Trie 会快 100 倍以上，而其中占比最大的性能开销，实际上是函数调用本身！

觉得上面的内容有用吗？快来点个赞吧！

点赞() 我要打赏

温馨提示 : 本站内容来自会员投稿以及互联网，所有源码及教程均为作者总结编辑，请大家在使用过程中提前做好备份，以免发生无法预知的错误，源码类教程请勿直接用于生产环境！

可能感兴趣的文章

前言：在上一篇文章中我们详细讲解了MySQL的基本查询相关的操作，内容还是挺多的，不过今天这篇文章我们就会轻松一点，在今天这篇文章中我们主要了解一下MySQL中常见的一些内置函数...

目录一、简单CASE WHEN函数：二、CASE WHEN条件表达式函数三、常用场景场景1：不同状态展示为不同的值场景2：统计不同状态下的值场景3：配合聚合函数做统计场景4：CASE W...

目录 mysql数据库双机热备份 1. 环境准备 2. 主从复制两台机器同时操作主服务器master配置从服务器slave配置测试同步 3. 主主复制服务器 A 配置（1...

PG 内核本身不包含所有扩展的文件，许多发行版将扩展拆分为独立包，仅安装 postgresql-server是不够的，启用插件之前需要在宿主机上*-contrib软件包，但是安装*-contrib软件包的话，...

目录 LazySQL 实战 sql-tap Tabularis rsql 实战 DbPaw 总结 LazySQL官网，开源（GitHub，3.7K Star，163 Fork）跨平台的终端用户界面（TUI）SQL客户端。核心理念是：将数据库...

目录前言一、ASC和DESC的基本概念 1、什么是ASC和DESC？ 2、基本语法 3、查询实战二、实际代码示例 1、建表与插入数据 2、使用ASC升序排序示例1：按分数升序排...

目录一、为什么会有一致性问题二、两种更新策略 1.先删除缓存，再更新数据库 2. 先更新数据库，再删除缓存三、延迟双删：解决先删缓存的问题四、MQ 补偿：解决删除缓存失...

首先，大部分的环境变量配置步骤都是相同的，这里我们来说说MySQL的环境变量第一步：找到安装路径并复制找到你的MySQL Server，我这里安装的是MySQL Server 8.0，安装在d盘，路径是D:\d...

目录聚簇索引：数据和索引长在一起没有聚簇索引会怎样抛出问题：为什么是 B+ 树淘汰赛：其他数据结构为什么不行选手一：有序数组选手二：二叉搜索树 / 红黑树选手三：Hash...

目录前言：一. MySQL 数据类型分类二. 数值类型 2.1 整数类型（BIT/TINYINT/INT/BIGINT） 2.1.1 TINYINT 越界测试与 Unsigned 机制 2.2.2 BIT 类型奇妙的 ASCII 显...

目录

前言

以 MySQL 为例

应用到 MongoDB

压缩率 & 性能

可能感兴趣的文章

热门文章