存储引擎的角色和整体架构

原创 IT阅读排行榜 2024-06-06 14:15

对于数据库行业或者后端行业的从业者而言,存储引擎这个词经常会提及。但对于大部分数据库爱好者,以及部分资历尚欠的从业者而言,对存储引擎可能并不是很熟悉。那到底什么是存储引擎呢?它在数据库中扮演着什么样的角色呢?它的整体架构是怎么样的呢?本文给读者逐个回答上述问题。

  • 作者:文小飞

01 什么是存储引擎

存储引擎是数据库系统中一个非常重要的组件,它主要负责数据的存储和检索。对于数据库系统而言,通常会将存储引擎设计为可插拔的组件。数据库系统只需要定义统一的数据读写接口,具体接口的实现可以根据不同的场景选择不同的设计结构来实现。因此对于存储引擎而言,既可以作为单独的组件独立使用,也可以内嵌在数据库系统中。

存储引擎的主要目标是提供高效的数据访问能力,以满足应用程序对数据的读取和写入需求。它不仅需要具备快速的查询和检索能力,同时需要保证数据的一致性、可靠性和安全性。存储引擎的设计和实现需要考虑多种因素,如数据结构、索引算法、并发控制、缓存管理等,以提供高性能和高可用性的数据存储服务。

02 存储引擎的角色

下图以MySQL Server的架构为例,来展现存储引擎在数据库系统中所处的扮演的角色。从下图中可以看到,存储引擎被设计成一个插件式的组件,可以根据不同的业务场景来选择不同类型的存储引擎。

03 存储引擎的整体架构

存储引擎的整体架构可以根据具体的实现和应用场景而有所不同,但通常包含以下几个关键组件:“存储管理组件”、“索引管理组件”、“并发控制组件”、“事务管理组件”、“缓存管理组件”、“查询优化和执行组件”。

1. 存储管理组件

存储引擎负责将数据持久地存储在物理介质中,如硬盘、固态硬盘(SSD)或内存等。它需要处理数据的组织和存储方式,包括数据结构、文件格式、分区方式等。

因此存储引擎中,通常会涉及一个存储管理组件,负责数据的物理存储和管理。存储管理组件负责定义和维护数据库中的数据结构。它决定了数据在物理介质上的组织方式,可以选择合适的数据结构,如表、索引、视图等,以满足不同类型的数据存储需求。通过数据结构的定义,存储管理组件能够有效地表示和操作数据,提供高效的数据访问和操作接口。

此外存储管理组件还负责数据文件的管理。它管理数据在物理介质上的存储文件,包括创建、打开、关闭和删除文件等操作。数据文件是存储引擎中的基本单位,存储管理组件通过对数据文件的管理,实现了数据的持久化存储和可靠性保证。它还处理文件的读取和写入操作,以及文件的扩展和收缩等管理任务。

2. 索引管理组件

它承担着创建、维护和使用索引的重要任务,以加速数据的读取和查询操作。通过索引的优化,存储引擎能够快速定位和检索满足查询条件的数据,从而提高数据库系统的整体性能。

一方面,索引管理组件负责索引的创建。在数据库表中选择一个或多个列作为索引键,根据这些键的值构建索引结构。常见的索引结构包括B树、B+树、哈希表和位图等。索引管理组件根据数据的选择性和分布情况,选择合适的索引结构和算法来创建索引。索引的创建过程可以在数据插入或更新时触发,以保持索引的实时性。

另一方面,索引管理组件负责索引的维护。随着数据的插入、更新和删除,索引需要动态地进行更新和调整,以保持索引的有效性和一致性。索引管理组件监视数据的变化,并相应地更新索引结构。它处理索引的分裂、合并、重建和优化等操作,以提高索引的性能和存储效率。索引维护还包括处理索引的冗余和重复问题,确保索引的准确性和完整性。

最后,索引管理组件负责索引的使用和优化。在执行查询操作时,存储引擎通过索引管理组件确定最佳的索引访问路径。索引管理组件分析查询语句,选择合适的索引,并生成高效的查询计划。它考虑查询的复杂性、数据分布和查询负载等因素,以选择最佳的索引策略和算法。通过索引的使用,存储引擎可以快速定位并检索满足查询条件的数据,提高查询性能。在查询过程中,它收集和维护索引的统计数据,如列的基数、数据分布和索引的选择性等。这些统计信息可以帮助存储引擎优化查询计划,选择最佳的索引和执行路径,从而提高查询性能。索引管理组件还可以根据查询需求,动态调整索引的结构和配置,以满足不同查询场景的需求。

3. 并发控制组件

在多用户环境下,存储引擎需要处理并发访问数据时的冲突和一致性问题。为了实现这些功能,存储引擎通常会设计一个并发控制组件,它负责协调多个用户之间对数据的并发访问,以确保数据的一致性和隔离性。

并发控制组件使用一系列技术和机制来实现并发控制。其中最常见的是锁机制,它使用锁来限制对共享数据的访问。并发控制组件会在事务对数据进行读取或写入操作时,根据事务的隔离级别和操作类型,分配合适的锁。这样可以确保同一时间只有一个事务能够修改数据,从而避免数据冲突和脏读等问题。锁机制可以细粒度地控制对数据的访问,并根据需要支持共享锁和排他锁等不同类型的锁。

另一种常见的并发控制技术是多版本并发控制(MVCC)。MVCC通过为每个事务创建一个独立的数据版本来实现并发控制。每个事务在读取数据时,可以访问到符合事务启动时间的数据版本,而不会受到其他事务的修改影响。这种方式下,事务之间的并发性得到提高,同时也保证了数据的一致性和隔离性。

并发控制组件还负责处理死锁的检测和解决。死锁是指多个事务因互相等待对方所持有的资源而无法继续执行的情况。并发控制组件会监测事务之间的等待关系,并在检测到死锁时,选择适当的策略来解除死锁,如终止某些事务或回滚操作。

此外,并发控制组件还需要考虑性能优化和资源利用的问题。它可以通过调整锁粒度、优化锁的获取和释放策略,以及使用并发度控制等手段来提高系统的并发性能。并发控制组件还可以与查询优化器和缓存管理器等其他组件进行协同工作,以进一步提升系统的性能和扩展能力。

4. 事务管理组件

事务管理组件是存储引擎中的关键组成部分,它负责处理事务的提交和回滚,以实现事务的原子性、一致性、隔离性和持久性。

首先,事务管理组件确保事务的原子性。原子性指事务中的操作要么全部执行成功,要么全部回滚到事务开始前的状态,不存在部分执行的情况。事务管理组件通过记录事务的操作日志或使用写前日志(write-ahead logging)等机制,将事务的执行过程持久化到磁盘上。这样,在系统崩溃或故障发生时,可以根据日志来恢复到事务开始前的状态,保证事务的原子性。

其次,事务管理组件确保事务的一致性。一致性指事务在执行过程中,数据库从一个一致的状态转变为另一个一致的状态。事务管理组件使用并发控制技术(如锁机制或MVCC)来协调多个事务之间对数据的访问,以避免数据的不一致性和冲突。它确保事务在执行过程中对数据的读取和修改操作是按照规定的顺序执行,避免数据的丢失、重复或不一致情况的发生。

另外,事务管理组件实现事务的隔离性。隔离性指多个并发执行的事务之间应该相互隔离,彼此感知不到对方的存在,以避免干扰和冲突。事务管理组件通过并发控制技术来限制事务之间对数据的可见性和影响范围,以实现不同隔离级别(如读未提交、读已提交、可重复读和串行化)的要求。这样可以确保事务在并发执行时不会相互干扰或产生不一致的结果。

最后,事务管理组件还负责事务的持久性。持久性指一旦事务提交,其对数据库的修改应该永久保存,即使系统发生故障或崩溃也不会丢失。事务管理组件通过将事务的提交操作持久化到磁盘上,以确保事务的修改操作能够在系统恢复后得到恢复和应用。它还可以使用缓冲区管理、日志刷写等技术来提高持久性的效率和性能。

5. 缓存管理组件

为了提高数据的访问速度,存储引擎通常会使用缓存来存储最常用的数据和索引块。为了实现上述功能,往往会设计一个缓存管理组件,缓存管理组件负责管理数据和索引的缓存,以提高数据的访问速度。它可以使用缓冲池或页缓存来存储最常用的数据块。缓存管理组件需要实现缓存的分配、回收和替换策略,以及缓存和存储之间的数据同步。以最大限度地利用有限的内存资源,提高数据的访问效率。

6. 查询优化和执行组件

查询优化和执行组件负责解析和优化查询语句,并生成高效的查询计划。它可以通过统计信息和查询代价模型来选择最佳的索引和执行策略。查询优化和执行组件需要考虑查询的复杂性、数据分布和查询负载等因素,以提供高性能的查询处理。

综上所述,存储引擎在数据存储和检索中扮演着关键的角色。它负责数据的存储和管理、索引的创建和使用、并发控制和事务处理、缓存管理,以及查询优化和执行等功能。存储引擎的整体架构需要考虑数据的物理存储、索引结构、并发控制和缓存管理等方面的设计和实现。通过合理的存储引擎设计,可以提供高性能、高可用性和高可靠性的数据存储服务,满足不同应用场景的需求。

关于作者:文小飞 (网名:jaydenwen/jaydenwen123),大厂资深研发工程师、公司级讲师。曾就职于腾讯等互联网公司,从事基础架构、后端开发、推荐系统架构等工作,具有丰富的基础架构经验。对技术充满热情,尤其对存储引擎、分布式共识算法等技术有较为深入的理解,曾编写开源书籍“自底向上分析 BoltDB 源码”,并发布“数据存储与检索”等网络课程。业余时间喜欢阅读开源项目源码,学习新技术。

- END - 

本文摘编自深入浅出存储引擎》,经出版方授权发布。



延伸阅读深入浅出存储引擎

推荐语:带你吃透存储引擎底层原理与实践技巧,攻克业务难题。通过阅读本书,读者不仅能对存储引擎,尤其是单机的存储引擎有一个整体的框架,而且能对两类存储引擎的实现思路及背后原理有个深刻的掌握,只有深刻理解了存储引擎的背后实现原理,读者不仅可以自己动手开发自己的存储引擎,更可以很快掌握关系型数据库或者NoSql这类组件的核心原理,对未来实际应用与开发提供参考。



长按下方二维码,发现更多科技好书



  • 本文来源:原创,图片来源:原创、pexels

  • 责任编辑:王莹,部门领导:宁姗

  • 发布人:白钰

IT阅读排行榜 技术圈的风向标,有趣,有料,有货,有品又有用
评论
  • 随着通信技术的迅速发展,现代通信设备需要更高效、可靠且紧凑的解决方案来应对日益复杂的系统。中国自主研发和制造的国产接口芯片,正逐渐成为通信设备(从5G基站到工业通信模块)中的重要基石。这些芯片凭借卓越性能、成本效益及灵活性,满足了现代通信基础设施的多样化需求。 1. 接口芯片在通信设备中的关键作用接口芯片作为数据交互的桥梁,是通信设备中不可或缺的核心组件。它们在设备内的各种子系统之间实现无缝数据传输,支持高速数据交换、协议转换和信号调节等功能。无论是5G基站中的数据处理,还是物联网网关
    克里雅半导体科技 2025-01-10 16:20 449浏览
  • ARMv8-A是ARM公司为满足新需求而重新设计的一个架构,是近20年来ARM架构变动最大的一次。以下是对ARMv8-A的详细介绍: 1. 背景介绍    ARM公司最初并未涉足PC市场,其产品主要针对功耗敏感的移动设备。     随着技术的发展和市场需求的变化,ARM开始扩展到企业设备、服务器等领域,这要求其架构能够支持更大的内存和更复杂的计算任务。 2. 架构特点    ARMv8-A引入了Execution State(执行状
    丙丁先生 2025-01-12 10:30 471浏览
  • 随着全球向绿色能源转型的加速,对高效、可靠和环保元件的需求从未如此强烈。在这种背景下,国产固态继电器(SSR)在实现太阳能逆变器、风力涡轮机和储能系统等关键技术方面发挥着关键作用。本文探讨了绿色能源系统背景下中国固态继电器行业的前景,并强调了2025年的前景。 1.对绿色能源解决方案日益增长的需求绿色能源系统依靠先进的电源管理技术来最大限度地提高效率并最大限度地减少损失。固态继电器以其耐用性、快速开关速度和抗机械磨损而闻名,正日益成为传统机电继电器的首选。可再生能源(尤其是太阳能和风能
    克里雅半导体科技 2025-01-10 16:18 331浏览
  • PNT、GNSS、GPS均是卫星定位和导航相关领域中的常见缩写词,他们经常会被用到,且在很多情况下会被等同使用或替换使用。我们会把定位导航功能测试叫做PNT性能测试,也会叫做GNSS性能测试。我们会把定位导航终端叫做GNSS模块,也会叫做GPS模块。但是实际上他们之间是有一些重要的区别。伴随着技术发展与越发深入,我们有必要对这三个词汇做以清晰的区分。一、什么是GPS?GPS是Global Positioning System(全球定位系统)的缩写,它是美国建立的全球卫星定位导航系统,是GNSS概
    德思特测试测量 2025-01-13 15:42 498浏览
  • 数字隔离芯片是现代电气工程师在进行电路设计时所必须考虑的一种电子元件,主要用于保护低压控制电路中敏感电子设备的稳定运行与操作人员的人身安全。其不仅能隔离两个或多个高低压回路之间的电气联系,还能防止漏电流、共模噪声与浪涌等干扰信号的传播,有效增强电路间信号传输的抗干扰能力,同时提升电子系统的电磁兼容性与通信稳定性。容耦隔离芯片的典型应用原理图值得一提的是,在电子电路中引入隔离措施会带来传输延迟、功耗增加、成本增加与尺寸增加等问题,而数字隔离芯片的目标就是尽可能消除这些不利影响,同时满足安全法规的要
    华普微HOPERF 2025-01-15 09:48 83浏览
  • 随着数字化的不断推进,LED显示屏行业对4K、8K等超高清画质的需求日益提升。与此同时,Mini及Micro LED技术的日益成熟,推动了间距小于1.2 Pitch的Mini、Micro LED显示屏的快速发展。这类显示屏不仅画质卓越,而且尺寸适中,通常在110至1000英寸之间,非常适合应用于电影院、监控中心、大型会议、以及电影拍摄等多种室内场景。鉴于室内LED显示屏与用户距离较近,因此对于噪音控制、体积小型化、冗余备份能力及电气安全性的要求尤为严格。为满足这一市场需求,开关电源技术推出了专为
    晶台光耦 2025-01-13 10:42 511浏览
  • 根据Global Info Research(环洋市场咨询)项目团队最新调研,预计2030年全球无人机电池和电源产值达到2834百万美元,2024-2030年期间年复合增长率CAGR为10.1%。 无人机电池是为无人机提供动力并使其飞行的关键。无人机使用的电池类型因无人机的大小和型号而异。一些常见的无人机电池类型包括锂聚合物(LiPo)电池、锂离子电池和镍氢(NiMH)电池。锂聚合物电池是最常用的无人机电池类型,因为其能量密度高、设计轻巧。这些电池以输出功率大、飞行时间长而著称。不过,它们需要
    GIRtina 2025-01-13 10:49 201浏览
  • 在不断发展的电子元件领域,继电器——作为切换电路的关键设备,正在经历前所未有的技术变革。固态继电器(SSR)和机械继电器之间的争论由来已久。然而,从未来发展的角度来看,固态继电器正逐渐占据上风。本文将从耐用性、速度和能效三个方面,全面剖析固态继电器为何更具优势,并探讨其在行业中的应用与发展趋势。1. 耐用性:经久耐用的设计机械继电器:机械继电器依靠物理触点完成电路切换。然而,随着时间的推移,这些触点因电弧、氧化和材料老化而逐渐磨损,导致其使用寿命有限。因此,它们更适合低频或对切换耐久性要求不高的
    腾恩科技-彭工 2025-01-10 16:15 109浏览
  • 新年伊始,又到了对去年做总结,对今年做展望的时刻 不知道你在2024年初立的Flag都实现了吗? 2025年对自己又有什么新的期待呢? 2024年注定是不平凡的一年, 一年里我测评了50余块开发板, 写出了很多科普文章, 从一个小小的工作室成长为科工公司。 展望2025年, 中国香河英茂科工, 会继续深耕于,具身机器人、飞行器、物联网等方面的研发, 我觉得,要向未来学习未来, 未来是什么? 是掌握在孩子们生活中的发现,和精历, 把最好的技术带给孩子,
    丙丁先生 2025-01-11 11:35 465浏览
  •   在信号处理过程中,由于信号的时域截断会导致频谱扩展泄露现象。那么导致频谱泄露发生的根本原因是什么?又该采取什么样的改善方法。本文以ADC性能指标的测试场景为例,探讨了对ADC的输出结果进行非周期截断所带来的影响及问题总结。 两个点   为了更好的分析或处理信号,实际应用时需要从频域而非时域的角度观察原信号。但物理意义上只能直接获取信号的时域信息,为了得到信号的频域信息需要利用傅里叶变换这个工具计算出原信号的频谱函数。但对于计算机来说实现这种计算需要面对两个问题: 1.
    TIAN301 2025-01-14 14:15 113浏览
  • 食物浪费已成为全球亟待解决的严峻挑战,并对环境和经济造成了重大影响。最新统计数据显示,全球高达三分之一的粮食在生产过程中损失或被无谓浪费,这不仅导致了资源消耗,还加剧了温室气体排放,并带来了巨大经济损失。全球领先的光学解决方案供应商艾迈斯欧司朗(SIX:AMS)近日宣布,艾迈斯欧司朗基于AS7341多光谱传感器开发的创新应用来解决食物浪费这一全球性难题。其多光谱传感解决方案为农业与食品行业带来深远变革,该技术通过精确判定最佳收获时机,提升质量控制水平,并在整个供应链中有效减少浪费。 在2024
    艾迈斯欧司朗 2025-01-14 18:45 68浏览
  • 01. 什么是过程能力分析?过程能力研究利用生产过程中初始一批产品的数据,预测制造过程是否能够稳定地生产符合规格的产品。可以把它想象成一种预测。通过历史数据的分析,推断未来是否可以依赖该工艺持续生产高质量产品。客户可能会要求将过程能力研究作为生产件批准程序 (PPAP) 的一部分。这是为了确保制造过程能够持续稳定地生产合格的产品。02. 基本概念在定义制造过程时,目标是确保生产的零件符合上下规格限 (USL 和 LSL)。过程能力衡量制造过程能多大程度上稳定地生产符合规格的产品。核心概念很简单:
    优思学院 2025-01-12 15:43 530浏览
  • 流量传感器是实现对燃气、废气、生活用水、污水、冷却液、石油等各种流体流量精准计量的关键手段。但随着工业自动化、数字化、智能化与低碳化进程的不断加速,采用传统机械式检测方式的流量传感器已不能满足当代流体计量行业对于测量精度、测量范围、使用寿命与维护成本等方面的精细需求。流量传感器的应用场景(部分)超声波流量传感器,是一种利用超声波技术测量流体流量的新型传感器,其主要通过发射超声波信号并接收反射回来的信号,根据超声波在流体中传播的时间、幅度或相位变化等参数,间接计算流体的流量,具有非侵入式测量、高精
    华普微HOPERF 2025-01-13 14:18 495浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦