DPU性能评测系统框架与测试流程

智能计算芯世界 2022-09-28 00:00

本文来自“专用数据处理器(DPU)性能基准评测方法与实现(2022)介绍 DPU 性能测试系统框架与测试流程,包括测试系统、测试要求、测试活动三部分。具体的,测试系统定义了三种搭建 DPU 测试系统的方法,测试要求阐述了组建 DPU 测试系统时需要满足的要求,测试活动定义了DPU Benchmark 的选择策略、执行前准备、执行过程及测试结果报告。


DPU 测试系统(SUT

DPU 测试系统(System Under TestSUT)是测试 DPU 性能的平台,其结构在不同应用场景中,主要分为三类:单端型测试系统(Single-End)、端到端型测试系统(End-to-End)和多端型测试系统(Multi-End



单端型(Single-End测试系统是主机与 DPU 通过总线互联构成的封闭测试系统,主要用于模拟无网络连接情况下,DPU 作为专用加速器执行主机端特定业务的过程。在这种系统中,计算与数据传输仅在主机与 DPU 之间进行,DPU 不与其他设备通信,仅执行特定计算业务。单端型测试系统主要测试 DPU 对特定计算任务的性能提升。


端到端型(End-to-End测试系统将两个单端型测试系统通过简单网络相连(网线直连),其中一个为请求发起者(Initiator/Client),另一个为请求接受者(Target/Server)。


端到端型测试系统主要模拟 DPU 作为网络加速器执行双端操作的场景。在这种系统中,计算与数据传输不仅在主机与 DPU 之间进行,还通过网络传输到其他系统。DPU Server 端接收主机端发起的网络请求并通过网口转发,或者在 Client 端接收网络的请求并向作出响应。端到端型测试系统能够屏蔽网络性能(转发次数、交换设备的性能、转发设备的性能)对 DPU 性能的影响,主要测试 DPU 对网络协议卸载、网络数据包处理的峰值能力。


多端型(Multi-End测试系统是多个单端型测试系统通过复杂的网络拓扑相连的开放测试系统。该测试系统主要模拟 DPU 作为网络加速器在复杂环境中处理网络任务的场景。在这种系统中,网络环境(网络拓扑)与资源分布(相同或者不同类型的 DPU 系统)情况复杂,DPU 不仅承担一对一的网络任务,还可能接收一/多个其他系统的请求(含背景流量甚至恶意攻击)或响应一/多个其他系统的请求。


单端型(Single-End)测试系统

主机与 DPU 通过总线(通常为 PCIe)直接相连形成的可独立工作的系统为单端型测试系统,系统包含支持 DPU 正常工作的软件和硬件。在这种测试系统中,DPU 作为专用加速器执行特点计算业务。


单端型测试系统模型的基本结构如图2.1(a) 所示。运行时环境(Run Time Environ-mentRTE)代表运行中的 DPU 测试程序,交换设备(Switch)为 DPU 与主机系统(Host System)的互连结构(通常为 PCIe)。在单端型测试系统中,DPU 作为专用加速器,主机使用 DPU 加速某些任务的处理,如数据库查询、AI 训练等。任务数据首先从主机端搬运到 DPUDPU 计算完成后,再将处理完的数据写回主机。在这种工作模式中,DPU测试程序可以以数据处理时间、数据处理规模作为性能指标。



单端型测试系统具体由硬件和软件两部分构成,硬件主要有 DPUCPU 以及其他

保证系统正常进行的硬件(内存、硬盘等),软件主要有操作系统、DPU 驱动、开源工具、DPU Benchmark,结构示意如图。各部分组件要求如下:


  • 1. DPU Benchmark,评测 DPU 系统性能的基准测试程序;
  • 2. 开源工具(Open Source Tools),一些广泛使用的性能测试工具,保证测试结果可重复,在不同的用户测试时可以获得相近的结果;
  • 3. DPU Benchmark 驱动(Benchmark Driver),基于内核态的测试驱动或者基于用户态的测试驱动;
  • 4. DPU 驱动(DPU Driver),包括 DPU 最底层的抽象,也包括 DPU 所提供给用户程序使用的接口;
  • 5. 操作系统(Operating System),需要支持 DPU Benchmark 的版本,且相关信息需要在结果报告中明确写出,如操作系统版本,内核版本等;
  • 6. 计算设备(Computing Device),通用 CPU,其上运行操作系统;
  • 7. 连接设备(Connected Device),根据 DPU 板卡接口不同选择不同,常见的有PCIeCXL
  • 8. IO 硬件(I/O),鼠标、键盘等保证系统执行所必须的硬件设备;
  • 9. 被测 DPU 产品(DPU);
  • 10. 其他硬件资源(Hardware Resources),如内存、硬盘。

端到端型(End-to-End)测试系统


端到端型测试系统是由两个单端型测试系统通过网线直连的方式组成的测试系统。在这种测试系统中,屏蔽了复杂的网络拓扑与其他系统流量的影响,可以测试 DPU 络加速的峰值性能。


端到端型测试系统由两个单端型测试模型直接相连(如图所示),每个单端测试系统分别运行 DPU Benchmark 测试程序,一般其中一个运行发起者程序 (Initiator/-Client),另一个运行接收者程序 (Target/Server)。通过发起者发送请求,接收者响应请求,测量基于网络的端到端操作,例如 RDMA Send/Receive 操作,NVMe-oF 远程访问。在这种测试模型中,根据从一端 DPU 系统到另一端 DPU 系统的请求时间和流量等测试DPU 的延迟、吞吐量等性能。



端对端型测试系统在单端型测试系统的基础上,增加网络基础设备(通常为网线)

用于直接连接两个单端测试系统,其结构如图2.3所示。根据 DPU 所支持的网口速率不同,可采取不同的网络连接设备,缺省值为 100Gbs 连接。

多端型(Multi-End)测试系统


多端型测试系统是由多个单端型测试系统经由复杂网络(复杂的网络拓扑)连接形

成的测试系统。在这种测试系统中,可以模拟 DPU 所处的真实网络环境,测试 DPU 络处理的实际性能。


多端型测试系统模型主要用于模拟基于 DPU 构建的数据中心,通过复杂的网络将

众多 DPU 系统 (功能相同或者不同) 互连起来,从而测试基于 DPU 系统实现的网络、存储或安全加速应用的真实性能,如NVMe-oF 读取不同结点存储系统的存储资源、RDMA访问不同结点的资源。在这种测试模型中,根据请求与响应时间、请求的数据量及并发的请求数等可以测试延时、吞吐量、连接能力等指标。



多端型测试系统在单端型测试系统的基础上,需要增加更复杂的网络基础设备用于连接不同节点的 DPU 系统。这些网络基础设施包括但不限于集线器、交换机、路由器等。



DPU Benchmark 执行时,为了保证测试结果的准确性与可重复性,对于同一种测试用例执行两轮(特殊的情况在具体的测试用例说明)。每一轮分为三个部分:预(Warmup Run) 部分排除初始化干扰;负载执行 (Measured Run) 部分为真正的指标测试;结果检查 (Result Check) 部分检查结果的正确性 (数据传输的完整性,计算结果的正确性等)。每执行完一轮需要恢复至初始状态 (Clear up)。在预热部分与负载执行之间不允许执行其他任务。每一轮执行的过程中,DPU 测试系统配置不可以发生变化。


DPU Benchmark 执行过程中,DPU 测试系统不可以重启或者重新开始。如果 DPU系统测试应用、操作系统或者硬件发生不可恢复的错误时,这一轮的执行应作无效;如DPU 系统测试应用、操作系统或者硬件检测到可恢复的错误,并且错误纠正并恢复正常,那么这一轮的执行应作有效。在错误发生处理期间,测试者不能人工干预,否则,这一轮执行应作无效。


测试报告中除了给出不同测试用例的性能指标,还需要给出测试过程中的全部配置信息,包括:配置参数,包括服务器、存储、网络等其他硬件设施;安装的操作系统、文件系统、测试工具等软件版本;在测试过程中使用到的其他软件程序;程序编译优化选项。在执行 DPU Benchmark 时如果系统发送异常或者其他情况,需要在报告附录中指出。


本文来自“专用数据处理器(DPU)性能基准评测方法与实现(2022)介绍 DPU性能测试系统框架与测试流程,包括测试系统、测试要求、测试活动三部分。完整内容请参看原报告


下载链接:
专用数据处理器(DPU)性能基准评测方法与实现(2022)
2022年中国DPU行业白皮书

专用数据处理器 (DPU)技术白皮书

2021中国DPU行业发展白皮书

DPU在数据中心和边缘云上的应用

英伟达DPU集数据中心于芯片

2021中国DPU行业发展白皮书 

CCIX缓存一致性互联技术概述

ARM CPU处理器资料汇总(1)

ARM CPU处理器资料汇总(2)

ARM系列处理器应用技术完全手册

CPU和GPU研究框架合集


本号资料全部上传至知识星球,更多内容请登录智能计算芯知识(知识星球)星球下载全部资料。



免责申明:本号聚焦相关技术分享,内容观点不代表本号立场,可追溯内容均注明来源,发布文章若存在版权等问题,请留言联系删除,谢谢。



电子书<服务器基础知识全解(终极版)>更新完毕。

获取方式:点击“阅读原文”即可查看182页 PPT可编辑版本和PDF阅读版本详情。



温馨提示:

请搜索“AI_Architect”或“扫码”关注公众号实时掌握深度技术分享,点击“阅读原文”获取更多原创技术干货。


智能计算芯世界 聚焦人工智能、芯片设计、异构计算、高性能计算等领域专业知识分享.
评论
  • 本文介绍编译Android13 ROOT权限固件的方法,触觉智能RK3562开发板演示,搭载4核A53处理器,主频高达2.0GHz;内置独立1Tops算力NPU,可应用于物联网网关、平板电脑、智能家居、教育电子、工业显示与控制等行业。关闭selinux修改此文件("+"号为修改内容)device/rockchip/common/BoardConfig.mkBOARD_BOOT_HEADER_VERSION ?= 2BOARD_MKBOOTIMG_ARGS :=BOARD_PREBUILT_DTB
    Industio_触觉智能 2025-01-08 00:06 92浏览
  • 村田是目前全球量产硅电容的领先企业,其在2016年收购了法国IPDiA头部硅电容器公司,并于2023年6月宣布投资约100亿日元将硅电容产能提升两倍。以下内容主要来自村田官网信息整理,村田高密度硅电容器采用半导体MOS工艺开发,并使用3D结构来大幅增加电极表面,因此在给定的占位面积内增加了静电容量。村田的硅技术以嵌入非结晶基板的单片结构为基础(单层MIM和多层MIM—MIM是指金属 / 绝缘体/ 金属) 村田硅电容采用先进3D拓扑结构在100um内,使开发的有效静电容量面积相当于80个
    知白 2025-01-07 15:02 141浏览
  • 彼得·德鲁克被誉为“现代管理学之父”,他的管理思想影响了无数企业和管理者。然而,关于他的书籍分类,一种流行的说法令人感到困惑:德鲁克一生写了39本书,其中15本是关于管理的,而其中“专门写工商企业或为企业管理者写的”只有两本——《为成果而管理》和《创新与企业家精神》。这样的表述广为流传,但深入探讨后却发现并不完全准确。让我们一起重新审视这一说法,解析其中的矛盾与根源,进而重新认识德鲁克的管理思想及其著作的真正价值。从《创新与企业家精神》看德鲁克的视角《创新与企业家精神》通常被认为是一本专为企业管
    优思学院 2025-01-06 12:03 158浏览
  • By Toradex 秦海1). 简介嵌入式平台设备基于Yocto Linux 在开发后期量产前期,为了安全以及提高启动速度等考虑,希望将 ARM 处理器平台的 Debug Console 输出关闭,本文就基于 NXP i.MX8MP ARM 处理器平台来演示相关流程。 本文所示例的平台来自于 Toradex Verdin i.MX8MP 嵌入式平台。  2. 准备a). Verdin i.MX8MP ARM核心版配合Dahlia载板并
    hai.qin_651820742 2025-01-07 14:52 108浏览
  • 这篇内容主要讨论三个基本问题,硅电容是什么,为什么要使用硅电容,如何正确使用硅电容?1.  硅电容是什么首先我们需要了解电容是什么?物理学上电容的概念指的是给定电位差下自由电荷的储藏量,记为C,单位是F,指的是容纳电荷的能力,C=εS/d=ε0εrS/4πkd(真空)=Q/U。百度百科上电容器的概念指的是两个相互靠近的导体,中间夹一层不导电的绝缘介质。通过观察电容本身的定义公式中可以看到,在各个变量中比较能够改变的就是εr,S和d,也就是介质的介电常数,金属板有效相对面积以及距离。当前
    知白 2025-01-06 12:04 223浏览
  •  在全球能源结构加速向清洁、可再生方向转型的今天,风力发电作为一种绿色能源,已成为各国新能源发展的重要组成部分。然而,风力发电系统在复杂的环境中长时间运行,对系统的安全性、稳定性和抗干扰能力提出了极高要求。光耦(光电耦合器)作为一种电气隔离与信号传输器件,凭借其优秀的隔离保护性能和信号传输能力,已成为风力发电系统中不可或缺的关键组件。 风力发电系统对隔离与控制的需求风力发电系统中,包括发电机、变流器、变压器和控制系统等多个部分,通常工作在高压、大功率的环境中。光耦在这里扮演了
    晶台光耦 2025-01-08 16:03 58浏览
  • 在智能家居领域中,Wi-Fi、蓝牙、Zigbee、Thread与Z-Wave等无线通信协议是构建短距物联局域网的关键手段,它们常在实际应用中交叉运用,以满足智能家居生态系统多样化的功能需求。然而,这些协议之间并未遵循统一的互通标准,缺乏直接的互操作性,在进行组网时需要引入额外的网关作为“翻译桥梁”,极大地增加了系统的复杂性。 同时,Apple HomeKit、SamSung SmartThings、Amazon Alexa、Google Home等主流智能家居平台为了提升市占率与消费者
    华普微HOPERF 2025-01-06 17:23 202浏览
  • 「他明明跟我同梯进来,为什么就是升得比我快?」许多人都有这样的疑问:明明就战绩也不比隔壁同事差,升迁之路却比别人苦。其实,之间的差异就在于「领导力」。並非必须当管理者才需要「领导力」,而是散发领导力特质的人,才更容易被晓明。许多领导力和特质,都可以通过努力和学习获得,因此就算不是天生的领导者,也能成为一个具备领导魅力的人,进而被老板看见,向你伸出升迁的橘子枝。领导力是什么?领导力是一种能力或特质,甚至可以说是一种「影响力」。好的领导者通常具备影响和鼓励他人的能力,并导引他们朝着共同的目标和愿景前
    优思学院 2025-01-08 14:54 61浏览
  • 根据环洋市场咨询(Global Info Research)项目团队最新调研,预计2030年全球无人机锂电池产值达到2457百万美元,2024-2030年期间年复合增长率CAGR为9.6%。 无人机锂电池是无人机动力系统中存储并释放能量的部分。无人机使用的动力电池,大多数是锂聚合物电池,相较其他电池,锂聚合物电池具有较高的能量密度,较长寿命,同时也具有良好的放电特性和安全性。 全球无人机锂电池核心厂商有宁德新能源科技、欣旺达、鹏辉能源、深圳格瑞普和EaglePicher等,前五大厂商占有全球
    GIRtina 2025-01-07 11:02 122浏览
  • 故障现象一辆2017款东风风神AX7车,搭载DFMA14T发动机,累计行驶里程约为13.7万km。该车冷起动后怠速运转正常,热机后怠速运转不稳,组合仪表上的发动机转速表指针上下轻微抖动。 故障诊断 用故障检测仪检测,发动机控制单元中无故障代码存储;读取发动机数据流,发现进气歧管绝对压力波动明显,有时能达到69 kPa,明显偏高,推断可能的原因有:进气系统漏气;进气歧管绝对压力传感器信号失真;发动机机械故障。首先从节气门处打烟雾,没有发现进气管周围有漏气的地方;接着拔下进气管上的两个真空
    虹科Pico汽车示波器 2025-01-08 16:51 70浏览
  • 每日可见的315MHz和433MHz遥控模块,你能分清楚吗?众所周知,一套遥控设备主要由发射部分和接收部分组成,发射器可以将控制者的控制按键经过编码,调制到射频信号上面,然后经天线发射出无线信号。而接收器是将天线接收到的无线信号进行解码,从而得到与控制按键相对应的信号,然后再去控制相应的设备工作。当前,常见的遥控设备主要分为红外遥控与无线电遥控两大类,其主要区别为所采用的载波频率及其应用场景不一致。红外遥控设备所采用的射频信号频率一般为38kHz,通常应用在电视、投影仪等设备中;而无线电遥控设备
    华普微HOPERF 2025-01-06 15:29 164浏览
  • 大模型的赋能是指利用大型机器学习模型(如深度学习模型)来增强或改进各种应用和服务。这种技术在许多领域都显示出了巨大的潜力,包括但不限于以下几个方面: 1. 企业服务:大模型可以用于构建智能客服系统、知识库问答系统等,提升企业的服务质量和运营效率。 2. 教育服务:在教育领域,大模型被应用于个性化学习、智能辅导、作业批改等,帮助教师减轻工作负担,提高教学质量。 3. 工业智能化:大模型有助于解决工业领域的复杂性和不确定性问题,尽管在认知能力方面尚未完全具备专家级的复杂决策能力。 4. 消费
    丙丁先生 2025-01-07 09:25 116浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦