【嵌入式】不服?跑个分看看!——Coremark篇

李肖遥 2023-06-04 22:09

【说在前面的话】


在计算机领域,很多无意义的论战都会在“不服跑个分看看”的叫嚣中进入下一个阶段:从原本Battle的议题转移为对跑分软件(Benchmark)严谨性和合法性的争论上——随着某些跑分软件陈芝麻烂谷子的黑料重见天日,群里论战的热情达到了最高潮……
这类盛况在PC和手机领域颇为常见。那么有的小伙伴会问了,在枯燥的MCU生态里,有没这样一个往群里大叫一声“不服?跑个分看看”,然后搬个小板凳躲在角落里吃瓜的机会呢?

哎!还真有。这就是大名鼎鼎的Coremark。根据EEMBC的说法:

CoreMark is a simple, yet sophisticated benchmark that is designed specifically to test the functionality of a processor core. Running CoreMark produces a single-number score allowing users to make quick comparisons between processors.

https://www.eembc.org/coremark/

简单来说,Coremark是一个专门测量嵌入式MCU(或者CPU)性能的跑分软件,用来替代已经过时且充满争议的Dhrystone跑分。Coremark包含了一系列算法:列表操作(查找和排序)、常用的矩阵运算、状态机以及CRC——这样做的目的据说是为了克服Dhrystone过于依赖libc库的缺点。官方甚至专门在网页上开辟了一个段落,细数Coremark相对Dhrysone做了哪些改进,感兴趣的小伙伴可以点击去看一看:

https://www.eembc.org/coremark/

这里记住结论就行:Dhrystone低级、过时、踩一脚;Coremark高级拉一把!

【部署CoreMark从未这么简单】

虽然Coremark的源代码在Github上可以直接下载,但拿回家后还需要针对你的目标处理器进行一番移植。总的来说,移植需要解决两类问题:
    • 提供对printf的重映射支持
    • 提供一个足够精准的时间测量手段 

哎,巧了不是。如果你使用的是Cortex-M处理器,并且习惯了在MDK环境下耕耘,只要借助 perf_counter 的帮助,在RTE里简单的勾选几下就可以迅速的在任意Cortex-M处理器中部署 Coremark。

首先,关于MDK下实现通用的printf功能,请参考文章《【震惊!】MDK下99%用户都不知道的万能printf方法》,这里就不再赘述。

从 v2.0.0开始 perf_counter 内置了 Coremark,并针对Cortex-M处理器完成了几乎所有的移植工作,这意味着你只需要在RTE中勾选对应的模块,即可完成对Coremark的部署(如下图所示):

如果你已经通过往期文章《【喂到嘴边了的模块】超级嵌入式系统“性能/时间”工具箱》熟悉过perf_counter的使用,那么接下来只要在超级循环里加入如下的代码就大功告成了:
#include "perf_counter.h"
int main(void){ printf("Coremark 1.0\r\n"); coremark_main(); while(1) {
} }
对应的运行效果如下(这里以Cortex-M55 r0p0为例,r0p1跑分会更高一些):

可以看到,这里的跑分结果是 4.367429

如果你之前从未用过 perf_counter,则推荐通过文章【喂到嘴边了的模块】超级嵌入式系统“性能/时间”工具箱》来了解详细的部署和使用方式。这里就不再赘述。
值得特别强调的是,perf_counter 已经加入 KEIL的官方索引列表,因此小伙伴可以直接从 Pack Installer 中找并安装它的最新版本:

如果你的网络不太好,无法通过Pack Installer直接安装,也可以在关注公众号【裸机思维】后向后台发送关键字 perf_counter 来获取网盘链接

【常见问题】

Coremark虽然简单直接,但在使用上仍然存在一些注意事项:
  • Coremark跑分的制约因素
一般来说,Coremark的结果肯定会受到以下几个因素的影响:
1. 优化等级

不要奢望 -O0 能跑出多高的结果。但如果你的项目从来都只用 -O0 那么跑Coremark时也一定要用 -O0 ——因为这反应了你使用时候的真实状况。

很多芯片公司和Arm一样都会用最好的编译器在最高的速度优化下跑Coremark,这意味着,我们通常可以在 Arm Compiler 6下使用 -Omax跑出当前硬件平台的最佳结果。

很多小伙伴可能不知道如何在 MDK 环境下使用 -Omax,因为Optimisation 下拉列表中根本没有 -Omax-Omax 是一个比 -Ofast要更上一个台阶的优化等级(用过都说好),可以说是MDK的一个隐藏技巧:

  • 请在 Msc Controls 中直接添加 -Omax,同时
  • 勾选 Link-Time-Optmisation

需要强调的是,一旦在 Misc Controls 文本框中添加了 -Omax,无论你在 Optimization 下拉列表中选择了哪个优化等级,都会被 -Omax 覆盖掉。为了避免误导后来人,推荐在这种情况下在该列表中选择


2. 程序存储器的速度以及RAM的访问速度

其实用脚指头想也知道:Coremark的跑分会受到存储器访问速度的影响。很多大公司会将程序保存在 0 wait state 的 RAM中来跑 Coremark,以求获得最佳的结果。

我猜很多小伙伴看到这里可能就炸了:我们平时都是在Flash里跑代码,你拿RAM跑出来的数据糊弄我?这不是欺负老实人么?

实际并非如此,原因如下:

1)对很多大公司来说,他要给客户提供理想状况下所能达到的最高评分,方便用户选型的时候了解芯片的能力上限(如果上限都达不到就别勉强了)

2)很多芯片会专门提供用于运行代码的 PRAMSRAM或者 TCM(Tightly Couple Memory),因此,只要合理安排程序的存储器布局,在核心应用和算法上,的确可以跑出官方给出的最大性能

从另外一个角度来说,以Cortex-M处理器为例,通过Coremark,对比Arm提供的最高跑分,我们可以很容易的评估当前芯片的 Flash速度是否拖累了处理器——从跑分的差异上判断拖累的程度。比如,很多时候,使用片内Flash跑 CoremarkXIPQSPI)连接的片外FlashCoremark 可以看出巨大的跑分差异,给了我们一个定量判断性能损失的参考手段——注意,只是参考,不是绝对的。

此外,RAM的速度也会对Coremark产生很大的影响,简单来说,0 wait stateRAM1~2wait state RAM以及 SDRAMCoremark的结果是截然不同的——这同样给了我们一个直观感受不同RAM性能差异的参考手段。

3. 是否存在cache

有没有cache,有多大的cache,以及cache覆盖ROM还是RAMCoremark结果的影响是巨大的。比如,哪怕你用 XIP 来跑 Coremark(或者用SDRAM来存储数据),只要你Cache到位,其跑分几乎和理想状况相差无几。

以上内容用脚趾都能想出来。接下来给大家说一个由cache引起的反直觉的现象:

前面我们说过,如果你想跑出最佳的跑分,就应该使用编译器的最高性能优化,对Cortex-MArm Compiler 6来说就是 -Omax + Link Time Optimisation

有些芯片虽然为Flash提供了一个专门的Cache,但由于其尺寸有限(通常是为了降低功耗或者芯片面积),会出现 -Omax + Link Time Optimisation优化下跑分反而不如 -Oz 或者 -Os 的情况。

首先这不是编译器的BUG,也不是你忘记给电脑开光导致来了脏东西。原因其实很简单:很多编译器在面向性能优化的时候会进行疯狂的循环展开,这会导致原本小巧的循环体突然体积暴涨——如果循环展开后的体积超过了cache所能容忍的程度,就会在这个关键的循环中频繁出现 cache miss——相当于处理器是直接从Flash上读取代码。相反,在 -Oz-Os 通常不会进行此类循环展开,因此在执行循环热点时,0 wait statecache发挥了高速缓存应有的作用,与直接在Flash上读取代码相比,极大的提高了程序的运行速度。
这里的关键其实是 cache 的大小以及循环展开后的体积。一般来说,大家常用的一线厂商芯片其 Flash Cache尺寸还是很得体的,一般不会出现上述情况,可以放心食用。
  • Coremark必须跑够10秒以上

这是Coremark为了跑出有效跑分而在算法中做出的硬性规定,如果你的芯片频率过高,则很可能会出现类似如下的提示:

ERROR! Must execute for at least 10 secs for a valid result.

观察 Total time (secs)可以知道Coremark实际运行了多少秒。

要解决这一问题也很简单:直接在工程中定义宏 ITERATIONS,并给出一个较大的值即可,比如3000:

重新编译,调试:

  • Coremark的结果处理
细心的小伙伴可能会发现一个现象,在很多新闻报道中,某些芯片厂商会声称自己的芯片Coremark跑分高达几千分,为什么我们这里所展示的Coremark跑分只有个位数呢?
其实二者都没错,几千分的那个结果是将芯片的频率考虑在内,而这里个位数的跑分是以1MHz作为参考——也就是所谓的 “每兆赫兹 Coremark”——显然,将结果换算成 1MHz 为单位的结果更为直观,也方便大家将不同频率的芯片拿到一起作比较,因此 perf_counter 在移植 Coremark 时也选择以 每MHz Coremark作为结果输出的标准格式。
【说在后面的话】


Battle千万条,拉踩第一条;跑分不规范,亲人两行泪。

感谢大家对 perf_counter 的支持。如果你喜欢我的作品,不妨献上您宝贵的一个 Star:
https://github.com/GorgonMeducer/perf_counter




原创不易,


如果你喜欢我的思维、觉得我的文章对你有所启发,

请务必 “点赞、收藏、转发” 三连,这对我很重要!谢谢!


欢迎订阅 裸机思维

李肖遥 公众号“技术让梦想更伟大”,作者:李肖遥,专注嵌入式,只推荐适合你的博文,干货,技术心得,与君共勉。
评论
  •   在信号处理过程中,由于信号的时域截断会导致频谱扩展泄露现象。那么导致频谱泄露发生的根本原因是什么?又该采取什么样的改善方法。本文以ADC性能指标的测试场景为例,探讨了对ADC的输出结果进行非周期截断所带来的影响及问题总结。 两个点   为了更好的分析或处理信号,实际应用时需要从频域而非时域的角度观察原信号。但物理意义上只能直接获取信号的时域信息,为了得到信号的频域信息需要利用傅里叶变换这个工具计算出原信号的频谱函数。但对于计算机来说实现这种计算需要面对两个问题: 1.
    TIAN301 2025-01-14 14:15 110浏览
  • PNT、GNSS、GPS均是卫星定位和导航相关领域中的常见缩写词,他们经常会被用到,且在很多情况下会被等同使用或替换使用。我们会把定位导航功能测试叫做PNT性能测试,也会叫做GNSS性能测试。我们会把定位导航终端叫做GNSS模块,也会叫做GPS模块。但是实际上他们之间是有一些重要的区别。伴随着技术发展与越发深入,我们有必要对这三个词汇做以清晰的区分。一、什么是GPS?GPS是Global Positioning System(全球定位系统)的缩写,它是美国建立的全球卫星定位导航系统,是GNSS概
    德思特测试测量 2025-01-13 15:42 498浏览
  • 01. 什么是过程能力分析?过程能力研究利用生产过程中初始一批产品的数据,预测制造过程是否能够稳定地生产符合规格的产品。可以把它想象成一种预测。通过历史数据的分析,推断未来是否可以依赖该工艺持续生产高质量产品。客户可能会要求将过程能力研究作为生产件批准程序 (PPAP) 的一部分。这是为了确保制造过程能够持续稳定地生产合格的产品。02. 基本概念在定义制造过程时,目标是确保生产的零件符合上下规格限 (USL 和 LSL)。过程能力衡量制造过程能多大程度上稳定地生产符合规格的产品。核心概念很简单:
    优思学院 2025-01-12 15:43 529浏览
  • 随着全球向绿色能源转型的加速,对高效、可靠和环保元件的需求从未如此强烈。在这种背景下,国产固态继电器(SSR)在实现太阳能逆变器、风力涡轮机和储能系统等关键技术方面发挥着关键作用。本文探讨了绿色能源系统背景下中国固态继电器行业的前景,并强调了2025年的前景。 1.对绿色能源解决方案日益增长的需求绿色能源系统依靠先进的电源管理技术来最大限度地提高效率并最大限度地减少损失。固态继电器以其耐用性、快速开关速度和抗机械磨损而闻名,正日益成为传统机电继电器的首选。可再生能源(尤其是太阳能和风能
    克里雅半导体科技 2025-01-10 16:18 328浏览
  • 根据Global Info Research(环洋市场咨询)项目团队最新调研,预计2030年全球无人机电池和电源产值达到2834百万美元,2024-2030年期间年复合增长率CAGR为10.1%。 无人机电池是为无人机提供动力并使其飞行的关键。无人机使用的电池类型因无人机的大小和型号而异。一些常见的无人机电池类型包括锂聚合物(LiPo)电池、锂离子电池和镍氢(NiMH)电池。锂聚合物电池是最常用的无人机电池类型,因为其能量密度高、设计轻巧。这些电池以输出功率大、飞行时间长而著称。不过,它们需要
    GIRtina 2025-01-13 10:49 198浏览
  • 食物浪费已成为全球亟待解决的严峻挑战,并对环境和经济造成了重大影响。最新统计数据显示,全球高达三分之一的粮食在生产过程中损失或被无谓浪费,这不仅导致了资源消耗,还加剧了温室气体排放,并带来了巨大经济损失。全球领先的光学解决方案供应商艾迈斯欧司朗(SIX:AMS)近日宣布,艾迈斯欧司朗基于AS7341多光谱传感器开发的创新应用来解决食物浪费这一全球性难题。其多光谱传感解决方案为农业与食品行业带来深远变革,该技术通过精确判定最佳收获时机,提升质量控制水平,并在整个供应链中有效减少浪费。 在2024
    艾迈斯欧司朗 2025-01-14 18:45 68浏览
  • 随着通信技术的迅速发展,现代通信设备需要更高效、可靠且紧凑的解决方案来应对日益复杂的系统。中国自主研发和制造的国产接口芯片,正逐渐成为通信设备(从5G基站到工业通信模块)中的重要基石。这些芯片凭借卓越性能、成本效益及灵活性,满足了现代通信基础设施的多样化需求。 1. 接口芯片在通信设备中的关键作用接口芯片作为数据交互的桥梁,是通信设备中不可或缺的核心组件。它们在设备内的各种子系统之间实现无缝数据传输,支持高速数据交换、协议转换和信号调节等功能。无论是5G基站中的数据处理,还是物联网网关
    克里雅半导体科技 2025-01-10 16:20 448浏览
  • 数字隔离芯片是现代电气工程师在进行电路设计时所必须考虑的一种电子元件,主要用于保护低压控制电路中敏感电子设备的稳定运行与操作人员的人身安全。其不仅能隔离两个或多个高低压回路之间的电气联系,还能防止漏电流、共模噪声与浪涌等干扰信号的传播,有效增强电路间信号传输的抗干扰能力,同时提升电子系统的电磁兼容性与通信稳定性。容耦隔离芯片的典型应用原理图值得一提的是,在电子电路中引入隔离措施会带来传输延迟、功耗增加、成本增加与尺寸增加等问题,而数字隔离芯片的目标就是尽可能消除这些不利影响,同时满足安全法规的要
    华普微HOPERF 2025-01-15 09:48 83浏览
  • 随着数字化的不断推进,LED显示屏行业对4K、8K等超高清画质的需求日益提升。与此同时,Mini及Micro LED技术的日益成熟,推动了间距小于1.2 Pitch的Mini、Micro LED显示屏的快速发展。这类显示屏不仅画质卓越,而且尺寸适中,通常在110至1000英寸之间,非常适合应用于电影院、监控中心、大型会议、以及电影拍摄等多种室内场景。鉴于室内LED显示屏与用户距离较近,因此对于噪音控制、体积小型化、冗余备份能力及电气安全性的要求尤为严格。为满足这一市场需求,开关电源技术推出了专为
    晶台光耦 2025-01-13 10:42 507浏览
  • ARMv8-A是ARM公司为满足新需求而重新设计的一个架构,是近20年来ARM架构变动最大的一次。以下是对ARMv8-A的详细介绍: 1. 背景介绍    ARM公司最初并未涉足PC市场,其产品主要针对功耗敏感的移动设备。     随着技术的发展和市场需求的变化,ARM开始扩展到企业设备、服务器等领域,这要求其架构能够支持更大的内存和更复杂的计算任务。 2. 架构特点    ARMv8-A引入了Execution State(执行状
    丙丁先生 2025-01-12 10:30 471浏览
  • 新年伊始,又到了对去年做总结,对今年做展望的时刻 不知道你在2024年初立的Flag都实现了吗? 2025年对自己又有什么新的期待呢? 2024年注定是不平凡的一年, 一年里我测评了50余块开发板, 写出了很多科普文章, 从一个小小的工作室成长为科工公司。 展望2025年, 中国香河英茂科工, 会继续深耕于,具身机器人、飞行器、物联网等方面的研发, 我觉得,要向未来学习未来, 未来是什么? 是掌握在孩子们生活中的发现,和精历, 把最好的技术带给孩子,
    丙丁先生 2025-01-11 11:35 463浏览
  • 流量传感器是实现对燃气、废气、生活用水、污水、冷却液、石油等各种流体流量精准计量的关键手段。但随着工业自动化、数字化、智能化与低碳化进程的不断加速,采用传统机械式检测方式的流量传感器已不能满足当代流体计量行业对于测量精度、测量范围、使用寿命与维护成本等方面的精细需求。流量传感器的应用场景(部分)超声波流量传感器,是一种利用超声波技术测量流体流量的新型传感器,其主要通过发射超声波信号并接收反射回来的信号,根据超声波在流体中传播的时间、幅度或相位变化等参数,间接计算流体的流量,具有非侵入式测量、高精
    华普微HOPERF 2025-01-13 14:18 486浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦