前两天,ARM在Computex 2019大会上宣布推出新一代Cortex-A77 CPU新架构,随之而来的还有Mali-G77 GPU。ARM Mali GPU一直以来相较高通Adreno和苹果A系GPU,都属短板,这让三星和华为始终在图形计算能力,尤其是游戏表现上比较尴尬。

前两天,ARM在Computex 2019大会上宣布推出新一代Cortex-A77 CPU新架构,随之而来的还有Mali-G77 GPU。ARM Mali GPU一直以来相较高通Adreno和苹果A系GPU,都属短板,这让三星和华为始终在图形计算能力,尤其是游戏表现上比较尴尬。甚至前两年就有传言说华为的自研GPU很快会上线,对Mali的嫌弃并不是一天两天了。

不过今年的Mali-G77换了新的Valhall架构,执行核心和ISA都发生了较大的变化——考虑到去年G76已经很大程度拉进了Mali与Adreno在性能和能效方面的距离,今年的G77就格外受人关注了。三星和华为手机终于要摆脱GPU孱弱的帽子了吗?


 

 

预期:靠近苹果,赶超高通?

由于Mali-G77尚无成品上市,现在只能看ARM给定的纸面数据,并参考去年G76的成绩,以此来看G77当前的水平层级。ARM宣称,G77相比G76在每mm²的性能方面提升1.2-1.4倍,或者说“性能密度”提升30%,以及能效提升30%(每瓦性能提升1.20-1.39倍),还有机器学习性能提升60%。

20190530-031.jpg

 

不同的厂商对于具体的GPU实施方案会存在差别,比如频率、核心数等,所以ARM提供了性能密度提升数据作为参考。Mali-G77 GPU预期在未来的制程工艺方面并不会有多大提升,不过性能密度和能效提升自然也就意味着GPU还可以做得更小,或者说可以塞进更多核心。

考虑到整个系统未来更多的提升,如LPDDR5,ARM认为未来采用Mali-G77的设备将在峰值图形性能方面提升40%。这里提升的40%,理应对应于G76,那么我们就可以来看一看G76是什么水平。

一般来说,历代Mali GPU在具体实施时,抛开GPU Turbo不谈,三星Exynos在硬件层面的绝对性能和能效方面是优于海思Kirin的。所以我们看看应用了Mali-G76的Exynos 9820当年的表现如何。

参考外媒AnandTech针对三星Galaxy S10的测试成绩——这款手机恰好有骁龙855和Exynos 9820两个版本。从GFXBench测试子项的曼哈顿3.1和霸王龙2.7测试中,Mali-G76和Adreno 640在峰值性能、持续性能,以及能效(每瓦帧率)方面都比较接近,虽然前者相较后者略有不及。

20190530-032.jpg

20190530-033.jpg
来源:AnandTech,其中A12分成Warm和Cold,其中Warm是指持续跑测试项目至少3分钟后,在性能下降后测得的成绩,这个状态下的功耗成绩会相对合理

Mali-G76实际上相比G72就已经完成了一次能效和性能飞跃,而且G76终于换掉了Midgard时代的texture单元,让Mali在游戏画质上终于达到与Adreno同一水准。那么如果G77的确像ARM宣称的那样,性能和能效都提升20%-40%,这对高通而言就是个大麻烦。要知道在G72时代以前,高通可是远远将Mali甩在身后的。或者说,在未来的G77手机设备中,三星和华为可能将彻底摆脱GPU孱弱的噩梦,只要芯片制造商能够按照ARM的实施方案去做。

不过按照40%的上限来看,大致上也就是刚刚达到苹果A12的水平,包括性能和能效。所以G77赶超高通是没问题的,但要赶超苹果,恐怕还得加把劲儿。

Valhall架构:改了什么?

做到这个程度的性能和能效飞跃,可以从Valhall执行核心,以及Mali-G77微架构层面的调整说起,尤其是前者。ARM官方提到,Valhall包含了这些特性:

- 新的超标量引擎,这是能效和性能密度提升的关键;
- 简化的标量ISA,新的指令组对compiler(编译器)更友好;
- 新的指令动态调度;
- 配合如Vulkan之类的当代API,采用新的数据结构。

实际上,Valhall架构的本质在新的执行核心。前代Bifrost架构是4-wide和8-wide设计,G72核心部分的执行模块就包含4-wide标量SIMD单元,warp size为4;G76则增加到两个4-wide单元,warp size为8。warp是GPU的最基本可调度单元,SIMD过程中数据处理的最小单位;在所有线程中,同时执行同一指令。

20190530-034.jpg

 

这种比较窄的warp设计,致使工作无法有效填充足够的线程。而Valhall则将warp执行模型增加到了16-wide,这样一来,ALU单元的利用率会提升。这是在向桌面级GPU靠拢的节奏。这也是ARM在PPT中反反复复宣传的核心所在,我们认为这也是G77完成性能提升和多场景应用的关键。

20190530-035.jpg

 

另外就是执行引擎从早前的3个,合并为更大的一个。不过实际ALU管线仍然由两部分构成,每部分有各自的16-wide FMA相应单元。类似Bifrost这样的三引擎设计,每个执行引擎都有各自的数据路径控制逻辑、scheduler、指令缓存等,这已经是比较老的设计方案了,相对也更浪费资源,节省空间。

除此之外,就新的ISA,Bifrost以往调度(fixed issuing)是依托于compiler的,而Valhall则降低了compiler的负荷;新版的ISA还对texture指令做了优化;针对AFBC(ARM帧缓冲压缩)的优化等。

20190530-036.jpg

 

深入到执行引擎微架构内部,其中共有四个模块,前端包括warp scheduler和16KB的指令缓存,两个处理单元,还有连接加载/存储单元和一些固定功能模块的Message Block。前端支持最多64 warp/1024个线程;执行单元中有三个ALU,分别是FMA、CVT(转换单元,用于基本的整数操作和类型转换)和SFU(特定功能单元,这个单元的warp为4-wide,因为相对比较少用),这种“超标量”发射的核心变化也就相应实现了compiler的简单化。

20190530-037.jpg

 

在执行引擎之外,shader核心在微架构层面的变动其实是不大的,其中尤为值得一提的是shader核心内部的TMU(纹理贴图单元),其吞吐能力相较Mali-G76翻番(命中路径吞吐翻番、未命中路径吞吐也翻番)。Texture缓存增加到32KB,也就能够达到16纹素/周期的吞吐。过滤单元吞吐也增加了,达到了G76的两倍。

不过这样一来,ALU相较texture过滤也就不是均衡分配的关系了,ARM认为当代的图形工作任务负载是需要这种变化的。ARM宣称,G77在texture重度游戏中的表现会很好。


 

 

再从shader核心之外来看,就不同芯片厂商可以为Mali-G77 GPU配备7-16个shader核心(每个核心一个执行引擎);L2缓存最多可以切分成4块,总体最多4MB大小。这些就要看不同厂商的设计了。

20190530-039.jpg

 

强化的更多应用场景:AR、ML

GPU执行神经网络引擎的推测(inference)其实并不稀罕,不过ARM这回专门拿出来谈了谈。ARM在社区文章中反复宣传其16-wide warp和一个执行引擎内的两簇设计,每个核心每个执行引擎都有16-wide FMA单元。如前文所述,这大概是本次计算性能相较G76提升的根本所在。另外加载/存储缓存(LSC)也有加强设计,这些带宽方面的加强对于推动本地推测执行性能都有益处,本身也迎合edge AI的趋势。

在此基础上,将Mali-G77应用于更为复杂的显示增强和机器学习场景——这都是对并行计算要求更高的场景,也就有了依据。不过在这些应用场景上,G77乃至Vallhall都可能只是个开始。

这么看来,今年的手机市场可能会更有意思,尤其华为在补齐GPU短板后,高通到底还能不能使出什么杀手锏呢?

本文为EET电子工程专辑原创文章,禁止转载。请尊重知识产权,违者本司保留追究责任的权利。
  • 传说中那个降画质的?
  • 纯nt,今年虽然没打过苹果,但已经超了骁龙

  • 3年前不就是高通吓尿,苹果怂了最强国产
您可能感兴趣
最近收到一款Jetson Orin Nano Super开发套装,我打算拿它来做个简单的AI应用开发...在没有任何AI应用和嵌入式应用开发经验的基础上...主打传说中的零代码开发~
这一新指导政策不仅反映了中国在芯片产业中减少对外依赖的战略意图,也体现了RISC-V架构在中国芯片产业中的重要地位和发展潜力。
“祖冲之三号” 具备105个可读取比特和182个耦合比特,处理量子随机线路采样问题的速度比目前最快的超级计算机快15个数量级,超过谷歌2024年10月公开发表的最新成果6个数量级。
目前英特尔采取了“产能匹配”策略,即需确保“投资节奏与市场需求一致”,避免过度投入导致产能闲置。这番说辞或意味着英特尔面对巨大财务压力作出了不得已的战略调整。
微软还强调,拜登政府的《人工智能扩散出口管制框架》限制了美国向许多快速增长且具有战略意义的市场出口关键AI组件,破坏了特朗普政府的两项优先事项:加强美国的AI领导地位以及减少美国近万亿美元的贸易逆差。
Ocelot是AWS与加州理工学院合作开发的,集成了两个堆叠在一起的小型硅微芯片。 AWS表示,该芯片的设计可将与纠错相关的成本降低多达90%。
TEL宣布自2025年3月1日起,现任TEL中国区地区总部——东电电子(上海)有限公司高级执行副总经理赤池昌二正式升任为集团副总裁,同时兼任东电电子(上海)有限公司总裁和东电光电半导体设备(昆山)有限公司总裁。
预计在2025年,以下七大关键趋势将塑造物联网的格局。
领域新成果领域新成果4月必逛电子展!AI、人形机器人、低空飞行、汽车、新能源、半导体六大热门新赛道,来NEPCON China 2025一展全看,速登记!
本次股东大会将采取线上和线下相结合的混合形式召开,股东们可选择现场出席或线上参会。
小米宣布全球首发光学预研技术——小米模块光学系统,同时发布官方宣传视频。简单来说,该系统是一个磁吸式可拆卸镜头,采用定制M4/3传感器+全非球面镜组,带来完整一亿像素,等效35mm焦段,配备f/1.4
千万级中标项目5个,百万级中标项目12个。文|新战略根据公开信息,新战略移动机器人产业研究所不完全统计,2025年2月,国内发布35项中标公告,披露总金额超15527.01万元。(由新战略移动机器人全
Mar. 5, 2025 产业洞察根据TrendForce集邦咨询最新研究,TSMC(台积电)近日宣布提高在美国的先进半导体制造投资,总金额达1650亿美元,若新增的三座厂区扩产进度顺利,预计最快20
本文来源:物联网展行业变革:“位置即服务”正催生万亿级市场裂变数据洞察:2025年全球GNSS市场规模预计达680亿美元,年复合增长率28%,其中智能穿戴、资产追踪、工业安全三大场景贡献超50%。增量
引言 嘿,各位电动汽车的爱好者们!咱们今儿个就来聊聊电动汽车里那些“看不见,摸不着”,但又至关重要的零部件。要说电动汽车这玩意儿,那可真是科技含量满满,各种高精尖的技术都往里堆。但要让这些
差分运算放大电路,对共模信号得到有效抑制,而只对差分信号进行放大,因而得到广泛的应用。差分电路的电路构型    上图是差分电路。    目标处理电压:是采集处理电压,比如在系统中像母线电压的采集处理,
在储能行业蓬勃发展的浪潮中,安富利凭借卓越的技术实力与广泛的市场影响力,荣获2025“北极星杯”储能影响力BMS/EMS供应商奖。这一荣誉不仅是对安富利过往成就的高度认可,更是对其在储能领域持续创新与
3月4日,中国商务部接连发布三则公告,对26家美国实体/企业采取不同的管制措施。商务部公告2025年第13号显示,根据《中华人民共和国出口管制法》和《中华人民共和国两用物项出口管制条例》等法律法规有关
点击蓝字 关注我们SUBSCRIBE to USImage: SwitchBotSwitchBot价格实惠、可调节的智能窗帘终于问世了。SwitchBot窗帘(SwitchBot Roller Sha
为进一步推进商业信用体系建设,促进企业诚实守信经营,面向企业普及诚信与品牌建设的意义,指导企业加强诚信品牌建设,提升其整体竞争力,“崛起的民族品牌”专题系列节目以诚信为内涵,在全国范围内遴选出有行业代