Fujitsu、NVIDIA、AMD和Intel高性能处理器架构分析

智能计算芯世界 2023-06-30 07:30

商用高性能计算处理器市场主要被NVIDIA、AMD和Intel3家公司长期占据,在面向E级计算 的 高 性 能 处 理 器 中,AMD 最 新 的Instinct MI250X处理器双精度浮点运算能力已经高达95.7TFlops,NVIDIA和Intel最新发布的高性能处理器峰值性能也均达到了数十 TFlops。

本文主要分析和探讨国际上面向 E 级计算的先进高性能处理器的核心运算架构,包括 Fujitsu A64FX、NVIDIA H100、AMD MI250X 和 Intel PonteVecchio 4款高性能处理器,着重关注运算资源组织结构、数据和指令级并行方式、领域专用加速结构 DSA、支持数据类型和算力等方面,并总结和展望主流高性能处理器的运算架构研究发展现状和趋势,以期为国内自主研发面向后 E 级计算的高性能处理器提供技术参考和借鉴。

本文选自“面向E级计算的高性能处理器核心运算架构研究进展”。
自治故障管理系统推理规则的智能学习技术
基于监督学习的稀疏矩阵自动任务分配
基于某国产双路服务器的液冷散热性能实验研究
半导体行业报告:“硅”期已近,AI先行(2023)
生成式AI掀起产业智能化新浪潮
大模型+政策+功能:三重共振开启L3智能化
中国文化元宇宙AIGC发展研究报告(发布版)
机器视觉专题报告:AI+机器视觉,应用场景持续拓展

1、Fujitsu A64FX

Fujitsu A64FX 是由富士通(Fujitsu)在2018年发布的,主要用于构建日本原计划研发的首台 E级计算机 “后 京”(POST-K)[6],后 改 名 为 “富 岳”(Fugaku)并于2020年6月发布。目前,“富岳”超算在全球高性能计算机 TOP500榜单中排名第2,集成的 A64FX处理器芯片数量高达158976片,全机峰值性能为0.537212EFlops,Linpack实测性能为0.44201EFlops,效率为82.28%。


A64FX处理器结构框图如图1所示,分成4个处理核心存储组 CMG(CPU MemoryGroup),每个 CMG 包含13个同构核心、L2Cache和存储控制器,其中12个核心为计算核心,1个为辅助核心,用于运行操作系统和I/O 操作,全片共52个核心。每个 CMG 集成8GB 容量的 HBM2存储器,全片总容量为32GB,总带宽为 1024GB/s。
片上还集成了 PCIe3.016x接口和富士通特有的TofuD互连网络接口与路由器,这些外接口与4个CMG 通过片上网络 NoC(NetworkonChip)实现互连和通信。

A64FX 处理器采用台积电7nm 工艺和 CoWoS封装实现,集成了87.86亿晶体管,最高运行频率为2.2GHz,峰值性能为3.3792TFlops,功耗为200W。

2、NVIDIA H100

NVIDIA 在 HPC 和 人 工 智 能 AI商用处理器市场占比非常高,一直是图形处理器 GPU领域的佼佼者。TOP500最新榜单排行前20的超算系统中有11台采用了 NVIDIA 的 GPU 实现。目前这些超算算力主要由前两代 GPU 产品 V100和A100提供。


NVIDIA 于2022年3月发布了面向 HPC 和AI的最新款高性能处理器 H100GPU。该处理器采用 新 一 代 HOPPER 架 构,基 于 上 一 代 GPUA100的 Ampere架构主要进行了如下扩展:

  • (1)集成第4代张量核心(TensorCore);
  • (2)新增动态规划算法加速指令 DPX;
  • (3)流多处理器 SM内 CUDA核 数 量 翻 倍;
  • (4)与GPC相对应,强化线程块簇特征;
  • (5)新增 TMA引 擎,增 强 异 步 数 据 传 输 功 能;
  • (6)定 制Transformer引 擎,以 加 速 Transformer 模 型 训练;
  • (7)更新换代 HBM3、PCIe5.0和第4代 NVLink等存储和外接口。

H100的结 构 框 图如 图 2 所 示,全 片 实 际(非 GH100架构满配)集成了132个 SM,每2个SM 构成一个 TPC(TextureProcessingCluster),9个或8个 TPC构成一个 GPC,全片共8个 GPC。

每个SM 包含128个 FP32(单精度浮点)CUDA核和 4 个 TensorCore,全片共 16896 个 CUDA核,528个 TensorCore。

H100GPU 片上集成了50MB的L2Cache,5个16GB容量的 HBM3,存储总容量为80GB,总访存带 宽 为 3 TB/s。此 外,片 上 还 集 成 了 PCIe 5.0 16x和第 4 代 NVLink 外接口,支 持 与 CPU或 GPU 高速互连。

H100GPU 采 用 台 积 电 为 NVIDIA 定 制 的4N 工艺和 CoWOS封装实现,全片集成了800亿个晶体管,运行频率为1.776GHz(根据双精度浮点峰值性能和全片集成运算部件数量推算得到),峰值性能为 60.0TFlops,TDP功耗为700 W。

3、AMD MI250X

为进一步加强在 HPC领域的影响力,AMD将旗下通用 GPUGP拆分成 RDNA(RadeonDNA)和 CDNA(ComputeDNA)架构,前者主要面向实时游戏和图形处理,后者主要面向 HPC应用。

CDNA 架构目前已经发展到第2代 MI200,代表高性能处理器是 MI250X发布于2021年11月,并用于构建美国E级超算“前线”(Frontier)。“前 线”超 算 发 布 于 2022 年 5 月 30日,在全球高性能计算机 TOP500榜单中排名第1,集成的 MI250X 处理器芯片数量高达36992片,全机峰值性能为1.68565EFlops,Linpack实测性能为1.102EFlops,效率为65.38%。


MI250X处理器采用 AMD 特有的先进3D封装技 术 集 成 2 个 MI200 GCD(GraphicsComputeDie),2个 GCD 间通过无尽互连IF(Infinit Fabric)接口直连实现高带宽通信。MI250X 处理y器中单个 GCD(非 MI200满配)结构框图如图3所示,包含4个计算引擎 CE(ComputeEngine),每个 CE内含27或28个计算单元 CU(ComputeUnit)。MI250X 处 理 器 全 片 2 个 GCD 共 220 个CU;集成了16 MB 的 L2Cache;8个16GB 容量的 HBM2E,总容量为128GB、总带宽为3.2TB/s;8路IFLink或者6路IFLink加PCIe4.0接口(2路IF接口可重构配置成 PCIE4.0接口),支持GPU 和 CPU 多种可扩展高速互连。

MI250X处理器采用台积电 N6工艺实现,全片集成了 582 亿个晶体管,运行频率最高为 1.7GHz,峰值性能为 95.7TFlops,是首个峰值性能接近 100 TFlops的 高 性 能 处 理 器,TDP 功 耗 为560 W。

4、Intel PonteVecchio

Intel一直致力于重新赢得 HPC 领域的高性能处理器领导者地位,其精心打造的面向 E 级计算的高性能处理器 PonteVecchio于2021年8月在Intel体系结构日上发布,2023年1季度已上市。PonteVecchio处理器将用于构建2台美国 E级计 算 机 “极 光”(Aurora)和 “酋 长 岩”(ElCaptain),并为其提供主要算力,预计“极光”的超算峰值性能为1.0EFlops、“酋长岩”的超算峰值性能为2.0EFlops。

PonteVecchio处理器采用 X HPC架构实现,结构框图如图4所示。

PonteVecchio处理器通过多种先进封装集成2个同构的 Stack,Stack 间通过高速直连接口互连;全片共8个 Slice,每个 Slice包含16个 X 核心,总计128个 X 核心;全片集成了144 MB的共享 L2Cache;8个 HBM2E,总带宽超过5TB/s;16路 X Link,支持多 CPU 间高速直连,总带宽超过2TB/s;此外还集成了 PCIe5.0接口。

PonteVecchio处理器采用 5 种先进工艺实现,包括台积电5nm、7nm 和Intel 7nm 等,全片多 达 47 个 Tile (Die),通 过 Foveros和 EMIB等多种先进封装技术集成。全片集成了超过1000亿个晶体管,运行频率为1.373GHz(根据单精度浮点峰值性能和全片集成运算部件数量推算得到),峰值性能超过45.0TFlops(双精度浮点与单精度浮点相同),功耗暂无官方数据。

5、小结

4款面向 E级计算的高性能处理器参数与对比统计信息如表1所示,4款处理器均采用台积电7nm 或更先进工艺,集成密度高、晶体管数目庞大,通过先进封装集成高带宽存储器 HBM 提供TB/s级访存带宽,并采用商用大容量存储颗粒。


工作频 率 方 面,A64FX 的 较 高,达 到 了 2.2GHz,H100 和 MI250X 的 均 在 1.7 GHz 左 右,PonteVecchio的最低为1.373GHz;

峰值性能方面,A64FX 是唯一峰值性能低于10.0TFlops的处理器,其他3款的均超过45.0TFlops,MI250X的甚 至 高 达 95.7 TFlops;

功 耗 方 面,H100 和MI250X的均超过 500 W,PonteVecchio的无官方数据,预计也会超过500W。

先进封装技术方面,均采用了2.5D 或3D 封装,MI250X 还通过 EFB封装集成了2个 GCD,而 PonteVecchio采用 Foveros+EMIB 封装集成超过47个 Die,并通过多种先进工艺分别实现了计算 Die、存储 Die和互连 Die。

作者:吴铁彬、过锋、王谛
下载链接:

算力铸就大模型:超算、智算及数据中心行业报告(2023)

《2023年高性能计算研讨合集(上)》

《2023年高性能计算研讨合集(下)》

《AI基础知识深度专题详解合集》

2021 HPC市场份额Update剖析(附报告)
HPDA/AI市场表现Update浅析(附报告)
HPC市场份额剖析和全球超算计划(附报告)

Hyperion Research:SC22 HPC Market Update(2022.11)

Hyperion Research:ISC22 Market Update(2022.5)

Intersect360全球HPC-AI市场报告(2022—2026)

Intersect360 AMD CPU和GPU调研白皮书

ARM CPU处理器资料汇总(1)
ARM CPU处理器资料汇总(2)
ARM系列处理器应用技术完全手册
CPU和GPU研究框架合集
虚拟人应用与实践报告(2022)
2022中国商用服务机器人行业简析
CAD行业简析报告(2022)
半导体先进封装市场简析(2022)

《AIGC行业深度报告系列合集》

AIGC行业深度报告(9):华为算力编年史

8、AIGC行业报告(8):谁是国产英伟达

7、AIGC行业报告(7):ChatGPT三大主线,AI算力需求井喷

6、AIGC行业报告(6):ChatGPT存算一体,算力的下一极 5、AIGC行业报告(5):ChatGPT加速计算服务器时代到来  

1、AIGC行业报告(1):ChatGPT开启AI新纪元(华西证券) 2、AIGC行业报告(2):ChatGPT重新定义搜索入口 3、AIGC行业报告(3):ChatGPT打响AI算力“军备战” 4、AIGC行业报告(4):ChatGPT百度文心一言畅想

《70+篇半导体行业“研究框架”合集》
《42份智能网卡和DPU合集》
清华大学:AIGC发展研究1.0版
中国AIGC商用场景趋势捕捉指北(2023)
通用AI,通用技术,通向何方(2023)
276份重磅ChatGPT专业报告
《ARM v8/v9架构技术合集》
1、ARM Cortex-M3权威指南 2、ARM v8-v9架构入门指南
2023电子与半导体行业白皮书
ChatGPT+的前世今生(464页)
ARM CPU处理器资料汇总(1)
ARM CPU处理器资料汇总(2)
ARM系列处理器应用技术完全手册


本号资料全部上传至知识星球,更多内容请登录智能计算芯知识(知识星球)星球下载全部资料。




免责申明:本号聚焦相关技术分享,内容观点不代表本号立场,可追溯内容均注明来源,发布文章若存在版权等问题,请留言联系删除,谢谢。



温馨提示:

请搜索“AI_Architect”或“扫码”关注公众号实时掌握深度技术分享,点击“阅读原文”获取更多原创技术干货。


智能计算芯世界 聚焦人工智能、芯片设计、异构计算、高性能计算等领域专业知识分享.
评论
  • 首先在gitee上打个广告:ad5d2f3b647444a88b6f7f9555fd681f.mp4 · 丙丁先生/香河英茂工作室中国 - Gitee.com丙丁先生 (mr-bingding) - Gitee.com2024年对我来说是充满挑战和机遇的一年。在这一年里,我不仅进行了多个开发板的测评,还尝试了多种不同的项目和技术。今天,我想分享一下这一年的故事,希望能给大家带来一些启发和乐趣。 年初的时候,我开始对各种开发板进行测评。从STM32WBA55CG到瑞萨、平头哥和平海的开发板,我都
    丙丁先生 2024-12-11 20:14 69浏览
  • 在智能化技术快速发展当下,图像数据的采集与处理逐渐成为自动驾驶、工业等领域的一项关键技术。高质量的图像数据采集与算法集成测试都是确保系统性能和可靠性的关键。随着技术的不断进步,对于图像数据的采集、处理和分析的需求日益增长,这不仅要求我们拥有高性能的相机硬件,还要求我们能够高效地集成和测试各种算法。我们探索了一种多源相机数据采集与算法集成测试方案,能够满足不同应用场景下对图像采集和算法测试的多样化需求,确保数据的准确性和算法的有效性。一、相机组成相机一般由镜头(Lens),图像传感器(Image
    康谋 2024-12-12 09:45 75浏览
  • 天问Block和Mixly是两个不同的编程工具,分别在单片机开发和教育编程领域有各自的应用。以下是对它们的详细比较: 基本定义 天问Block:天问Block是一个基于区块链技术的数字身份验证和数据交换平台。它的目标是为用户提供一个安全、去中心化、可信任的数字身份验证和数据交换解决方案。 Mixly:Mixly是一款由北京师范大学教育学部创客教育实验室开发的图形化编程软件,旨在为初学者提供一个易于学习和使用的Arduino编程环境。 主要功能 天问Block:支持STC全系列8位单片机,32位
    丙丁先生 2024-12-11 13:15 63浏览
  • 习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习笔记&记录学习习笔记&记学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记
    youyeye 2024-12-12 10:13 36浏览
  • 全球智能电视时代来临这年头若是消费者想随意地从各个通路中选购电视时,不难发现目前市场上的产品都已是具有智能联网功能的智能电视了,可以宣告智能电视的普及时代已到临!Google从2021年开始大力推广Google TV(即原Android TV的升级版),其他各大品牌商也都跟进推出搭载Google TV操作系统的机种,除了Google TV外,LG、Samsung、Panasonic等大厂牌也开发出自家的智能电视平台,可以看出各家业者都一致地看好这块大饼。智能电视的Wi-Fi连线怎么消失了?智能电
    百佳泰测试实验室 2024-12-12 17:33 46浏览
  • RK3506 是瑞芯微推出的MPU产品,芯片制程为22nm,定位于轻量级、低成本解决方案。该MPU具有低功耗、外设接口丰富、实时性高的特点,适合用多种工商业场景。本文将基于RK3506的设计特点,为大家分析其应用场景。RK3506核心板主要分为三个型号,各型号间的区别如下图:​图 1  RK3506核心板处理器型号场景1:显示HMIRK3506核心板显示接口支持RGB、MIPI、QSPI输出,且支持2D图形加速,轻松运行QT、LVGL等GUI,最快3S内开
    万象奥科 2024-12-11 15:42 86浏览
  • 一、SAE J1939协议概述SAE J1939协议是由美国汽车工程师协会(SAE,Society of Automotive Engineers)定义的一种用于重型车辆和工业设备中的通信协议,主要应用于车辆和设备之间的实时数据交换。J1939基于CAN(Controller Area Network)总线技术,使用29bit的扩展标识符和扩展数据帧,CAN通信速率为250Kbps,用于车载电子控制单元(ECU)之间的通信和控制。小北同学在之前也对J1939协议做过扫盲科普【科普系列】SAE J
    北汇信息 2024-12-11 15:45 110浏览
  • 铁氧体芯片是一种基于铁氧体磁性材料制成的芯片,在通信、传感器、储能等领域有着广泛的应用。铁氧体磁性材料能够通过外加磁场调控其导电性质和反射性质,因此在信号处理和传感器技术方面有着独特的优势。以下是对半导体划片机在铁氧体划切领域应用的详细阐述: 一、半导体划片机的工作原理与特点半导体划片机是一种使用刀片或通过激光等方式高精度切割被加工物的装置,是半导体后道封测中晶圆切割和WLP切割环节的关键设备。它结合了水气电、空气静压高速主轴、精密机械传动、传感器及自动化控制等先进技术,具有高精度、高
    博捷芯划片机 2024-12-12 09:16 85浏览
  • 习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习笔记&记录学习习笔记&记学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记
    youyeye 2024-12-11 17:58 86浏览
  • 近日,搭载紫光展锐W517芯片平台的INMO GO2由影目科技正式推出。作为全球首款专为商务场景设计的智能翻译眼镜,INMO GO2 以“快、准、稳”三大核心优势,突破传统翻译产品局限,为全球商务人士带来高效、自然、稳定的跨语言交流体验。 INMO GO2内置的W517芯片,是紫光展锐4G旗舰级智能穿戴平台,采用四核处理器,具有高性能、低功耗的优势,内置超微高集成技术,采用先进工艺,计算能力相比同档位竞品提升4倍,强大的性能提供更加多样化的应用场景。【视频见P盘链接】 依托“
    紫光展锐 2024-12-11 11:50 72浏览
  • 本文介绍瑞芯微RK3588主板/开发板Android12系统下,APK签名文件生成方法。触觉智能EVB3588开发板演示,搭载了瑞芯微RK3588芯片,该开发板是核心板加底板设计,音视频接口、通信接口等各类接口一应俱全,可帮助企业提高产品开发效率,缩短上市时间,降低成本和设计风险。工具准备下载Keytool-ImportKeyPair工具在源码:build/target/product/security/系统初始签名文件目录中,将以下三个文件拷贝出来:platform.pem;platform.
    Industio_触觉智能 2024-12-12 10:27 49浏览
  • 应用环境与极具挑战性的测试需求在服务器制造领域里,系统整合测试(System Integration Test;SIT)是确保产品质量和性能的关键步骤。随着服务器系统的复杂性不断提升,包括:多种硬件组件、操作系统、虚拟化平台以及各种应用程序和服务的整合,服务器制造商面临着更有挑战性的测试需求。这些挑战主要体现在以下五个方面:1. 硬件和软件的高度整合:现代服务器通常包括多个处理器、内存模块、储存设备和网络接口。这些硬件组件必须与操作系统及应用软件无缝整合。SIT测试可以帮助制造商确保这些不同组件
    百佳泰测试实验室 2024-12-12 17:45 43浏览
  • 时源芯微——RE超标整机定位与解决详细流程一、 初步测量与问题确认使用专业的电磁辐射测量设备,对整机的辐射发射进行精确测量。确认是否存在RE超标问题,并记录超标频段和幅度。二、电缆检查与处理若存在信号电缆:步骤一:拔掉所有信号电缆,仅保留电源线,再次测量整机的辐射发射。若测量合格:判定问题出在信号电缆上,可能是电缆的共模电流导致。逐一连接信号电缆,每次连接后测量,定位具体哪根电缆或接口导致超标。对问题电缆进行处理,如加共模扼流圈、滤波器,或优化电缆布局和屏蔽。重新连接所有电缆,再次测量
    时源芯微 2024-12-11 17:11 109浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦