国产AI的希望!摩尔线程夸娥千卡集群化解AI算力国产化难题

硬件世界 2024-06-06 23:41

这是一个AI的时代,这是一个算力的时代。

遗憾的是,我们已经无缘接触到最先进的AI硬件和算力,用着H20这样阉割两次的N卡,还要支付上百亿元的费用,实在憋屈。

面对持续上涨的AI算力需求,我们唯有发展自己的国产方案,发展自己的大规模AI算力集群,才能突破围追堵截,走上康庄大道。

说到这里,很多人或许会第一时间想到华为,在美国制裁下顽强屹立突破的中国企业标杆,昇腾910B在AI算力领域也取得了一定的成就。

当然了,中国只依靠一个华为是不够的。中国的AI生态需要遍地开花,才有可能多点突破,让生态更繁荣。

目前来看,摩尔线程以全功能GPU走通用计算路线是另一条希望之路,尤其是它已经成为华为之外,另一家可以实现千卡千亿参数大模型训推的全国产AI芯片公司。

说起来,大家对摩尔线程并不陌生,其堪称中国自主GPU最大的希望,但很多人对摩尔线程的认知还停留在国产游戏显卡,其实不然,摩尔线程在AI上也实力突出。

自成立以来,摩尔线程做的就是通用GPU,跟英伟达一样,除了图形渲染,也能用于AI人工智能加速、科学计算。

经过三年多潜心发展,摩尔线程在AI GPU方面已经展现了强劲的实力,构建了一张从芯片、板卡、服务器,到集群、软件栈的全栈AI智算产品版图,并且已经多点落地、处处开花。

比如和清华系AI大模型公司无问芯穹的合作。摩尔线程是第一家接入无问芯穹,并成功完成千卡级别大模型训练的国产GPU公司。

摩尔线程的“夸娥”(KUAE)千卡智算集群,已与无穹Infini-AI大模型开发与服务平台完成系统级融合适配,并完成了LLama2 700亿参数大模型的训练测试。近期,双方又完成了“MT-infini-3B” 3B(30亿参数)大模型的实训。

这意味着什么呢?这是行业首个基于国产GPU芯片的从0到1的端到端大模型实训案例。夸娥也成为业内首个成功跑通并完整运行国产大模型的千卡集群。

无问芯穹联合创始人兼CEO夏立雪表示力挺:“经过无问芯穹Infini-AI平台的实训与联合优化工作验证,摩尔线程夸娥千卡智算集群在精度、性能、易用性和算力利用率上均有优异表现,而且在实训中实现了长时间稳定训练不中断,可以为千亿参数级别大模型训练提供持续高效的高性能算力支持。

另外,滴普科技、实在智能等也基于摩尔线程的夸娥千卡智算集群,成功完成了不同参数量级的大模型分布式训练测试,效率、精度、稳定性都相当完美。基于摩尔线程夸娥千卡智算集群,滴普科技成功完成了700亿参数LLaMA2大语言模型的预训练测试,训练时长共计77小时,全程无故障连续运行,集群训练稳定性达到100%。

夸娥(KUAE)是摩尔线程推出的智算中心全栈解决方案,而夸娥这个名字来自我国神话传说中的大力神夸娥氏,

可以说,为AI算力集群取这么一个名字,充分展现了独属于中国人的坚忍不拔和浪漫情怀。出自《愚公移山》:“帝感其诚,命夸娥氏二子负二山,一厝朔东,一厝雍南。自此,冀之南,汉之阴,无陇断焉。”

夸娥解决方案的基本节点是大模型智算加速卡MTT S4000组成的双路八卡GPU服务器“MCCX D800”,以软硬件一体化交付、开箱即用的方式,高可靠地解决大规模GPU算力的建设和运营管理问题。

MTT S4000是摩尔线程新一代专为AI大模型打造的智算加速卡,基于其自主研发的第三代MUSA架构。

利用自研的MTLink互连技术,MTT S4000可以高效千卡并行,线性加速比高达91%以上。

最为关键的是,摩尔线程拥有自研的全功能GPU MUSA统一系统架构,包括指令集架构、MUSA 编程模型、驱动、运行时库、算子库、通讯库、数学库等,而且充分兼容CUDA软件生态,代码可以几乎零成本迁移,也无需担心未来的可用性问题。

MTT S4000不但可用于大规模AI计算,还具备领先的图形渲染能力、视频编解码能力、8K超高清显示能力。

这使得它可为数字孪生、云游戏、云渲染、数字内容创作等场景提供支持,并配合大模型推理能力,服务于AIGC等多模态业务场景。

从2024年的趋势来看,多模态需求将快速崛起,英伟达CFO Colette Kress曾预计这块业务将从零增长至数十亿美元,对国产芯片来说也同样如此。

MCCX D800作为AI大模型训推一体机,是专为支持MTT S4000大模型智算加速卡充分发挥其训练与推理性能、稳定性、可靠性的服务器系统,同时兼容主流GPU软硬件生态。

就这样,从核心基础层面的MUSA统一架构芯片,到性能强大、可灵活部署的MTT S系列智算加速卡,到高度整合、完整方案的训推一体机,到小型的智算微模块,最终到夸娥千卡集群,摩尔线程提供了全套的全功能GPU产品组合。

如此一来,不同需求的客户,都可以根据实际情况,选择最适合自己的对应层级方案。

夸娥智算中心全栈解决方案,包括底层的以夸娥计算集群为核心的基础设施、中间层的KUAE Platform集群管理平台、最上层的KUAE Model Studio大模型平台,软硬一体开箱即用,一站式方案,一体化交付。

首先在基础设施方面,全功能GPU是最坚定的基石,具备AI加速计算、3D图形渲染、超清视频编解码、物理仿真和科学计算四大计算引擎,在功能上是国内唯一可以对标NVIDIA的全功能国产GPU。

其次是软硬一体,因为与传统GPU从芯片到卡的路径不同,摩尔线程走的是系统级平台路线,不但有千卡规模的算力集群,还有集群管理平台、大模型平台,从而做到软硬结合,以一体化交付的方式,解决大规模GPU算力的建设和运营管理问题。

最后是全栈方案,从底层基础设施,到中间层管理平台,再到上层应用,摩尔线程做到了全面覆盖,具备云全栈能力,能够有效地为千亿参数大模型训练和推理提供强大支持。

总结来说,夸娥智算集群全栈方案有8大核心优势:

一是广泛模型覆盖,支持包括LLaMA、GLM、Aquila、Baichuan、GPT、Bloom、玉言等数十种业界主流的多种大模型的训练和微调。

二是CUDA主流生态兼容,可利用摩尔线程代码移植工具Musify,几乎零成本地将CUDA代码自动迁移到摩尔线程统一系统架构MUSA,再快速完成优化,而且完全独立可靠。

三是断点续训,可以实时监测训练任务集群,分钟级发现故障,并自动恢复训练,再加上检查点备份恢复,可以大大降低故障率,并将综合训练效率提升15-50%。

四是大模型分布式训练,支持DeepSpeed、Megatron-DeepSpeed、Colossal-AI、FlagScale等业界主流分布式框架,并融合多种并行算法策略,还支持大模型分布式训练断点续训、分布式推理。

五是推理加速,包含了KUAEModel Studio一体化应用平台、MUSA Serving推理服务软件、MT Transformer分布式推理加速框架、TensorX推理加速框架四大部分,可以有效支持主流大语言模型推理。

六是高性能通信,包括2/4/8卡节点内互连、PCIe和自主研发的MT-Link链路带宽聚合、自研MCCL集合通讯库等,MT-Link带宽高达112GB/s。

七是高性能存储,支持存储数据经RDMA网络读写、GPU Direct Storage、数据读写加速、数据缓存加速、AI训练数据集加载加速、高性能并行文件系统、与外部存储交换冷热数据,等等。

八是集群可靠性与性能,完全可以支持万卡以上大规模GPU集群的运行。

历史无数次证明,越是艰难时刻,越需要国人勇敢地站出来,独立自主,打破封锁,AI算力时代亦是如此。

作为国内率先落地的首个以全功能GPU为底座的全国产千卡千亿模型训练平台,摩尔线程夸娥千卡集群方案实现了软硬设计、性能算力、生态应用的多方面突破,凭借自研软硬架构与开发平台、通用计算路线,具备多方面的独特优势。

尤其是在恶劣的国际环境下,在我国GPU技术相对薄弱的情况下,摩尔线程是最有希望破局的,全功能GPU唯一可以在功能上对标媲美英伟达,尤其是摩尔线程的创始团队基本都出自英伟达,创始人张建中是原英伟达全球副总裁、中国区总经理,不但有着丰富的行业经验、雄厚的技术功底,更能做到知己知彼。

而在技术之外,GPU行业也迎来了政策利好,更有利于实现突围。

比如北京市近期发布的《北京市算力基础设施建设实施方案(2024-2027年)》就明确提出,加快推动核心软硬件产品自主可控,建设自主可控算力技术体系,推动人工智能大模型与自主可控芯片开展适配。

对于采购自主可控GPU芯片、开展智能算力服务的企业,按照投资额的一定比例给予支持,加速实现智算资源供给自主可控。

从千卡高效互连的算力领先,到软硬一体的高度优化,从大模型训练与推理一体化,到高度的稳定性与可靠性,摩尔线程夸娥千卡集群在各个方面都已经拥有成熟的经验,堪称“中国英伟达”,最有希望实现国产自主替代,解决国内AI算力紧缺的难题。


硬件世界 共同研究探讨硬件知识及相关信息
评论
  • 当前,智能汽车产业迎来重大变局,随着人工智能、5G、大数据等新一代信息技术的迅猛发展,智能网联汽车正呈现强劲发展势头。11月26日,在2024紫光展锐全球合作伙伴大会汽车电子生态论坛上,紫光展锐与上汽海外出行联合发布搭载紫光展锐A7870的上汽海外MG量产车型,并发布A7710系列UWB数字钥匙解决方案平台,可应用于数字钥匙、活体检测、脚踢雷达、自动泊车等多种智能汽车场景。 联合发布量产车型,推动汽车智能化出海紫光展锐与上汽海外出行达成战略合作,联合发布搭载紫光展锐A7870的量产车型
    紫光展锐 2024-12-03 11:38 101浏览
  • RDDI-DAP错误通常与调试接口相关,特别是在使用CMSIS-DAP协议进行嵌入式系统开发时。以下是一些可能的原因和解决方法: 1. 硬件连接问题:     检查调试器(如ST-Link)与目标板之间的连接是否牢固。     确保所有必要的引脚都已正确连接,没有松动或短路。 2. 电源问题:     确保目标板和调试器都有足够的电源供应。     检查电源电压是否符合目标板的规格要求。 3. 固件问题: &n
    丙丁先生 2024-12-01 17:37 100浏览
  • TOF多区传感器: ND06   ND06是一款微型多区高集成度ToF测距传感器,其支持24个区域(6 x 4)同步测距,测距范围远达5m,具有测距范围广、精度高、测距稳定等特点。适用于投影仪的无感自动对焦和梯形校正、AIoT、手势识别、智能面板和智能灯具等多种场景。                 如果用ND06进行手势识别,只需要经过三个步骤: 第一步&
    esad0 2024-12-04 11:20 52浏览
  • 最近几年,新能源汽车愈发受到消费者的青睐,其销量也是一路走高。据中汽协公布的数据显示,2024年10月,新能源汽车产销分别完成146.3万辆和143万辆,同比分别增长48%和49.6%。而结合各家新能源车企所公布的销量数据来看,比亚迪再度夺得了销冠宝座,其10月新能源汽车销量达到了502657辆,同比增长66.53%。众所周知,比亚迪是新能源汽车领域的重要参与者,其一举一动向来为外界所关注。日前,比亚迪汽车旗下品牌方程豹汽车推出了新车方程豹豹8,该款车型一上市就迅速吸引了消费者的目光,成为SUV
    刘旷 2024-12-02 09:32 119浏览
  • 遇到部分串口工具不支持1500000波特率,这时候就需要进行修改,本文以触觉智能RK3562开发板修改系统波特率为115200为例,介绍瑞芯微方案主板Linux修改系统串口波特率教程。温馨提示:瑞芯微方案主板/开发板串口波特率只支持115200或1500000。修改Loader打印波特率查看对应芯片的MINIALL.ini确定要修改的bin文件#查看对应芯片的MINIALL.ini cat rkbin/RKBOOT/RK3562MINIALL.ini修改uart baudrate参数修改以下目
    Industio_触觉智能 2024-12-03 11:28 87浏览
  • 光伏逆变器是一种高效的能量转换设备,它能够将光伏太阳能板(PV)产生的不稳定的直流电压转换成与市电频率同步的交流电。这种转换后的电能不仅可以回馈至商用输电网络,还能供独立电网系统使用。光伏逆变器在商业光伏储能电站和家庭独立储能系统等应用领域中得到了广泛的应用。光耦合器,以其高速信号传输、出色的共模抑制比以及单向信号传输和光电隔离的特性,在光伏逆变器中扮演着至关重要的角色。它确保了系统的安全隔离、干扰的有效隔离以及通信信号的精准传输。光耦合器的使用不仅提高了系统的稳定性和安全性,而且由于其低功耗的
    晶台光耦 2024-12-02 10:40 120浏览
  • 11-29学习笔记11-29学习笔记习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习笔记&记录学习习笔记&记学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&学习学习笔记&记录学习学习笔记&记录学习学习笔记&记
    youyeye 2024-12-02 23:58 73浏览
  • 作为优秀工程师的你,已身经百战、阅板无数!请先醒醒,新的项目来了,这是一个既要、又要、还要的产品需求,ARM核心板中一个处理器怎么能实现这么丰富的外围接口?踌躇之际,你偶阅此文。于是,“潘多拉”的魔盒打开了!没错,USB资源就是你打开新世界得钥匙,它能做哪些扩展呢?1.1  USB扩网口通用ARM处理器大多带两路网口,如果项目中有多路网路接口的需求,一般会选择在主板外部加交换机/路由器。当然,出于成本考虑,也可以将Switch芯片集成到ARM核心板或底板上,如KSZ9897、
    万象奥科 2024-12-03 10:24 68浏览
  • 概述 说明(三)探讨的是比较器一般带有滞回(Hysteresis)功能,为了解决输入信号转换速率不够的问题。前文还提到,即便使能滞回(Hysteresis)功能,还是无法解决SiPM读出测试系统需要解决的问题。本文在说明(三)的基础上,继续探讨为SiPM读出测试系统寻求合适的模拟脉冲检出方案。前四代SiPM使用的高速比较器指标缺陷 由于前端模拟信号属于典型的指数脉冲,所以下降沿转换速率(Slew Rate)过慢,导致比较器检出出现不必要的问题。尽管比较器可以使能滞回(Hysteresis)模块功
    coyoo 2024-12-03 12:20 111浏览
  •         温度传感器的精度受哪些因素影响,要先看所用的温度传感器输出哪种信号,不同信号输出的温度传感器影响精度的因素也不同。        现在常用的温度传感器输出信号有以下几种:电阻信号、电流信号、电压信号、数字信号等。以输出电阻信号的温度传感器为例,还细分为正温度系数温度传感器和负温度系数温度传感器,常用的铂电阻PT100/1000温度传感器就是正温度系数,就是说随着温度的升高,输出的电阻值会增大。对于输出
    锦正茂科技 2024-12-03 11:50 111浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦