英伟达芯片,最新路线图

美股研究社 2023-10-12 20:10

来源 | 半导体行业观察


众所周知,随着生成式AI的大热,英伟达正在数据中心领域大杀四方,这也帮助他们实现了更好的业绩。根据公司公布的数据,截至 2023 年 7 月 30 日的第二季度,英伟达收入为 135.1 亿美元,较上一季度增长 88%,较去年同期增长 101%。


不过,英伟达目前的业绩预期很多都是基于当前的芯片和硬件所做的。但有分析人士预计,如果包含企业 AI 及其 DGX 云产品,该数据中心的市场规模将至少是游戏市场的 3 倍,甚至是 4.5 倍。


瑞银分析师Timothy Arcuri也表示,英伟达目前在DGX云计算方面的收入约为10亿美元。但在与客户交谈后,他认为,该公司每年可能从该部门获得高达100亿美元的收入。他给出的理由是Nvidia仍然可以在DGX云上添加额外的产品,包括预先训练的模型,访问H100 GPU等等。他说,现在这些领先GPU仍然“非常难”获得访问,能够根据需要扩大和缩小规模,并与现有的云或内部部署基础设施“基本上无缝集成”。


因此,英伟达在最近公布了一个包括H200、B100、X100、B40、X40、GB200、GX200、GB200NVL、GX200NVL 等新部件在内的产品路线图,这对英伟达未来的发展非常重要。

01

数据中心路线图

根据servethehome披露的路线图,英伟达的一项重大变化是他们现在将其基于 Arm 的产品和基于 x86 的产品分开,其中 Arm 处于领先地位。作为参考,普通客户现在甚至无法购买 NVIDIA Grace 或 Grace Hopper,因此在 2023-2025 年路线图的堆栈中显示它是一个重要的细节。以下是 NVIDIA 提出的路线图:
在Arm方面,英伟达计划将在2024年推出GH200NVL,在2024年推出GB200NVL,然后在2025年推出GX200NVL。我们已经看到 x86 NVL 系列与NVIDIA H100 NVL一起推出,但这些都是基于 Arm 的解决方案。然后是 2024 年推出的 GH200NVL。还有快速跟随的 GB200NVL,然后是 GX200NVL。还有非 NVL 版本。

在NVIDIA 宣布推出双配置的新型 NVIDIA Hopper 144GB HBM3e 型号(可能最终成为 GH200NVL)的时候,我们介绍了具有 142GB/144GB 内存的 GH200 (非 NVL)。据介绍,与当前一代产品相比,双配置的内存容量增加了 3.5 倍,带宽增加了 3 倍,包括一台具有 144 个 ArmNeoverse 核心、8 petaflops 的 AI 性能和 282GB 最新 HBM3e内存技术的产品。
GB200 将成为 2024 年的下一代加速器,GX200 将成为 2025 年的下一代加速器。

面向 x86 市场,英伟达预计 2024 年将推出 H200,它会在 Hopper 架构上进行更新,并具有更多内存。B100和B40是下一代架构部件,随后是2025年的X100和X40。考虑到B40和X40位于“企业”赛道上,而当前的L40S是PCIe卡,因此这些可能是PCIe卡。

在网络方面,Infiniband 和以太网都将于 2024 年从 400Gbps 发展到 800Gbps,然后在 2025 年达到 1.6Tbps。鉴于我们已经在 2023 年初研究了 Broadcom Tomahawk 4 和交换机,并看到了合作伙伴今年的800G Broadcom Tomahawk 5 交换机,感觉有点像 NVIDIA 以太网产品组合在以太网方面明显落后。Broadcom 的 2022-2023 年 800G 系列似乎与 NVIDIA 的 2024 年升级保持一致,NVIDIA 在 2023 年中期宣布了 Spectrum 4,而Tomahawk 5 则在大约 21-22 个月前宣布。在业界,芯片发布与投入生产之间通常存在很大的差距。
由此可见,在 Infiniband 方面,NVIDIA 是孤军奋战。从该路线图中,我们没有看到 NVSwitch/NVLink 路线图。

其他人工智能硬件公司应该会被 NVIDIA 的企业人工智能路线图吓到。在人工智能训练和推理领域,这意味着 2024 年将更新当前的 Hopper,然后在 2024 年晚些时候过渡到 Blackwell 一代,并在 2025 年采用另一种架构。

在 CPU 方面,我们最近已经看到了令人激动的更新节奏,x86 方面的核心数量之战出现了大幅增长。例如,英特尔的顶级 Xeon 核心数量预计从 2021 年第二季度初到2024 年第二季度将增加 10 倍以上。NVIDIA 在数据中心领域似乎也在紧跟这一步伐。对于构建芯片的人工智能初创公司来说,考虑到 NVIDIA 的新路线图步伐,这现在是一场竞赛。

对于英特尔、AMD,或许还有 Cerebras 来说,随着 NVIDIA 销售大型高利润芯片,他们的目标将会发生变化。它还将基于 Arm 的解决方案置于顶级赛道中,这样它不仅可以在 GPU/加速器方面获得高利润,而且可以在 CPU 方面获得高利润。

一个值得注意的落后者似乎是以太网方面,这感觉很奇怪。

02

精准的供应链控制

据semianalysis说法,英伟达之所以能够在群雄毕至的AI芯片市场一枝独秀,除了他们在硬件和软件上的布局外,对供应链的控制,也是英伟达能坐稳今天位置的一个重要原因。

英伟达过去多次表明,他们可以在短缺期间创造性地增加供应。英伟达愿意承诺不可取消的订单,甚至预付款,从而获得了巨大的供应。目前,Nvidia 有111.5 亿美元的采购承诺、产能义务和库存义务。Nvidia 还额外签订了价值 38.1 亿美元的预付费供应协议。单从这方面看,没有其他供应商可以与之相媲美,因此他们也将无法参与正在发生的狂热AI浪潮。

自 Nvidia 成立之初起,黄仁勋就一直积极布局其供应链,以推动 Nvidia 的巨大增长雄心。黄仁勋曾在重述了他与台积电创始人张忠谋的早期会面中表示:

“1997 年,当张忠谋和我相遇时,Nvidia 那一年的营收为 2700 万美元。我们有 100 个人,然后我们见面了。你们可能不相信这一点,但张忠谋曾经打销售电话。你以前经常上门拜访,对吗?你会进来拜访客户,我会向张忠谋解释英伟达做了什么,你知道,我会解释我们的芯片尺寸需要有多大,而且每年都会变得越来越大而且更大。你会定期回到英伟达,让我再讲一遍这个故事,以确保我需要那么多晶圆,明年,我们开始与台积电合作。Nvidia 做到了,我认为是 1.27 亿,然后,从那时起,我们每年增长近 100%,直到现在。”
张忠谋一开始不太相信英伟达需要这么多晶圆,但黄仁勋坚持了下来,并利用了当时游戏行业的巨大增长。英伟达通过大胆供应而取得了巨大成功,而且通常情况下他们都是成功的。当然,他们必须时不时地减记价值数十亿美元的库存,但他们仍然从超额订购中获得了积极的收益。

如果某件事有效,为什么要改变它?

最近这一次,英伟达又抢走了SK海力士、三星、美光HBM的大部分供应,这是GPU和AI芯片正在追逐的又一个核心。英伟达向所有 3 个 HBM 供应商下了非常大的订单,并且正在挤出除Broadcom/Google之外的其他所有人的供应。

此外,Nvidia 还已经买下了台积电 CoWoS 的大部分供应。但他们并没有就此止步,他们还出去考察并买下了Amkor的产能。

Nvidia 还利用了 HGX 板或服务器所需的许多下游组件,例如重定时器、DSP、光学器件等。拒绝英伟达要求的供应商通常会受到“胡萝卜加大棒”的对待。一方面,他们可以从英伟达那里获得看似难以想象的订单,另一方面,他们也面临着被英伟达现有供应链所设计的问题。他们仅在供应商至关重要并且无法设计出来或多源时才使用提交和不可取消。

每个供应商似乎都认为自己是人工智能赢家,部分原因是英伟达从他们那里订购了大量订单,而且他们都认为自己赢得了大部分业务,但实际上,英伟达的发展速度是如此之快,甚至已经超出了他们的想想。

回到上面的市场动态,虽然 Nvidia 的目标是明年数据中心销售额超过 700 亿美元,但只有 Google 拥有足够的上游产能,能够拥有超过 100 万个规模的有意义的单元。即使AMD最新调整了产能,他们在AI方面的总产能仍然非常温和,最高只有几十万台。

03

精明的商业计划

众所周知,Nvidia 正在利用 GPU 的巨大需求,利用 GPU 向客户进行追加销售和交叉销售。供应链上的多位消息人士告诉semianalysis,英伟达正在基于多种因素对企业进行优先分配,这些因素包括但不限于:多方采购计划、计划生产自己的人工智能芯片、购买英伟达的 DGX、网卡、交换机和光学器件等。

Semianalysis指出,CoreWeave、Equinix、Oracle、AppliedDigital、Lambda Labs、Omniva、Foundry、Crusoe Cloud 和 Cirrascale 等基础设施提供商所面临的分配的产品数量远比亚马逊等大型科技公司更接近其潜在需求。

据semianalysis所说,事实上,Nvidia 的捆绑销售非常成功,尽管之前是一家规模很小的光收发器供应商,但他们的业务在 1 季度内增长了两倍,并有望在明年实现价值超过 10 亿美元的出货量。这远远超过了 GPU 或网络芯片业务的增长率。

而且,这些策略是经过深思熟虑的,例如目前,在 Nvidia 系统上通过可靠的 RDMA/RoCE 实现 3.2T 网络的唯一方法是使用 Nvidia 的 NIC。这主要是因为Intel、AMD、Broadcom缺乏竞争力,仍然停留在200G。

在Semianalysis开来,Nvidia正在趁机管理其供应链,使其 400G InfiniBand NIC 的交货时间明显低于 400G 以太网 NIC。请记住,两个 NIC (ConnectX-7) 的芯片和电路板设计是相同的。这主要取决于 Nvidia 的 SKU 配置,而不是实际的供应链瓶颈。这迫使公司购买 Nvidia 更昂贵的 InfiniBand 交换机,而不是使用标准以太网交换机。当您购买具有 NIC 模式 Bluefield-3 DPU 的 Spectrum-X 以太网网络时,Nvidia 会破例。

事情还不止于此,看看供应链对 L40 和 L40S GPU 的疯狂程度就知道了。

Semianalysis透露,为了让那些原始设备制造商赢得更多的 H100 分配,Nvidia 正在推动 L40S的销售,这些 OEM 也面临着购买更多 L40S 的压力,进而获得更好的 H100 分配。这与 Nvidia 在 PC 领域玩的游戏相同,笔记本电脑制造商和 AIB 合作伙伴必须购买大量的 G106/G107(中端和低端 GPU),才能为更稀缺、利润率更高的 G102/G104 获得良好的分配(高端和旗舰 GPU)。

台湾供应链中的许多人都被认为 L40S 比 A100 更好,因为它的 FLOPS 更高。需要明确的是,这些 GPU 不适合 LLM 推理,因为它们的内存带宽不到 A100 的一半,而且没有 NVLink。这意味着除了非常小的模型之外,以良好的总体拥有成本在它们上运行LLM几乎是不可能的。高批量大小(High batch sizes)具有不可接受的令牌/秒/用户(tokens/second/user),使得理论上的 FLOPS 在实践中对于 LLM 毫无用处。

Semianalysis说,OEM 厂商也面临着支持 Nvidia 的 MGX 模块化服务器设计平台的压力。这有效地消除了设计服务器的所有艰苦工作,但同时也使其商品化,创造了更多竞争并压低了 OEM 的利润。戴尔、HPE 和联想等公司显然对 MGX 持抵制态度,但台湾的低成本公司,如超微、广达、华硕、技嘉、和硕和华擎,正在急于填补这一空白,并将低成本“企业人工智能”商品化。

当然,这些参与 L40S 和 MGX 游戏的 OEM/ODM 也获得了 Nvidia 主线 GPU 产品更好的分配。

虽然英伟达正在面临着芯片厂商和系统厂商自研芯片的夹击。但这些布局,似乎短期内都能让英伟达高枕无忧。他们依然会是AI时代最成功的“卖铲人”。

END

美股研究社(meigushe)所发布文章不具有投资建议,请各位投资者自行判断。




听说好看的人都点赞了~

美股研究社 美股研究社,一个专注研究美股的平台,专业的美股投资人都在这.想了解美国股市行情、美股开户、美股资讯、美股公司;
评论
  • 时源芯微——RE超标整机定位与解决详细流程一、 初步测量与问题确认使用专业的电磁辐射测量设备,对整机的辐射发射进行精确测量。确认是否存在RE超标问题,并记录超标频段和幅度。二、电缆检查与处理若存在信号电缆:步骤一:拔掉所有信号电缆,仅保留电源线,再次测量整机的辐射发射。若测量合格:判定问题出在信号电缆上,可能是电缆的共模电流导致。逐一连接信号电缆,每次连接后测量,定位具体哪根电缆或接口导致超标。对问题电缆进行处理,如加共模扼流圈、滤波器,或优化电缆布局和屏蔽。重新连接所有电缆,再次测量
    时源芯微 2024-12-11 17:11 80浏览
  • 智能汽车可替换LED前照灯控制运行的原理涉及多个方面,包括自适应前照灯系统(AFS)的工作原理、传感器的应用、步进电机的控制以及模糊控制策略等。当下时代的智能汽车灯光控制系统通过车载网关控制单元集中控制,表现特殊点的有特斯拉,仅通过前车身控制器,整个系统就包括了灯光旋转开关、车灯变光开关、左LED前照灯总成、右LED前照灯总成、转向柱电子控制单元、CAN数据总线接口、组合仪表控制单元、车载网关控制单元等器件。变光开关、转向开关和辅助操作系统一般连为一体,开关之间通过内部线束和转向柱装置连接为多,
    lauguo2013 2024-12-10 15:53 85浏览
  •         霍尔传感器是根据霍尔效应制作的一种磁场传感器。霍尔效应是磁电效应的一种,这一现象是霍尔(A.H.Hall,1855—1938)于1879年在研究金属的导电机构时发现的。后来发现半导体、导电流体等也有这种效应,而半导体的霍尔效应比金属强得多,利用这现象制成的各种霍尔元件,广泛地应用于工业自动化技术、检测技术及信息处理等方面。霍尔效应是研究半导体材料性能的基本方法。通过霍尔效应实验测定的霍尔系数,能够判断半导体材料的导电类型、载流子浓度及载流子
    锦正茂科技 2024-12-10 11:07 64浏览
  • RK3506 是瑞芯微推出的MPU产品,芯片制程为22nm,定位于轻量级、低成本解决方案。该MPU具有低功耗、外设接口丰富、实时性高的特点,适合用多种工商业场景。本文将基于RK3506的设计特点,为大家分析其应用场景。RK3506核心板主要分为三个型号,各型号间的区别如下图:​图 1  RK3506核心板处理器型号场景1:显示HMIRK3506核心板显示接口支持RGB、MIPI、QSPI输出,且支持2D图形加速,轻松运行QT、LVGL等GUI,最快3S内开
    万象奥科 2024-12-11 15:42 71浏览
  • 【萤火工场CEM5826-M11测评】OLED显示雷达数据本文结合之前关于串口打印雷达监测数据的研究,进一步扩展至 OLED 屏幕显示。该项目整体分为两部分: 一、框架显示; 二、数据采集与填充显示。为了减小 MCU 负担,采用 局部刷新 的方案。1. 显示框架所需库函数 Wire.h 、Adafruit_GFX.h 、Adafruit_SSD1306.h . 代码#include #include #include #include "logo_128x64.h"#include "logo_
    无垠的广袤 2024-12-10 14:03 71浏览
  • 肖特基具有很多的应用场景, 可以做同步整流,防止电流倒灌和电源反接等,但是随着电源电流的增大,肖特基导通正向压降0.3~0.7v的劣势也越发明显,产生了很多的热,对于工程师的散热设计是个考验,增加了工程师的设计难度和产品成本,目前一种新的理想二极管及其控制器,目前正在得到越来越广泛的应用- BMS,无人机,PLC,安防,家电,电动工具,汽车等都在快速普及理想二极管有三种架构,内置电荷泵的类似无锡明芯微MX5050T这种,驱动能力会弱点,静态功耗200uA,外置电荷泵MX74700T的这种驱动能力
    王萌 2024-12-10 08:51 86浏览
  •         在有电流流过的导线周围会感生出磁场,再用霍尔器件检测由电流感生的磁场,即可测出产生这个磁场的电流的量值。由此就可以构成霍尔电流、电压传感器。因为霍尔器件的输出电压与加在它上面的磁感应强度以及流过其中的工作电流的乘积成比例,是一个具有乘法器功能的器件,并且可与各种逻辑电路直接接口,还可以直接驱动各种性质的负载。因为霍尔器件的应用原理简单,信号处理方便,器件本身又具有一系列的du特优点,所以在变频器中也发挥了非常重要的作用。  &nb
    锦正茂科技 2024-12-10 12:57 76浏览
  • 近日,搭载紫光展锐W517芯片平台的INMO GO2由影目科技正式推出。作为全球首款专为商务场景设计的智能翻译眼镜,INMO GO2 以“快、准、稳”三大核心优势,突破传统翻译产品局限,为全球商务人士带来高效、自然、稳定的跨语言交流体验。 INMO GO2内置的W517芯片,是紫光展锐4G旗舰级智能穿戴平台,采用四核处理器,具有高性能、低功耗的优势,内置超微高集成技术,采用先进工艺,计算能力相比同档位竞品提升4倍,强大的性能提供更加多样化的应用场景。【视频见P盘链接】 依托“
    紫光展锐 2024-12-11 11:50 51浏览
  • 概述 通过前面的研究学习,已经可以在CycloneVGX器件中成功实现完整的TDC(或者说完整的TDL,即延时线),测试结果也比较满足,解决了超大BIN尺寸以及大量0尺寸BIN的问题,但是还是存在一些之前系列器件还未遇到的问题,这些问题将在本文中进行详细描述介绍。 在五代Cyclone器件内部系统时钟受限的情况下,意味着大量逻辑资源将被浪费在于实现较大长度的TDL上面。是否可以找到方法可以对此前TDL的长度进行优化呢?本文还将探讨这个问题。TDC前段BIN颗粒堵塞问题分析 将延时链在逻辑中实现后
    coyoo 2024-12-10 13:28 102浏览
  • 全球知名半导体制造商ROHM Co., Ltd.(以下简称“罗姆”)宣布与Taiwan Semiconductor Manufacturing Company Limited(以下简称“台积公司”)就车载氮化镓功率器件的开发和量产事宜建立战略合作伙伴关系。通过该合作关系,双方将致力于将罗姆的氮化镓器件开发技术与台积公司业界先进的GaN-on-Silicon工艺技术优势结合起来,满足市场对高耐压和高频特性优异的功率元器件日益增长的需求。氮化镓功率器件目前主要被用于AC适配器和服务器电源等消费电子和
    电子资讯报 2024-12-10 17:09 88浏览
  • 习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习笔记&记录学习习笔记&记学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记
    youyeye 2024-12-10 16:13 110浏览
  • 天问Block和Mixly是两个不同的编程工具,分别在单片机开发和教育编程领域有各自的应用。以下是对它们的详细比较: 基本定义 天问Block:天问Block是一个基于区块链技术的数字身份验证和数据交换平台。它的目标是为用户提供一个安全、去中心化、可信任的数字身份验证和数据交换解决方案。 Mixly:Mixly是一款由北京师范大学教育学部创客教育实验室开发的图形化编程软件,旨在为初学者提供一个易于学习和使用的Arduino编程环境。 主要功能 天问Block:支持STC全系列8位单片机,32位
    丙丁先生 2024-12-11 13:15 50浏览
  • 本文介绍Linux系统(Ubuntu/Debian通用)挂载exfat格式U盘的方法,触觉智能RK3562开发板演示,搭载4核A53处理器,主频高达2.0GHz;内置独立1Tops算力NPU,可应用于物联网网关、平板电脑、智能家居、教育电子、工业显示与控制等行业。修改对应的内核配置文件# 进入sdk目录cdrk3562_linux# 编辑内核配置文件vi./kernel-5.10/arch/arm64/configs/rockchip_linux_defconfig注:不清楚内核使用哪个defc
    Industio_触觉智能 2024-12-10 09:44 92浏览
  • 一、SAE J1939协议概述SAE J1939协议是由美国汽车工程师协会(SAE,Society of Automotive Engineers)定义的一种用于重型车辆和工业设备中的通信协议,主要应用于车辆和设备之间的实时数据交换。J1939基于CAN(Controller Area Network)总线技术,使用29bit的扩展标识符和扩展数据帧,CAN通信速率为250Kbps,用于车载电子控制单元(ECU)之间的通信和控制。小北同学在之前也对J1939协议做过扫盲科普【科普系列】SAE J
    北汇信息 2024-12-11 15:45 88浏览
  • 我的一台很多年前人家不要了的九十年代SONY台式组合音响,接手时只有CD功能不行了,因为不需要,也就没修,只使用收音机、磁带机和外接信号功能就够了。最近五年在外地,就断电闲置,没使用了。今年9月回到家里,就一个劲儿地忙着收拾家当,忙了一个多月,太多事啦!修了电气,清理了闲置不用了的电器和电子,就是一个劲儿地扔扔扔!几十年的“工匠式”收留收藏,只能断舍离,拆解不过来的了。一天,忽然感觉室内有股臭味,用鼻子的嗅觉功能朝着臭味重的方向寻找,觉得应该就是这台组合音响?怎么会呢?这无机物的东西不会腐臭吧?
    自做自受 2024-12-10 16:34 141浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦