如日中天的英伟达,下一个目标是抢走云厂商的生意?


为了确保您每日收到“阿尔法工场”优质的财经内容推送,请进入公众号主页,点击右上角“···”标志,点击第一行“设为星标⭐”。

作者 | 薛良Neil
来源 | 品玩

导语:既然已经卡住了云厂商们的脖子,那何不更进一步?


谁有英伟达GPU,谁就是云公司


关于英伟达总有新的消息让你惊讶。

最近的一则来自美国的一家云初创公司CoreWeave 。

这家公司宣布融资23亿美金,而更让人震惊的是这笔钱的抵押物是其拥有的GPU。在大模型热潮下,GPU俨然成为一种硬通货,而CoreWeave之所以能有如此多的英伟达稀缺物品,是因为它过去的身份——北美最大的以太坊矿工。

那时它有超过五万台GPU用来挖矿,在面对挖矿的不可持续性后,CoreWeave把目光转向AI等需要并行计算的领域,并在ChatGPT爆红之前就采购了大量英伟达芯片——那时芯片的产能还足够充分。

由此,CoreWeave自称是世界上唯一一个可以大规模提供H100算力的公司,也摇身一变成为了一家“云厂商”。


是的,它的GPU供给超越了所有云服务巨头,包括谷歌云、亚马逊云和微软的Azure。

这听上去有些奇特,即使是不谈GPU数量瓶颈,构建数据中心还需要巨量的成本,精巧的空间、能源和散热设计以及十分复杂的软硬件协同,一般来说,能满足这些条件的只能是巨头,而不是刚进行了B轮融资(4.21亿美元)的初创公司。

CoreWeave 能做到这一点,源于一种对数据中心截然不同的理解。

传统的数据中心由CPU构成,它们侧重于通用计算的能力,主要由最开始是英特尔,后来是AMD的芯片所垄断。

但全新的用于加速计算的数据中心则更强调并行计算,这就意味着它需要有更大的内存、带宽以及把所有的加速计算单元密切连接起来的能力,英伟达创始人和CEO黄仁勋称这个过程为“数据中心现代化”,在他看来这是一个将持续10年的周期。

这个新周期的开始预示着整个数据中心的建构方式,软硬件协同乃至电源和散热结构都需要重新设计。这让所有的云服务提供商几乎重回起跑线——针对CPU设计的上一代的数据中心方案几乎完全无法照搬。比如英伟达连接庞大GPU集群所用到的Infinite Band技术需要超过500英里的电缆,这在传统的数据中心设计中根本不存在。

CoreWeave举了另一个例子,相同场地大小,GPU 集群所需要的电力是传统数据中心的 4 倍,因此新数据中心的电力系统和散热系统都需要完全重新设计,这甚至还不算软硬件协同的成本。

抢占先机的CoreWeave由此不仅能提供庞大的H100算力,并且在比其它的云服务快几十倍的同时费用还低80%,能做到这些,我们可以将其归功于它很早就精准践行了黄仁勋有关数据中心的愿景——数据中心正在向加速计算方向转化,而紧缺的算力则通过云供应。

就这样,一家虚拟币挖矿公司就变成了一家当红的云计算公司,只因为它是最忠诚的英伟达门徒。



英伟达云是个什么云


谁有英伟达的GPU谁就是最红的云厂商,那么谁有最多的英伟达GPU?显然是它自己。

于是在扶持类似的云初创企业的同时,英伟达也在建设自己的云。

英伟达亲自下场做云的优势有很多,最明显的是它不受到GPU供需关系的困扰。马斯克曾在公开场合说,获得GPU比获得毒品要难多了,而CoreWeave之所以能提供超大规模的H100算力,据悉也和英伟达的充分供应有关——英伟达在几个月前参与了CoreWeave的B轮融资。

但显然,仅仅投一些初创公司还不够,生成式AI对算力的巨大需求最终让英伟达自己下场。在今年3月的GTC大会上,英伟达推出了自己的云服务DGX Cloud,它已在年中正式上线。

从名字就可以看出,DGX Cloud直接利用了英伟达DGX超级计算机的能力,云的每个实例均配备8个H100或A100 GPU以及640GB内存。

DGX Cloud采用了一种低延迟结构,让庞大的工作流可以在集群之间扩展,于多个计算节点上并行分配。举个例子来说,最先宣布与DGX Cloud合作的甲骨文,它在OCI Supercluster上每个集群可以部署超过3万个A100 GPU,由此大模型可以在云上进行训练。用户在任何地方都能自由访问属于自己的AI超级计算机(英伟达表示算力的分配是独享排他的),打交道的只有前台界面,除了开发过程本身不用再去担心任何和硬件基础设施有关的问题。

这项服务采用月租形式,金额高达近4万美元。当然,相比直接买一台 DGX 服务器 20 万美元的价格来说还是便宜了许多,但不少人都指出,微软的Azure同样8个A100GPU的收费只有不到2万美元,几乎是前者的一半。

为什么这么贵?因为英伟达的云服务和别家不同,它不仅包括算力,还包括一整套AI解决方案。

名为Base Command Platform(基础命令平台)和AI Enterprise的两项服务被集成到了DGX Cloud里。前者是一个管理与监控软件,不仅可以用来记录云端算力的训练负载,提供跨云端和本地算力的整合,还能让用户直接从浏览器访问DGX Cloud。后者则是英伟达AI平台中的软件层,高达数千个软件包提供了各种预训练模型、AI框架和加速库,从而简化端到端的AI开发和部署成本。除此之外,DGX Cloud上还提供名为AI Foundations的模型铸造服务,让企业用户可以使用自己的专有数据定制属于自己的垂直大模型。

这套软硬件组合起来的完整解决方案让DGX Cloud训练速度相比传统的云计算提高了两到三倍,这成为了DGX Cloud与传统云服务最大的不同,它很好的综合了英伟达两方面的强项:AI生态和算力。对于英伟达来说,“软件即服务”这句话似乎应该改成“软硬件一体即服务”,DGX Cloud集中代表了一个硬件厂商向上垂直整合的能力天花板。



黄仁勋的野心和现实


但这并不意味着英伟达就彻底掀了传统云厂商的桌子。它的这项服务是通过传统云厂商来提供的。DGX Cloud最开始被宣布推出在甲骨文云上,随后微软和谷歌跟进,而英伟达与这些云厂商合作的方式显得颇为有趣:英伟达先把GPU硬件卖给这些云合作伙伴,然后再租用这些硬件以便运行DGX Cloud。

有人戏称这叫两边钱一起赚,都不耽误。

实际上,黄仁勋解释过这种模式:“我们从让客户使用我们的计算平台中受益,而客户通过将我们(的计算平台)置于他们(云厂商)的云中而受益。”

如果只听黄仁勋说,这就是个皆大欢喜的双赢结局,然而这只是他一贯的叙事而已。英伟达已经陷入与自己客户的竞争中,并且心知肚明。

DGX Cloud进展告诉我们,黄仁勋并不打算仅仅把它布置于传统云厂商上。在八月的SIGGRAPH 2023上,英伟达先是宣布了与Hugging Face的合作,接着发布了名为AI Workbench的服务。它们都可以让用户便捷创建、测试和定制预训大模型,其背后的算力支持自然都包括了DGX Cloud。

这显然会冲击英伟达和云厂商的关系:最主要的云服务商,包括谷歌、亚马逊和微软,它们同样也是英伟达的大客户,英伟达推广自有云服务势必会抢夺它们的市场份额。特别是我们在第一部分已经谈到,作为数据中心和云服务巨头的它们在构建下一代数据中心的问题上本来就不具备多少优势,如果再考虑到英伟达芯片产能“卡脖子”的问题,英伟达的自有云服务威胁不可谓不小。

黄仁勋不会不知道这一点,因此他对DGX Cloud的态度就显得颇值得玩味了,比如他公开表示,一个恰当的云服务组合比例应该是10%英伟达DGX加上90%的公有云。换而言之,DGX Cloud在黄仁勋的定位里并不是传统云厂商的对手与威胁,而是合作伙伴。

在Q1季度财报公布后的分析师电话会上黄仁勋谈的更多的都是这种合作的好处,“一个巨大的双赢”,黄仁勋如此形容。在他的理解里,DGX Cloud是一个纯粹的英伟达堆栈(pure Nvidia stack),把人工智能开发、大型数据库和高速低延迟网络组合在一起,成为一种便捷的AI 基础设施从而打开全新的、巨大的市场——这个市场的参与者包括了英伟达和传统云厂商,大家将共同受益于生成式AI的爆发。

极力避谈冲突,其实是因为,DGX Cloud恐怕很长时间内都只能维持一个较小的体量。

第一个原因当然是算力的瓶颈。“订单多到不可思议”是黄仁勋形容数据中心业务量时的描述,英伟达的核心要务当然是开发并保证生产尽可能多的符合市场需求的先进芯片,否则云服务的规模是无法扩大的。

尽管台积电在马不停蹄的生产,但值得注意的是算力缺口不是变小而是更大了,因为一旦大模型落地和商业化(比如像ChatGPT那样),其推理成本将随着用户规模的提升指数级升高,长远来看会比训练模型的算力需求大得多(有人给出的倍率是100)。

此外也是考虑到英伟达和传统云厂商合作关系的复杂性。DGX Cloud如果作为一种纯粹的竞品出现,或许会占领可观的市场份额,但势必进一步加速云厂商摆脱对英伟达的依赖——它们本来就已经为了少交点“英伟达税”而不约而同地自研芯片了。

从另一个角度讲,全力扩大DGX Cloud规模可能也不符合英伟达的最佳利益。从芯片到游戏显卡再到服务器和数据中心,英伟达绝少自己制造硬件产品,它更喜欢和OEM厂商合作——以至于许多时候你要采购英伟达芯片都还是得经过OEM厂商。这让英伟达很好的控制成本,维持利润率。

今天英伟达和云厂商之间似乎维持了一种平衡,但平衡就是用来打破的,尤其当一方是英伟达的时候,毕竟眼下才是黄仁勋所谓“下一代数据中心十年”更新周期的第一年。


加入阿尔法工场投资者交流社群 | 添加微信:dlfxs2

阿尔法工场研究院 阿尔法工场旗下研究院.定期发布覆盖A股、美股、港股的上市公司研究报告.
评论
  • 每日可见的315MHz和433MHz遥控模块,你能分清楚吗?众所周知,一套遥控设备主要由发射部分和接收部分组成,发射器可以将控制者的控制按键经过编码,调制到射频信号上面,然后经天线发射出无线信号。而接收器是将天线接收到的无线信号进行解码,从而得到与控制按键相对应的信号,然后再去控制相应的设备工作。当前,常见的遥控设备主要分为红外遥控与无线电遥控两大类,其主要区别为所采用的载波频率及其应用场景不一致。红外遥控设备所采用的射频信号频率一般为38kHz,通常应用在电视、投影仪等设备中;而无线电遥控设备
    华普微HOPERF 2025-01-06 15:29 164浏览
  • By Toradex 秦海1). 简介嵌入式平台设备基于Yocto Linux 在开发后期量产前期,为了安全以及提高启动速度等考虑,希望将 ARM 处理器平台的 Debug Console 输出关闭,本文就基于 NXP i.MX8MP ARM 处理器平台来演示相关流程。 本文所示例的平台来自于 Toradex Verdin i.MX8MP 嵌入式平台。  2. 准备a). Verdin i.MX8MP ARM核心版配合Dahlia载板并
    hai.qin_651820742 2025-01-07 14:52 106浏览
  • 故障现象一辆2017款东风风神AX7车,搭载DFMA14T发动机,累计行驶里程约为13.7万km。该车冷起动后怠速运转正常,热机后怠速运转不稳,组合仪表上的发动机转速表指针上下轻微抖动。 故障诊断 用故障检测仪检测,发动机控制单元中无故障代码存储;读取发动机数据流,发现进气歧管绝对压力波动明显,有时能达到69 kPa,明显偏高,推断可能的原因有:进气系统漏气;进气歧管绝对压力传感器信号失真;发动机机械故障。首先从节气门处打烟雾,没有发现进气管周围有漏气的地方;接着拔下进气管上的两个真空
    虹科Pico汽车示波器 2025-01-08 16:51 69浏览
  • 彼得·德鲁克被誉为“现代管理学之父”,他的管理思想影响了无数企业和管理者。然而,关于他的书籍分类,一种流行的说法令人感到困惑:德鲁克一生写了39本书,其中15本是关于管理的,而其中“专门写工商企业或为企业管理者写的”只有两本——《为成果而管理》和《创新与企业家精神》。这样的表述广为流传,但深入探讨后却发现并不完全准确。让我们一起重新审视这一说法,解析其中的矛盾与根源,进而重新认识德鲁克的管理思想及其著作的真正价值。从《创新与企业家精神》看德鲁克的视角《创新与企业家精神》通常被认为是一本专为企业管
    优思学院 2025-01-06 12:03 158浏览
  • 村田是目前全球量产硅电容的领先企业,其在2016年收购了法国IPDiA头部硅电容器公司,并于2023年6月宣布投资约100亿日元将硅电容产能提升两倍。以下内容主要来自村田官网信息整理,村田高密度硅电容器采用半导体MOS工艺开发,并使用3D结构来大幅增加电极表面,因此在给定的占位面积内增加了静电容量。村田的硅技术以嵌入非结晶基板的单片结构为基础(单层MIM和多层MIM—MIM是指金属 / 绝缘体/ 金属) 村田硅电容采用先进3D拓扑结构在100um内,使开发的有效静电容量面积相当于80个
    知白 2025-01-07 15:02 141浏览
  • 根据Global Info Research项目团队最新调研,预计2030年全球封闭式电机产值达到1425百万美元,2024-2030年期间年复合增长率CAGR为3.4%。 封闭式电机是一种电动机,其外壳设计为密闭结构,通常用于要求较高的防护等级的应用场合。封闭式电机可以有效防止外部灰尘、水分和其他污染物进入内部,从而保护电机的内部组件,延长其使用寿命。 环洋市场咨询机构出版的调研分析报告【全球封闭式电机行业总体规模、主要厂商及IPO上市调研报告,2025-2031】研究全球封闭式电机总体规
    GIRtina 2025-01-06 11:10 124浏览
  • 这篇内容主要讨论三个基本问题,硅电容是什么,为什么要使用硅电容,如何正确使用硅电容?1.  硅电容是什么首先我们需要了解电容是什么?物理学上电容的概念指的是给定电位差下自由电荷的储藏量,记为C,单位是F,指的是容纳电荷的能力,C=εS/d=ε0εrS/4πkd(真空)=Q/U。百度百科上电容器的概念指的是两个相互靠近的导体,中间夹一层不导电的绝缘介质。通过观察电容本身的定义公式中可以看到,在各个变量中比较能够改变的就是εr,S和d,也就是介质的介电常数,金属板有效相对面积以及距离。当前
    知白 2025-01-06 12:04 222浏览
  • 「他明明跟我同梯进来,为什么就是升得比我快?」许多人都有这样的疑问:明明就战绩也不比隔壁同事差,升迁之路却比别人苦。其实,之间的差异就在于「领导力」。並非必须当管理者才需要「领导力」,而是散发领导力特质的人,才更容易被晓明。许多领导力和特质,都可以通过努力和学习获得,因此就算不是天生的领导者,也能成为一个具备领导魅力的人,进而被老板看见,向你伸出升迁的橘子枝。领导力是什么?领导力是一种能力或特质,甚至可以说是一种「影响力」。好的领导者通常具备影响和鼓励他人的能力,并导引他们朝着共同的目标和愿景前
    优思学院 2025-01-08 14:54 61浏览
  • 本文介绍编译Android13 ROOT权限固件的方法,触觉智能RK3562开发板演示,搭载4核A53处理器,主频高达2.0GHz;内置独立1Tops算力NPU,可应用于物联网网关、平板电脑、智能家居、教育电子、工业显示与控制等行业。关闭selinux修改此文件("+"号为修改内容)device/rockchip/common/BoardConfig.mkBOARD_BOOT_HEADER_VERSION ?= 2BOARD_MKBOOTIMG_ARGS :=BOARD_PREBUILT_DTB
    Industio_触觉智能 2025-01-08 00:06 92浏览
  •  在全球能源结构加速向清洁、可再生方向转型的今天,风力发电作为一种绿色能源,已成为各国新能源发展的重要组成部分。然而,风力发电系统在复杂的环境中长时间运行,对系统的安全性、稳定性和抗干扰能力提出了极高要求。光耦(光电耦合器)作为一种电气隔离与信号传输器件,凭借其优秀的隔离保护性能和信号传输能力,已成为风力发电系统中不可或缺的关键组件。 风力发电系统对隔离与控制的需求风力发电系统中,包括发电机、变流器、变压器和控制系统等多个部分,通常工作在高压、大功率的环境中。光耦在这里扮演了
    晶台光耦 2025-01-08 16:03 58浏览
  • 在智能家居领域中,Wi-Fi、蓝牙、Zigbee、Thread与Z-Wave等无线通信协议是构建短距物联局域网的关键手段,它们常在实际应用中交叉运用,以满足智能家居生态系统多样化的功能需求。然而,这些协议之间并未遵循统一的互通标准,缺乏直接的互操作性,在进行组网时需要引入额外的网关作为“翻译桥梁”,极大地增加了系统的复杂性。 同时,Apple HomeKit、SamSung SmartThings、Amazon Alexa、Google Home等主流智能家居平台为了提升市占率与消费者
    华普微HOPERF 2025-01-06 17:23 202浏览
  • 大模型的赋能是指利用大型机器学习模型(如深度学习模型)来增强或改进各种应用和服务。这种技术在许多领域都显示出了巨大的潜力,包括但不限于以下几个方面: 1. 企业服务:大模型可以用于构建智能客服系统、知识库问答系统等,提升企业的服务质量和运营效率。 2. 教育服务:在教育领域,大模型被应用于个性化学习、智能辅导、作业批改等,帮助教师减轻工作负担,提高教学质量。 3. 工业智能化:大模型有助于解决工业领域的复杂性和不确定性问题,尽管在认知能力方面尚未完全具备专家级的复杂决策能力。 4. 消费
    丙丁先生 2025-01-07 09:25 116浏览
  • 根据环洋市场咨询(Global Info Research)项目团队最新调研,预计2030年全球无人机锂电池产值达到2457百万美元,2024-2030年期间年复合增长率CAGR为9.6%。 无人机锂电池是无人机动力系统中存储并释放能量的部分。无人机使用的动力电池,大多数是锂聚合物电池,相较其他电池,锂聚合物电池具有较高的能量密度,较长寿命,同时也具有良好的放电特性和安全性。 全球无人机锂电池核心厂商有宁德新能源科技、欣旺达、鹏辉能源、深圳格瑞普和EaglePicher等,前五大厂商占有全球
    GIRtina 2025-01-07 11:02 119浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦