初创公司Cerebras将在Hot Chips上展出号称是“世界上最大”的半导体器件——一个16nm工艺、晶圆大小的处理器阵列,旨在取代英伟达(Nvidia) GPU在训练神经网络方面的主导地位。这颗面积达到46,225平方毫米的芯片功耗为15千瓦,封装了400,000个内核,并且仅支持在极少数系统中运行,至少已有一家客户采用……

EETimes加利福尼亚州圣何塞报道,初创公司Cerebras将在Hot Chips上展出号称是“世界上最大”的半导体器件——一个16nm工艺、晶圆大小的处理器阵列,旨在取代英伟达(Nvidia) GPU在训练神经网络方面的主导地位。这颗面积达到46,225平方毫米的芯片功耗为15千瓦,封装了400,000个内核,并且仅支持在极少数系统中运行,至少已有一家客户采用。

此外,在本周末的活动中,华为、英特尔和初创公司Habana将详细介绍他们用于训练神经网络的芯片。他们都把Nvidia当作竞争对手,去年Nvidia销售了大约价值30亿美元的GPU,用于支持这些对硬件性能极端渴望的新兴应用。

英特尔的1.1 GHz Spring Crest旨在通过将64个28G系列服务器,整合成16条112Gbit /秒的通道,可以连接多达1,024个芯片。专有互连(proprietary interconnect)是一种直接的无协议链路,无需通过外部HBM2内存,从而能够以相对快速的方式在多个处理器和机箱之间传播大型神经网络。

通过在一个晶圆上放置所有内核、存储器和互连,Cerebras的方法将更快,并且可以整合到同一个框架中。

该初创公司从资深投资者那里筹集了超过2亿美元,成为第一个将晶圆级集成商业化、开创封装和晶圆处理新技术的公司。该公司押注人工智能培训市场,认为它将从七个超大规模数据中心供应商,扩展到数百家公司,覆盖从制药到金融科技等希望将搜集到的数据留给自己的行业。

这个芯片怎么运作?

Cerebras这颗器件在7x12阵列中包含84个块,每个包含大约4,800个内核,用于AI的稀疏线性代数(sparse linear algebra),每个都有48 KB的SRAM,这是它们唯一的内存源。

单级层次结构加快了处理速度,训练程序几乎不需要跨内核共享内存。与单个Nvidia GPU相比,芯片上总共18GB的SRAM是巨大的,但与Cerebras的目标竞争系统相比,这个数字很小。

该公司不愿对该器件的频率发表评论,该频率可能很低,无法帮助管理其功率和热量需求。Cerebras首席执行官兼创始人安德鲁.费尔德曼(Andrew Feldman)表示,这家初创公司的资深工程师“之前已经完成了2-3 GHz芯片,但这不是最终目标——超频带来的回报不如增加内核。”

Feldman不愿对Cerebras计划出售的机架系统成本、设计或路线图发表评论。但他表示,这个一个机架的性能,将相当于一个拥有1000台Nvidia GPU设备的工厂,同时只需要他2-3%的空间和功耗。而且组装1000台设备可能需要数月的时间。

CerebrasNvidiasmall.png
Cerebras器件比Nvidia GPU,以及用于AI培训的任何其他竞争对手芯片大得多。 (图片:Cerebras)

该公司的目标是在11月的超级计算机展上讲解该系统,并介绍其性能和benchmark数据。对于所有参会者来说这将是历史性的一刻,上一次达成类似成就是在1980年的超级计算机展上,当时Gene Amdahl创立的公司Trinity推出了3.5英寸晶圆,

Cerebras编译器将摄取TensorFlow或Pytorch模型,将其转换为机器语言,并使用微代码库将神经网络层映射到巨型芯片的各个区域。它在一定程度上通过在内核上编写编程指令,并配置链接块的网状网络来实现。

“我们将整个网络功能保留在芯片上。” Feldman说,“其他所有人都在压榨网络功能,以至于花费更多时间来回倒数据“,常见的做法是通过内存进行缓慢的外部互连。

Cerebras的174名工程师中,近三分之二是软件开发人员,这表明AI和编译器代码的复杂性。Feldman说,在第一批商业系统投入使用之前,他们将面临“一大堆问答(Q&A)”。

如何面对Nvidia、英特尔、华为和其他新创企业

Moor Insights&Strategy的人工智能和高端系统分析师卡尔•弗罗因德(Karl Freund)说:“如果他们能够让这个晶圆发挥作用,那将是开创性的。”

“他们正在解决的问题很难,但并不是不切实际的,所以我认为他们会在明年的某个时候完成这项任务,”他补充道。

Cerebras面临着Nvidia在人工智能加速器市场预计90%以上的垄断地位。它的16nm产品将与Nvidia的7nm Ampere GPU同时投向市场。

此外,在Hot Chips展上,英特尔将介绍其28核的Spring Crest平台,创业公司Habana将展示一款八核训练处理器,华为也将介绍其训练芯片,创业公司Graphcore的1,200核芯片更是已经拿到戴尔3亿美元的融资和支持。

“人们正在尝试各种各样的事情——核心有多大,决定了内存和带宽有多大,以及它们是如何连接的。正确的组合还有待观察”Linley集团的林利•格温纳普(Linley Gwennap)表示,他指出很少有人在现阶段引用benchmark数据。 (预计在10月底之前,MLPerf会提供Spring Crest和Habana的训练数据。)

Gwennap补充说,人工智能软件还存在许多漏洞,例如芯片能够支持多少TensorFlow的操作,并且能够在多种神经网络类型中表现良好。

开创性的晶圆级集成

就其本身而言,Cerebras提供这种晶圆尺寸级别的器件,在产量、功耗和发热量方面都遇到了挑战。它申请了约30项专利,迄今已发行约6项。

例如,台积电经典的300毫米晶圆可能包含“少量的100个缺陷,” Feldman说。 Cerebras为其Swarm互连提供冗余链路,以便绕过有缺陷的区块,并分配“超过(区块数)1%的链路量作为备用。”

迄今为止,该公司已经生产了100多块晶圆,所有晶圆都能在可接受的水平上运行。为了给它们供电和冷却,Cerebras设计了自己的电路板和冷却板,为每块芯片垂直提供电力和水冷。机架包括一个闭环系统,用于空气冷却水。

Cerebras还与合作伙伴合作设计了一台用于处理和对齐晶圆的机器。 “我们公司拥有流体、材料科学家和制造工程师,”Feldman说。

这家创业公司与台积电合作,发明了一种方法,将其互连放置在区块之间的划线中,这个区域通常被保留,作为芯片之间的隔离区。

Cerebrascrossection.png

一种特别设计的电路板和冷却板,垂直地将电力和冷却水输送到每块芯片上。

制造一台计算机的全新方法

该公司计划在超级计算机大会上推出其系统,这表明它认为晶圆级设备的市场远远超过目前七家超大规模数据中心。

至于人工智能训练,“最初,我们认为全球将有200个客户,但我们已将该估算修改为1,000个,” Feldman说。 “我们所到之处,大批拥有大型数据集的公司,不希望他们的数据保存在谷歌云中,在那里,单次训练的费用高达15万美元,”他补充道。

汽车制造商、制药公司、石油和天然气勘探公司以及金融公司将能够训练自己的神经网络。他说:“超大规模(云服务)公司是一个重要的细分市场,但它们甚至远不及市场的一半。”

Fred Weber是Cerebras的投资人,也是AMD Opteron CPU的前工程经理,他认为晶圆级集成(WSI)的潜力更大。他设想将其用于传统的高性能计算工作,如信号处理、天气预报、模拟/仿真甚至网络切换。

“科技行业中,经常出现一些有趣的良性循环,比如摩尔定律。你可以缩小硅片,而有人会为此付钱——每一代演进都很难,但你知道这是值得的,” Weber说。

“晶圆级集成可能也类似。它要解决的问题很难,但并非不可能。现在行业内有了训练这个需求,于是人们有了一个商业理由去做这件事,“他说,并补充说WSI”一直是我非常感兴趣的领域,因为我在肯德尔广场研究院(Kendall Square Research)工作时,就主要研究大型并行计算机。“

也就是说,“人工智能培训不是一个利基应用。我们正处于‘人工智能可以做什么’这个命题的最开始,因为它是一个通用平台。人工智能是一种计算范式而非应用程序,我对此非常看好,“韦伯说。

在这方面,“在我参与的众多初创公司项目中,Cerebras最有趣,因为它既是一种了不起的人工智能机器,又是一种构建计算机的全新方式,”他说。

编译:Luffy Liu

原文链接:Startup Spins Whole Wafer for AI,By Rick Merritt

本文为EET电子工程专辑原创文章,禁止转载。请尊重知识产权,违者本司保留追究责任的权利。
阅读全文,请先
您可能感兴趣
美国试图通过技术封锁维持其全球主导地位,而中国则希望通过自主创新实现产业升级和经济转型。未来很长一段时间,中美之间合作与竞争并存的局面可能会成为一种常态。
Beyond Gravity是一家总部位于瑞士苏黎世的高科技公司,主要业务包括为运载火箭提供结构件,并在卫星产品和星座领域处于领先地位。其光刻部门位于瑞士苏黎世和德国德累斯顿附近的Coswig,拥有约210名员工。蔡司(ZEISS)成功收购了Beyond Gravity的光刻部门,并将其整合到其半导体制造技术部门(ZEISS SMT)......
芯片是方的,晶圆却是圆的;如果把封装的载片晶圆换成方形面板,情况会是怎样?
在接受笔者采访时,Nexperia公司SiC产品组高级总监Katrin Feurle和该公司副总裁兼GaN FET业务部总经理Carlos Castro就这一相关投资计划发表了见解。
SK海力士在HBM4上将对基础裸片的称呼已经从DRAM Base Die调整为Logic Base Die,强调了基础裸片愈发重要的逻辑功能。这意味着HBM4时代的基础裸片将全面转向逻辑半导体工艺。
台积电的1.6纳米芯片“A16”技术具有多项创新点,其中最显著的是其超级电源轨(SPR)背面供电网络。这一技术是台积电首创,专为高性能计算产品设计,旨在提高芯片的性能和降低功耗。
目前,智能终端NFC功能的使用频率越来越高,面对新场景新需求,ITMA多家成员单位一起联合推动iTAP(智能无感接近式协议)标准化项目,预计25年上半年发布1.0标准,通过功能测试、兼容性测试,确保新技术产业应用。
中科院微电子所集成电路制造技术重点实验室刘明院士团队提出了一种基于记忆交叉阵列的符号知识表示解决方案,首次实验演示并验证了忆阻神经-模糊硬件系统在无监督、有监督和迁移学习任务中的应用……
C&K Switches EITS系列直角照明轻触开关提供表面贴装 PIP 端子和标准通孔配置,为电信、数据中心和专业音频/视频设备等广泛应用提供创新的多功能解决方案。
投身国产浪潮向上而行,英韧科技再获“中国芯”认可
点击蓝字 关注我们安森美(onsemi)在2024年先后推出两款超强功率半导体模块新贵,IGBT模块系列——SPM31 IPM,QDual 3。值得注意的是,背后都提到采用了最新的FS7技术,主要性能
‍‍12月18日,深圳雷曼光电科技股份有限公司(下称“雷曼光电”)与成都辰显光电有限公司(下称“辰显光电”)在成都正式签署战略合作协议。双方将充分发挥各自在技术创新、产品研发等方面的优势,共同推进Mi
12月18日,珠海京东方晶芯科技举行设备搬入仪式。插播:加入LED显示行业群,请加VX:hangjia188在10月31日,珠海京东方晶芯科技有限公司发布了Mini/Micro LED COB显示产品
对于华为来说,今年的重磅机型都已经发完了,而明年的机型已经在研发中,Pura 80就是期待很高的一款。有博主爆料称,华为Pura 80将会用上了豪威OV50K传感器,同时电池容量达到5600毫安时。至
阿里资产显示,随着深圳柔宇显示技术有限公司(下称:“柔宇显示”)旗下资产一拍以流拍告终,二拍将于12月24日开拍,起拍价为9.8亿元。拍卖标的包括位于深圳市龙岗区的12套不动产和一批设备类资产,其中不
又一地,新型储能机会来了?■ 印度:2032储能增长12倍,超60GW据印度国家银行SBI报告,印度准备大幅提升能源存储容量,预计到2032财年将增长12 倍,超60GW左右。这也将超过可再生能源本身
 “ 担忧似乎为时过早。 ”作者 | RichardSaintvilus编译 | 华尔街大事件由于担心自动驾驶汽车可能取消中介服务,Uber ( NYSE: UBER ) 的股价在短短几周内从 202
LG Display  12月18日表示,为加强OLED制造竞争力,自主开发并引进了“AI(人工智能)生产体系”。“AI生产体系”是AI实时收集并分析OLED工艺制造数据的系统。LG Display表
极越汽车闪崩,留下一地鸡毛,苦的是供应商和车主。很多人都在关心,下一个倒下的新能源汽车品牌,会是谁?我们都没有未卜先知的超能力,但可以借助数据管中窥豹。近日,有媒体统计了15家造车新势力的销量、盈亏情
上个月,亿万富翁埃隆·马斯克谈到了年轻一代的生育问题。他强调生育的紧迫性,认为无论面临何种困难,生育后代都是必要的,否则人类可能会在无声中走向消亡。他认为人们对于生育的担忧有些过头,担心经济压力等问题