芯片“小”问题或导致互联网巨头停机

半导体产业纵横 2022-02-10 18:37


本文由半导体产业纵横编译自纽约时报


随着最大的计算机网络不断发展壮大,一些工程师担心他们最小的组件可能会成为致命的弱点。



想象一下,为世界上最大的数据中心提供动力的服务器内的数百万个计算机芯片里存在罕见的、几乎无法检测到的缺陷。发现缺陷的唯一方法是将这些芯片放入到大量的计算问题中一一寻找,这种难度在十年前是无法想象的。


随着计算机芯片中的微型开关已经缩小到几个原子的宽度,芯片的可靠性已成为运行世界上最大网络的人们的另一个担忧。去年,亚马逊、Facebook、Twitter 和许多其他网站公司们都经历了令人惊讶的停机。


停机有几个原因,例如编程错误和网络拥塞。但人们越来越担心随着云计算网络变得越来越大、越来越复杂,它们在最基本的层面上仍然依赖于计算机芯片,但是这些芯片现在不太可靠、在某些情况下也难以预测的。


在过去的一年里,Facebook和谷歌的研究人员都发表了描述计算机硬件故障的研究报告,说这些故障的原因不容易确定。他们认为,问题不在于软件,而在于不同公司制造的计算机硬件的某个地方。谷歌拒绝对其研究发表评论,而现在被称为 Meta 的 Facebook 没有回复对其研究发表评论的请求。


专门测试计算机硬件的斯坦福大学电气工程师 Subhasish 说:“他们看到了这些无声的错误,基本上来自底层硬件,” Mitra博士说,越来越多人认为,缺陷的产生与这些不易被发现的所谓无声错误有关。


Facebook 位于俄勒冈州普林维尔的数据中心。大型数据中心曾经历过中断,部分原因可能是芯片错误。 

来源:纽约时报Leah Nash


研究人员担心他们会发现罕见的缺陷,因为他们正试图解决越来越大的计算问题,这会以意想不到的方式给他们的系统带来压力。


十多年前,运行大型数据中心的公司开始报告系统性问题。2015 年,在工程出版物IEEE Spectrum中,一群在多伦多大学研究硬件可靠性的计算机科学家报告称,每年谷歌数百万台计算机中有多达 4% 的计算机遇到了无法检测到的错误,并且导致了他们意外关闭。


在一个拥有数十亿个晶体管的微处理器中——或者一个由数万亿个微型开关组成的计算机内存板中,每个微型开关都可以存储一个1 或 0,即使是最小的错误也会破坏现在每秒例行执行数十亿次计算的系统。


在半导体时代初期,工程师们担心宇宙射线偶尔会翻转单个晶体管并改变计算结果的可能性。现在他们担心开关本身越来越不可靠。Facebook 研究人员甚至争辩说,这些开关变得越来越容易磨损,并且计算机内存或处理器的寿命可能比以前认为的要短。


越来越多的证据表明,随着每一代新一代芯片的出现,这个问题都在恶化。芯片制造商 Advanced Micro Devices 于 2020 年发布的一份报告发现,现在最先进的计算机内存芯片的可靠性大约比上一代低 5.5 倍。AMD 没有回应对该报告发表评论的请求。


资深硬件工程师大卫·迪策尔(David Ditzel) 是世界语科技公司的董事长兼创始人,他说追踪这些错误具有挑战性。世界语科技公司是一家为加利福尼亚州山景城(Mountain View,California)的人工智能应用而设计的新型处理器制造商,有1000个处理器,由280亿个晶体管组成。


他将芯片比作一座横跨整个美国表面的公寓楼。Mitra 博士使用 Ditzel 先生的比喻说,发现新错误有点像在那栋大楼的一间公寓里寻找一个单独的水龙头,只有当卧室灯亮并且公寓门打开时,水龙头才会发生故障。

 

谷歌位于爱荷华州康瑟尔布拉夫斯的数据中心。谷歌研究人员发现,处理器内核似乎只在特定条件下才会产生错误。 

来源:路透社Brian Snyder


到目前为止,计算机设计人员一直试图通过在芯片中添加特殊电路来纠正错误,从而解决硬件缺陷。电路会自动检测和纠正不良数据。它这曾经被认为是一个极其罕见的问题。但几年前,谷歌生产团队开始报告难以诊断的错误。根据他们的报告,计算错误会间歇性发生并且难以重现。


一组研究人员试图追查这个问题,去年他们发表了他们的发现。他们得出的结论是,该公司庞大的数据中心由基于数百万个处理器“内核”的计算机系统组成,它正在经历新的错误,这些错误可能是由两个因素组合而成:接近物理极限的较小晶体管和不充分的测试。

 

谷歌研究人员在他们的论文《Cores That Don’t Count》中指出,这个问题非常具有挑战性,以至于他们已经投入了相当于数十年的工程时间来解决它。


现代处理器芯片由数十个处理器内核组成,计算引擎可以分解任务且并行解决它们。研究人员发现,一小部分核心很少会产生不准确的结果,而且仅在某些条件下才会产生。他们将这种行为描述为零星的。在某些情况下,只有在计算速度或温度发生变化时,内核才会产生错误。


据谷歌称,处理器设计复杂性的增加是失败的重要原因之一。但工程师们也表示,较小的晶体管、三维芯片和仅在某些情况下会产生错误的新设计都导致了这个问题。


在去年发布的一篇类似论文中,Facebook的一组研究人员指出,一些处理器会通过制造商的测试,但在投入使用时就开始出现故障。

英特尔高管表示,他们熟悉谷歌和Facebook 的研究论文,并正在与两家公司合作开发检测和纠正硬件错误的新方法。


英特尔数据平台集团副总裁布莱恩·乔根森(Bryan Jorgensen)表示,研究人员的断言是正确的,“他们对行业提出的挑战是正确的选择。”

 

*声明:本文系原作者创作。文章内容系其个人观点,我方转载仅为分享与讨论,不代表我方赞成或认同,如有异议,请联系后台。






半导体产业纵横 (微信号: ICViews)半导体产业纵横是神州数码数智创新+平台下的自媒体账号,立足产业视角,提供及时、专业、深度的前沿洞见、技术速递、趋势解析,赋能中国半导体产业,我们一直在路上。
评论
  • 一、SAE J1939协议概述SAE J1939协议是由美国汽车工程师协会(SAE,Society of Automotive Engineers)定义的一种用于重型车辆和工业设备中的通信协议,主要应用于车辆和设备之间的实时数据交换。J1939基于CAN(Controller Area Network)总线技术,使用29bit的扩展标识符和扩展数据帧,CAN通信速率为250Kbps,用于车载电子控制单元(ECU)之间的通信和控制。小北同学在之前也对J1939协议做过扫盲科普【科普系列】SAE J
    北汇信息 2024-12-11 15:45 88浏览
  • 我的一台很多年前人家不要了的九十年代SONY台式组合音响,接手时只有CD功能不行了,因为不需要,也就没修,只使用收音机、磁带机和外接信号功能就够了。最近五年在外地,就断电闲置,没使用了。今年9月回到家里,就一个劲儿地忙着收拾家当,忙了一个多月,太多事啦!修了电气,清理了闲置不用了的电器和电子,就是一个劲儿地扔扔扔!几十年的“工匠式”收留收藏,只能断舍离,拆解不过来的了。一天,忽然感觉室内有股臭味,用鼻子的嗅觉功能朝着臭味重的方向寻找,觉得应该就是这台组合音响?怎么会呢?这无机物的东西不会腐臭吧?
    自做自受 2024-12-10 16:34 141浏览
  • 习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习笔记&记录学习习笔记&记学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记
    youyeye 2024-12-10 16:13 110浏览
  • 【萤火工场CEM5826-M11测评】OLED显示雷达数据本文结合之前关于串口打印雷达监测数据的研究,进一步扩展至 OLED 屏幕显示。该项目整体分为两部分: 一、框架显示; 二、数据采集与填充显示。为了减小 MCU 负担,采用 局部刷新 的方案。1. 显示框架所需库函数 Wire.h 、Adafruit_GFX.h 、Adafruit_SSD1306.h . 代码#include #include #include #include "logo_128x64.h"#include "logo_
    无垠的广袤 2024-12-10 14:03 71浏览
  • 全球知名半导体制造商ROHM Co., Ltd.(以下简称“罗姆”)宣布与Taiwan Semiconductor Manufacturing Company Limited(以下简称“台积公司”)就车载氮化镓功率器件的开发和量产事宜建立战略合作伙伴关系。通过该合作关系,双方将致力于将罗姆的氮化镓器件开发技术与台积公司业界先进的GaN-on-Silicon工艺技术优势结合起来,满足市场对高耐压和高频特性优异的功率元器件日益增长的需求。氮化镓功率器件目前主要被用于AC适配器和服务器电源等消费电子和
    电子资讯报 2024-12-10 17:09 88浏览
  • RK3506 是瑞芯微推出的MPU产品,芯片制程为22nm,定位于轻量级、低成本解决方案。该MPU具有低功耗、外设接口丰富、实时性高的特点,适合用多种工商业场景。本文将基于RK3506的设计特点,为大家分析其应用场景。RK3506核心板主要分为三个型号,各型号间的区别如下图:​图 1  RK3506核心板处理器型号场景1:显示HMIRK3506核心板显示接口支持RGB、MIPI、QSPI输出,且支持2D图形加速,轻松运行QT、LVGL等GUI,最快3S内开
    万象奥科 2024-12-11 15:42 71浏览
  • 智能汽车可替换LED前照灯控制运行的原理涉及多个方面,包括自适应前照灯系统(AFS)的工作原理、传感器的应用、步进电机的控制以及模糊控制策略等。当下时代的智能汽车灯光控制系统通过车载网关控制单元集中控制,表现特殊点的有特斯拉,仅通过前车身控制器,整个系统就包括了灯光旋转开关、车灯变光开关、左LED前照灯总成、右LED前照灯总成、转向柱电子控制单元、CAN数据总线接口、组合仪表控制单元、车载网关控制单元等器件。变光开关、转向开关和辅助操作系统一般连为一体,开关之间通过内部线束和转向柱装置连接为多,
    lauguo2013 2024-12-10 15:53 85浏览
  • 天问Block和Mixly是两个不同的编程工具,分别在单片机开发和教育编程领域有各自的应用。以下是对它们的详细比较: 基本定义 天问Block:天问Block是一个基于区块链技术的数字身份验证和数据交换平台。它的目标是为用户提供一个安全、去中心化、可信任的数字身份验证和数据交换解决方案。 Mixly:Mixly是一款由北京师范大学教育学部创客教育实验室开发的图形化编程软件,旨在为初学者提供一个易于学习和使用的Arduino编程环境。 主要功能 天问Block:支持STC全系列8位单片机,32位
    丙丁先生 2024-12-11 13:15 50浏览
  • 概述 通过前面的研究学习,已经可以在CycloneVGX器件中成功实现完整的TDC(或者说完整的TDL,即延时线),测试结果也比较满足,解决了超大BIN尺寸以及大量0尺寸BIN的问题,但是还是存在一些之前系列器件还未遇到的问题,这些问题将在本文中进行详细描述介绍。 在五代Cyclone器件内部系统时钟受限的情况下,意味着大量逻辑资源将被浪费在于实现较大长度的TDL上面。是否可以找到方法可以对此前TDL的长度进行优化呢?本文还将探讨这个问题。TDC前段BIN颗粒堵塞问题分析 将延时链在逻辑中实现后
    coyoo 2024-12-10 13:28 102浏览
  • 时源芯微——RE超标整机定位与解决详细流程一、 初步测量与问题确认使用专业的电磁辐射测量设备,对整机的辐射发射进行精确测量。确认是否存在RE超标问题,并记录超标频段和幅度。二、电缆检查与处理若存在信号电缆:步骤一:拔掉所有信号电缆,仅保留电源线,再次测量整机的辐射发射。若测量合格:判定问题出在信号电缆上,可能是电缆的共模电流导致。逐一连接信号电缆,每次连接后测量,定位具体哪根电缆或接口导致超标。对问题电缆进行处理,如加共模扼流圈、滤波器,或优化电缆布局和屏蔽。重新连接所有电缆,再次测量
    时源芯微 2024-12-11 17:11 80浏览
  • 近日,搭载紫光展锐W517芯片平台的INMO GO2由影目科技正式推出。作为全球首款专为商务场景设计的智能翻译眼镜,INMO GO2 以“快、准、稳”三大核心优势,突破传统翻译产品局限,为全球商务人士带来高效、自然、稳定的跨语言交流体验。 INMO GO2内置的W517芯片,是紫光展锐4G旗舰级智能穿戴平台,采用四核处理器,具有高性能、低功耗的优势,内置超微高集成技术,采用先进工艺,计算能力相比同档位竞品提升4倍,强大的性能提供更加多样化的应用场景。【视频见P盘链接】 依托“
    紫光展锐 2024-12-11 11:50 51浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦