芯片“小”问题或导致互联网巨头停机

半导体产业纵横 2022-02-10 18:37


本文由半导体产业纵横编译自纽约时报


随着最大的计算机网络不断发展壮大,一些工程师担心他们最小的组件可能会成为致命的弱点。



想象一下,为世界上最大的数据中心提供动力的服务器内的数百万个计算机芯片里存在罕见的、几乎无法检测到的缺陷。发现缺陷的唯一方法是将这些芯片放入到大量的计算问题中一一寻找,这种难度在十年前是无法想象的。


随着计算机芯片中的微型开关已经缩小到几个原子的宽度,芯片的可靠性已成为运行世界上最大网络的人们的另一个担忧。去年,亚马逊、Facebook、Twitter 和许多其他网站公司们都经历了令人惊讶的停机。


停机有几个原因,例如编程错误和网络拥塞。但人们越来越担心随着云计算网络变得越来越大、越来越复杂,它们在最基本的层面上仍然依赖于计算机芯片,但是这些芯片现在不太可靠、在某些情况下也难以预测的。


在过去的一年里,Facebook和谷歌的研究人员都发表了描述计算机硬件故障的研究报告,说这些故障的原因不容易确定。他们认为,问题不在于软件,而在于不同公司制造的计算机硬件的某个地方。谷歌拒绝对其研究发表评论,而现在被称为 Meta 的 Facebook 没有回复对其研究发表评论的请求。


专门测试计算机硬件的斯坦福大学电气工程师 Subhasish 说:“他们看到了这些无声的错误,基本上来自底层硬件,” Mitra博士说,越来越多人认为,缺陷的产生与这些不易被发现的所谓无声错误有关。


Facebook 位于俄勒冈州普林维尔的数据中心。大型数据中心曾经历过中断,部分原因可能是芯片错误。 

来源:纽约时报Leah Nash


研究人员担心他们会发现罕见的缺陷,因为他们正试图解决越来越大的计算问题,这会以意想不到的方式给他们的系统带来压力。


十多年前,运行大型数据中心的公司开始报告系统性问题。2015 年,在工程出版物IEEE Spectrum中,一群在多伦多大学研究硬件可靠性的计算机科学家报告称,每年谷歌数百万台计算机中有多达 4% 的计算机遇到了无法检测到的错误,并且导致了他们意外关闭。


在一个拥有数十亿个晶体管的微处理器中——或者一个由数万亿个微型开关组成的计算机内存板中,每个微型开关都可以存储一个1 或 0,即使是最小的错误也会破坏现在每秒例行执行数十亿次计算的系统。


在半导体时代初期,工程师们担心宇宙射线偶尔会翻转单个晶体管并改变计算结果的可能性。现在他们担心开关本身越来越不可靠。Facebook 研究人员甚至争辩说,这些开关变得越来越容易磨损,并且计算机内存或处理器的寿命可能比以前认为的要短。


越来越多的证据表明,随着每一代新一代芯片的出现,这个问题都在恶化。芯片制造商 Advanced Micro Devices 于 2020 年发布的一份报告发现,现在最先进的计算机内存芯片的可靠性大约比上一代低 5.5 倍。AMD 没有回应对该报告发表评论的请求。


资深硬件工程师大卫·迪策尔(David Ditzel) 是世界语科技公司的董事长兼创始人,他说追踪这些错误具有挑战性。世界语科技公司是一家为加利福尼亚州山景城(Mountain View,California)的人工智能应用而设计的新型处理器制造商,有1000个处理器,由280亿个晶体管组成。


他将芯片比作一座横跨整个美国表面的公寓楼。Mitra 博士使用 Ditzel 先生的比喻说,发现新错误有点像在那栋大楼的一间公寓里寻找一个单独的水龙头,只有当卧室灯亮并且公寓门打开时,水龙头才会发生故障。

 

谷歌位于爱荷华州康瑟尔布拉夫斯的数据中心。谷歌研究人员发现,处理器内核似乎只在特定条件下才会产生错误。 

来源:路透社Brian Snyder


到目前为止,计算机设计人员一直试图通过在芯片中添加特殊电路来纠正错误,从而解决硬件缺陷。电路会自动检测和纠正不良数据。它这曾经被认为是一个极其罕见的问题。但几年前,谷歌生产团队开始报告难以诊断的错误。根据他们的报告,计算错误会间歇性发生并且难以重现。


一组研究人员试图追查这个问题,去年他们发表了他们的发现。他们得出的结论是,该公司庞大的数据中心由基于数百万个处理器“内核”的计算机系统组成,它正在经历新的错误,这些错误可能是由两个因素组合而成:接近物理极限的较小晶体管和不充分的测试。

 

谷歌研究人员在他们的论文《Cores That Don’t Count》中指出,这个问题非常具有挑战性,以至于他们已经投入了相当于数十年的工程时间来解决它。


现代处理器芯片由数十个处理器内核组成,计算引擎可以分解任务且并行解决它们。研究人员发现,一小部分核心很少会产生不准确的结果,而且仅在某些条件下才会产生。他们将这种行为描述为零星的。在某些情况下,只有在计算速度或温度发生变化时,内核才会产生错误。


据谷歌称,处理器设计复杂性的增加是失败的重要原因之一。但工程师们也表示,较小的晶体管、三维芯片和仅在某些情况下会产生错误的新设计都导致了这个问题。


在去年发布的一篇类似论文中,Facebook的一组研究人员指出,一些处理器会通过制造商的测试,但在投入使用时就开始出现故障。

英特尔高管表示,他们熟悉谷歌和Facebook 的研究论文,并正在与两家公司合作开发检测和纠正硬件错误的新方法。


英特尔数据平台集团副总裁布莱恩·乔根森(Bryan Jorgensen)表示,研究人员的断言是正确的,“他们对行业提出的挑战是正确的选择。”

 

*声明:本文系原作者创作。文章内容系其个人观点,我方转载仅为分享与讨论,不代表我方赞成或认同,如有异议,请联系后台。






半导体产业纵横 (微信号: ICViews)半导体产业纵横是神州数码数智创新+平台下的自媒体账号,立足产业视角,提供及时、专业、深度的前沿洞见、技术速递、趋势解析,赋能中国半导体产业,我们一直在路上。
评论 (0)
  •   陆地边防事件紧急处置系统平台解析   北京华盛恒辉陆地边防事件紧急处置系统平台是整合监测、预警、指挥等功能的智能化综合系统,致力于增强边防安全管控能力,快速响应各类突发事件。以下从系统架构、核心功能、技术支撑、应用场景及发展趋势展开全面解读。   应用案例   目前,已有多个陆地边防事件紧急处置系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润陆地边防事件紧急处置系统。这些成功案例为陆地边防事件紧急处置系统的推广和应用提供了有力支持。   一、系统架构   感知层:部
    华盛恒辉l58ll334744 2025-04-23 11:22 88浏览
  • 一、技术背景与市场机遇在智能家居高速发展的今天,用户对家电设备的安全性、智能化及能效表现提出更高要求。传统取暖器因缺乏智能感知功能,存在能源浪费、安全隐患等痛点。WTL580-C01微波雷达感应模块的诞生,为取暖设备智能化升级提供了创新解决方案。该模块凭借微波雷达技术优势,在精准测距、环境适应、能耗控制等方面实现突破,成为智能取暖器领域的核心技术组件。二、核心技术原理本模块采用多普勒效应微波雷达技术,通过24GHz高频微波信号的发射-接收机制,实现毫米级动作识别和精准测距。当人体进入4-5米有效
    广州唯创电子 2025-04-23 08:41 115浏览
  • 一、行业背景与市场需求高血压作为全球发病率最高的慢性病之一,其早期监测与管理已成为公共卫生领域的重要课题。世界卫生组织数据显示,全球超13亿人受高血压困扰,且患者群体呈现年轻化趋势。传统血压计因功能单一、数据孤立等缺陷,难以满足现代健康管理的需求。在此背景下,集语音播报、蓝牙传输、电量检测于一体的智能血压计应运而生,通过技术创新实现“测量-分析-管理”全流程智能化,成为慢性病管理的核心终端设备。二、技术架构与核心功能智能血压计以电子血压测量技术为基础,融合物联网、AI算法及语音交互技术,构建起多
    广州唯创电子 2025-04-23 09:06 123浏览
  • 前言本文主要演示基于TL3576-MiniEVM评估板HDMI OUT、DP 1.4和MIPI的多屏同显、异显方案,适用开发环境如下。Windows开发环境:Windows 7 64bit、Windows 10 64bitLinux开发环境:VMware16.2.5、Ubuntu22.04.5 64bitU-Boot:U-Boot-2017.09Kernel:Linux-6.1.115LinuxSDK:LinuxSDK-[版本号](基于rk3576_linux6.1_release_v
    Tronlong 2025-04-23 13:59 67浏览
  • 在科技飞速发展的当下,机器人领域的每一次突破都能成为大众瞩目的焦点。这不,全球首届人形机器人半程马拉松比赛刚落下帷幕,赛场上的 “小插曲” 就掀起了一阵网络热潮。4月19日,北京亦庄的赛道上热闹非凡,全球首届人形机器人半程马拉松在这里激情开跑。20支机器人队伍带着各自的“参赛选手”,踏上了这21.0975公里的挑战之路。这场比赛可不简单,它将机器人放置于真实且复杂的动态路况与环境中,对机器人在运动控制、环境感知和能源管理等方面的核心技术能力进行了全方位的检验。不仅要应对长距离带来的续航挑战,还要
    用户1742991715177 2025-04-22 20:42 83浏览
  • 文/Leon编辑/cc孙聪颖‍在特朗普政府发起的关税战中,全球芯片产业受到巨大冲击,美国芯片企业首当其冲。据报道称,英伟达本周二公布的8-K文件显示,美国政府通知该公司向中国(包括中国香港及澳门)销售尖端芯片(H20)时,需要获得美国政府的许可。文件发布后,英伟达预计会在第一季度中额外增加55亿美元的相关费用计提。随后,英伟达股价单日下跌6.9%,市值一夜蒸发约1890亿美元(约合人民币1.37万亿元)。至截稿时,至截稿时,其股价未见止跌,较前日下跌4.51%。北京时间4月17日,英伟达创始人、
    华尔街科技眼 2025-04-22 20:14 87浏览
  • 故障现象一辆2016款奔驰C200L车,搭载274 920发动机,累计行驶里程约为13万km。该车组合仪表上的防侧滑故障灯、转向助力故障灯、安全气囊故障灯等偶尔异常点亮,且此时将挡位置于R挡,中控显示屏提示“后视摄像头不可用”,无法显示倒车影像。 故障诊断用故障检测仪检测,发现多个控制单元中均存储有通信类故障代码(图1),其中故障代码“U015587 与仪表盘的通信存在故障。信息缺失”出现的频次较高。 图1 存储的故障代码1而组合仪表中存储有故障代码“U006488 与用户界
    虹科Pico汽车示波器 2025-04-23 11:22 55浏览
  •   电磁频谱数据综合管理平台系统解析   一、系统定义与目标   北京华盛恒辉电磁频谱数据综合管理平台融合无线传感器、软件定义电台等前沿技术,是实现无线电频谱资源全流程管理的复杂系统。其核心目标包括:优化频谱资源配置,满足多元通信需求;运用动态管理与频谱共享技术,提升资源利用效率;强化频谱安全监管,杜绝非法占用与干扰;为电子战提供频谱监测分析支持,辅助作战决策。   应用案例   目前,已有多个电磁频谱数据综合管理平台在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润电磁频谱数
    华盛恒辉l58ll334744 2025-04-23 16:27 97浏览
  •   复杂电磁环境模拟系统平台解析   一、系统概述   北京华盛恒辉复杂电磁环境模拟系统平台是用于还原真实战场或特定场景电磁环境的综合性技术平台。该平台借助软硬件协同运作,能够产生多源、多频段、多体制的电磁信号,并融合空间、时间、频谱等参数,构建高逼真度的电磁环境,为电子对抗、通信、雷达等系统的研发、测试、训练及评估工作提供重要支持。   应用案例   目前,已有多个复杂电磁环境模拟系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润复杂电磁环境模拟系统。这些成功案例为复杂电
    华盛恒辉l58ll334744 2025-04-23 10:29 122浏览
  •   无人机结构仿真与部件拆解分析系统平台解析   北京华盛恒辉无人机结构仿真与部件拆解分析系统无人机技术快速发展的当下,结构仿真与部件拆解分析系统平台成为无人机研发测试的核心工具,在优化设计、提升性能、降低成本等方面发挥关键作用。以下从功能、架构、应用、优势及趋势展开解析。   应用案例   目前,已有多个无人机结构仿真与部件拆解分析系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润无人机结构仿真与部件拆解分析系统。这些成功案例为无人机结构仿真与部件拆解分析系统的推广和应用提
    华盛恒辉l58ll334744 2025-04-23 15:00 113浏览
  •   后勤实验仿真系统平台深度解析   北京华盛恒辉后勤实验仿真系统平台依托计算机仿真技术,是对后勤保障全流程进行模拟、分析与优化的综合性工具。通过搭建虚拟场景,模拟资源调配、物资运输等环节,为后勤决策提供数据支撑,广泛应用于军事、应急管理等领域。   应用案例   目前,已有多个后勤实验仿真系统平台在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润后勤实验仿真系统平台。这些成功案例为后勤实验仿真系统平台的推广和应用提供了有力支持。   一、核心功能   (一)后勤资源模拟
    华盛恒辉l58ll334744 2025-04-23 15:39 80浏览
我要评论
0
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦