HotChips2023:用至强处理器执行类脑推论

EETOP 2023-10-18 11:33
点这里👇关注我,记得标星哦~

来源:科技新报  作者:痴汉水球

可曾想过人为什么会有「意识」?理解世界的“智能”又从何而来?这和处理器业界的年度盛事 Hot Chips 又有什么千丝万缕的关系?

被誉为世界科幻文学三巨头之一的罗伯特·海莱恩(Robert Anson Heinlein),1961 年出版的《异乡异客》(Stranger in a Strange Land),陈述在火星长大的孤儿,用非人类的眼光审视人类世界的故事。作者杜撰了一个词「Numenta」,来自拉丁文的「心灵」(Mentis)之意。

2005 年,知名计算机科学家兼神经生物学家 Jeff Hawkins、Donna Dubinsky 和 Dileep George 创立 Numenta,目标通过开发基于大脑新皮质的原理,创造机器智能。之前 Jeff Hawkins 是 Palm 和 Handspring 创办人,可谓掌上型运算领域先驱者,也创建红杉神经科学研究所(Redwood Neuroscience Institute),身兼美国国家工程学院院士。

▲ Numenta 创办人之一 Jeff Hawkins 是知名的计算机科学家与神经生物学家,更是 Palm、Handspring、红杉神经科学研究所(Redwood Neuroscience Institute)和 Numenta 创办者,曾主导 Palm 和 Treo 等早期掌上型运算平台研发,并撰写《On Intelligence》(创智慧)和《A Thoudand Brains》(千脑)两本人工智能领域的名作。

据人类进化史,大脑皮质分为新皮层和古皮层,厚度约 2~4 毫米,位于脑半球顶层的新皮质,处理数据的手段与人类意识和知觉息息相关。

因此 Jeffrey 和伙伴一起写了《On Intelligence》(中译「创智慧」或「人工智能的未来」),提出「阶层式时序记忆」(HTM,Hierarchical Temporal Memory)演算法,为 Numenta 核心技术,藉模拟新皮层机制,以人类认知世界的方式学习世界,可储存、学习、推论和长序列回忆。Numenta 成立宗旨,不外乎逆向工程新皮质,最终制造出以相同理念运作的人工智能机器。

▲ 不同神经元模型比较:A. 人工神经网络。B. 生物神经元(新皮层锥体神经元)。C.HTM(阶层式时序记忆)神经元。可清楚看到 Numenta 企图变相复制更接近大脑的运作方式,再用于人工智能。

Jeff Hawkins 2018 年出版《A Thoudand Brains》,后来被微软创办人比尔盖兹(Bill Gates)列入 2021 年底圣诞阅读清单,探讨「千脑理论」(The Thousand Brains Theory)彻底改变我们对大脑和人工智能前景的理解,介绍千脑理论如何影响机器智能的未来, 并试图解释大脑皮质每小部分都独立学习对象模型,这些模型最后合并,形成整体认知。

换言之,人类智慧来自大脑无数个几乎一模一样的皮质柱(Cortical Column)共同作业,就好像大脑由「几千个同时运行组件」组成。

更精确点,千脑理论可分成四部分:

  • 「多重模型」:

    皮层每部分都独立学习对象模型。

    这象征有成千上万皮层区域同时学习和建立相同对象的模型。

  • 「多重表征」:

    皮层每部分都独立学习对象,代表大脑有多个同对象的表征。

  • 「投影框架」:

    大脑使用称为投影框架的方法确定物体的空间位置,意谓我们不仅学习物体本身,还要学习物体与其他物体的相对位置。

  • 「结合模型」:

    虽然皮层每部分都有独立模型,但高层次整合或结合,形成完整的认知模型。

▲「千脑理论」是 Numenta 试图解释大脑皮层工作原理的神经科学理论,核心观点在大脑皮层每小部分都独立学习对象模型,这些模型最终会合并,形成整体认知。

既然 Numenta 开宗明义要「模仿人类大脑」,那像大脑与生俱来的「稀疏性(Sparsity)计算」,与避免神经网络学习新任务或新数据时,可能会完全或部分忘记以前学到的信息或技能的「灾难性遗忘」(Catastrophic Forgetting)造成连续学习(连续学习多任务, 而不是从头开始)于传统神经网络的瓶颈,自然也是 Numenta 努力的重点。

▲ Jeff Hawkins 两本著作构成 Numenta 公司的技术思路基础,阐述「千脑理论」的后者还曾被被微软创办人比尔盖茨列为 2021 年底圣诞阅读清单。

但你或许会疑惑:难道 Numenta 真要打造「与大脑同样原理」的芯片?当然不是,且任何芯片都不做。Numenta 的诉求很简单:普及的泛用服务器处理器(通指英特尔 Xeon)就可靠 AVX-512 指令集和内建「AI 的下一大步」AMX(Advanced Matrix Extensions)矩阵加速器,跑出优异的推论效能,更不需高阶运算 GPU。这很可能让人觉得 Numenta 的「格局」和这么多年于 Hot Chips 猛冲「人工智能」的众多厂商,高下立判。

▲ 英特尔AMX发布超过三年,但到今年第一季第四代Xeon-SP处理器Sapphire Rapids才让人一亲芳泽。就让我们看看 Numenta 如何发挥 AMX 对人工智能的潜能。

历经 20 年深入研究神经网络,不久前 9 月 11 日,Numenta 终于宣布推出商业化人工智能产品:Numenta 智能运算平台(NuPIC,Numenta Platform for Intelligent Computing),为 HTM 算法的实际商品,对应 C++、Python、Java 及 Clojure(Java 平台 Lisp)等程式语言版。

现在就让我们好好瞧瞧今年 Hot Chips,Numenta 怎样使用普遍部署的 CPU 解决人工智能推理问题,如何活用 AVX-512 和 AMX,一睹足以让英特尔自豪的成果。

▲ Numenta 的目标:受神经科学启发,将更多大脑运作方式用于人工智能。毕竟人脑功率约 20W,却能超越功耗超出几个量级的电脑。与为了密集计算(尝试计算每种排列组合)而生的近代电脑,人脑是为大量稀疏计算(仅计算最相关和最有影响力组合)而设计。

▲ 神经元看起来很复杂,却让生物大脑在极度稀疏状态运作。Numenta 将 HTM 算法应用到新型 CPU,可将运算变得超稀疏,消除 90% 权重同时,提供相似的精确度。

▲ 使用 GPU 推论的技术限制:现今 GPU 专为超高密度矩阵乘法运算量身订做,须持续填充数据才能维持高效处理,且缺乏弹性,混合 CPU 和 GPU 的「两块内存」基础架构也造成额外麻烦和挑战。

▲ Numenta 利用 AVX-512 指令集、AMX 和英特尔数学核心函式库(MKL,Math Kernel Library),达成约 90% 稀疏率。

▲ 英特尔延宕多次的第四代Xeon-SP处理器 Sapphire Rapids 首次引进AMX(Advanced Matrix Extensions),正如其名,旨在高效矩阵运算,特色在2D结构的数据寄存器Tile和每个时钟周期可同时进行1,024个BF16格式数据计算的TMUL(Tile Matrix Multiply)执行单元,同时支持 FP32、FP16 和 INT8。后继第六代 Granite Rapids 将新增 AMX-COMPLEX 半精度浮点复数。这次 Numenta 将对世人展示真正威力。

▲ Numenta 同步使用AVX-512和AMX,如AMX输出FP32运算结果,用AVX-512转换成BF16,再回馈给AMX下一步计算,充分掩盖AMX载入Tile的延迟,尽量保持运作单元满载,达成最大计算量。

▲ Numenta 充分运用AVX-512和AMX加持下,56核心的英特尔第四代Xeon-SP处理器,BERT(Bidirectional Encoder Representations from Transformers)模型推论效能达19倍、32核心第四代Xeon-SP Ice Lake的62倍和48核心AMD第三代EPYC Milan的123 倍。

▲ 结合 Numenta 的 HTM 算法和英特尔 AMX,第四代 Xeon-SP 有 Nvidia A100 十倍的推论输出率。

▲ 相同计算成本,Numenta 有明显较高精确度。Numenta 目标在通过改变模型计算需求,调整实现准确性成本曲线。

▲ Numenta 不但证明英特尔 AMX 可明显提升大型语言模型(LLM,Large Language Model)效率,更可怕的是,假若换装成内建 64GB HBM2e 的 Xeon Max,还可再提高到「三倍」输出率。

▲ 最后,Numenta 强调「整个 NuPIC 可以只用 CPU 跑」(NuPIC can run entirely on CPUs),这还真是 Numenta 和英特尔的共同胜利。

自从英特尔 2020 年 6 月发布 AMX 后,大概因一再延期与坊间极度陌生的刻板印象,加上拜 OpenAI 之赐的 Nvidia「皮衣教主」热潮,少人关注这技术的实际潜力,但「20 年磨一剑」的 Numenta,却让世人在 Hot Chips 首次见识到真正威力──况且这两家公司很明显合作密切,否则近年「核战」一直处于上风的 AMD 就不会当沙包猛打了──即使拖出没有AVX-512的AMD第三代EPYC Milan有点胜之不武。

▲ 看来 Xeon Max 的 64GB HBM2e 的确有不错效果,尤其对很吃带宽的大型语言模型(LLM,Large Language Model)特别有效。

人工智能用户用英特尔 Xeon 处理器执行近似人类大脑推论的 Numenta,最大贡献在「连常规服务器也可跑很快」,不必痴痴等待缺货的 Nvidia、尚未完备的 AMD MI300 与刚起步的英特尔 Gaudi 2 加速器。但话说回来,AMD 会不会全面性兼容AVX-512 后,也将实装AMX 纳入之后产品计划,颇值得观察。

EETOP EETOP半导体社区-国内知名的半导体行业媒体、半导体论坛、IC论坛、集成电路论坛、电子工程师博客、工程师BBS。
评论
  •   陆地边防事件紧急处置系统平台解析   北京华盛恒辉陆地边防事件紧急处置系统平台是整合监测、预警、指挥等功能的智能化综合系统,致力于增强边防安全管控能力,快速响应各类突发事件。以下从系统架构、核心功能、技术支撑、应用场景及发展趋势展开全面解读。   应用案例   目前,已有多个陆地边防事件紧急处置系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润陆地边防事件紧急处置系统。这些成功案例为陆地边防事件紧急处置系统的推广和应用提供了有力支持。   一、系统架构   感知层:部
    华盛恒辉l58ll334744 2025-04-23 11:22 32浏览
  • 近期,金融界消息称,江西万年芯微电子有限公司申请一项名为“基于预真空腔体注塑的芯片塑封方法及芯片”的专利。此项创新工艺的申请,标志着万年芯在高端芯片封装领域取得重要突破,为半导体产业链提升注入了新动能。专利摘要显示,本发明公开了一种基于预真空腔体注塑的芯片塑封方法,方法包括将待塑封的大尺寸芯片平铺于下模盒腔体内的基板并将大尺寸芯片的背向表面直接放置于基板上以进行基板吸附;将上模盒盖合于下模盒形成塑封腔,根据基板将塑封腔分为上型腔以及下型腔;将下型腔内壁与大尺寸芯片间的空隙进行树脂填充;通过设置于
    万年芯 2025-04-22 13:28 95浏览
  • 一、行业背景与市场需求高血压作为全球发病率最高的慢性病之一,其早期监测与管理已成为公共卫生领域的重要课题。世界卫生组织数据显示,全球超13亿人受高血压困扰,且患者群体呈现年轻化趋势。传统血压计因功能单一、数据孤立等缺陷,难以满足现代健康管理的需求。在此背景下,集语音播报、蓝牙传输、电量检测于一体的智能血压计应运而生,通过技术创新实现“测量-分析-管理”全流程智能化,成为慢性病管理的核心终端设备。二、技术架构与核心功能智能血压计以电子血压测量技术为基础,融合物联网、AI算法及语音交互技术,构建起多
    广州唯创电子 2025-04-23 09:06 72浏览
  •   电磁兼容(EMC)故障诊断系统软件解析   北京华盛恒辉电磁兼容故障诊断系统软件是攻克电子设备电磁干扰难题的专业利器。在电子设备复杂度攀升、电磁兼容问题频发的背景下,该软件于研发、测试、生产全流程中占据关键地位。以下为其详细介绍:   应用案例   目前,已有多个电磁兼容故障诊断系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润电磁兼容故障诊断系统。这些成功案例为电磁兼容故障诊断系统的推广和应用提供了有力支持。   一、软件核心功能   干扰与敏感分析:深度剖析电磁干
    华盛恒辉l58ll334744 2025-04-22 14:53 139浏览
  •   电磁兼容故障诊断系统平台深度解析   北京华盛恒辉电磁兼容(EMC)故障诊断系统平台是解决电子设备在复杂电磁环境下性能异常的核心工具。随着电子设备集成度提升与电磁环境复杂化,EMC 问题直接影响设备可靠性与安全性。以下从平台架构、核心功能、技术实现、应用场景及发展趋势展开全面剖析。   应用案例   目前,已有多个电磁兼容故障诊断系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润电磁兼容故障诊断系统。这些成功案例为电磁兼容故障诊断系统的推广和应用提供了有力支持。  
    华盛恒辉l58ll334744 2025-04-22 14:29 156浏览
  • 文/Leon编辑/cc孙聪颖‍4月18日7时,2025北京亦庄半程马拉松暨人形机器人半程马拉松正式开跑。与普通的半马比赛不同,这次比赛除了有人类选手,还有21支人形机器人队伍参赛,带来了全球首次人类与机器人共同竞技的盛况。参赛队伍中,不乏明星机器人企业及机型,比如北京人形机器人创新中心的天工Ultra、松延动力的N2等。宇树G1、众擎PM01,则是由城市之间科技有限公司购置及调试,并非厂商直接参赛。考虑到机器人的适用场景和续航力各有不同,其赛制也与人类选手做出区别:每支赛队最多可安排3名参赛选手
    华尔街科技眼 2025-04-22 20:10 55浏览
  •   电磁干扰抑制系统平台深度解析   一、系统概述   北京华盛恒辉电磁干扰抑制系统在电子技术快速发展、电磁环境愈发复杂的背景下,电磁干扰(EMI)严重影响电子设备性能、稳定性与安全性。电磁干扰抑制系统平台作为综合性解决方案,通过整合多元技术手段,实现对电磁干扰的高效抑制,确保电子设备稳定运行。   应用案例   目前,已有多个电磁干扰抑制系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润电磁干扰抑制系统。这些成功案例为电磁干扰抑制系统的推广和应用提供了有力支持。   二
    华盛恒辉l58ll334744 2025-04-22 15:27 145浏览
  • 文/Leon编辑/cc孙聪颖‍在特朗普政府发起的关税战中,全球芯片产业受到巨大冲击,美国芯片企业首当其冲。据报道称,英伟达本周二公布的8-K文件显示,美国政府通知该公司向中国(包括中国香港及澳门)销售尖端芯片(H20)时,需要获得美国政府的许可。文件发布后,英伟达预计会在第一季度中额外增加55亿美元的相关费用计提。随后,英伟达股价单日下跌6.9%,市值一夜蒸发约1890亿美元(约合人民币1.37万亿元)。至截稿时,至截稿时,其股价未见止跌,较前日下跌4.51%。北京时间4月17日,英伟达创始人、
    华尔街科技眼 2025-04-22 20:14 55浏览
  •   卫星通信效能评估系统平台全面解析   北京华盛恒辉卫星通信效能评估系统平台是衡量卫星通信系统性能、优化资源配置、保障通信服务质量的关键技术工具。随着卫星通信技术的快速发展,特别是低轨卫星星座、高通量卫星和软件定义卫星的广泛应用,效能评估系统平台的重要性日益凸显。以下从技术架构、评估指标、关键技术、应用场景及发展趋势五个维度进行全面解析。   应用案例   目前,已有多个卫星通信效能评估系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润卫星通信效能评估系统。这些成功案例为卫
    华盛恒辉l58ll334744 2025-04-22 16:34 132浏览
  • 在科技飞速发展的当下,机器人领域的每一次突破都能成为大众瞩目的焦点。这不,全球首届人形机器人半程马拉松比赛刚落下帷幕,赛场上的 “小插曲” 就掀起了一阵网络热潮。4月19日,北京亦庄的赛道上热闹非凡,全球首届人形机器人半程马拉松在这里激情开跑。20支机器人队伍带着各自的“参赛选手”,踏上了这21.0975公里的挑战之路。这场比赛可不简单,它将机器人放置于真实且复杂的动态路况与环境中,对机器人在运动控制、环境感知和能源管理等方面的核心技术能力进行了全方位的检验。不仅要应对长距离带来的续航挑战,还要
    用户1742991715177 2025-04-22 20:42 54浏览
  •   复杂电磁环境模拟系统平台解析   一、系统概述   北京华盛恒辉复杂电磁环境模拟系统平台是用于还原真实战场或特定场景电磁环境的综合性技术平台。该平台借助软硬件协同运作,能够产生多源、多频段、多体制的电磁信号,并融合空间、时间、频谱等参数,构建高逼真度的电磁环境,为电子对抗、通信、雷达等系统的研发、测试、训练及评估工作提供重要支持。   应用案例   目前,已有多个复杂电磁环境模拟系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润复杂电磁环境模拟系统。这些成功案例为复杂电
    华盛恒辉l58ll334744 2025-04-23 10:29 54浏览
  • 一、技术背景与市场机遇在智能家居高速发展的今天,用户对家电设备的安全性、智能化及能效表现提出更高要求。传统取暖器因缺乏智能感知功能,存在能源浪费、安全隐患等痛点。WTL580-C01微波雷达感应模块的诞生,为取暖设备智能化升级提供了创新解决方案。该模块凭借微波雷达技术优势,在精准测距、环境适应、能耗控制等方面实现突破,成为智能取暖器领域的核心技术组件。二、核心技术原理本模块采用多普勒效应微波雷达技术,通过24GHz高频微波信号的发射-接收机制,实现毫米级动作识别和精准测距。当人体进入4-5米有效
    广州唯创电子 2025-04-23 08:41 71浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦