HotChips2023:用至强处理器执行类脑推论

EETOP 2023-10-18 11:33
点这里👇关注我,记得标星哦~

来源:科技新报  作者:痴汉水球

可曾想过人为什么会有「意识」?理解世界的“智能”又从何而来?这和处理器业界的年度盛事 Hot Chips 又有什么千丝万缕的关系?

被誉为世界科幻文学三巨头之一的罗伯特·海莱恩(Robert Anson Heinlein),1961 年出版的《异乡异客》(Stranger in a Strange Land),陈述在火星长大的孤儿,用非人类的眼光审视人类世界的故事。作者杜撰了一个词「Numenta」,来自拉丁文的「心灵」(Mentis)之意。

2005 年,知名计算机科学家兼神经生物学家 Jeff Hawkins、Donna Dubinsky 和 Dileep George 创立 Numenta,目标通过开发基于大脑新皮质的原理,创造机器智能。之前 Jeff Hawkins 是 Palm 和 Handspring 创办人,可谓掌上型运算领域先驱者,也创建红杉神经科学研究所(Redwood Neuroscience Institute),身兼美国国家工程学院院士。

▲ Numenta 创办人之一 Jeff Hawkins 是知名的计算机科学家与神经生物学家,更是 Palm、Handspring、红杉神经科学研究所(Redwood Neuroscience Institute)和 Numenta 创办者,曾主导 Palm 和 Treo 等早期掌上型运算平台研发,并撰写《On Intelligence》(创智慧)和《A Thoudand Brains》(千脑)两本人工智能领域的名作。

据人类进化史,大脑皮质分为新皮层和古皮层,厚度约 2~4 毫米,位于脑半球顶层的新皮质,处理数据的手段与人类意识和知觉息息相关。

因此 Jeffrey 和伙伴一起写了《On Intelligence》(中译「创智慧」或「人工智能的未来」),提出「阶层式时序记忆」(HTM,Hierarchical Temporal Memory)演算法,为 Numenta 核心技术,藉模拟新皮层机制,以人类认知世界的方式学习世界,可储存、学习、推论和长序列回忆。Numenta 成立宗旨,不外乎逆向工程新皮质,最终制造出以相同理念运作的人工智能机器。

▲ 不同神经元模型比较:A. 人工神经网络。B. 生物神经元(新皮层锥体神经元)。C.HTM(阶层式时序记忆)神经元。可清楚看到 Numenta 企图变相复制更接近大脑的运作方式,再用于人工智能。

Jeff Hawkins 2018 年出版《A Thoudand Brains》,后来被微软创办人比尔盖兹(Bill Gates)列入 2021 年底圣诞阅读清单,探讨「千脑理论」(The Thousand Brains Theory)彻底改变我们对大脑和人工智能前景的理解,介绍千脑理论如何影响机器智能的未来, 并试图解释大脑皮质每小部分都独立学习对象模型,这些模型最后合并,形成整体认知。

换言之,人类智慧来自大脑无数个几乎一模一样的皮质柱(Cortical Column)共同作业,就好像大脑由「几千个同时运行组件」组成。

更精确点,千脑理论可分成四部分:

  • 「多重模型」:

    皮层每部分都独立学习对象模型。

    这象征有成千上万皮层区域同时学习和建立相同对象的模型。

  • 「多重表征」:

    皮层每部分都独立学习对象,代表大脑有多个同对象的表征。

  • 「投影框架」:

    大脑使用称为投影框架的方法确定物体的空间位置,意谓我们不仅学习物体本身,还要学习物体与其他物体的相对位置。

  • 「结合模型」:

    虽然皮层每部分都有独立模型,但高层次整合或结合,形成完整的认知模型。

▲「千脑理论」是 Numenta 试图解释大脑皮层工作原理的神经科学理论,核心观点在大脑皮层每小部分都独立学习对象模型,这些模型最终会合并,形成整体认知。

既然 Numenta 开宗明义要「模仿人类大脑」,那像大脑与生俱来的「稀疏性(Sparsity)计算」,与避免神经网络学习新任务或新数据时,可能会完全或部分忘记以前学到的信息或技能的「灾难性遗忘」(Catastrophic Forgetting)造成连续学习(连续学习多任务, 而不是从头开始)于传统神经网络的瓶颈,自然也是 Numenta 努力的重点。

▲ Jeff Hawkins 两本著作构成 Numenta 公司的技术思路基础,阐述「千脑理论」的后者还曾被被微软创办人比尔盖茨列为 2021 年底圣诞阅读清单。

但你或许会疑惑:难道 Numenta 真要打造「与大脑同样原理」的芯片?当然不是,且任何芯片都不做。Numenta 的诉求很简单:普及的泛用服务器处理器(通指英特尔 Xeon)就可靠 AVX-512 指令集和内建「AI 的下一大步」AMX(Advanced Matrix Extensions)矩阵加速器,跑出优异的推论效能,更不需高阶运算 GPU。这很可能让人觉得 Numenta 的「格局」和这么多年于 Hot Chips 猛冲「人工智能」的众多厂商,高下立判。

▲ 英特尔AMX发布超过三年,但到今年第一季第四代Xeon-SP处理器Sapphire Rapids才让人一亲芳泽。就让我们看看 Numenta 如何发挥 AMX 对人工智能的潜能。

历经 20 年深入研究神经网络,不久前 9 月 11 日,Numenta 终于宣布推出商业化人工智能产品:Numenta 智能运算平台(NuPIC,Numenta Platform for Intelligent Computing),为 HTM 算法的实际商品,对应 C++、Python、Java 及 Clojure(Java 平台 Lisp)等程式语言版。

现在就让我们好好瞧瞧今年 Hot Chips,Numenta 怎样使用普遍部署的 CPU 解决人工智能推理问题,如何活用 AVX-512 和 AMX,一睹足以让英特尔自豪的成果。

▲ Numenta 的目标:受神经科学启发,将更多大脑运作方式用于人工智能。毕竟人脑功率约 20W,却能超越功耗超出几个量级的电脑。与为了密集计算(尝试计算每种排列组合)而生的近代电脑,人脑是为大量稀疏计算(仅计算最相关和最有影响力组合)而设计。

▲ 神经元看起来很复杂,却让生物大脑在极度稀疏状态运作。Numenta 将 HTM 算法应用到新型 CPU,可将运算变得超稀疏,消除 90% 权重同时,提供相似的精确度。

▲ 使用 GPU 推论的技术限制:现今 GPU 专为超高密度矩阵乘法运算量身订做,须持续填充数据才能维持高效处理,且缺乏弹性,混合 CPU 和 GPU 的「两块内存」基础架构也造成额外麻烦和挑战。

▲ Numenta 利用 AVX-512 指令集、AMX 和英特尔数学核心函式库(MKL,Math Kernel Library),达成约 90% 稀疏率。

▲ 英特尔延宕多次的第四代Xeon-SP处理器 Sapphire Rapids 首次引进AMX(Advanced Matrix Extensions),正如其名,旨在高效矩阵运算,特色在2D结构的数据寄存器Tile和每个时钟周期可同时进行1,024个BF16格式数据计算的TMUL(Tile Matrix Multiply)执行单元,同时支持 FP32、FP16 和 INT8。后继第六代 Granite Rapids 将新增 AMX-COMPLEX 半精度浮点复数。这次 Numenta 将对世人展示真正威力。

▲ Numenta 同步使用AVX-512和AMX,如AMX输出FP32运算结果,用AVX-512转换成BF16,再回馈给AMX下一步计算,充分掩盖AMX载入Tile的延迟,尽量保持运作单元满载,达成最大计算量。

▲ Numenta 充分运用AVX-512和AMX加持下,56核心的英特尔第四代Xeon-SP处理器,BERT(Bidirectional Encoder Representations from Transformers)模型推论效能达19倍、32核心第四代Xeon-SP Ice Lake的62倍和48核心AMD第三代EPYC Milan的123 倍。

▲ 结合 Numenta 的 HTM 算法和英特尔 AMX,第四代 Xeon-SP 有 Nvidia A100 十倍的推论输出率。

▲ 相同计算成本,Numenta 有明显较高精确度。Numenta 目标在通过改变模型计算需求,调整实现准确性成本曲线。

▲ Numenta 不但证明英特尔 AMX 可明显提升大型语言模型(LLM,Large Language Model)效率,更可怕的是,假若换装成内建 64GB HBM2e 的 Xeon Max,还可再提高到「三倍」输出率。

▲ 最后,Numenta 强调「整个 NuPIC 可以只用 CPU 跑」(NuPIC can run entirely on CPUs),这还真是 Numenta 和英特尔的共同胜利。

自从英特尔 2020 年 6 月发布 AMX 后,大概因一再延期与坊间极度陌生的刻板印象,加上拜 OpenAI 之赐的 Nvidia「皮衣教主」热潮,少人关注这技术的实际潜力,但「20 年磨一剑」的 Numenta,却让世人在 Hot Chips 首次见识到真正威力──况且这两家公司很明显合作密切,否则近年「核战」一直处于上风的 AMD 就不会当沙包猛打了──即使拖出没有AVX-512的AMD第三代EPYC Milan有点胜之不武。

▲ 看来 Xeon Max 的 64GB HBM2e 的确有不错效果,尤其对很吃带宽的大型语言模型(LLM,Large Language Model)特别有效。

人工智能用户用英特尔 Xeon 处理器执行近似人类大脑推论的 Numenta,最大贡献在「连常规服务器也可跑很快」,不必痴痴等待缺货的 Nvidia、尚未完备的 AMD MI300 与刚起步的英特尔 Gaudi 2 加速器。但话说回来,AMD 会不会全面性兼容AVX-512 后,也将实装AMX 纳入之后产品计划,颇值得观察。

EETOP EETOP半导体社区-国内知名的半导体行业媒体、半导体论坛、IC论坛、集成电路论坛、电子工程师博客、工程师BBS。
评论
  • 在过去十年中,自动驾驶和高级驾驶辅助系统(AD/ADAS)软件与硬件的快速发展对多传感器数据采集的设计需求提出了更高的要求。然而,目前仍缺乏能够高质量集成多传感器数据采集的解决方案。康谋ADTF正是应运而生,它提供了一个广受认可和广泛引用的软件框架,包含模块化的标准化应用程序和工具,旨在为ADAS功能的开发提供一站式体验。一、ADTF的关键之处!无论是奥迪、大众、宝马还是梅赛德斯-奔驰:他们都依赖我们不断发展的ADTF来开发智能驾驶辅助解决方案,直至实现自动驾驶的目标。从新功能的最初构思到批量生
    康谋 2025-01-09 10:04 55浏览
  • 1月7日-10日,2025年国际消费电子产品展览会(CES 2025)盛大举行,广和通发布Fibocom AI Stack,赋智千行百业端侧应用。Fibocom AI Stack提供集高性能模组、AI工具链、高性能推理引擎、海量模型、支持与服务一体化的端侧AI解决方案,帮助智能设备快速实现AI能力商用。为适应不同端侧场景的应用,AI Stack具备海量端侧AI模型及行业端侧模型,基于不同等级算力的芯片平台或模组,Fibocom AI Stack可将TensorFlow、PyTorch、ONNX、
    物吾悟小通 2025-01-08 18:17 53浏览
  • 在当前人工智能(AI)与物联网(IoT)的快速发展趋势下,各行各业的数字转型与自动化进程正以惊人的速度持续进行。如今企业在设计与营运技术系统时所面临的挑战不仅是技术本身,更包含硬件设施、第三方软件及配件等复杂的外部因素。然而这些系统往往讲究更精密的设计与高稳定性,哪怕是任何一个小小的问题,都可能对整体业务运作造成严重影响。 POS应用环境与客户需求以本次分享的客户个案为例,该客户是一家全球领先的信息技术服务与数字解决方案提供商,遭遇到一个由他们所开发的POS机(Point of Sal
    百佳泰测试实验室 2025-01-09 17:35 54浏览
  • 本文介绍编译Android13 ROOT权限固件的方法,触觉智能RK3562开发板演示,搭载4核A53处理器,主频高达2.0GHz;内置独立1Tops算力NPU,可应用于物联网网关、平板电脑、智能家居、教育电子、工业显示与控制等行业。关闭selinux修改此文件("+"号为修改内容)device/rockchip/common/BoardConfig.mkBOARD_BOOT_HEADER_VERSION ?= 2BOARD_MKBOOTIMG_ARGS :=BOARD_PREBUILT_DTB
    Industio_触觉智能 2025-01-08 00:06 111浏览
  • 根据环洋市场咨询(Global Info Research)项目团队最新调研,预计2030年全球中空长航时无人机产值达到9009百万美元,2024-2030年期间年复合增长率CAGR为8.0%。 环洋市场咨询机构出版了的【全球中空长航时无人机行业总体规模、主要厂商及IPO上市调研报告,2025-2031】研究全球中空长航时无人机总体规模,包括产量、产值、消费量、主要生产地区、主要生产商及市场份额,同时分析中空长航时无人机市场主要驱动因素、阻碍因素、市场机遇、挑战、新产品发布等。报告从中空长航时
    GIRtina 2025-01-09 10:35 56浏览
  • 故障现象一辆2017款东风风神AX7车,搭载DFMA14T发动机,累计行驶里程约为13.7万km。该车冷起动后怠速运转正常,热机后怠速运转不稳,组合仪表上的发动机转速表指针上下轻微抖动。 故障诊断 用故障检测仪检测,发动机控制单元中无故障代码存储;读取发动机数据流,发现进气歧管绝对压力波动明显,有时能达到69 kPa,明显偏高,推断可能的原因有:进气系统漏气;进气歧管绝对压力传感器信号失真;发动机机械故障。首先从节气门处打烟雾,没有发现进气管周围有漏气的地方;接着拔下进气管上的两个真空
    虹科Pico汽车示波器 2025-01-08 16:51 107浏览
  • 一个真正的质量工程师(QE)必须将一件产品设计的“意图”与系统的可制造性、可服务性以及资源在现实中实现设计和产品的能力结合起来。所以,可以说,这确实是一种工程学科。我们常开玩笑说,质量工程师是工程领域里的「侦探」、「警察」或「律师」,守护神是"墨菲”,信奉的哲学就是「墨菲定律」。(注:墨菲定律是一种启发性原则,常被表述为:任何可能出错的事情最终都会出错。)做质量工程师的,有时会不受欢迎,也会被忽视,甚至可能遭遇主动或被动的阻碍,而一旦出了问题,责任往往就落在质量工程师的头上。虽然质量工程师并不负
    优思学院 2025-01-09 11:48 79浏览
  • 在智能网联汽车中,各种通信技术如2G/3G/4G/5G、GNSS(全球导航卫星系统)、V2X(车联网通信)等在行业内被广泛使用。这些技术让汽车能够实现紧急呼叫、在线娱乐、导航等多种功能。EMC测试就是为了确保在复杂电磁环境下,汽车的通信系统仍然可以正常工作,保护驾乘者的安全。参考《QCT-基于LTE-V2X直连通信的车载信息交互系统技术要求及试验方法-1》标准10.5电磁兼容试验方法,下面将会从整车功能层面为大家解读V2X整车电磁兼容试验的过程。测试过程揭秘1. 设备准备为了进行电磁兼容试验,技
    北汇信息 2025-01-09 11:24 65浏览
  • 「他明明跟我同梯进来,为什么就是升得比我快?」许多人都有这样的疑问:明明就战绩也不比隔壁同事差,升迁之路却比别人苦。其实,之间的差异就在于「领导力」。並非必须当管理者才需要「领导力」,而是散发领导力特质的人,才更容易被晓明。许多领导力和特质,都可以通过努力和学习获得,因此就算不是天生的领导者,也能成为一个具备领导魅力的人,进而被老板看见,向你伸出升迁的橘子枝。领导力是什么?领导力是一种能力或特质,甚至可以说是一种「影响力」。好的领导者通常具备影响和鼓励他人的能力,并导引他们朝着共同的目标和愿景前
    优思学院 2025-01-08 14:54 93浏览
  •  在全球能源结构加速向清洁、可再生方向转型的今天,风力发电作为一种绿色能源,已成为各国新能源发展的重要组成部分。然而,风力发电系统在复杂的环境中长时间运行,对系统的安全性、稳定性和抗干扰能力提出了极高要求。光耦(光电耦合器)作为一种电气隔离与信号传输器件,凭借其优秀的隔离保护性能和信号传输能力,已成为风力发电系统中不可或缺的关键组件。 风力发电系统对隔离与控制的需求风力发电系统中,包括发电机、变流器、变压器和控制系统等多个部分,通常工作在高压、大功率的环境中。光耦在这里扮演了
    晶台光耦 2025-01-08 16:03 84浏览
  • 光伏逆变器是一种高效的能量转换设备,它能够将光伏太阳能板(PV)产生的不稳定的直流电压转换成与市电频率同步的交流电。这种转换后的电能不仅可以回馈至商用输电网络,还能供独立电网系统使用。光伏逆变器在商业光伏储能电站和家庭独立储能系统等应用领域中得到了广泛的应用。光耦合器,以其高速信号传输、出色的共模抑制比以及单向信号传输和光电隔离的特性,在光伏逆变器中扮演着至关重要的角色。它确保了系统的安全隔离、干扰的有效隔离以及通信信号的精准传输。光耦合器的使用不仅提高了系统的稳定性和安全性,而且由于其低功耗的
    晶台光耦 2025-01-09 09:58 43浏览
  • 职场是人生的重要战场,既是谋生之地,也是实现个人价值的平台。然而,有些思维方式却会悄无声息地拖住你的后腿,让你原地踏步甚至退步。今天,我们就来聊聊职场中最忌讳的五种思维方式,看看自己有没有中招。1. 固步自封的思维在职场中,最可怕的事情莫过于自满于现状,拒绝学习和改变。世界在不断变化,行业的趋势、技术的革新都在要求我们与时俱进。如果你总觉得自己的方法最优,或者害怕尝试新事物,那就很容易被淘汰。与其等待机会找上门,不如主动出击,保持学习和探索的心态。加入优思学院,可以帮助你快速提升自己,与行业前沿
    优思学院 2025-01-09 15:48 47浏览
  • HDMI 2.2 规格将至,开启视听新境界2025年1月6日,HDMI Forum, Inc. 宣布即将发布HDMI规范2.2版本。新HDMI规范为规模庞大的 HDMI 生态系统带来更多选择,为创建、分发和体验理想的终端用户效果提供更先进的解决方案。新技术为电视、电影和游戏工作室等内容制作商在当前和未来提供更高质量的选择,同时实现多种分发平台。96Gbps的更高带宽和新一代 HDMI 固定比率速率传输(Fixed Rate Link)技术为各种设备应用提供更优质的音频和视频。终端用户显示器能以最
    百佳泰测试实验室 2025-01-09 17:33 55浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦