CUDA编程训练营

Linux阅码场 2024-05-16 08:00
培训主题: CUDA编程
培训时长: 12 小时
课程描述
本课程是为对cuda编程感兴趣的软件工程师设计的。本课程第一部分主要介绍CUDA编程相关的知识。首先本课程将简单介绍GPU编程的基础概念,包括GPU硬件,GPU编程模型(SIMT),以及简单的CUDA程序实例。本课程将进一步介绍GPU程序运行时,包括CUDA初始化,CUDA程序中不同内存的使用,CUDA程序同步机制,多GPU间的通信和进程间的通信。本课程也介绍高级的CUDA编程技术,如协作组(cooperative group),动态并发 (dynamic parallism),虚拟内存 (virtual memory),流(stream),和统一内存模型(unified memory)等。本课程的第二部分涉及CUDA编程的基础设施部分,包括网络和存储。网络部分设计Nivdia NCCL库,存储部分涉及GPU Direct Storage。为了让本课程更加实用,本课程第三部分将介绍开发不同应用程序(数值分析,计算机视觉,自然语言处理等)所需要的CUDA 库。本课程最后一部分是实验部分,主要涵盖典型的CUDA程序例子,用以熟悉CUDA编程的各种模式。
面向的听众:本课程适合任何有编程开发经验的人
学习目标
· 理解CUDA编程基本概念:SIMT,CUDA kernel,GPU内存分成结构,GPU线程模型等。
· 理解GPU CUDA程序运行时系统
· 掌握GPU CUDA程序性能调优
· 掌握GPU编程生态中网络和存储相关基础设施
· 掌握CUDA编程常见范式和多种开发应用程序需要的CUDA库
课程大纲
1) CUDA编程 (6 hour)
i. CUDA编程入门(
ii. CUDA程序运行时
iii. 高级CUDA编程技术和CUDA性能调优
2) CUDA生态网络和存储基础设施介绍 (2 hours)
3) CUDA应用程序开发库介绍 (2 hours)
4) CUDAc程序开发实践(2 hours)
课程预备知识
学生应该熟悉C/C++编程,并拥有笔记本电脑进行编程,最好能有GPU硬件。
课程名称:CUDA Programming
1:CUDA 编程基础(6 hour)
1.1: CUDA编程入门
学习目标:
· 了解GPU硬件体系架构
· 掌握GPU编程模型
· 掌握GPU内存和线程结构
· 掌握CUDA组成结构
· 掌握CUDA程序接口,CUDA编译流程,PTX指令等
1.2 CUDA运行时
学习目标:
· 掌握CUDA程序初始化流程
· 掌握在CUDA程序中各种GPU内存的使用
§ 共享内存
§ 纹理内存(texture memory)等
· 内存同步
· 异步并发执行
· 多GPU设备编程
1.3 高级CUDA编程及CUDA程序性能调优
学习目标:
· CUDA程序协作
· CUDA动态并发
· 虚拟内存管理
· 流式有序的内存分配
· 统一内存编程模型
· CUDA程序性能调优
§ 最大化GPU使用率
§ 最大化内存/指令
§ Minizine memory thrashing
2: CUDA生态基础设施(2 hour)
2.1: GPU网络互联
学习目标:
· 理解NCCL(NVidia Collective Communication Library)的作用
· 深入理解NCCL实现的通信原语(Ring-allreduce, Tree-Gather, All-to-All, etc).
· 掌握NCCL API的使用
· 了解真实GPU互联的案例 – Azure NDv4
· 熟悉基于网络图的训练系统
2.2: GPU直通存储(GPU direct storage)
学习目标:
· 熟悉GPU Direct Storage 的基本概念
· 掌握GDS软件栈和legacy存储软件栈的区别
· 掌握cuFile的API使用
· 完整的GDS软硬件系统示例
3: CUDA应用程序库介绍 (2 hour)
3.1: CUDA数值分析库
学习目标:学习掌握数值分析需要的CUDA库, 如cuBlas, cuFFT,cuSolver等
3.2: CV-CUDA库使用介绍
学习目标:学习掌握CUDA计算机视觉算法库(CV-CUDA)的使用,比掌握一些基础算法的实现,如自适应阈值处理,2D卷积运算,直方图统计,和SIFT算子提取。
3.3: cuDNN深度学习库
学习目标:学习掌握使用cuDNN库的API和组成部件,掌握如何使用cuDNN实现深度学习网络,理解cuDNN在深度学习框架pytoch的应用。
3.4: CUDA数据科学库
学习目标:学习掌握cuDF的使用,已经应用案例。了解Nvidia DALI系统。
4: CUDA编程实践 (2 hour)
4.1: Cuda “hello world” and Monte Carlo模拟(实验)
4.2: 3D Laplace finite difference solver (实验)
4.3: Reduction and Scan operation and recurrence equations (实验)
4.4: Streams and OpenMP Multithreading (实验)
4.5: CV: edge detection (实验)
4.7: NLP: sequence processing and generation (实验)

讲师介绍:
Andy,美国北卡罗来纳大学教堂山计算机科学博士
• 北卡罗来纳大学教堂山博士
• 研究高性能计算对 GPU,RDMA 等有系统研究
• 研究深度学习框架,熟练掌握 Jax,Pyotch,Mindspore 底层设计。
• 纽约州立大学石溪分校硕士
• 从事操作系统方面的研究
• 发表了多篇计算文件系统相关的会议论文。
• 华中科技大学电信系硕士
• 研究计算视觉应用,如人脸识别,自动驾驶等
• 积累了丰富的计算机视觉和深度学习算法。
Andy博士在计算机系统软件设计和实现方面有丰富的经历。Andy在国际顶级会议(SOSP,Eurosys, HostStorage, FAST, SC, PACT, SPAA),和著名杂志(TOS,TOPC)上发表有论文 20 余篇。焦博士对 GPU 的体系架构,GPU CUDA 编程,深度学习算法和软件栈(Pytorch/DeepSpeed 等)有深入研究。焦博士对计算视觉应用(如人脸识别,行人检测,视频监控等)有丰富经验;熟练使用 CUDA 库高效实现计算机视觉常用算法。

课程定价:6000元/人(阅码场会员和训练营老用户优惠券已发放。)

开课时间:20246

课前准备:课程咨询请联系客服小月(WX:linuxer2016)



Linux阅码场 专业的Linux技术社区和Linux操作系统学习平台,内容涉及Linux内核,Linux内存管理,Linux进程管理,Linux文件系统和IO,Linux性能调优,Linux设备驱动以及Linux虚拟化和云计算等各方各面.
评论
  • 在电子技术快速发展的今天,KLV15002光耦固态继电器以高性能和强可靠性完美解决行业需求。该光继电器旨在提供无与伦比的电气隔离和无缝切换,是现代系统的终极选择。无论是在电信、工业自动化还是测试环境中,KLV15002光耦合器固态继电器都完美融合了效率和耐用性,可满足当今苛刻的应用需求。为什么选择KLV15002光耦合器固态继电器?不妥协的电压隔离从本质上讲,KLV15002优先考虑安全性。输入到输出隔离达到3750Vrms(后缀为V的型号为5000Vrms),确保即使在高压情况下,敏感的低功耗
    克里雅半导体科技 2024-11-29 16:15 119浏览
  • 光伏逆变器是一种高效的能量转换设备,它能够将光伏太阳能板(PV)产生的不稳定的直流电压转换成与市电频率同步的交流电。这种转换后的电能不仅可以回馈至商用输电网络,还能供独立电网系统使用。光伏逆变器在商业光伏储能电站和家庭独立储能系统等应用领域中得到了广泛的应用。光耦合器,以其高速信号传输、出色的共模抑制比以及单向信号传输和光电隔离的特性,在光伏逆变器中扮演着至关重要的角色。它确保了系统的安全隔离、干扰的有效隔离以及通信信号的精准传输。光耦合器的使用不仅提高了系统的稳定性和安全性,而且由于其低功耗的
    晶台光耦 2024-12-02 10:40 54浏览
  • 《高速PCB设计经验规则应用实践》+PCB绘制学习与验证读书首先看目录,我感兴趣的是这一节;作者在书中列举了一条经典规则,然后进行详细分析,通过公式推导图表列举说明了传统的这一规则是受到电容加工特点影响的,在使用了MLCC陶瓷电容后这一条规则已经不再实用了。图书还列举了高速PCB设计需要的专业工具和仿真软件,当然由于篇幅所限,只是介绍了一点点设计步骤;我最感兴趣的部分还是元件布局的经验规则,在这里列举如下:在这里,演示一下,我根据书本知识进行电机驱动的布局:这也算知行合一吧。对于布局书中有一句:
    wuyu2009 2024-11-30 20:30 86浏览
  • 最近几年,新能源汽车愈发受到消费者的青睐,其销量也是一路走高。据中汽协公布的数据显示,2024年10月,新能源汽车产销分别完成146.3万辆和143万辆,同比分别增长48%和49.6%。而结合各家新能源车企所公布的销量数据来看,比亚迪再度夺得了销冠宝座,其10月新能源汽车销量达到了502657辆,同比增长66.53%。众所周知,比亚迪是新能源汽车领域的重要参与者,其一举一动向来为外界所关注。日前,比亚迪汽车旗下品牌方程豹汽车推出了新车方程豹豹8,该款车型一上市就迅速吸引了消费者的目光,成为SUV
    刘旷 2024-12-02 09:32 59浏览
  • 光耦合器作为关键技术组件,在确保安全性、可靠性和效率方面发挥着不可或缺的作用。无论是混合动力和电动汽车(HEV),还是军事和航空航天系统,它们都以卓越的性能支持高要求的应用环境,成为现代复杂系统中的隐形功臣。在迈向更环保技术和先进系统的过程中,光耦合器的重要性愈加凸显。1.混合动力和电动汽车中的光耦合器电池管理:保护动力源在电动汽车中,电池管理系统(BMS)是最佳充电、放电和性能监控背后的大脑。光耦合器在这里充当守门人,将高压电池组与敏感的低压电路隔离开来。这不仅可以防止潜在的损坏,还可以提高乘
    腾恩科技-彭工 2024-11-29 16:12 117浏览
  • RDDI-DAP错误通常与调试接口相关,特别是在使用CMSIS-DAP协议进行嵌入式系统开发时。以下是一些可能的原因和解决方法: 1. 硬件连接问题:     检查调试器(如ST-Link)与目标板之间的连接是否牢固。     确保所有必要的引脚都已正确连接,没有松动或短路。 2. 电源问题:     确保目标板和调试器都有足够的电源供应。     检查电源电压是否符合目标板的规格要求。 3. 固件问题: &n
    丙丁先生 2024-12-01 17:37 57浏览
  • 在现代科技浪潮中,精准定位技术已成为推动众多关键领域前进的核心力量。虹科PCAN-GPS FD 作为一款多功能可编程传感器模块,专为精确捕捉位置和方向而设计。该模块集成了先进的卫星接收器、磁场传感器、加速计和陀螺仪,能够通过 CAN/CAN FD 总线实时传输采样数据,并具备内部存储卡记录功能。本篇文章带你深入虹科PCAN-GPS FD的技术亮点、多场景应用实例,并展示其如何与PCAN-Explorer6软件结合,实现数据解析与可视化。虹科PCAN-GPS FD虹科PCAN-GPS FD的数据处
    虹科汽车智能互联 2024-11-29 14:35 149浏览
  • 戴上XR眼镜去“追龙”是种什么体验?2024年11月30日,由上海自然博物馆(上海科技馆分馆)与三湘印象联合出品、三湘印象旗下观印象艺术发展有限公司(下简称“观印象”)承制的《又见恐龙》XR嘉年华在上海自然博物馆重磅开幕。该体验项目将于12月1日正式对公众开放,持续至2025年3月30日。双向奔赴,恐龙IP撞上元宇宙不久前,上海市经济和信息化委员会等部门联合印发了《上海市超高清视听产业发展行动方案》,特别提到“支持博物馆、主题乐园等场所推动超高清视听技术应用,丰富线下文旅消费体验”。作为上海自然
    电子与消费 2024-11-30 22:03 70浏览
  • 国产光耦合器因其在电子系统中的重要作用而受到认可,可提供可靠的电气隔离并保护敏感电路免受高压干扰。然而,随着行业向5G和高频数据传输等高速应用迈进,对其性能和寿命的担忧已成为焦点。本文深入探讨了国产光耦合器在高频环境中面临的挑战,并探索了克服这些限制的创新方法。高频性能:一个持续关注的问题信号传输中的挑战国产光耦合器传统上利用LED和光电晶体管进行信号隔离。虽然这些组件对于标准应用有效,但在高频下面临挑战。随着工作频率的增加,信号延迟和数据保真度降低很常见,限制了它们在电信和高速计算等领域的有效
    腾恩科技-彭工 2024-11-29 16:11 106浏览
  • 国产光耦合器正以其创新性和多样性引领行业发展。凭借强大的研发能力,国内制造商推出了适应汽车、电信等领域独特需求的专业化光耦合器,为各行业的技术进步提供了重要支持。本文将重点探讨国产光耦合器的技术创新与产品多样性,以及它们在推动产业升级中的重要作用。国产光耦合器创新的作用满足现代需求的创新模式新设计正在满足不断变化的市场需求。例如,高速光耦合器满足了电信和数据处理系统中快速信号传输的需求。同时,栅极驱动光耦合器支持电动汽车(EV)和工业电机驱动器等大功率应用中的精确高效控制。先进材料和设计将碳化硅
    克里雅半导体科技 2024-11-29 16:18 157浏览
  • 艾迈斯欧司朗全新“样片申请”小程序,逾160种LED、传感器、多芯片组合等产品样片一触即达。轻松3步完成申请,境内免费包邮到家!本期热荐性能显著提升的OSLON® Optimal,GF CSSRML.24ams OSRAM 基于最新芯片技术推出全新LED产品OSLON® Optimal系列,实现了显著的性能升级。该系列提供五种不同颜色的光源选项,包括Hyper Red(660 nm,PDN)、Red(640 nm)、Deep Blue(450 nm,PDN)、Far Red(730 nm)及Ho
    艾迈斯欧司朗 2024-11-29 16:55 155浏览
  • 学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习笔记&记录学习习笔记&记学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&学习学习笔记&记录学习学习笔记&记录学习学习笔记&记录学习学习笔记&
    youyeye 2024-11-30 14:30 63浏览
  • By Toradex胡珊逢简介嵌入式领域的部分应用对安全、可靠、实时性有切实的需求,在诸多实现该需求的方案中,QNX 是经行业验证的选择。在 QNX SDP 8.0 上 BlackBerry 推出了 QNX Everywhere 项目,个人用户可以出于非商业目的免费使用 QNX 操作系统。得益于 Toradex 和 QNX 的良好合作伙伴关系,用户能够在 Apalis iMX8QM 和 Verdin iMX8MP 模块上轻松测试和评估 QNX 8 系统。下面将基于 Apalis iMX8QM 介
    hai.qin_651820742 2024-11-29 15:29 150浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦