中科院王金桥:多模态大模型的发展与思考

原创 爱分析ifenxi 2024-01-19 14:01






1 月 9 日,爱分析成功举办 2024 爱分析·AI与大模型高峰论坛,邀请了各领域的专家学者、企业代表、大模型厂商和实践专家,分享前沿的技术进展和领先企业内的落地场景与实践经验。
今天为大家带来多模态大模型的技术原理和发展趋势。

分享嘉宾|王金桥 中国科学院自动化所研究所副总工程师、武汉人工智能研究院院长

内容已做精简,如需和专家交流&获取专家完整版视频实录,请扫码。


过去十年的人工智能,我们称为是专用智能,就是用大数据训练一个小模型,解决单一的任务。

专用智能有三个问题,第一是泛化能力差,这个场景能识别目标,换个场景就识别不了;第二是智能性差,只能做一些感知任务,例如识别人脸,识别语音,识别物体;第三是通用性差,一个模型只能做一个任务,导致整个人工智能的应用非常的碎片化,每个场景都要很多人采集大量的数据标注训练,在监督学习的范式下做人工智能的落地,就遇到了巨大的一个挑战:难以实现商业的闭环。
所以大家都开始做“大数据+大模型+大算力”,训练类人一样通用性的模型,相当于一个模型做多个任务,无论是感知、认知、推理、决策。
Open AI 在2023 年收入超过 16 亿美金, Open AI 和竞品的一些实践,也证明整个大模型是能够实现商业闭环,而且一个模型可以做多个任务。所以现在大家的各个场景都在全面的拥抱大模型,现在大模型和各个场景结合,也是整个人工智能落地的一个非常好的前景。
从 2022 年的语言模型,现在逐步演进到多模态,因为多模态的思考方式才更像我们人一样感知、认知、和环境进行交互、学会使用工具。同时它的成长也是随着年龄一直到  14 岁,基本上它的智力进化相对是一个比较持续完善的过程,而且还有人看不到的一些信号理解。
整个的大模型也是从大语言模型到多模态,像多模态交互以及多模态的智能体,到群体智能这是整个大模型的技术路径。
当然我们也一直在这方面做了很多的工作,特别是在我们自动化所在 2020 年成立了全国第一个大模型研究中心,把视觉团队、语言团队还有语音团队合并成了一个团队。自动化所是国内在人工智能领域最早的模式识别国家重点实验室,它在人工智能的每个细分领域都有非常多的团队,所以在合并之后就专门成立了这个中心来做大模型的攻关,全面进入自监督学习加微调的新范式。
一直到 2021 年我们发布了业内第一个多模态的大模型“紫东太初”,用了大概9亿的弱相关数据,模型自监督的学习自身的知识,这是我们提出的第一个跨模态自监督学习的范式。
在 2023 年的 6 月发布了 2.0 的版本。1.0 开发最早是聚焦在异构数据的图像、文本、语音的多模态自监督学习。希望图像的每个区域,能对应语言的每个词或者是每个 token 做弱的对应和对齐,在词语级别以及它模态级别的对齐后,随便的遮盖掉任何一个模态、或者任何一个字、或者任一个语音片段、图像的任何一个区域,就能实现跨模态的自监督,这就是能够实现海量的知识的学习,以及潜在关系的学习。例如我们所看到的“岩石”“海”“女人”“牛仔裤”“脚”“提琴”它们之间空间知识的关系,大模型会形成隐式知识的表示。
最早期实现的跨模态生成,是不同模态之间自动的转换,这是 1.0 的版本。在 2.0 阶段进一步的把人看不到的信息,像雷达、红外、各种各样的光谱,把这些信息都融合到框架里。当然我们发现在框架里,不是所有的数据都能弱相关,特别是红外的数据和三维点云的数据,往往它对齐的是图像空间,我们叫做分组对齐,在分组对齐的过程中,将各种多模态的数据混排。
我们一直探索的、最重要的大模型基石就是 Transformer 的结构。在刚才的跨模态对齐中,固定化的划分模块或者 token ,很难实现语义结构的完整性,所以更重要的是如何去更好的捕获更有表述力和特征的区域。在这里我们提出了可变形的 Transformer 模块。这个模块一定是语义敏感的区域,通过多头的注意力机制,每个模块的尺寸是不固定的,叫做可变形的。这就是类似在机器学习 HOG 特征对应一个可变形 HOG ,这样随着模块可变形的空间,就能更好的捕获语言语义、图像、视频、音频的动态区域大小,捕获更精准的语义。
同时在多模态的序列对齐里,把图像看成小作文,把它展成多模态的不同大小的框,或者每个区域把它展成序列,通过图像序列和语言标签序列,把每个框的坐标也作为序列的输出,就形成序列的多任务对齐方式。这就是在解决不同模态、不同场景的数据之间,多任务自回归的序列。这样的回归机制,就可以保证自回归损失和重构的损失,收敛的速度更快一些。
同时在细粒度的表示中,除了有框的表示,在视觉的任务中,多个任务都可以用一种表示,就是像素级的表示,既可以画框,也可以画轮廓,也可以给它做一些分割。另外还可以根据用户的需求,分割的力度不一样,这样就形成了基于提示的对象提取,把对标  Meta 的 SAM 模型,引入全实力分割的检测头的 Fast SAM 方法,让分割任务的性能跟 Meta 的 SAM 性能相当,同时处理的速度提高了 50 倍,全面的实现在视觉任务上,支持多尺度、多粒度的目标提取,实现了在多模态对齐里,能够支撑各种各样的任务输出。
同时现在大模型的小型化也是非常主流的一个趋势。我们现在这方面做了很多的工作,第一是在大模型的高效训练上,第二是在推理上。通过通道的系数化和空间的系数化,使 token 建立共享的机制,从而保证推理的参数直接能降低 35% 。同时在训练的过程中,也用了各种各样的并行策略,以及混合精度的策略,把各种各样的算子融合、替代和加速,使效果能够实现高速的训练。最典型的一个方法,叫做基于波动性度量的高效模型剪枝。在做大模型落地的过程,比如金融的场景中,发现用一个 6B 的模型在做推理的时候,度量每个权重会发现有 50% 的权重基本上是不变的,就类似大模型做能力分区。例如在人做某一项专业任务的时候,其他的神经元很多都不激活,它的参数、权重是不怎么变的,所以就直接把参数记录下来,算过的数就不算了,这样直接使它参数量降低 50% ,推理速度提高 66% ,这是目前最简单粗暴的一个剪枝方法。只要看一下哪些权重是不变的,把它固定下来。这样的效率是可以用到任何一个模型结构里,都能达到高效的推理。
特别在手机端,不同的任务可以激活不同的权重,就实现了基于多模态的任务,可以进行图文并茂的任意回答。例如你让他把这个胡萝卜框出来,他就给你框出来,你让他的画框、检测关键点、分割,都可以实现多任务的推理和高效的输出。也可以给它一个三维的点云,同样它能输出有多少个房间,现在在跟设计公司,做一些设计、装修,通过  AI 的自动化三维设计,能够使它的效果跟人做对齐。
现在人工智能的感知能力、逻辑、推理、解题都取得了巨大的进步,但是仍然存在的一些问题。第一是幻觉,要外挂知识库;第二是自主进化,我们只知道 GPT 4 只到 2023  年 4 月份,后面就不知道了。如何通过搜索增强,以及让最新的数据喂进去,也不遗忘以前的数据,同时保持新的数据学习。这就是它的泛化能力和自学能力提出更高的要求。
另一方面大模型能够借助工具通过 agent 能够更好的与环境进行交互,通过单源的场景,从语言场景到多模态,再到真正的融入生活中,通过各种各样 agent 的信息消化,实现认知世界到融入环境的跨越,这也是整个大模型生成归纳新概念的能力。
现在AI 在各个领域都一些典型的应用,包括客服,知识库,同时更希望大模型能够提供规划任务的拆解和推理能力,所以在整个大模型的发展趋势里,从大数据智能、语言智能到多模态的具身智能、群体智能、混合智能、最后的自主智能,最终大模型还是要和人进行协同的,和价值观的对齐。
整个大模型现在进入到新的阶段,原来的专用模型,到现在兼采集数据、标注、训练,然后不断的做场景适配,相当于手工作坊的模型研发时代,基本上算法工程师占据了交付的主力军。再慢慢的到工业化的开发时代,把世界知识的底座模型训好。各领域训练行业专属模型,然后再做微调,只需要输出需要的东西,大模型就变成了平台,相当于工业化的研发模式。而且可以减少对数据的依赖,可以把知识和经验有效的进行编码,最终的还可以去辅助更多的规划和决策。
所以将整个的趋势做一个总结:
第一,多模态、多任务的高效对齐协同,包括价值观的对齐。
第二,大模型深度结合,串联小模型。不是所有的情况都由大模型解决,什么情况下需要小模型呢?像人脸识别,每人有 40 张照片,共有七八千万人的ID。训练一个两兆的模型就能实现这种亿万分之一的误识率。所以并不是大模型把小模型都替代了,而是更多开放的、泛化的场景,需要大模型串联小模型加各种工具,作为中间的桥梁把各种各样的工具和能力串联起来。
第三,更强的理解、推理、生成和交互能力。真正的大模型竞争是抢占科技的制高点,推理生成和复杂的规划能力,才是真正的模型。当你发现机器人场景中,你让他做一些任务发现都不行, GPT 4 有的时候也不行,就需要更多高质量的数据,使它变得更强。
第四,可控与安全性。我们要让模型不能有偏见,价值观对齐,对人没有伤害。
以上四点是整个的大模型发展趋势,今天跟大家分享就是这些,谢谢。

长按二维码,领取完整版视频实录和课件

中国科学院自动化所副总工程师,紫东太初大模型研究中心常务副主任,研究员,博导,武汉人工智能研究院院长,中国科学院大学人工智能学院岗位教授,多模态人工智能产业联盟秘书长,主要从事多模态大模型、视频分析与检索、大规模目标识别等方面的研究。共发表包括IEEE国际权威期刊和顶级会议论文300余篇,国际期刊50余篇,国际会议220余篇。完成国家标准提案3项,发明专利36项,10项国际视觉算法竞赛冠军,新时代中国经济创新人物,北京市科技进步一等奖,北京市自然科学二等奖,世界人工智能大会SAIL奖,吴文俊人工智能科技进步二等奖,中国发明创新银奖,中科院科苑名匠团队。

注:点击左下角“阅读原文”,领取专家完整版实录


爱分析ifenxi 爱分析是一家中国领先的数字化市场研究与咨询机构。
评论 (0)
  •   电磁信号模拟系统深度解析   一、系统概述   北京华盛恒辉电磁信号模拟系统作为半实物仿真测试系统,广泛应用于无线通信、军事训练等多领域。它通过软硬件结合,构建逼真电磁信号环境,用于测试电子设备在复杂电磁干扰下的性能表现。   应用案例   目前,已有多个电磁信号模拟系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润电磁信号模拟系统。这些成功案例为电磁信号模拟系统的推广和应用提供了有力支持。   二、系统组成   装备模型库:涵盖雷达、通信设备等各类装备平台及电子装
    华盛恒辉l58ll334744 2025-04-21 10:48 93浏览
  •   海上安全事件应急处置系统解析   北京华盛恒辉海上安全事件应急处置系统是为应对船舶碰撞、火灾等海上突发事件打造的综合管理体系,通过技术与协同机制,实现快速响应救援、优化资源配置,守护海上生命、财产与环境安全。以下从系统构成、功能、技术、应用及趋势展开阐述。   应用案例   目前,已有多个海上安全事件应急处置系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润海上安全事件应急处置系统。这些成功案例为海上安全事件应急处置系统的推广和应用提供了有力支持。   一、系统构成
    华盛恒辉l58ll334744 2025-04-21 15:50 66浏览
  • 一、‌基础原理验证与分析‌1、‌理解霍尔效应基本机制‌通过实验观察磁场中导体或半导体材料的电荷偏转现象,验证霍尔电压与磁场强度、电流方向的关系,直观认识洛伦兹力对载流子的作用‌。2、‌探索磁电效应关联性‌研究霍尔效应与材料电学特性(如载流子类型、浓度)的关联,揭示半导体材料的导电机制(如N型/P型半导体)。二、‌参数测量与标定‌1、‌关键物理量测量‌掌握霍尔元件灵敏度(KH)、霍尔系数(RH)、电导率(σ)及载流子迁移率(μ)的测量方法,为半导体材料性能评估提供数据支持。2、‌磁场强度与分布测定
    锦正茂科技 2025-04-21 13:03 34浏览
  •   海上安全事件应急处置系统平台深度解析   一、平台概述   北京华盛恒辉海上安全事件应急处置系统平台融合现代信息技术、通信技术、GIS、大数据分析及 AI 等技术,旨在快速响应船舶碰撞、火灾、溢油等海上突发事件,实现科学决策与高效资源调配,保障海上生命财产安全、减少环境污染。   应用案例   目前,已有多个海上安全事件应急处置系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润海上安全事件应急处置系统。这些成功案例为海上安全事件应急处置系统的推广和应用提供了有力支持
    华盛恒辉l58ll334744 2025-04-21 15:21 82浏览
  • 精益生产咨询师证/精益管理专业人员证/精益生产工程师证虽然在名称上有一些差异,但其实实际区别并不大,目前类似的证书以ILSSI-CLMP较为得到国际上的认可,当然,你不会因为有一张精益生产咨询师证,而会有人马上请你做咨询师,因为除了知识之外,你还要有充足经验、热诚、沟通能力等等,这些也是我们招聘咨询师的基本要求。那么,有没有必要取得CLMP证书呢?这主要取决于你自己对职业发展的规划和自我提升的意志。CLMP是什么?CLMP的全称是Certified Lean Management Profess
    优思学院 2025-04-21 14:29 39浏览
  •   电磁信号模拟平台解析   北京华盛恒辉电磁信号模拟平台作为模拟复杂电磁环境的系统,在无线通信、电子对抗等多领域广泛应用。以下从功能、技术特性、应用场景及发展趋势展开详细解读。   应用案例   目前,已有多个电磁信号模拟平台在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润电磁信号模拟平台。这些成功案例为电磁信号模拟平台的推广和应用提供了有力支持。   一、核心功能   复杂电磁环境建模:构建贴近真实的电磁环境,涵盖各类干扰因素。   多通道信号模拟:模拟多通道电磁信号
    华盛恒辉l58ll334744 2025-04-21 15:10 88浏览
  •   有效数据智能分拣系统平台深度解析   一、系统概述   北京华盛恒辉有效数据智能分拣系统平台融合人工智能、机器视觉、物联网及大数据分析技术,为物流包裹、数据信息等提供高效精准的智能化分拣处理方案。通过自动化设备与智能算法协同运作,取代传统人工分拣模式,显著提升分拣效率、降低错误率,满足电商、快递及供应链不断增长的业务需求。   应用案例   目前,已有多个有效数据智能分拣系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润有效数据智能分拣系统。这些成功案例为有效数据智能分
    华盛恒辉l58ll334744 2025-04-21 16:22 111浏览
  • 导读在汽车测试和现代工业领域,功耗控制与效率优化是工程师们不断追求的目标。虹科PCAN Router系列设备以其卓越的性能和灵活性,为CAN/CAN FD网络中的报文转换提供了高效解决方案。本文将探讨虹科PCAN Router系列设备如何在保持高效工作的同时,通过低功耗模式和高效唤醒功能,满足对能耗有严格要求的应用场景。虹科PCAN Router系列网关1 低功耗模式的优势与实现在实际的工作场景中,可能会出现一些对功耗要求存在限制的情况。鉴于此,可以灵活设置虹科PCAN Router系
    虹科汽车智能互联 2025-04-21 15:45 57浏览
  • 导读在智能汽车技术发展浪潮中,车辆控制系统的智能化、网络化已成为行业发展的必然趋势。虹科PEAK智行定位车控系统,集成了尖端科技,能够实现车辆全方位监控与控制。从实时GPS定位到CAN/CAN FD信号处理,虹科方案不仅提升了车辆的智能化水平,更在安全性和效率上迈出了革命性的一步。虹科PEAK智行定位车控系统,通过CAN/CAN FD信号实现车辆的精准控制,包括加减速、转弯、倒退等动作,模拟真实车辆平台的动态表现。该系统搭载了虹科各型号设备,通过紧密协作,实时反映车辆位置、总线报文等信息,实现车
    虹科汽车智能互联 2025-04-21 16:04 64浏览
  •  霍尔效应的检测需通过实验手段测量霍尔电压、载流子浓度等参数,并分析材料电学特性。以下是具体检测方法及流程:一、核心检测方法1、‌直流(DC)霍尔测试‌‌原理‌:通过恒定磁场和电流测量霍尔电压,适用于常规半导体材料(如硅、砷化镓)。‌步骤‌:向样品通入直流电流,施加垂直磁场,用高精度电压表直接测量霍尔电压,并排除热电压等干扰信号。2、‌交流磁场(AC)霍尔测试‌‌适用场景‌:针对低迁移率材料(如某些有机半导体),霍尔电压远小于误差电压时使用。‌技术要点‌:利用锁相放大器提取交流磁场下的
    锦正茂科技 2025-04-21 11:39 37浏览
  • 北京贞光科技有限公司作为紫光同芯授权代理商,深耕电子元器件领域数十载,专为汽车与工业客户提供车规级安全芯片及配套服务。公司整合硬件供应、软件SDK与技术支持为一体,配备专业团队提供选型咨询与现场指导,助力客户实现完整的芯片应用解决方案。在全球芯片供应链重构的大背景下,我国车规级芯片产业正迎来前所未有的发展机遇。北京贞光科技有限公司作为紫光同芯授权代理商,深耕电子元器件领域数十载,专为汽车与工业客户提供车规级安全芯片及配套服务。公司整合硬件供应、软件SDK与技术支持为一体,配备专业团队提供选型咨询
    贞光科技 2025-04-21 16:10 65浏览
  •   有效数据智能分拣系统详解   北京华盛恒辉有效数据智能分拣系统融合人工智能、大数据分析与机器学习等前沿技术,实现海量数据自动化分类、筛选、整理及分配。凭借强大的数据处理效能,助力企业精准提取关键信息,优化决策流程,提升运营效率。以下从系统架构、核心功能、技术特性、应用场景及发展趋势展开解读。   应用案例   目前,已有多个有效数据智能分拣系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润有效数据智能分拣系统。这些成功案例为有效数据智能分拣系统的推广和应用提供了有力支持。
    华盛恒辉l58ll334744 2025-04-21 16:46 97浏览
  •  霍尔效应自发现以来,已渗透至多个行业领域,其核心应用可归纳为以下几类:一、‌电子与半导体行业‌1、‌半导体器件开发与测试‌① 通过测量霍尔系数和电阻率,判断器件的导电类型(N型/P型)及载流子浓度分布,优化器件设计和制造工艺‌。② 监控晶圆掺杂水平和表面缺陷,提高集成电路良率‌。2、‌磁场传感器制造与校准‌测试霍尔传感器的灵敏度、线性度、响应时间等参数,确保其在汽车、工业控制等场景下的可靠性‌。3、‌电磁测量仪器‌基于霍尔电压与磁场强度的线性关系,开发高斯计、电流表、功率计等‌。二、
    锦正茂科技 2025-04-21 13:17 42浏览
  • 导读在当今快速发展的智能通讯领域,时间敏感网络(TSN)已成为确保网络通信高可靠性和低延迟的关键技术。IEEE 802.1 Qci作为TSN的一个重要组成部分,提供了一套强大的机制来管理网络流量,确保关键数据流的优先级和带宽得到保障。本文将深入探讨IEEE 802.1 Qci协议的基本概念、工作原理以及虹科提供的Qci解决方案,帮您理解如何通过精确的流量控制来提升网络的稳定性和效率。虹科TSN解决方案01# 技术简介时间敏感网络(TSN)通过IEEE 802.1 Qci标准定义了一种关
    虹科工业智能互联 2025-04-21 16:17 70浏览
  • 导读Linux驱动程序领域再添新成员,PLIN驱动程序现已正式发布。这一新驱动程序为使用LIN接口的用户提供了一个便捷、高效的解决方案。本文将展示如何安装PLIN驱动程序,以及如何在Linux环境下进行基本的PLIN通信操作,确保您能够快速掌握并应用这一新工具。继我们在Linux环境下成功推出CAN/CAN FD接口驱动程序后,现在我们为LIN接口带来了同样兼容Linux的驱动程序。免费软件包中不仅包含了驱动程序本身,还提供实用工具和一份易于理解的快速入门指南。用户下载后,需要根据当前使用的Li
    虹科汽车智能互联 2025-04-21 14:56 56浏览
我要评论
0
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦