2023爱分析·知识库问答市场厂商评估报告:爱数

原创 爱分析ifenxi 2024-02-01 08:02

01 

研究范围定义
研究范围
大模型是指通过在海量数据上依托强大算力资源进行训练后能完成大量不同下游任务的模型。2023年以来,ChatGPT引爆全球大模型市场。国内众多大模型先后公测,众多互联网领军者投身大模型事业,使得大模型市场进入“百团大战”阶段,2023年成为公认的“大模型元年”。
企业用户方面,大模型的应用速度之快超乎想象。2023年初,企业管理层对大模型的话题还停留在大模型是什么,是不是概念炒作。短短半年,大模型已经从饭后谈资走向落地应用。大企业管理层们希望了解到大模型能为企业发展带来哪些变革,大模型的应用路径是什么,如何提升大模型的投资回报率,以及应该为拥抱大模型做哪些准备。而且,大模型吸引的人群也愈发广泛,不仅吸引CIO、CTO等技术管理者的关注,CEO、CMO等非技术类管理者同样期待大模型在业务中发挥价值。这些转变表明,大模型的变革之力正日益得到产业界的认可。
通过对市场规模数据的分析,能较为直观地体现出企业对大模型应用落地的热情。爱分析数据显示,2023年中国大模型市场规模约为50亿元(人民币,下同)。2023年,企业在大模型方面的采购特点是论证多、采购少,各企业计划在2024年开始大量释放大模型预算,因此市场规模将大幅增长,预计达到120亿元。
爱分析认为,大模型市场从技术架构角度可以划分为基础层、模型层、中间层和应用层。基础层是指为大模型训练推理而提供的基础环境,包括湖仓一体、向量数据库、智算中心、大模型安全流通平台等。模型层是指基础大模型以及微调后的大模型,包括通用大模型、行业大模型、领域大模型和企业大模型。中间层是模型层和应用层之间的“桥梁”,有利于大模型在各种实际场景快速落地,包括大模型应用开发工具、LLMOps工具等。应用层是指大模型应用和解决方案,包括知识库问答、智能客服、对话式分析等。大模型市场划分详见下图。

本评估报告聚焦知识库问答市场,爱分析遴选出具备成熟解决方案和成功案例的厂商,供企业做厂商选型时提供参考。同时,在该市场下,爱分析重点选取了知识库问答厂商爱数进行能力评估。

02 

知识库问答市场分析

市场定义

知识库问答是指将大模型与知识库相结合,改变原有的知识库构建、应用与运维的方式,致力于更好地支撑企业管理层及全体员工的知识检索与应用需求。

甲方终端用户:   

企业管理层及全体员工

甲方核心需求:   

成本可控、验证速度较快、覆盖的企业内部用户比较多等多重因素共同作用下,知识库成为大模型在企业落地的首选场景之一。从渗透情况来看,大模型在知识构建、知识校验和知识库应用三个环节渗透较深。

图1:知识库构建流程及大模型渗透情况

基于大模型在知识库场景的渗透情况,当前甲方对知识库问答主要有三项核心需求,一是压缩知识库冷启动时间,二是降低知识校验环节对人工的依赖,三是企业亟需解决幻觉问题。
  • 压缩知识库冷启动时间。当前,知识构建工作比较依赖话术师,他们负责整理问答对和扩写相似问,此过程比较依赖他们的个人经验。一个话术师整理一类知识库通常需要耗费大约1-3 个月的时间。知识构建是知识库冷启动的核心环节,知识构建效率偏低会直接导致知识库冷启动时间比较长。企业需要借助大模型的理解能力和生成能力压缩知识库冷启动时间。引入大模型之后,可以提升问答对整理和相似问扩写的速度,甚至可以直接采用“大模型+文档库”的方式,实现更极致的冷启动压缩。
  • 降低知识校验环节对人工的依赖。在完成知识构建后,企业需要校验知识准确性以及文法细节,此环节主要靠人工来实现。并且,该工作对相关人员的工作经验有较高要求。企业希望借助大模型实现自动化知识校验。
  • 知识库交互方式变化,企业亟需解决幻觉问题,生成可信的答案。传统知识库主要采用人工检索方式,很难直接告诉用户答案,该交互方式比较低效。企业需要利用大模型的生成能力直接生成用户所需的答案。但是,交互方式的变化也为知识库应用带来新的挑战,即大模型幻觉导致的答案不可信。

厂商能力要求:  

厂商需要满足三项能力要求,一是具备利用大模型进行知识分类、知识抽取和问答对拆分的能力,二是具备解决两个校验难题的方案,三是具备RAG、微调等缓解大模型幻觉的能力。

  • 具备利用大模型进行知识分类、知识抽取和问答对拆分的能力。引入大模型之后,首先可以做知识域的自动分类。第二个作用是自动抽取知识点的实体和关系,本质是基于大模型做预处理,降低对人工的依赖程度。第三个作用是问答对拆分和相似问扩写。过去,该环节非常依赖话术师,有大模型以后可以实现自动化,相关人员则转变为审核职能,即主要负责知识管理,而非知识创建。

  • 具备解决两个校验难题的方案。直接利用大模型进行知识校验存在两个比较明显的问题。首先是过度校验。即原来的回答比较准确,但大模型会演绎出很多新内容,导致校验工作质量下降。第二个问题是新词校验存在滞后性,因为大模型背后的知识是无法实时更新的。厂商可以通过Prompt工程、RAG、微调大模型等方式解决上述两个问题。

  • 具备RAG、微调等缓解大模型幻觉的能力。企业需要利用大模型的生成能力直接生成用户所需的答案。但是,交互方式的变化也为知识库应用带来新的挑战,即大模型幻觉导致的答案不可信。厂商需要具体幻觉大模型幻觉的能力,主要有RAG、微调两种方式。RAG是指在大语言模型推理生成答案时,额外检索调用外部的知识,然后综合其检索结果进行回答生成。RAG为大模型提供了准确、丰富、可解释的知识支撑,从而实现更准确的语义理解、答案推理以及答案解释。微调则是厂商根据行业或企业数据,对基础大模型进行优化,以便其更好地胜任特定任务。对基础大模型进行后训练也是一种缓解大模型幻觉的方式,但较高的成本导致其可行性较低。

入选标准说明:  
1. 符合知识库问答市场分析的厂商能力要求;
2. 近一年厂商在该市场至少服务1家企业(含POC)。
03 
厂商评估:爱数
厂商介绍: 

爱数是一家全域数据能力服务商,通过全域数据的整合、治理、洞察与保护,实现数据的资产化和知识化,与客户共同打造数据驱动型组织。2003年爱数在长沙起步,2006 年上海爱数成立,2023 年爱数集团正式成立,公司双总部位于上海、长沙,目前全球员工约 1700 人,业务遍及 60 多个国家与地区,合作伙伴超过千家,客户积累超过 27000 家,分布于金融、高端制造、运营商、政府、公共事业等各行业。

产品服务介绍: 
爱数产品架构分为基础层、认知层和产品层。基础层提供GPU集群和混合数据湖;认知层则通过领域大模型与领域知识网络相互增强,实现认知能力;产品层是指AnyFabric(数据编织架构)、AnyShare(智能内容管理平台)、AnyRobot(可观测性平台)和AnyBackup(统一数据管理平台)等多个应用产品,它们通过认知助手获得大模型赋能。
AnyShare family 7是AnyShare的最新产品,它是爱数打造的属于AGI 时代的智能内容管理平台。AnyShare family 7通过挖掘非结构化数据的标签、编目、实体对象,形成的事件信息和知识,可以服务于合同一致性和风险审核、文案撰写、资料查找。并且,在AnyShare 认知助手加持下,AnyShare family 7实现了大模型辅助创作、辅助内容阅读和智能搜索,同时可以通过内容开放 API 和组件被企业应用集成。

厂商评估: 

爱数提供“企业知识+大模型”端到端解决方案,涵盖算力、基础大模型、知识化、应用等多个层面。并且,AnyShare存量客户只需采购爱数大模型一体机和AnyShare认知助手,即可实现轻量化升级。在大模型幻觉方面,爱数以检索增强生成模式(RAG)实现大模型领域化,可以有效缓解幻觉产生。在交付方面,爱数拥有完备的数据管理能力和服务团队,有利于大模型在企业真正发挥价值。同时,AnyShare family 7全模块开放,支持企业搭建个性化应用和流程。
  • 爱数提供“企业知识+大模型”端到端解决方案,涵盖算力、基础大模型、知识化、应用等多个层面。在算力层面,爱数推出大模型一体机(AS19000),不仅让企业能够“开箱即用”,而且该产品将大模型训练与推理分离,实现低成本训练和低资源推理。爱数大模型一体机具有国产芯片和国外芯片两种型号,可以满足不同企业的需求。在基础大模型方面,爱数采用“中立”的架构设计,避免捆绑企业。如果企业没有倾向的大模型,可以直接采购封装了基础大模型的爱数大模型一体机;如果企业有倾向的大模型,可以直接将其接入AnyShare family 7。基础大模型之上是企业数据知识化能力层,爱数可以通过机器学习算法对企业数据进行解构,然后通过重新组装实现语义对齐,最终将其编织到领域知识网络之中。在此方面,爱数具备将企业数据以低成本、自动化方式转化为企业知识的能力。最上面是应用层,爱数提供内容门户、文档中心、工作中心、知识中心、表格中心、SAP数据资产管理等多个应用。
  • AnyShare存量客户只需采购爱数大模型一体机和AnyShare认知助手,即可实现轻量化升级。企业比较担心大模型应用对企业现状的挑战。一是IT投入挑战,如果需要企业将原有系统推倒,转而使用大模型相关应用,会带来比较高的投入。二是IT负责人规划能力会受到质疑,因为企业原有系统可能刚刚完成建设,未到更新换代的时候,IT负责人推进大模型应用落地可能受到来自企业内部的质疑。三是业务连续性受到挑战,企业将原有系统推倒重建,可能需要较长时间完成系统切换,影响业务开展。爱数AnyShare产品推出时间较久,有众多存量客户。对他们而言,只需采购爱数大模型一体机和AnyShare认知助手,即可实现轻量化升级。大模型一体机包含算力和基础大模型,AnyShare认知助手包含爱数所有基于大模型构建的AI能力。因此,AnyShare存量客户无需推倒原来系统,即可低成本、快速地完成“大模型升级”。
  • 爱数以检索增强生成模式(RAG)实现大模型领域化,有效缓解大模型幻觉。目前,大模型领域化有两种解决思路,分别是检索增强模式(RAG )和Finetune(微调)。检索增强是指在大语言模型推理生成答案时,额外检索调用外部的领域知识网络(领域数据、概念库、知识图谱等),然后综合其检索结果进行回答生成。领域知识网络为大模型提供了准确、丰富、可解释的知识支撑,从而实现更准确的语义理解、答案推理以及答案解释。相比单纯依靠模型训练,外部领域知识网络的引入可以大幅提升回答的准确性和合规性。它有效减少了大模型幻觉,使应用更加可控。爱数以领域知识网络“可控制、可编辑、可保护、可溯源”等特性弥补大模型“不可控、难编辑”等缺陷,有效减少大模型“幻觉”现象的发生。
    同时,在构建领域知识网络的过程中,爱数利用大模型的知识提取能力,从已有数据中抽取补充知识,实现知识网络的不断丰富和优化。通过这种良性循环,外部知识网络的引入强化了大模型的知识抽取能力,从而反过来进一步完善知识网络本身。最终使基于该知识网络的大模型应用效果持续提升。
  • 爱数拥有完备的数据管理能力和服务团队,有利于大模型在企业真正发挥价值。基础大模型是实现“企业知识+大模型”的核心,但不是全部,厂商还需要具备权限控制、杀毒、水印等一系列数据管理能力。如果厂商只掌握预训练、微调等方法,容易导致企业在“企业知识+大模型”的应用之路上停留在比较初级的阶段。爱数AnyShare产品已有十余年历史,交付了数千家企业,经过几轮迭代逐渐形成比较完备的数据管理能力,包括权限控制、海量分布式文件管理、容灾、备份、杀毒、水印、国产化、涉密管理等。以权限控制为例,企业内不同角色能接触到的数据、能用大模型来理解的数据必受个人权限限制,爱数能够保证经过语义理解的生成式搜索结果一定是根据使用者所拥有权限能看到的文档所产生的,并能在几十到几百毫秒完成一系列查找、生成工作。
    除此之外,爱数拥有比较完备的组织架构为企业提供端到端的服务。爱数打造了专业的、独立于产品研发的服务团队,分区域为当地客户提供开发、部署等服务。爱数的产品研发团队则专注核心产品的研发迭代,保持产品稳定性。相较于组织架构比较单一的厂商,爱数在交付周期、版本控制、服务品质等方面具有一定优势。
  • AnyShare family 7全模块开放,支持企业搭建个性化应用和流程。AnyShare family 7拥有全新的架构设计,每个模块均保持高度开放性,支持企业搭建个性化应用和流程。企业里一个文档全生命周期包括自动采集录入、对象处理、信息化、杀毒、知识化、纳入知识体系、搜索、门户呈现等环节, AnyShare family 7在每个环节让特定模块来负责,并保持它们的高度开放性。比如企业可以自定义审批、打水印等流程,自定义搜索目标(人、文档或者产品),自定义门户的个性化呈现等。企业可以在每一环节低成本、快速地按照自身需求进行系统接入和开发。
典型客户: 
国泰君安、金诚同达

04
入选证书

注:点击左下角“阅读原文”,了解更多内容。


爱分析ifenxi 爱分析是一家中国领先的数字化市场研究与咨询机构。
评论
  • 大模型的赋能是指利用大型机器学习模型(如深度学习模型)来增强或改进各种应用和服务。这种技术在许多领域都显示出了巨大的潜力,包括但不限于以下几个方面: 1. 企业服务:大模型可以用于构建智能客服系统、知识库问答系统等,提升企业的服务质量和运营效率。 2. 教育服务:在教育领域,大模型被应用于个性化学习、智能辅导、作业批改等,帮助教师减轻工作负担,提高教学质量。 3. 工业智能化:大模型有助于解决工业领域的复杂性和不确定性问题,尽管在认知能力方面尚未完全具备专家级的复杂决策能力。 4. 消费
    丙丁先生 2025-01-07 09:25 85浏览
  • PLC组态方式主要有三种,每种都有其独特的特点和适用场景。下面来简单说说: 1. 硬件组态   定义:硬件组态指的是选择适合的PLC型号、I/O模块、通信模块等硬件组件,并按照实际需求进行连接和配置。    灵活性:这种方式允许用户根据项目需求自由搭配硬件组件,具有较高的灵活性。    成本:可能需要额外的硬件购买成本,适用于对系统性能和扩展性有较高要求的场合。 2. 软件组态   定义:软件组态主要是通过PLC
    丙丁先生 2025-01-06 09:23 85浏览
  • 根据环洋市场咨询(Global Info Research)项目团队最新调研,预计2030年全球无人机锂电池产值达到2457百万美元,2024-2030年期间年复合增长率CAGR为9.6%。 无人机锂电池是无人机动力系统中存储并释放能量的部分。无人机使用的动力电池,大多数是锂聚合物电池,相较其他电池,锂聚合物电池具有较高的能量密度,较长寿命,同时也具有良好的放电特性和安全性。 全球无人机锂电池核心厂商有宁德新能源科技、欣旺达、鹏辉能源、深圳格瑞普和EaglePicher等,前五大厂商占有全球
    GIRtina 2025-01-07 11:02 79浏览
  • 根据Global Info Research项目团队最新调研,预计2030年全球封闭式电机产值达到1425百万美元,2024-2030年期间年复合增长率CAGR为3.4%。 封闭式电机是一种电动机,其外壳设计为密闭结构,通常用于要求较高的防护等级的应用场合。封闭式电机可以有效防止外部灰尘、水分和其他污染物进入内部,从而保护电机的内部组件,延长其使用寿命。 环洋市场咨询机构出版的调研分析报告【全球封闭式电机行业总体规模、主要厂商及IPO上市调研报告,2025-2031】研究全球封闭式电机总体规
    GIRtina 2025-01-06 11:10 106浏览
  • By Toradex 秦海1). 简介嵌入式平台设备基于Yocto Linux 在开发后期量产前期,为了安全以及提高启动速度等考虑,希望将 ARM 处理器平台的 Debug Console 输出关闭,本文就基于 NXP i.MX8MP ARM 处理器平台来演示相关流程。 本文所示例的平台来自于 Toradex Verdin i.MX8MP 嵌入式平台。  2. 准备a). Verdin i.MX8MP ARM核心版配合Dahlia载板并
    hai.qin_651820742 2025-01-07 14:52 57浏览
  • 本文介绍Linux系统更换开机logo方法教程,通用RK3566、RK3568、RK3588、RK3576等开发板,触觉智能RK3562开发板演示,搭载4核A53处理器,主频高达2.0GHz;内置独立1Tops算力NPU,可应用于物联网网关、平板电脑、智能家居、教育电子、工业显示与控制等行业。制作图片开机logo图片制作注意事项(1)图片必须为bmp格式;(2)图片大小不能大于4MB;(3)BMP位深最大是32,建议设置为8;(4)图片名称为logo.bmp和logo_kernel.bmp;开机
    Industio_触觉智能 2025-01-06 10:43 87浏览
  • 每日可见的315MHz和433MHz遥控模块,你能分清楚吗?众所周知,一套遥控设备主要由发射部分和接收部分组成,发射器可以将控制者的控制按键经过编码,调制到射频信号上面,然后经天线发射出无线信号。而接收器是将天线接收到的无线信号进行解码,从而得到与控制按键相对应的信号,然后再去控制相应的设备工作。当前,常见的遥控设备主要分为红外遥控与无线电遥控两大类,其主要区别为所采用的载波频率及其应用场景不一致。红外遥控设备所采用的射频信号频率一般为38kHz,通常应用在电视、投影仪等设备中;而无线电遥控设备
    华普微HOPERF 2025-01-06 15:29 134浏览
  • 彼得·德鲁克被誉为“现代管理学之父”,他的管理思想影响了无数企业和管理者。然而,关于他的书籍分类,一种流行的说法令人感到困惑:德鲁克一生写了39本书,其中15本是关于管理的,而其中“专门写工商企业或为企业管理者写的”只有两本——《为成果而管理》和《创新与企业家精神》。这样的表述广为流传,但深入探讨后却发现并不完全准确。让我们一起重新审视这一说法,解析其中的矛盾与根源,进而重新认识德鲁克的管理思想及其著作的真正价值。从《创新与企业家精神》看德鲁克的视角《创新与企业家精神》通常被认为是一本专为企业管
    优思学院 2025-01-06 12:03 132浏览
  • 在智能家居领域中,Wi-Fi、蓝牙、Zigbee、Thread与Z-Wave等无线通信协议是构建短距物联局域网的关键手段,它们常在实际应用中交叉运用,以满足智能家居生态系统多样化的功能需求。然而,这些协议之间并未遵循统一的互通标准,缺乏直接的互操作性,在进行组网时需要引入额外的网关作为“翻译桥梁”,极大地增加了系统的复杂性。 同时,Apple HomeKit、SamSung SmartThings、Amazon Alexa、Google Home等主流智能家居平台为了提升市占率与消费者
    华普微HOPERF 2025-01-06 17:23 149浏览
  • 这篇内容主要讨论三个基本问题,硅电容是什么,为什么要使用硅电容,如何正确使用硅电容?1.  硅电容是什么首先我们需要了解电容是什么?物理学上电容的概念指的是给定电位差下自由电荷的储藏量,记为C,单位是F,指的是容纳电荷的能力,C=εS/d=ε0εrS/4πkd(真空)=Q/U。百度百科上电容器的概念指的是两个相互靠近的导体,中间夹一层不导电的绝缘介质。通过观察电容本身的定义公式中可以看到,在各个变量中比较能够改变的就是εr,S和d,也就是介质的介电常数,金属板有效相对面积以及距离。当前
    知白 2025-01-06 12:04 178浏览
  • 村田是目前全球量产硅电容的领先企业,其在2016年收购了法国IPDiA头部硅电容器公司,并于2023年6月宣布投资约100亿日元将硅电容产能提升两倍。以下内容主要来自村田官网信息整理,村田高密度硅电容器采用半导体MOS工艺开发,并使用3D结构来大幅增加电极表面,因此在给定的占位面积内增加了静电容量。村田的硅技术以嵌入非结晶基板的单片结构为基础(单层MIM和多层MIM—MIM是指金属 / 绝缘体/ 金属) 村田硅电容采用先进3D拓扑结构在100um内,使开发的有效静电容量面积相当于80个
    知白 2025-01-07 15:02 85浏览
  •     为控制片内设备并且查询其工作状态,MCU内部总是有一组特殊功能寄存器(SFR,Special Function Register)。    使用Eclipse环境调试MCU程序时,可以利用 Peripheral Registers Viewer来查看SFR。这个小工具是怎样知道某个型号的MCU有怎样的寄存器定义呢?它使用一种描述性的文本文件——SVD文件。这个文件存储在下面红色字体的路径下。    例:南京沁恒  &n
    电子知识打边炉 2025-01-04 20:04 100浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦