【小白扫盲】到底什么是数据(data)?

原创 鲜枣课堂 2025-04-13 23:25

什么是数据?


简单来说,数据是信息的一种载体。更严谨一点,我们也可以说,数据是客观世界中被记录、存储的原始符号或信息。


在目前我们所处的时代,通常所说的数据,都是指计算机系统里的那些文本、图片、音频、视频文件,那些二进制的0和1。



整个计算机系统,甚至整个数字世界,都是围绕数据进行工作。CPU,计算数据。内存和硬盘,存储数据。通信网络,传递数据。


因此,在计算机科学中,数据被定义为:“所有能输入计算机并被程序处理的符号的总称”。


需要注意的是,数据本身是没有意义的,是未经加工的“原材料”。经过处理和分析之后,数据才能转化为有意义的信息。


也有人指出,信息是数据经过处理后的结果,是对数据的解释和赋予意义的产物。这句话虽然有点抽象(烧脑),但准确地表达了数据和信息之间的关系。



 数据的特性


数据有很多特性。小枣君初步统计了一下,就有14个,分别是——


符号性:数据以符号形式存在,例如数字,以及刚才提到的文字、图像、音频、视频等。


客观性:数据反映了现实世界事物的属性、状态、关系等情况。它是客观存在的,不随主观意志而改变。


量化性:数据通常以量化的形式存在,便于计数、测量和统计分析。


可比性:数据之间可以进行对比分析,通过比较可以揭示数据之间的关系和差异。


可传递性:数据可以通过各种方式进行传输,如电子文档、纸质报告等,使得信息能够在不同个体或组织间传递。


可存储性:数据可以被存储在数据库、文件系统或其他存储介质中,以便于未来的访问和使用。


可处理性:数据可以通过计算、分析、加工等手段进行处理,以提取有用信息或转化为知识。


多维度:数据可以从多个角度进行观察和分析,如时间、空间、类别等多个维度。


多样性:数据有多种多样的类别和形式,能够满足不同领域和需求。


时效性:数据可能随时间的推移而发生变化,某些数据在特定时间点之后可能失去价值或准确性。


可靠性:数据应该是可靠的,即数据的来源、收集方法和处理过程应该是可信的,以保证数据的准确性。


相关性:数据之间存在相关性,某些数据的变化可能会影响其他数据的表现。


可解释性:数据应该能够被解释和理解,其背后的意义和代表的现实世界情况应该清晰。


限制性:数据可能受到隐私、法律、伦理等因素的限制,使用数据时需要遵守相关规范。



以上这么多的特性,在现实情况中,并不能都满足。


例如,在追求数据时效性的同时,可能需要牺牲部分可存储性。因为实时数据的收集和处理,需要更高的空间和成本。


同样,为了提高数据的可靠性,可能需要投入更多的资源进行数据验证和清洗,这可能会增加数据处理的复杂性和时间成本。


总之,能够尽可能地满足更多特性的数据,就会被认为是高质量的数据。数据的价值,也就更大。在实际应用中,我们需要根据具体场景和需求,权衡数据的各个特性,加以利用。



 数据的分类方式


刚才在说数据特性的时候,提到数据有多样性的特点,也就是有多种形式和类别。


对数据有很多种分类方式。例如,现在最常用的,就是按结构进行分类,包括结构化数据、半结构化数据和非结构化数据。


结构化数据,是指可以用预先定义的数据模型表述,或者,可以存入关系型数据库的数据。例如,一个班级所有人的年龄、一个超市所有商品的价格,这些都是结构化数据。


结构化数据


非结构化数据,指网页文章、邮件内容、图像、音频、视频等。


半结构化数据,介于结构化和非结构化数据之间。如XML、JSON等格式的数据,它们有一定的组织形式,但不如结构化数据那样严格。


目前,非结构化数据的占比是最高的。例如,在互联网领域里,非结构化数据的占比已经超过了80%。


根据数据的来源,也可以分类。


例如,企业所产生的营销数据、业务系统数据、生产数据等,互联网行业所产生的社交内容数据、订单数据、用户数据等,政府部门所产生的社会治理数据、地理数据、经济数据,等等。



根据数据的性质,还可以分为定位数据(描述空间位置,如坐标)、定性数据(描述事物属性,如“阴雨天气”)、定量数据(反映数量特征,如长度、重量)、定时数据(记录时间特征,如日期、时刻)等。


总之,每种分类方式都有其特定的应用场景和价值。


了解数据的分类,有助于我们更好地理解数据的本质,以及如何在不同场景下有效地管理和利用数据。



 数据的度量方式


前面我们也提到,数据具有量化性的特点。也就是说,数据是可以度量的。


我们通常度量数据的单位,大家应该比较熟悉,就是KB、MB、GB、TB等。


我们传统PC和手机处理的数据,是GB/TB级别。例如,我们的硬盘,现在通常是1TB/2TB/4TB的容量。


在TB之上,还有PB、EB、ZB等。


TB、GB、MB、KB的关系,如下:

1 KB = 1024 B  (KB - kilobyte) 

1 MB = 1024 KB (MB - megabyte) 

1 GB = 1024 MB (GB - gigabyte) 

1 TB = 1024 GB (TB - terabyte) 

1 PB = 1024 TB (PB - petabyte) 

1 EB = 1024 PB (EB - exabyte) 

1 ZB = 1024 EB (ZB - zettabyte) 


只是看这几个字母的话,貌似不是很直观。我来举个例子吧。


1TB,只需要一块硬盘可以存储。容量大约是20万张照片或20万首MP3音乐,或者是20万部电子书。



1PB,需要大约2个机柜的存储设备。容量大约是2亿张照片或2亿首MP3音乐。如果一个人不停地听这些音乐,可以听差不多两千年。


1EB,需要大约2000个机柜的存储设备。如果并排放这些机柜,可以连绵1.2公里那么长。如果摆放在机房里,需要21个标准篮球场那么大的机房,才能放得下。


阿里、百度、腾讯这样的互联网巨头,数据量据说已经接近EB级。目前全人类的数据量,是ZB级。


数据中心


根据IDC的数据,在2020年,全球创建、捕获、复制和消耗的数据总量约为64ZB。而到了2025年,全球数据总量可能会达到惊人的163ZB。如果建一个机房来存储这些数据,那么,这个机房的面积将比196个鸟巢体育场还大。



 数据的产生阶段


人类社会的数据体量不仅大,增长速度也很快——每年增长50%。也就是说,每两年就会增长一倍多。


为什么会如此之快?


说到这里,就要回顾一下人类社会数据产生的三个重要阶段。


第一个阶段,是1940-1990年。


计算机和数据库被发明之后,数据管理的复杂度大大降低。各行各业开始产生了计算机数据,并记录在数据库中。这时的数据,以结构化数据为主(待会解释什么是结构化数据)。数据的产生方式,是被动的。


第二个阶段,是1990-2010年。


伴随着互联网的爆发,网络内容开始迅速增长,增加了很多的专业输出内容(PGC)。Web2.0出现后,人们开始使用博客、facebook、youtube这样的社交网络,输出大量的用户原创内容(UGC),从而主动产生了大量的数据。移动智能终端时代的到来,也加速了该阶段数据的产生。


第三个阶段,是2010年至今。


随着物联网的发展,各种各样的感知层节点(例如遍布各个角落的传感器、摄像头)开始自动产生大量的数据。企业的数字化转型,构建了大量的系统,沉淀和管理这些数据。人类的数据总量,再次跃升。



经过了“被动-主动-自动”这三个阶段的发展,最终导致了人类数据总量的爆炸式膨胀。


值得一提的是,如今,随着我们逐渐进入AI智能时代,很可能会迎来第四次数据暴增阶段。以AIGC为代表的智能机器生产内容,正在急剧增加。



 数据的作用和意义


数据是信息的载体。它的最基础作用,就是记录和表征。


例如,考勤数据,记录了员工每天的上下班时间、请假、迟到、早退等信息。这些数据不仅帮助我们了解员工的出勤情况,还能进一步分析员工的工作效率、团队协作以及可能存在的管理问题。


再例如,体检数据,记录了我们的身高、体重、血压、血糖等各项生理指标。这些数据不仅有助于我们了解自身的健康状况,还能及时发现潜在的健康问题,为预防和治疗疾病提供重要依据。



除了个人工作和生活领域之外,在科学、商业和公共管理领域,都有对应的系统和数据。这个数据的体量更大,甚至达到了大数据的级别。


通过深入挖掘和分析海量的数据,企业和政府部门可以找到隐藏在数据背后的规律和趋势,为未来的发展和决策提供有力的支持。



科学领域,实验数据、观测数据、模拟数据等构成了科学研究的基础。这些数据不仅帮助科学家验证理论、发现新现象,还能推动科学技术的进步和创新。


例如,天文学中的天文观测数据,记录了星系的运动、恒星的诞生和消亡等宇宙现象,这些数据为理解宇宙的起源和演化提供了重要线索。



商业领域,销售数据、客户数据、市场数据等是企业运营和决策的重要依据。通过分析这些数据,企业可以了解市场需求、优化产品设计、提升客户满意度,从而制定更为精准的市场策略和商业计划。


例如,电商平台通过分析用户的购买历史和浏览行为,可以为用户推荐更为符合其需求的商品,提升用户的购物体验和平台的销售额。



公共管理领域,政府数据、公共服务数据、社会调查数据等是政策制定和实施的基础。这些数据不仅帮助政府了解社会现状、预测发展趋势,还能为政策评估和优化提供依据。


例如,通过分析交通流量数据,政府可以合理规划交通路线、优化公共交通服务,从而缓解城市交通拥堵问题。




 最后的话


总而言之,数据在目前这个时代,已经变成了重要的无形资产,也被称为“新石油”。


从个人生活到全球治理,数据都扮演着不可或缺的角色,已成为驱动效率提升、科学发现和社会进步的核心资源。


最近几年愈演愈烈的AI浪潮,进一步推动了数据的价值提升。人工智能的三要素,其中一项,就是数据(另外两个是算力和算法)。数据作为AI的“燃料”,其质量和数量直接决定了AI系统的性能和准确性。


未来,随着数据规模的指数级增长和技术的持续突破,数据的价值将进一步释放。



好啦,以上就是关于数据的基本常识。大家都搞明白了嘛?


想要了解更多关于数据的知识,可以看这里:

写给小白的数据库入门科普

写给小白的“数据仓库”科普

到底什么是“数据湖”?

到底是什么是“数据湖仓”?

大数据,到底有什么用?

大数据的3V、4V、7V,到底是什么意思?

一文看懂大数据的四十年发展史

78页PPT,彻底看懂数据库!

61页PPT,看懂什么是“大数据”!


鲜枣课堂 学通信,学5G,就上鲜枣课堂!
评论 (0)
  • 一、技术背景与市场机遇在智能家居高速发展的今天,用户对家电设备的安全性、智能化及能效表现提出更高要求。传统取暖器因缺乏智能感知功能,存在能源浪费、安全隐患等痛点。WTL580-C01微波雷达感应模块的诞生,为取暖设备智能化升级提供了创新解决方案。该模块凭借微波雷达技术优势,在精准测距、环境适应、能耗控制等方面实现突破,成为智能取暖器领域的核心技术组件。二、核心技术原理本模块采用多普勒效应微波雷达技术,通过24GHz高频微波信号的发射-接收机制,实现毫米级动作识别和精准测距。当人体进入4-5米有效
    广州唯创电子 2025-04-23 08:41 122浏览
  •   复杂电磁环境模拟系统平台解析   一、系统概述   北京华盛恒辉复杂电磁环境模拟系统平台是用于还原真实战场或特定场景电磁环境的综合性技术平台。该平台借助软硬件协同运作,能够产生多源、多频段、多体制的电磁信号,并融合空间、时间、频谱等参数,构建高逼真度的电磁环境,为电子对抗、通信、雷达等系统的研发、测试、训练及评估工作提供重要支持。   应用案例   目前,已有多个复杂电磁环境模拟系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润复杂电磁环境模拟系统。这些成功案例为复杂电
    华盛恒辉l58ll334744 2025-04-23 10:29 148浏览
  •   电磁频谱数据综合管理平台系统解析   一、系统定义与目标   北京华盛恒辉电磁频谱数据综合管理平台融合无线传感器、软件定义电台等前沿技术,是实现无线电频谱资源全流程管理的复杂系统。其核心目标包括:优化频谱资源配置,满足多元通信需求;运用动态管理与频谱共享技术,提升资源利用效率;强化频谱安全监管,杜绝非法占用与干扰;为电子战提供频谱监测分析支持,辅助作战决策。   应用案例   目前,已有多个电磁频谱数据综合管理平台在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润电磁频谱数
    华盛恒辉l58ll334744 2025-04-23 16:27 141浏览
  •   无人机结构仿真与部件拆解分析系统平台解析   北京华盛恒辉无人机结构仿真与部件拆解分析系统无人机技术快速发展的当下,结构仿真与部件拆解分析系统平台成为无人机研发测试的核心工具,在优化设计、提升性能、降低成本等方面发挥关键作用。以下从功能、架构、应用、优势及趋势展开解析。   应用案例   目前,已有多个无人机结构仿真与部件拆解分析系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润无人机结构仿真与部件拆解分析系统。这些成功案例为无人机结构仿真与部件拆解分析系统的推广和应用提
    华盛恒辉l58ll334744 2025-04-23 15:00 146浏览
  • 一、行业背景与市场需求高血压作为全球发病率最高的慢性病之一,其早期监测与管理已成为公共卫生领域的重要课题。世界卫生组织数据显示,全球超13亿人受高血压困扰,且患者群体呈现年轻化趋势。传统血压计因功能单一、数据孤立等缺陷,难以满足现代健康管理的需求。在此背景下,集语音播报、蓝牙传输、电量检测于一体的智能血压计应运而生,通过技术创新实现“测量-分析-管理”全流程智能化,成为慢性病管理的核心终端设备。二、技术架构与核心功能智能血压计以电子血压测量技术为基础,融合物联网、AI算法及语音交互技术,构建起多
    广州唯创电子 2025-04-23 09:06 134浏览
  • 文/Leon编辑/cc孙聪颖‍在特朗普政府发起的关税战中,全球芯片产业受到巨大冲击,美国芯片企业首当其冲。据报道称,英伟达本周二公布的8-K文件显示,美国政府通知该公司向中国(包括中国香港及澳门)销售尖端芯片(H20)时,需要获得美国政府的许可。文件发布后,英伟达预计会在第一季度中额外增加55亿美元的相关费用计提。随后,英伟达股价单日下跌6.9%,市值一夜蒸发约1890亿美元(约合人民币1.37万亿元)。至截稿时,至截稿时,其股价未见止跌,较前日下跌4.51%。北京时间4月17日,英伟达创始人、
    华尔街科技眼 2025-04-22 20:14 105浏览
  •   卫星通信效能评估系统平台全面解析   北京华盛恒辉卫星通信效能评估系统平台是衡量卫星通信系统性能、优化资源配置、保障通信服务质量的关键技术工具。随着卫星通信技术的快速发展,特别是低轨卫星星座、高通量卫星和软件定义卫星的广泛应用,效能评估系统平台的重要性日益凸显。以下从技术架构、评估指标、关键技术、应用场景及发展趋势五个维度进行全面解析。   应用案例   目前,已有多个卫星通信效能评估系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润卫星通信效能评估系统。这些成功案例为卫
    华盛恒辉l58ll334744 2025-04-22 16:34 148浏览
  •   后勤实验仿真系统平台深度解析   北京华盛恒辉后勤实验仿真系统平台依托计算机仿真技术,是对后勤保障全流程进行模拟、分析与优化的综合性工具。通过搭建虚拟场景,模拟资源调配、物资运输等环节,为后勤决策提供数据支撑,广泛应用于军事、应急管理等领域。   应用案例   目前,已有多个后勤实验仿真系统平台在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润后勤实验仿真系统平台。这些成功案例为后勤实验仿真系统平台的推广和应用提供了有力支持。   一、核心功能   (一)后勤资源模拟
    华盛恒辉l58ll334744 2025-04-23 15:39 110浏览
  •   陆地边防事件紧急处置系统平台解析   北京华盛恒辉陆地边防事件紧急处置系统平台是整合监测、预警、指挥等功能的智能化综合系统,致力于增强边防安全管控能力,快速响应各类突发事件。以下从系统架构、核心功能、技术支撑、应用场景及发展趋势展开全面解读。   应用案例   目前,已有多个陆地边防事件紧急处置系统在实际应用中取得了显著成效。例如,北京华盛恒辉和北京五木恒润陆地边防事件紧急处置系统。这些成功案例为陆地边防事件紧急处置系统的推广和应用提供了有力支持。   一、系统架构   感知层:部
    华盛恒辉l58ll334744 2025-04-23 11:22 110浏览
  • 文/Leon编辑/cc孙聪颖‍4月18日7时,2025北京亦庄半程马拉松暨人形机器人半程马拉松正式开跑。与普通的半马比赛不同,这次比赛除了有人类选手,还有21支人形机器人队伍参赛,带来了全球首次人类与机器人共同竞技的盛况。参赛队伍中,不乏明星机器人企业及机型,比如北京人形机器人创新中心的天工Ultra、松延动力的N2等。宇树G1、众擎PM01,则是由城市之间科技有限公司购置及调试,并非厂商直接参赛。考虑到机器人的适用场景和续航力各有不同,其赛制也与人类选手做出区别:每支赛队最多可安排3名参赛选手
    华尔街科技眼 2025-04-22 20:10 99浏览
  • 前言本文主要演示基于TL3576-MiniEVM评估板HDMI OUT、DP 1.4和MIPI的多屏同显、异显方案,适用开发环境如下。Windows开发环境:Windows 7 64bit、Windows 10 64bitLinux开发环境:VMware16.2.5、Ubuntu22.04.5 64bitU-Boot:U-Boot-2017.09Kernel:Linux-6.1.115LinuxSDK:LinuxSDK-[版本号](基于rk3576_linux6.1_release_v
    Tronlong 2025-04-23 13:59 96浏览
  • 在科技飞速发展的当下,机器人领域的每一次突破都能成为大众瞩目的焦点。这不,全球首届人形机器人半程马拉松比赛刚落下帷幕,赛场上的 “小插曲” 就掀起了一阵网络热潮。4月19日,北京亦庄的赛道上热闹非凡,全球首届人形机器人半程马拉松在这里激情开跑。20支机器人队伍带着各自的“参赛选手”,踏上了这21.0975公里的挑战之路。这场比赛可不简单,它将机器人放置于真实且复杂的动态路况与环境中,对机器人在运动控制、环境感知和能源管理等方面的核心技术能力进行了全方位的检验。不仅要应对长距离带来的续航挑战,还要
    用户1742991715177 2025-04-22 20:42 94浏览
  • 故障现象一辆2016款奔驰C200L车,搭载274 920发动机,累计行驶里程约为13万km。该车组合仪表上的防侧滑故障灯、转向助力故障灯、安全气囊故障灯等偶尔异常点亮,且此时将挡位置于R挡,中控显示屏提示“后视摄像头不可用”,无法显示倒车影像。 故障诊断用故障检测仪检测,发现多个控制单元中均存储有通信类故障代码(图1),其中故障代码“U015587 与仪表盘的通信存在故障。信息缺失”出现的频次较高。 图1 存储的故障代码1而组合仪表中存储有故障代码“U006488 与用户界
    虹科Pico汽车示波器 2025-04-23 11:22 77浏览
我要评论
0
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦