很多人在初次接触元数据时,会有一个本能的类比:元数据就是”数据的数据”,相当于图书馆里的索引卡。
这个类比有它的道理,但也掩盖了一个重要的事实:图书馆的索引卡和信息卡片其实不止一种,有些是帮你找到书的(书名、作者),有些是告诉你书的结构(目录、页码),有些是管理员用的(借阅记录、馆藏位置),有些是系统用的(条形码、RFID标签)。
数据空间的元数据体系也是如此。我们将其归纳为四类,每一类解决一个特定的问题。
描述性元数据:帮人”找到”数据
描述性元数据解决的是”可发现”的问题,让数据使用方在数据目录中快速找到自己需要的数据。
它包含的信息与图书馆的”索引卡”最接近:数据集名称、数据集描述(摘要)、关键词标签、发布方名称、发布方联系信息、语言、学科/行业分类。
比如,一个”某省医保脱敏数据集”的描述性元数据可能包含:数据集名称”2024年某省医保报销脱敏数据集”、描述”包含2024年1月至12月全省医保报销记录的脱敏版本”、关键词”医保、报销、脱敏、医疗数据”、发布方”某省医疗保障局”。
描述性元数据的核心要求是”让搜索准确的”(使用方输入一个关键词)描述性元数据要与”被找到的意愿”足够匹配。
结构性元数据:帮系统”组织”数据
结构性元数据解决的是”可理解”的问题,让使用方知道数据的内部结构,知道数据怎么被组织和关联。
它描述的是数据的组织方式:数据表的字段定义和类型、字段之间的关联关系、数据文件的结构(XML schema、JSON schema)、数据模型类型(关系模型、图模型、文档模型)、目录结构(文件系统中的文件夹层次)。
使用方在搜索到数据集后,接下来需要判断”这个数据集的字段是否满足我的分析需求”——结构性元数据就是为此服务的。
管理性元数据:帮运营方”管”数据
管理性元数据解决的是”可治理”的问题,让数据运营方知道数据从哪里来、现在的状态是什么、谁可以做什么。
它包含的信息是IT运维和治理需要的:创建日期和最后修改日期、文档类型和版本号、访问权限和所有者、数据质量评分、保留期限、数据敏感度等级。
数据空间中的数据治理、访问控制、数据质量监控——所有”管”的能力,在技术上都是通过对管理性元数据的操作来实现的。比如,一条”数据质量评分低于0.8的数据集自动暂停发布”的规则,就是基于管理性元数据中的”质量评分”字段来触发的。
技术性元数据:帮系统”处理”数据
技术性元数据解决的是”可交互”的问题,让系统层面知道怎么处理这个数据。
它包含的信息是系统集成需要的:文件格式(CSV、Parquet、Avro、JSON)、文件大小、压缩方法、字符编码(UTF-8、GBK等)、数据库版本和兼容性、签名和数字指纹(HASH值)。
数据提供方发布数据时,技术性元数据中的HASH值被记录——使用方在收到数据后,计算同样的HASH值,比对一致,说明数据在传输过程中没有被篡改。
四类元数据的循环交互
四类元数据不是各自独立的标签集合。它们通过循环交互形成完整的元数据体系:
描述性元数据让人找到数据。结构性元数据让人理解数据。管理性元数据让运营方管理数据。技术性元数据让系统处理数据。
一个常见的问题是:这四类元数据分别应该由谁来负责?答案不是唯一的,描述性元数据通常由数据提供方维护,管理性元数据由运营方维护,结构性元数据和技术性元数据可以由数据提供方在发布时自动生成,也可以在数据接入过程中由元数据引擎自动抽取。
四类元数据分类最大的实用价值,不是学术上的分类法,而是在实操中帮你定位问题——使用方说”搜不到数据”,问题在描述性元数据;使用方说”数据接进来后处理不了”,问题在技术性元数据。定位准确了,改一行元数据配置就能解决,不用大动干戈改系统。
我是BSN联盟成员。有着十年区块链与隐私计算的产品开发和方案咨询经验,先后参与多个国家重大课题,亲手建过区块链、隐私计算、可信数据空间的落地项目。不追概念,写真的。