21 数据架构四十年——从文件夹到数据空间的五级跳

这篇文章要拉一条四十年的演进线:数据架构从1980年代的文件系统,走到今天的数据空间,经历了五个明确的阶段。看懂这条线,你就知道数据空间不是突然冒出来的概念,而是数据架构长期演进的必然产物。


有一年在行业会议上,一个甲方CIO在听完我的数据空间介绍后,皱着眉头问了一个很诚实的问题:”数据空间跟数据仓库到底什么关系?是不是换个名字又来卖我一轮软件?”

这个问题不丢人。数据空间这个概念确实站在了数据架构四十年的积累之上,它没有推翻前人的东西,而是在前人的地基上盖了新的一层。从1980年代到今天,数据架构经历了五个清晰的阶段。

第一阶段:文件系统和数据库(1980年前)

数据架构的起点是文件系统。一个应用、一套文件、一个存储——数据跟应用程序深度耦合,换一个应用,旧数据基本废了。

关系数据库(RDBMS)的出现是第一次升级——它让数据可以被结构化地管理,SQL成为标准查询语言。但这个阶段的数据,仍然是具体应用系统的”附属品”——CRM的数据在CRM的数据库里,ERP的数据在ERP的数据库里,彼此之间没有对话。

核心矛盾:数据被锁在应用系统中,跨系统的数据整合代价极高。

第二阶段:企业数据仓库 EDW(1980年代—2000年)

数据仓库的出现解决了”跨系统整合”的问题。以Inmon的”企业信息工厂”和Kimball的”维度建模”为代表的架构方法论,让企业第一次有了”统一的数据视图”。

这个阶段的核心成就是ETL——从各个业务系统中抽取数据、清洗转换、加载到数据仓库中。BI报表、经营分析、决策支持——全是数据仓库的功劳。

但数据仓库有一个结构性局限:它是”推”的模式——数据从业务系统被”推”到仓库中,做什么用、什么时候用,由集中式的数据团队决定。业务部门想用新数据?排队等ETL排期。

核心矛盾:集中式管控与敏捷需求的冲突。

第三阶段:后EDW时代(2000—2010年)

数据湖的出现打破了数据仓库的”先清洗再存储”模式——先把原始数据存起来,用的时候再处理。

同时,MPP数据库(大规模并行处理)和Hadoop生态系统的成熟,让企业可以处理PB级别的数据。数据仓库不再是唯一的选择,数据湖、数据集市、OLAP引擎并存。

这个阶段的特点是”多元化存储”——企业在同一时间拥有数据仓库、数据湖、OLAP引擎、实时流处理平台。听起来很强大,实际问题是:数据分散在多个系统中,缺乏统一的元数据管理,数据发现和数据治理的成本急剧上升。

核心矛盾:存储多元化与统一管理的冲突。

第四阶段:逻辑数据仓库 LDW(2010—2020年)

逻辑数据仓库的概念在这个阶段兴起。核心思路是——不要物理移动数据,而是通过虚拟化层实现对多个数据源的统一查询。

数据虚拟化和联邦查询技术成为关键。用户在逻辑数据仓库上跑一条SQL,底层自动把这个SQL翻译成对多个后端数据源的查询,然后把结果聚合返回。数据不需要搬到一个地方再查。

这个阶段的进步在于”数据与存储的解耦”——数据不再绑定特定的存储系统。但联邦查询的性能问题(跨多个数据源的JOIN效率)成为一个实际瓶颈。

核心矛盾:查询灵活性与性能的矛盾。

第五阶段:增强数据分析和主动元数据(2020年起)

当前我们所在的阶段。数据网格(Data Mesh)、数据目录、主动元数据管理——这些新理念把数据架构从”集中式管控”推向”联邦式自治”。

Data Mesh的核心理念是:让业务团队拥有自己的数据产品和数据治理责任,而不是全部依赖一个中央数据团队。主动元数据管理通过AI自动抽取、标注、关联元数据,大幅降低数据发现和治理的人工成本。

这个阶段的一个关键特征是:数据开始从”IT系统的附属品”变成”独立的生产要素”。

数据空间站在哪里

如果把这五个阶段画成一条时间轴,数据空间不是”第六阶段”的替代品,而是对第五阶段的架构范式升级。

前四个阶段解决的核心问题是”数据如何被统一管理”,数据空间要解决的问题是”数据如何在跨组织的边界上安全流通”。前者是”对内”的课题,后者是”对外”的课题。

数据仓库解决的是企业内部的数据孤岛问题,数据空间解决的是企业与外部的数据流通问题。两者不是替代关系,而是内外互补关系

数据架构四十年的演进史,本质上是一部”数据从应用系统中逐步解放出来”的历史。文件系统绑在应用上,数据仓库解放了”跨系统”,数据空间要解放的是”跨组织”。每一轮解放,都带来一轮新的商业价值。


BSN联盟成员。十年区块链与隐私计算的产品开发和方案咨询,先后参与多个国家重大课题,亲手建过区块链、隐私计算、可信数据空间的落地项目。不追概念,写真的。


发表评论