Metadata(元数据)在 Data Fabric 中的作用与构建方法
1.元数据的重要性
元数据是数据的“上下文”,它记录了数据的来源、时间、位置、使用者和使用方式等信息。元数据是数据编织(Data Fabric)的核心,因为它为数据管理提供了必要的背景信息,帮助自动化和优化数据管理任务。
2.元数据的类型
元数据可以分为以下四种类型:
(1)技术元数据(Technical Metadata):描述数据的技术属性,如数据格式、存储位置、数据类型等。
(2)操作元数据(Operational Metadata):描述数据的使用情况,如数据的访问频率、更新时间等。
(3)业务元数据(Business Metadata):描述数据的业务属性,如数据的业务定义、数据所有者等。
(4)社会元数据(Social Metadata):描述数据的社会属性,如用户对数据的评价、标签等。
每种元数据可以是“被动”元数据(组织收集但不主动分析)或“主动”元数据(跨多个系统使用相同数据的行动标识)。数据编织的核心功能之一是将被动元数据转换为主动元数据。
3.构建可组合的数据编织(Composable Data Fabric)
构建数据编织的第一步是增强数据目录(Data Catalog)。数据编织是可组合的,由多个技术组件组成,这些组件可以组合在一起。以下是构建数据编织的具体步骤:
(1)增强数据目录(Augmented Data Catalog):
功能:使用人工智能(AI)和机器学习(ML)技术连接不同的数据源,发现、标记和注释这些数据源。
结果:生成一个分布式数据资产及其关联被动元数据的库存清单。
作用:帮助利益相关者协作进行数据治理,并促进不同来源数据的共享语义的沟通。
(2)激活元数据(Activate Metadata):
方法:对收集到的元数据进行图分析(Graph Analytics),并使用分析结果训练AI/ML模型,以自动化数据集成和数据管理任务。
结果:生成知识图(Knowledge Graphs),展示组织内不同数据资产及其用户之间的连接关系。
(3)丰富知识图(Enrich Knowledge Graphs):
方法:在知识图的基础上添加语义(Semantics),即数据的业务含义和关系。
作用:使数据编织能够更好地支持分析和更智能的AI/ML模型。

4.数据编织的自动化程度
完成上述步骤后,数据编织的机器学习引擎可以开始通知和自动化某些数据集成任务和数据管理活动。根据数据编织的复杂程度,自动化的程度可以分为以下几个阶段:
(1)参与(Engagement):
功能:例如,使技能较低的集成人员能够找到和集成数据源,或使主题专家使用语义搜索更好地理解数据。
作用:提高数据集成的易用性和效率。
(2)洞察(Insights):
功能:例如,实现自动标记和注释、动态模式识别、异常检测和报告、突出显示GDPR敏感属性等。
作用:提供更深入的数据洞察,帮助数据治理和合规性管理。
(3)自动化(Automation):
功能:例如,自动纠正模式漂移、自动集成“最佳下一个”数据源、推荐最佳转换,并将自助服务集成到生产环境中。
作用:实现数据管理任务的自动化,减少人工干预,提高数据管理的效率和准确性。
5.总结
元数据是数据编织的核心,通过增强数据目录、激活元数据和丰富知识图,数据编织可以实现从被动元数据到主动元数据的转换,并通过AI/ML技术自动化数据集成和管理任务。这种自动化不仅提高了数据管理的效率,还增强了数据治理和分析能力,为企业提供了更智能的数据管理解决方案。
更多推荐


所有评论(0)