导图社区 第8章数据集成和互操作
《DAMA数据管理知识体系指南》第八章的读书笔记,主要讲述数据集成和互操作相关的内容,就是数据集成处理与数据能力提供,核心内容就是ETL相关的内容。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。
《谏太宗十思疏》全篇以“思国之安者,必积其德义”为中心展开论述。先从正反两方面进行论述,提出为君必须“居安思危,戒奢以俭”的结论。然后提醒太宗,守成之君易失人心
《建筑消防设施的维护管理》GB25201-2010,内容有值班、巡查、检测、维修、保养、建档,快来看看吧!
《冀中的地道战》这篇课文记叙了在抗日战争中,冀中地道战的产生、作用,地道的结构特点,歌颂了我国人民在对敌斗争中表现出来的顽强斗志和无穷无尽的智慧
社区模板帮助中心,点此进入>>
互联网9大思维
组织架构-单商户商城webAPP 思维导图。
域控上线
python思维导图
css
CSS
计算机操作系统思维导图
计算机组成原理
IMX6UL(A7)
考试学情分析系统
第8章 数据集成和互操作
8.1 引言
定义:数据集成和互操作(DII)描述了数据在不同数据存储、应用程序和组织这三者内部和之间进行移动和整合的相关过程。数据集成是将数据整合成物理的或虚拟的一致格式。数据互操作是多个系统之间进行通信的能力。
重要性:数据集成和互操作是新兴大数据管理领域的核心
数据集成和互操作基本数据管理职能
1)数据迁移和转换。
2)数据整合到数据中心或数据集市。
3)将供应商的软件包集成到组织的应用系统框架中。
4)在不同应用程序或组织之间数据共享。
5)跨数据存储库和数据中心分发数据。
6)数据归档。
7)数据接口管理。
8)获取和接收外部数据。
9)结构化和非结构化数据集成。
10)提供运营智能化和管理决策支持。
8.1.1 业务驱动因素
目的:为了对数据移动进行有效管理
1)对企业来说,管理数据集成的复杂性以及相关成本是建立数据集成架构的原因。
2)另一个业务驱动因素是维护管理成本
解释:数据仓库和主数据解决方案,如数据中心(Data Hub),通过整合许多应用程序所需的数据,并为这些应用程序提供一致的数据视图,从而能缓解这个问题。类似地,对于需要跨组织共享的操作和交易数据,通过使用企业数据集成技术(如中心辐射型集成(Hub-and-SpokeIntegration)和规范化消息模型等)可以极大地简化管理这些数据的复杂性。
数据集成和互操作(DII)还支持组织遵守数据处理标准和规则的能力
8.1.2 目标和原则
目标
1)及时以数据消费者(人和系统)所需的格式提供数据。
2)将数据物理地或虚拟地合并到数据中心。
3)通过开发共享模型和接口来降低管理解决方案的成本和复杂度。
4)识别有意义的事件(机会和威胁),自动触发警报并采取相应行动。
5)支持商务智能、数据分析、主数据管理以及运营效率的提升。
原则
1)采用企业视角确保未来的可扩展性设计,通过迭代和增量交付实现。
2)平衡本地数据需求与企业数据需求,包括支撑与维护。
3)确保数据集成和互操作设计和活动的可靠性。业务专家应参与数据转换规则的设计和修改,包括持久性和虚拟性。
8.1.3 基本概念
抽取、转换、加载(ETL)
总论:数据集成和互操作的核心是抽取、转换和加载(ETL)这一基本过程。无论是在物理状态下或虚拟状态下,批量的或实时的执行ETL都是在应用程序和组织之间数据流动的必要步骤。
抽取
定义:抽取过程包括选择所需的数据并从其源数据中提取。然后,被抽取的数据会在磁盘或内存中的物理数据存储库中进行储存。
转换
定义:转换过程是让选定的数据与目标数据库的结构相兼容
转换方法种类
格式变化。技术上的格式转换,如从EBCDIC到ASCII的格式转换。
结构变化。数据结构的变化,如从非规范化到规范化的记录。
语义转换。数据值转换时保持语义的一致化表达,如源性别代码可以包括0、1、2和3,
而目标性别代码可以表示为UNKNOWN、FEMALE、MALE或NOT PROVIDED。
消除重复。如规则需要唯一的键值或记录,以确保包括扫描目标、检测和删除重复行的方法。
重新排序。改变数据元素或记录的顺序以适应已定义的模式。
转换可以批量执行,也可以实时执行,或者是将转换结果存储在物
理状态下的缓存区域,或者是将转换后的数据存储在虚拟状态下的内存 中,直至移动到加载步骤为止。转换阶段所产生的数据应准备好与目标 结构中的数据进行集成。
加载
定义说明:加载过程是在目标系统中物理存储或呈现转换结果。根据所执行的转换、目标系统的目的和其预期用途,数据可能需要被进一步的处理以便与其他数据集成,或者可能以一种最终形式呈现给消费者。
抽取、加载、转换(ELT)
如果目标系统比源系统或中间应用系统具有更强的转换能力,那么数据处理的顺序可以切换为ELT——抽取、加载、转换
ELT允许源数据以原始数据的形式在目标系统上实例化,这对其他进程是有用的。用ELT的方式加载至数据湖,这在大数据环境中是很常见的。
映射(转换的同义词)
既是从源结构到目标结构建立查找矩阵的过程,也是该过程的结果。
映射定义了要抽取的源数据与抽取数据的识别规则、要加载的目标与要更新的目标行的识别规则(如果有的话)以及要应用的任何转换或计算规则
数据集成和互操作的核心
时延
定义:时延(Latency)是指从源系统生成数据到目标系统可用该数据的时间差。
批处理
定义:大多数数据在应用程序和组织之间以一批文件的形式移动,要么是根据数据使用者的人工请求,要么是按周期自动触发。这种类型的交互称为批处理或ETL。
特点:批处理对于在短时间内处理大量数据非常有用,它倾向用于数据仓库数据集成解决方案,即使在低延迟解决方案可用时也是如此。
用途:批量数据集成可用于数据转换、迁移和归档以及从数据仓库和数据集市中抽取和加载数据。
变更数据捕获
定义:更数据捕获是一种通过增加过滤来减少传送带宽需求的方法,只包含在特定时间范围内更改过的数据。
特点:变更数据捕获监视数据集的更改(插入、更改、删除),然后将这些更改(增量)传送给使用这些数据的其他数据集、应用程序和组织。
3种捕获技术
源系统填入特定的数据元素
源系统进程在更改数据时被添加到一个简单的对象和标识符列表,然后用于控制抽取数据的选择
源系统复制已经变化的数据。这些数据已经作为交易的一部分变成了独立对象,然后用于抽取处理
准实时和事件驱动
定义:数据在特定的时间表内是以较小的集合进行处理,或者在事件发生时处理,如数据更新
用途:大多数未采用批量方式的数据集成解决方案都是使用准实时或事件驱动的方式。
特点:与批处理相比,准实时(Near-Real