面临哪些数据湖管理挑战?
|
有必要定义什么是数据湖:一种可容纳大量原始数据的数据平台,这些数据通常以其本机格式保留,直到需要用于分析。 传统的数据仓库将数据存储在关系表中,而数据湖则使用平面结构。每个数据元素被分配唯一标识符,并用一组元数据标签进行标记。这就是说,数据湖没有数据仓库那么结构化。在访问数据进行分析时,数据会被分类和整理,而不是在将数据加载到数据湖中时。 有效的数据治理使企业能够提高数据质量和一致性,并很大程度地利用数据进行业务决策,从而可以改善业务规划和财务绩效。数据治理的配套数据管理学科包括数据质量、元数据管理和数据安全性,所有这些因素都影响到数据湖治理。 现在,让我们看看下面5个数据湖部署中的数据治理挑战。 1.识别和维护正确的数据源 在很多数据湖部署中,源元数据没有被获取或根本不可用,这使得数据湖内容的有效性令人质疑。例如,可能未列出记录系统或数据集的业务所有者,或者显然冗余数据可能会给数据分析人员造成问题。至少应记录数据湖中所有数据的源元数据,并使用户可以使用它来了解其出处。 2.元数据管理问题 元数据为数据集内容提供背景信息,并且是使数据在应用程序中易于理解和可使用的重要组件。但是很多数据湖部署忽略了对收集的数据应用正确数据定义的需求。而且,由于原始数据通常被加载到数据湖中,很多企业没有采取步骤来验证数据或对其应用企业数据标准。缺少适当的元数据管理使得数据湖中的数据对分析的用处不大。 3.在数据治理和数据质量方面缺乏协调性
不协调的数据湖治理和数据质量工作会导致劣质数据进入数据湖。当这些数据用于分析并驱动业务决策时,这可能导致结果不准确,从而导致丧失对数据湖的信心以及整个企业对数据普遍不信任。有效的数据湖部署需要数据质量分析师和工程师与数据治理团队及数据管理员密切合作,以部署数据质量策略、分析数据并采取必要的措施 (编辑:平凉站长网) 【声明】本站内容均来自网络,其相关言论仅代表作者个人观点,不代表本站立场。若无意侵犯到您的权利,请及时与联系站长删除相关内容! |

