课程介绍
【培训背景】
在当今数字化时代,数据已经成为企业不可或缺的核心资产。随着企业对数据的依赖日益加深,有效的数据治理成为保障数据质量、确保合规性及安全性的关键。特别是在中国,政府对数据治理的重视程度不断提升,推动了一系列政策和框架的建设,促进数据资源的合理利用和保护。党的二十大报告强调了推动数字经济健康发展和加强数字中国建设整体布局的重要性。在此背景下,工业和信息化部印发的《"十四五"大数据产业发展规划》,提出了一个目标:到2025年,构建一个基本完善的数据治理体系,使数据资源的价值得到充分释放,同时政策还鼓励企业在其估值和报告中体现数据的价值。
数据,作为数字经济中的“核心动力”,已经被确认为推动企业创新发展、数字化转型的战略性资源。
【培训收益】
通过学习本课程,您将获得如下收益:
1. 掌握数据治理战略制定、组织架构设计及全流程闭环管控,具备治理顶层规划能力;
2. 精通数据质量管控体系、主数据系统建设与元数据治理实操,解决数据杂乱、质量差、不可用问题;
3. 掌握DDD领域建模向多维模型转换及数仓分层架构设计,具备数仓搭建与运维能力;
4. 熟悉Hadoop、Spark、Flink等分布式组件原理,具备批流一体数据处理实战能力;
5. 掌握数据湖、流批一体化采集与全链路治理,具备数据中台建设项目落地能力;
6. 掌握NoSQL、ES及Kylin应用开发,实现海量数据秒级查询与多维分析;
7. 掌握CRISP-DM标准流程与核心算法,实现数据可视化、风险防控与业务价值转化;
8. 掌握AI辅助治理与建模方法,积累大数据+AI融合项目落地实操经验。

【适合人群】

【培训特色】
1.资深讲师授课,小班制教学;
2.理论与实践相结合、案例分析与行业应用穿插进行;
3.专家精彩内容解析、学员专题讨论、分组研究。
【授课专家】
范老师 大数据转型的实践者与倡导者
独立咨询顾问,畅销书籍《架构真意》与《大话重构》的作者,规模化敏捷SPC。曾任航天信息首席架构师,哈工大软件工程硕士,软件架构及重构的客座讲师。从事软件研发工作近二十年,并且现在一直坚守在大型软件架构设计一线工作。从需求分析、软件开发到项目管理、架构设计都有丰富的从业经验。先后参与了数十个国内大型软件项目,涉及国家财政、军工、税务、医疗等领域的大数据中台建设、风险防控与人工智能研究。互联网转型、微服务转型及大数据转型的实践者与倡导者。
赵老师 资深企业管理和IT咨询专家
资深企业管理和IT咨询专家,毕业于北京工商大学,2013年受邀担任和君商学院二十四节气导师。曾担任某大型软件公司产品规划部总设计师,某石油集团企业架构总体架构师兼第一试点项目经理、中航工业企业架构总体架构师。有12年以上企业业务架构、IT架构、管理咨询、企业整体信息化解决方案规划经验。为中石油、中海油、大唐、华电、双汇、蒙牛、国家电网、包商银行等多家企业提供过咨询服务和企业整体解决方案的规划和实施工作。致力于利用架构思想和开发方法为企业提供组织、流程与技术有效结合的企业运营蓝图。
王老师 数据治理及数据标准化专家
王老师,毕业于中央广播电视大学,国内IT培训金牌讲师,拥有多年IT职业培训生涯,授课时长超5600学时,教学经验与实践能力兼备,对IT职业培训有深刻理解。主导或参与完成20余个大中型项目,深耕数据治理、数据架构、数据标准化及数据质量提升等领域,在数据治理体系建设、数据能力成熟度评估、企业级数据模型设计等方面具有丰富实战经验,长期致力于推动企业数据资产规范化管理与价值释放。同时在项目管理、IT运维管理、ITIL落地、机房管理等方向亦有深入研究。
【结业证书】
参加培训并通过考试学员,由工业和信息化部教育与考试中心统一颁发《数据管理工程师(高级)》工业和信息化职业能力证书。

证书样本
开班计划
| 开课时间 | 授课形式 | 培训类型 | 上课城市 | 在线报名 |
|---|---|---|---|---|
| 2026-01-29 | 面授+直播 | 精品班 | 哈尔滨 | 在线报名 |
| 2026-05-29 | 面授+直播 | 精品班 | 上海 | 在线报名 |
| 2026-09-22 | 面授+直播 | 精品班 | 成都 | 在线报名 |
| 2026-12-25 | 面授+直播 | 精品班 | 北京 | 在线报名 |
| 随报随学 | 录播 | 特惠班 | IT云课 | 在线报名 |
课程大纲
数据治理、数据架构设计及数据标准化方法培训班,标准公开课为3天,每天6小时,录播课为17课时,企业内训可按需求定制。
课程安排如下:
日程 | 主题 | 内容 |
第一天上午 | 第一章 大数据治理业务全景 | 企业数字化转型带来数据治理挑战 1. 企业数据化转型的三个层面 2. 企业数据化转型的挑战 |
数据资产管理的核心是数据治理 1. 数据资产管理的概念与内容 2. 数据资产的构成:业务数据、分析数据、主数据 3. 数据资产管理的挑战 | ||
数据治理的过程 1. 制定数据治理战略 2. 建立相关的组织与制度 3. 发布数据治理标准 4. 定义数据质量 5. 监控、反馈与评价 | ||
第一天下午 | 第二章 数据质量管理 | 数据质量管理的挑战 1. 获取大量准确数据非常困难,不能满足分析需求 2. 获取大量、丰富但不太准确的数据(大数据时代特征) |
建立数据质量管理体系: 1. 事前:数据质量评估 2. 事中:建立ETL过程 3. 事后:数据质量报告 | ||
数据质量管理的过程:ETL过程 1. 数据清洗及其实战举例 2. 数据转换及其实战举例 3. 数据集成及其实战举例 | ||
数据治理落地:数据仓库 1. 主题数据模型(主题域划分) 2. 多维数据模型(事实表、维度表) 3. 数据仓库分层:ODS, DWD, MID, DM, ADS 4. 数据仓库设计与运维 | ||
主数据建设的过程 1. 没有主数据的数据治理:成本非常高 2. 开始建设主数据:数据治理与主数据建设并行开展 3. 建立起主数据系统:数据质量大幅度提高 | ||
主数据的范围: 1. 基础数据、组织机构、财务类数据 2. 物资设备、知识数据、客户/供应商 | ||
主数据系统架构: 1. 主数据采集、主数据治理、主数据业务管理 2. 主数据管控、主数据维护、主数据分发与数据安全 | ||
元数据治理面临的挑战: 数据找不到、读不懂、不可信 | ||
元数据的概念与分类 1. 业务元数据、技术元数据、操作元数据 2. 消费侧、服务侧、数据主题侧、数据湖侧、数据源侧 | ||
案例讲解元数据治理的过程 1. 数据资产的整理与规范 2. 元数据的注册与采集 3. 元数据的版本管理与发布 | ||
第三章 基于DDD的数据治理实战 | 基于DDD的数据治理实战 1. 通过领域模型梳理业务系统的数据 2. 基于领域模型建立多维数据模型 3. 探查数据质量,建立ETL过程 4. 导入数据仓库,建立数据中台 案例:智慧远程大数据平台的建设过程 | |
将领域模型转换成多维数据模型 1. 建立多维数据模型 2. 多维数据模型优化 3. 数据主题域的划分 4. 数据中台的分层:原始数据层、细节数据层、轻度综合层、数据集市层 5. 数据集市与数据分析挖掘 | ||
实战演练:AI辅助的数据治理过程 1. AI辅助对数据字典进行分类梳理 2. AI辅助对业务系统建立领域模型 3. AI辅助将领域模型转换成多维模型 4. AI辅助形成数据仓库设计 | ||
第二天 上午 | 第四章 数据中台建设 | IT向DT的转型 1. 回顾这些年IT建设的发展历程 2. 当前IT建设遇到的瓶颈: 数据分散、数据质量低、数据量大、数据利用率低 3. 当前信息化发展趋势:IT向DT 转型 |
数据中台的概念 持续地将业务数据转变为数据资产,并服务于业务 1. 尽可能多地汇聚业务数据,将数据拉通,形成数据资产 2. 尽可能地挖掘数据价值,用数据驱动业务发展 | ||
数据中台建设的内容 1. 数据采集:数据定义、结构化数据采集、非结构化数据采集、流批一体化、数据湖建设 2. 数据治理:数据标准化、数据质量管理、ETL过程、数据仓库、主题数据模型、大数据存储 3. 数据应用:数据可视化、数据分析、数据挖掘、人工智能 | ||
第五章 分布式大数据技术 | 分布式大数据技术原理 传统关系型数据库的设计局限 | |
分布式大数据的设计理念 1. 分布式并行计算 2. 移动计算而不是移动数据 3. 分布式计算发展历程与未来趋势 4. 如何进行大数据分析与应用 5. 大数据分析系统的架构设计 | ||
大数据的生态圈 1. Hadoop核心组件:MapReduce,HDFS 2. 并行计算框架:Spark vs. MapReduce 3. 在线查询:HBase与Impala 4. 流式计算:Flink vs. Spark Stream 5. 文本索引:Solr vs. ElasticSearch 6. Zookeeper与高可靠架构 7. Kafka分布式队列与日志收集 8. 数据挖掘工具:Mahout、SparkR与Spark ML | ||
核心组件Hadoop的工作原理 1. HDFS的工作原理 2. MapReduce的工作原理 3. MapReduce的优劣势分析 实战:编写WordCount程序 | ||
计算框架Spark的工作原理 1. Spark在Hadoop生态圈中的位置 2. Spark vs. MapReduce 3. Spark系统架构与RDD 案例:WordCount在Spark中的实现 | ||
流式计算Flink的工作原理 1. 批流一体的设计思想 2. Flink流式计算的原理 3. Flink的系统架构 4. Flink设计实战 5. 项目实战:用户行为分析 | ||
第二天 下午 | 第六章 数据中台建设:数据采集 | 大数据采集建设思路 1. 数据湖概念及其设计应用 2. 流批一体化建设思路 |
结构化数据采集 1. sqoop工作原理 2. 数据导入功能 实战:数据导入的实战应用 3. 数据导出功能 实操:数据导出的实战演练 | ||
非结构化数据采集 1. 批处理 vs. 实时分析 2. 实时分析系统应用实战 实操:基于日志的用户行为分析的实战演练 | ||
第七章 数据中台建设:数据治理 | 大数据治理的建设思路 1. 数据治理面临的难题及其建设思路 2. 基于大数据的数据治理的建设过程 | |
大数据ETL过程 1. 数据标准化与数据质量管理 2. ETL过程:数据清洗、转换、集成 3. Hive工作原理 4. Hive命令:创建表、导入数据、查询数据、分区 5. Hive+SparkSQL的开发实战 6. 清洗、转换、集成、装载的应用案例 | ||
数据体系建设 1. 数据体系规划:原始数据层、数据仓库层、数据集市层 2. 数据资产管理:资产规划、数据治理、标签管理 3. 数据质量管理:元数据管理、数据血缘管理 4. 数据仓库建设:多维数据建模、事实表、维度表、聚合表 | ||
实操:基于大数据的数据治理实战演练 1. Hive数据库的建表、导数据、查询、分区操作 2. Hive数据库的分层:ODS, DWD, MID, DM, ADS 3. Spark开发实战:数据清洗、转换、集成、导入数仓 4. Flink开发实战:日志采集、实时分析、数据展现 | ||
第三天 上午 | 第八章 数据中台建设:数据服务 | 大数据服务的建设思路 1. 大数据分析挖掘及其应用 2. 海量数据秒级查询的建设思路 3. 大数据共享平台的建设思路 |
大数据查询与NoSQL数据库 1. 离线分析、在线查询与近线分析 2. NoSQL数据库 3. HBase的工作原理 | ||
实操:HBase的开发实战 1. HBase数据库的设计 2. 批量数据高效导入 3. 数据查询与展现 | ||
数据索引与ElasticSearch 1. ElasticSearch的性能分析与特点 2. ElasticSearch的应用实战 3. ElasticSearch应用开发应注意的问题 | ||
实操:ElasticSearch的实战演练 1. ElasticSearch的操作:建表、插入、查询 2. 批量数据高效导入 3. 数据查询与展现 | ||
大数据多维数据分析 1. 多维数据建模 2. Kylin的工作原理 3. Kylin的开发实战 4. Kylin的性能优化 | ||
第九章 数据分析与挖掘 | 数据中台的核心是价值变现 1. 数据可视化 案例:网络运营商大数据监控系统建设过程 2. 数字化运营 案例:滴滴打车的数字化运营与产品创新过程 3. 数据风险防控 案例:税务系统虚开发票风险监控系统建设过程 | |
挖掘数据价值与价值变现 1. 数据挖掘的本质:挖掘数据中潜藏的规律 2. 基于大数据平台的数据挖掘过程 | ||
跨行业数据挖掘标准流程(CRISP-DM) 1. 理解业务:理解业务场景、理解业务需求 2. 理解数据:数据来源、数据含义、数据量、数据质量 3. 准备数据:采集数据、探索数据、数据清洗 4. 数据建模:关联分析、分类问题、预测模型、聚类算法 5. 模型评估:准确率、精确率、召回率、过度拟合 6. 部署应用:大数据开发、分布式部署 | ||
分类算法及其实战演练 1. 决策树算法及其原理 2. 决策树算法的实战演练 3. 决策树算法评估与模型优化 | ||
预测问题及其实战演练 1. 逻辑回归算法的原理与动手练习 2. 案例:市场营销与广告投入的分析 3. 案例:企业成长性预测模型的设计过程 | ||
第三天下午 | 第十章 人工智能及其应用 | 人工智能的发展趋势 1. 人工智能与数据分析、数据挖掘的区别与联系 2. 人工智能的设计套路:形成人工智能算法闭环 3. 人工智能的设计困境:需要有数据中台支撑 4. 人工智能的未来趋势:与5G和物联网相结合 |
人工智能如何识别图像 1. 深度学习与神经网络 2. 神经网络算法的原理 3. 案例:演练神经网络识别图像的过程 | ||
如何开展人工智能业务 案例分析:远程智慧诊疗大数据平台的人工智能建设 1. 项目建设思路与规划 2. 医生对患者诊断与治疗的业务梳理过程 3. 多模态的数据建模过程 4. 大数据采集、大数据中台建设与建立人工智能算法闭环 5. 设计智能前端、架构智能业务系统与基于SaaS的云服务 |