具体描述
作为数据仓库和商业智能(DW/BI)行业中有影响力的领军人物,RalphKimball、MargyRoss得到了世界范围内的认可和尊重,他们在《数据仓库与商业智能宝典(第1版)》中确立了行业标准。现在,在《数据仓库与商业智能宝典(第2版)成功设计、部署和维护DW/BI系统》中已经更新了65篇DesignTip和白皮书,从而汇集了DW/BI技术创新前沿的著作。
从项目规划和需求收集,到维度建模、ETL和BI应用,本书涵盖了你在数据仓库和商业智能中将会遇到的所有内容。这些无与伦比的文章提供了成功地设计、部署和维护DW/BI系统的重要建议。
主要内容:
◆启动DW/BI项目和收集需求的注意事项
◆集成式企业数据仓库的必备要素,其中包括总线架构和矩阵
◆事实表的粒度性和三种基本类型
◆渐变维度技术
◆星型模式、外支架和桥接表
◆维度建模高级模式
◆提取、转换和加载(ETL)子系统与数据质量
◆BI应用佳实践
◆大数据注意事项
无论你正以种身份参与数据仓库或商业智能项目,这本可轻易参考和更新的宝典可谓无价之宝。
作者简介
RalphKimball创立了KimballGroup。自20世纪80年代中期开始,他就一直是DW/BI行业关于维度化方法的思想领袖,并且已经培训了超过20000名IT专家。在任职于Metaphor和创立RedBrickSystems之前,Ralph在施乐帕克研究中心(XeroxPARC)参与创建了Star工作站。Ralph拥有斯坦福大学电子工程专业的博士学位。
MargyRoss是KimballGroup和DecisionWorksConsulting的董事长。她从1982年开始就专注于数据仓库和商业智能。截止现在,Margy已经为数百个客户提供过咨询服务,并且向数万人讲解过DW/BI的实践。在任职于Metaphor和联合创办DecisionWorksConsulting之前,她毕业于美国西北大学,并且获得了工业工程专业的学士学位。
目录信息
1.1 抑制住立即开始编码的冲动
1.2 设置边界
1.3 数据争夺
1.4 流言终结者
1.5 划分数据世界
1.6 集成式企业数据仓库的必要步骤
1.6.1 集成式:EDW会交付什么
1.6.2 集成的终极试金石
1.6.3 组织挑战
1.6.4 一致化维度和事实
1.6.5 使用总线矩阵与管理层交流
1.6.6 管理集成式EDW的主干
1.6.7 维度管理器
1.6.8 事实提供者
1.6.9 配置商业智能(BI)工具
1.6.10 连带责任
1.7 钻取以寻求原因
1.8 渐变维度
1.8.1 渐变维度的三种原生类型
1.8.2 高级渐变维度
1.9 通过维度评价BI工具
1.10 事实表
1.10.1 忠实于粒度
1.10.2 从最低的可能粒度进行构建
1.10.3 三类事实表
1.11 开发利用事实表
1.11.1 前端:聚合导航
1.11.2 前端:钻取不同的粒度
1.11.3 前端:将约束暴露给不同的业务过程
1.11.4 后端:事实表代理键
第2章 深入研究之前
2.1 Ralph Kimball和施乐帕克研究中心(Xerox PARC)
2.2 数据库市场分化
2.3 提出超市概念(Kimball经典)
2.3.1 危机规划
2.3.2 具有架构的数据集市
2.3.3 一致化维度的重要性
2.3.4 设计一致化维度
2.3.5 做出承诺
2.3.6 允许的一致化维度变体
2.3.7 建立标准事实定义
2.3.8 粒度的重要性
2.3.9 更高级别的数据集市
2.3.10 解决烟囱问题
2.3.11 不需要一致化维度的情形
2.3.12 清晰视角
2.4 数据仓库的全新需求
2.5 应对全新需求
2.5.1 数据集市和维度建模
2.5.2 将数据集市插入数据仓库总线架构中
2.6 挑起事端
2.7 设计约束和不可避免的现实
2.7.1 设计约束
2.7.2 不可避免的现实
2.7.3 摆脱困境
……
第3章 项目/程序规划
第4章 需求定义
第5章 数据架构
第6章 维度建模基础
第7章 维度建模任务和职责
第8章 事实表核心概念
第9章 维度表核心概念
第10章 更多的维度模式和注意事项
第11章 后台ETL和数据质量
第12章 技术架构注意事项
第13章 前台商业智能应用程序
第14章 维护和发展的注意事项
第15章 最后的思考
· · · · · · (收起)
读后感
用户评价
作为一名刚毕业不久,正在努力钻研数据工程方向的新人,我发现很多入门书籍都只停留在SQL查询或者简单的Python脚本层面。这本书则为我打开了一扇通往企业级数据平台的大门。它对数据抽取、转换和加载(ETL/ELT)过程中的细节处理,比如错误日志记录、数据回填策略、以及大数据量下的性能调优,都有非常细致的描述。我特别喜欢其中关于数据湖与数据仓库集成架构的探讨,这正是我目前公司正在尝试转型的方向。书中的概念阐释逻辑严密,层层递进,即便是涉及复杂的数据管道设计,作者也能用清晰的流程图和类比来解释清楚。它不仅教会了我如何构建数据仓库,更重要的是,让我理解了如何构建一个“健壮的、可扩展的”数据基础设施,这对我的职业发展规划具有指导性的意义。
我是一个资深的数据分析师,过去几年里,我们团队一直挣扎在报表滞后和数据口径不一致的问题上,每次老板问个紧急问题,我们都得花上两天时间去“考古”数据源。这本书的出现,彻底改变了我的工作方法论。它对数据仓库架构的阐述极其精妙,尤其是它对星型模型和雪花模型的应用场景区分得非常到位,不再是生搬硬套教科书上的定义。我印象最深的是它关于BI选型和实施策略的章节,那部分内容简直就是一份现成的行动指南。书中详细对比了不同BI工具的优缺点和适用场景,并且强调了“业务驱动”的重要性,而不是被技术牵着鼻子走。读完之后,我立刻在团队内部推动了一场关于“事实表和维度表”定义的统一工作,效果立竿见影,我们部门内部的沟通效率都提升了好几个档次。这本书的价值在于,它不仅告诉你“怎么做”,更重要的是告诉你“为什么这么做”,这种深层次的理解对于长期维护和优化系统至关重要。
我以一个项目经理的角度来看待这本书,它提供了一个极其清晰的框架来指导整个DW/BI项目的生命周期。我们过去的项目常常在需求阶段就陷入泥潭,因为业务部门和技术团队对“成功”的标准理解不一致。这本书在项目规划和治理部分给出了非常实用的建议,比如如何建立数据治理委员会,如何量化BI项目的ROI。更重要的是,它非常坦诚地讨论了项目实施过程中可能遇到的政治阻力、技术债务积累等“非技术性难题”。这种对现实挑战的直面,让这本书显得格外真实可信。我特别欣赏作者在提到敏捷方法在数据仓库项目中的应用时,那种既肯定其灵活性的同时,又指出了其在数据一致性维护上的潜在风险的平衡观点。这本书的组织结构非常适合作为项目启动会议的参考资料,能够迅速让所有利益相关者对项目的目标和风险达成共识。
这本书的深度和广度令人印象深刻。我原本以为它会侧重于某个单一的技术栈,比如只谈论某个特定的数据库或BI工具,但出乎意料的是,它采用了一种高度中立和普适性的视角。它并没有强行推荐“最好的”技术,而是提供了一套通用的设计哲学。书中关于元数据管理和数据血缘追踪的章节,简直是企业数据治理的圣经。我过去常常被“这个数是从哪里来的?”这样的问题困扰,而这本书清晰地展示了如何建立一个可靠的元数据层来解决这些溯源难题。它的行文风格非常严谨,但又不失启发性,很多关键的见解都是通过对最佳实践的反思来呈现的。这本书真正做到了“宝典”二字,值得放在案头,时常翻阅,每一次重读都能发现新的领悟。
这本书简直是我的救星!我最近被派去负责我们公司的数据治理项目,说实话,我对数据仓库和商业智能(BI)这些概念还停留在“听说过”的阶段。市面上的书要么太学术,看得我云里雾里,要么就是过于基础,对实操指导性不强。而这本书,从一开始就给我一种脚踏实地的感觉。它没有一开始就堆砌复杂的理论模型,而是先用生动的案例帮我理解了为什么我们需要一个好的数据仓库,以及它到底能为企业带来什么价值。我尤其喜欢它对“数据孤岛”问题的剖析,那种感觉就像作者直接点出了我们当前业务的痛点。后面的章节更是逐步深入,从数据建模到ETL流程的设计,每一步都有详细的图示和操作建议,让我感觉自己不是在看一本厚厚的教科书,而是在跟随一位经验丰富的导师学习。特别是关于数据质量管理的部分,讲得非常透彻,解决了我在实际工作中遇到的很多模糊地带。这本书的叙述方式非常人性化,没有那种高高在上的技术腔调,非常适合像我这样需要快速上手并解决实际问题的实干派。
太多大全了,而且有点老了,不如数仓工具箱更实际。
太多大全了,而且有点老了,不如数仓工具箱更实际。
太多大全了,而且有点老了,不如数仓工具箱更实际。
太多大全了,而且有点老了,不如数仓工具箱更实际。
太多大全了,而且有点老了,不如数仓工具箱更实际。