具体描述
市面上不乏大数据具体技术组件的书籍,但却很少有从大数据平台整体建设和产品形态的宏观角度入手来阐释的。本书重点介绍大数据开发平台服务构建的整体思路和解决方案,内容涵盖一个成熟的大数据开发平台必不可少的各类核心组件:工作流调度系统、集成开发环境、元数据管理系统、数据交换服务、数据可视化服务、数据质量管理服务,以及测试环境的建设等。书中还凝结了作者多年平台建设的实践经验,以及对大数据相关从业人员能力建设和职业规划的宝贵建议。本书适合广大志在深入了解大数据平台建设、开发和应用的在职人员及院校师生。
作者简介
刘旭晖,花名天火,原蘑菇街数据平台资深架构师,负责蘑菇街大数据服务平台整体产品规划和架构设计工作;此前多年供职于Intel开源技术中心,是Spark/Hadoop/HBase/Phoenix等开源项目贡献者;在内核驱动、操作系统中间件、输入法、浏览器等方向均有多年开发经验。
目录信息
1.1 什么是大数据平台 1
1.2 大数据平台的建设目标 3
1.2.1 别人的大数据平台是怎样的 3
1.2.2 和业内领先的大数据平台的差距 4
1.2.3 大数据平台建设目标小结 6
1.3 大数据平台的建设指导方针 6
1.3.1 组件工具化 7
1.3.2 工具平台化 8
1.3.3 平台服务化 9
1.3.4 平台产品化 10
1.3.5 对中小公司大数据平台的适用性 11
1.4 大数据平台的两种建设路径 12
1.4.1 垂直业务领域一站到底的建设方式 13
1.4.2 通用组件建设,组合支持业务的方式 13
1.4.3 从蘑菇街平台的实践经验对比两种建设路径 14
1.4.4 两种建设路径的对比小结 16
第2章 服务意识和产品思想的培养 17
2.1 明确大数据平台服务能力的评估标准 17
2.1.1 大数据平台团队的职能定位 18
2.1.2 打通上下游系统和业务流程的能力 18
2.2 满足用户真正的需求 19
2.3 认清服务的代价,做好心理建设 20
2.4 寻找解决服务代价问题的方案 23
2.4.1 路线选择带来的代价问题 23
2.4.2 如何降低服务自身的代价 25
2.5 大数据平台的产品化思想 29
2.5.1 从用户体验的角度谈产品设计 31
2.5.2 从价值和利益的角度谈产品思维 36
2.6 小结 38
第3章 工作流(作业)调度系统 39
3.1 作业调度系统基础理论 40
3.1.1 调度系统分类 40
3.1.2 工作流调度系统的两种心法流派 45
3.1.3 工作流调度系统功能特性详解 49
3.2 Jarvis调度系统产品开发实践 55
3.2.1 需求定位分析 55
3.2.2 具体功能目标的详细分析和实践 57
3.2.3 第二代Jarvis现状和将来 75
3.3 小结 79
第4章 集成开发环境门户建设 81
4.1 集成开发环境的功能定位 82
4.1.1 集成开发环境的整体服务思路 83
4.1.2 集成开发环境的具体产品建设目标 86
4.1.3 小结 93
4.2 开发平台测试环境建设 94
4.2.1 问题背景 94
4.2.2 系统功能性测试环境 95
4.2.3 数据业务类测试环境 96
4.2.4 小结 100
第5章 数据采集、传输、交换、同步服务 101
5.1 数据交换服务场景和常见开源方案 102
5.1.1 大数据平台数据交换服务业务场景 102
5.1.2 常见数据交换服务解决方案介绍 103
5.2 数据交换服务具体产品实践 110
5.2.1 数据交换服务底层组件 110
5.2.2 数据交换服务管控平台 113
5.2.3 蘑菇街数据交换服务的实践现状和未来改进计划 118
5.3 用户行为链路分析之日志埋点采集跟踪方案实践 120
5.3.1 记日志有什么难的 120
5.3.2 蘑菇街的用户行为日志采集方案实践 122
5.3.3 小结 129
第6章 数据可视化平台 130
6.1 什么是数据可视化平台 130
6.1.1 数据可视化平台名词定义 131
6.1.2 已经有了那么多商业BI系统,为什么还要造轮子 132
6.2 数据可视化平台产品实践 134
6.2.1 可视化平台产品定位和需求分析 135
6.2.2 具体产品功能需求实践详解 136
6.2.3 将来的改进目标 146
6.2.4 产品实践小结 148
第7章 安全与权限管控 149
7.1 权限管理的目标是什么 149
7.1.1 适度安全,降低人为风险 150
7.1.2 隔离环境,提高工作效率 151
7.1.3 权责明晰,规范业务流程 152
7.1.4 权限管理目标小结 153
7.2 如何解决安全和便利的矛盾 153
7.2.1 安全和便利天生矛盾 153
7.2.2 改变角度,转移目标 154
7.2.3 把握尺度 155
7.2.4 可能的变通措施 157
7.2.5 思想小结 163
7.3 权限管控系统产品方案和技术分析 163
7.3.1 常见开源方案 164
7.3.2 Kerberos 165
7.3.3 Sentry和Ranger 168
7.3.4 Knox 169
7.3.5 开源项目中常见的权限模型概念 169
7.4 基于开发平台服务入口的权限管控方案 171
7.4.1 权限管控方案实践 171
7.4.2 底层统一权限管控和平台边界权限管控方案对比 173
第8章 数据质量管理 175
8.1 元数据管理平台 176
8.1.1 元数据管理平台管理什么 176
8.1.2 元数据管理相关系统方案介绍 180
8.1.3 元数据管理系统工程实践 183
8.2 DQC数据质量中心 185
8.2.1 DQC数据质量中心业界方案 186
8.2.2 DQC数据质量系统建设实践 188
8.3 数据质量管理小结 193
第9章 大数据集群迁移经验谈 195
9.1 集群迁移都要面对哪些麻烦事 196
9.1.1 集群和机房外部环境问题 196
9.1.2 平台自身组件和服务依赖问题 196
9.1.3 业务模式和沟通配合问题 197
9.1.4 业务逻辑和数据正确性问题 198
9.2 集群搬迁方案的总体目标、原则、流程 199
9.3 一些具体问题的分析和实践 201
9.3.1 如何保证正确性 201
9.3.2 集群数据同步拷贝方案 205
9.3.3 各种无法双跑的业务场景梳理 207
9.4 小结 208
第10章 谈谈大数据码农的职业发展问题 210
10.1 如何成为一名糟糕的大数据平台工程师 211
10.1.1 我是小白我怕谁 211
10.1.2 敏而好学,不耻下问 212
10.1.3 效率优先,中文至上 213
10.1.4 流行的就是最好的 213
10.1.5 我们的征途,是星辰大海 215
10.1.6 书中自有颜如玉,热衷阅读代码 216
10.1.7 谜之问题的谜之解决方式 218
10.1.8 勤奋好学,但是回头即忘 220
10.1.9 小结 221
10.2 职业选择和我们早晚要面对的中年危机问题 222
10.2.1 中年危机,要从娃娃抓起 222
10.2.2 中年危机之抗焦虑指南 223
10.2.3 如何才能获得自由 225
10.2.4 案例 230
10.2.5 小结 233
· · · · · · (收起)
读后感
用户评价
我是一名刚接触大数据领域的项目经理,这本书对我来说,犹如黑暗中的一盏明灯,但同时也是一座需要攀登的高山。它的深度令人敬佩,但信息的密度也相当惊人。书中对于构建弹性伸缩机制和容错恢复策略的论述尤为精辟,尤其是在描述如何设计一个“自愈合”的数据管道时,作者引用了大量的业界最佳实践和失败案例,使得那些抽象的概念变得异常具体和可感。我记得其中一节专门讨论了云原生环境下大数据组件的容器化部署和编排优化,这对于我们计划迁移到Kubernetes集群的团队来说,简直是救命稻草。然而,这本书的阅读体验并非一帆风顺,很多高级概念需要反复咀嚼,甚至需要结合其他更基础的分布式系统书籍一起阅读才能完全消化。它的行文风格严谨且偏学术化,缺少一些轻松的插科打诨来缓解阅读压力,需要读者具备一定的耐心和主动查阅资料的习惯。
坦白说,我一开始对这本书抱有很高的期望,希望能找到一本能立刻上手操作的“速成手册”,结果发现它更像是一本详尽的“设计原理教材”。对于那些只关注特定工具链(比如某个版本的Kafka或HBase)的工程师来说,这本书的宏观视角可能会让人觉得有些“不接地气”。它很少涉及具体的代码片段或命令行操作,更多的是围绕着分布式系统的CAP理论、一致性模型以及面向服务的架构(SOA)在数据层面的实现进行深入阐述。我特别留意了其中关于数据湖与数据仓库融合的章节,作者清晰地勾勒出了这两种范式的演进路线和未来的融合趋势,并通过多个抽象模型来解释复杂的数据流转逻辑。对我而言,这本书的价值在于构建了一个坚实的理论基础,让我能够理解为什么在某些高并发场景下,我们必须牺牲一部分强一致性来换取更高的可用性和分区容错性。它迫使我停下来思考,我们当前使用的架构是否真正契合业务的长期发展目标,而不是仅仅为了追赶技术热点而盲目跟风。
这本《大数据平台基础架构指南》真是让我大开眼界,感觉像是拿到了一份通往数据洪流心脏的地图。我一直以为搭建一个可靠的大数据平台就是把一堆Hadoop和Spark的组件堆砌起来,但这本书深入浅出地剖析了其背后的哲学和工程实践,完全颠覆了我的固有认知。它花了大量的篇幅讨论了数据治理、元数据管理以及如何构建一个真正具有弹性、可扩展且易于维护的架构蓝图。我特别欣赏作者对“去中心化”与“集中控制”之间微妙平衡的探讨,这一点在实际工作中经常让人头疼。书中对流批一体化架构的案例分析极其到位,从数据采集、清洗、存储到最终的消费,每一步的技术选型和权衡都给出了非常中肯的建议,而不是简单地推荐某个特定厂商的解决方案。读完之后,我感觉自己不再是那个只会配置参数的“运维工人”,而更像一个能够设计和优化整个数据生态系统的“架构师”。它不仅仅是教你“怎么做”,更重要的是教会你“为什么这么做”,这种深度思考的引导才是真正有价值的。
这本书给我的最大感受是“前瞻性”,它不满足于描述当前主流的技术栈,而是着眼于未来三到五年内数据架构可能面临的挑战。作者花费了大量的笔墨探讨了联邦式数据架构(Data Mesh)的组织结构和技术实现难点,这在当前许多企业还在为搭建统一数据湖而焦头烂额时,显得格外有远见。书中对数据安全和隐私保护在架构设计初期的融入(Security by Design)的强调,也是我以前工作中常常被忽略的关键点。它不仅仅是谈论加密和访问控制,而是从数据生命周期的各个环节来审视如何确保合规性和信任。如果说市面上大部分书籍是在教你如何用锤子(工具)去钉钉子(解决问题),那么这本书则是在告诉你如何设计一个更高效的、能够自我调节的“制造流水线”。它提供的是一种思维模型,一种看待和设计复杂系统的视角,而非一套即买即用的配置模板。
作为一名资深数据工程师,我原以为我对现有的大数据架构已经了如指掌,但这本书中的“数据质量门禁”和“架构演进的可回溯性”的章节狠狠地给我上了一课。作者对于如何建立一个能够自动检测并隔离“脏数据”的机制,以及如何确保架构升级过程中历史数据查询的平滑过渡,给出了远超我预期的详细方案。我特别喜欢作者用类比的方式解释了复杂系统中的“影子模式”部署和“金丝雀发布”在大数据管道中的应用,让原本高风险的操作变得清晰可控。这本书的排版和图表设计也相当专业,那些流程图和结构分解图,清晰地展示了复杂组件间的依赖关系,极大地帮助了我的理解和内部知识分享。总而言之,它不是一本轻松的读物,但它是一本能真正提升你作为系统设计者专业高度的深度参考书。
对基础架构这块的思路梳理得不错,作者还是挺有诚意的,就是行为略显“自媒体”。
好久不阅读这种“系统化务虚”的书了,读完以后回头想了想,这才是问题。 该书作者实实在在的把诸多看似务虚的事情,以系统化且实战体验化(不少自己的实战经验和痛处)一股脑告诉了你,完完全全对得起读者
很真诚,把大数据平台搭建中的一些组件选型娓娓道来。既不照本宣科讲述原理,也不泛泛而谈讨论实现,而是真正的描述了作者在自己搭建过程中的一些思考。而正如作者最后一章所总结的,这些思考并不是片面的,停留在表面的,而是系统的,高角度的。虽然总体还并没有形成高度的体系(如 场景如何对应选型,公司如何平衡资源),带来的思考已经受益匪浅
原来学习的都是大数据的点,一个个framework, 这本书把这些点串起来了。
对基础架构这块的思路梳理得不错,作者还是挺有诚意的,就是行为略显“自媒体”。