具体描述
Apache Kylin是一个开源的分布式分析引擎,提供Hadoop之上的SQL查询接口及多维分析(OLAP)能力以支持超大规模数据,最初由eBay公司开发并贡献至开源社区。它能在亚秒内查询巨大的Hive表。
本书分为21章,详细讲解Apache Kylin概念、安装、配置、部署,让读者对Apache Kylin构建大数据分析平台有一个感性认识。同时,本书从应用角度,结合Dome和实例介绍了用于多维分析的Cube算法的创建、配置与优化。最后还介绍了Kyligence公司发布KAP大数据分析平台,对读者有极大的参考价值。
本书适合大数据技术初学者、大数据分析人员、大数据架构师等,也适合用于高等院校和培训学校相关专业师生教学参考。
作者简介
目录信息
第1章 Apache Kylin前世今生 3
1.1 Apache Kylin的背景 3
1.2 Apache Kylin的应用场景 3
1.3 Apache Kylin的发展历程 4
第2章 Apache Kylin前奏 7
2.1 事实表和维表 7
2.2 星型模型和雪花型模型 7
2.2.1 星型模型 7
2.2.2 雪花型模型 8
2.2.3 星型模型示例 8
2.3 OLAP 9
2.3.1 OLAP分类 9
2.3.2 OLAP的基本操作 10
2.4 数据立方体(Data Cube) 11
第3章 Apache Kylin 工作原理和体系架构 12
3.1 Kylin工作原理 12
3.2 Kylin体系架构 13
3.3 Kylin中的核心部分:Cube构建 15
3.4 Kylin的SQL查询 16
3.5 Kylin的特性和生态圈 16
第4章 搭建CDH大数据平台 18
4.1 系统环境和安装包 19
4.1.1 系统环境 19
4.1.2 安装包的下载 20
4.2 准备工作:系统环境搭建 21
4.2.1 网络配置(CDH集群所有节点) 21
4.2.2 打通SSH,设置ssh无密码登录(所有节点) 21
4.3 正式安装CDH:准备工作 29
4.4 正式安装CDH5:安装配置 30
4.4.1 CDH5的安装配置 30
4.4.2 对Hive、HBase执行简单操作 39
第5章 使用Kylin构建企业大数据分析平台的4种部署方式 41
5.1 Kylin部署的架构 41
5.2 Kylin的四种典型部署方式 42
第6章 单独为Kylin部署HBase集群 44
第7章 部署Kylin集群环境 58
7.1 部署Kylin的先决条件 58
7.2 部署Kylin集群环境 61
7.3 为Kylin集群搭建负载均衡器 70
7.3.1 搭建Nginx环境 70
7.3.2 配置Nginx实现Kylin的负载均衡 73
第二部分 Apache Kylin 进阶部分
第8章 Demo案例实战 77
8.1 Sample Cube案例描述 77
8.2 Sample Cube案例实战 78
8.2.1 准备数据 78
8.2.2 构建Cube 81
第9章 多维分析的Cube创建实战 89
9.1 Cube模型 89
9.2 创建Cube的流程 90
9.2.1 步骤一:Hive中事实表,以及多张维表的处理 90
9.2.2 步骤二:Kylin中建立项目(Project) 95
9.2.3 步骤三:Kylin中建立数据源(Data Source) 95
9.2.4 步骤四:Kylin中建立数据模型(Model) 98
9.2.5 步骤五:Kylin中建立Cube 104
9.2.6 步骤六:Build Cube 114
9.2.7 步骤七:查询Cube 118
第10章 Build Cube的来龙去脉 120
10.1 流程分析 120
10.2 小结 134
第三部分 Apache Kylin 高级部分
第11章 Cube优化 137
第12章 备份Kylin的Metadata 142
12.1 Kylin的元数据 142
12.2 备份元数据 143
12.3 恢复元数据 146
第13章 使用Hive视图 147
13.1 使用Hive视图 147
13.2 使用视图实战 149
第14章 Kylin的垃圾清理 153
14.1 清理元数据 153
14.2 清理存储器数据 154
第15章 JDBC访问方式 157
第16章 通过RESTful访问Kylin 161
第17章 Kylin版本之间升级 179
17.1 从1.5.2升级到最新版本1.5.3 179
17.2 从1.5.1升级到1.5.2版本 180
17.3 从Kylin 1.5.2.1升级到Kylin 1.5.3实战 181
17.4 补充内容 187
第18章 大数据可视化实践 189
18.1 可视化工具简述 189
18.2 安装Kylin ODBC驱动 190
18.3 通过Excel访问Kylin 192
18.4 通过Power BI访问Kylin 194
18.4.1 安装配置Power BI 194
18.4.2 实战操作 198
18.5 通过Tableau访问Kylin 199
18.6 Kylin + Mondrian + Saiku 205
18.7 实战演练:通过Saiku访问Kylin 211
18.7.1 第一个Schema例子:myproject_pvuv_cube的演示 211
18.7.2 第二个Schema例子:kylin_sales_cube的演示 219
18.7.3 Saiku使用的一些问题 223
18.8 通过Apache Zepplin访问Kylin 229
18.9 通过Kylin的“Insight”查询 232
第19章 使用Streaming Table 构建准实时Cube 236
第20章 快速数据立方算法 251
20.1 快速数据立方算法概述 251
20.2 快速数据立方算法优点和缺点 253
20.3 获取Fast Cubing算法的优势 254
第四部分 Apache Kylin的扩展部分
第21章 大数据智能分析平台KAP 257
21.1 大数据智能分析平台KAP概述 257
21.2 KAP的安装部署 259
· · · · · · (收起)
读后感
用户评价
我花了整整一个周末的时间沉浸在书的开篇部分,不得不说,作者对于“为什么是Kylin”的论述,简直是教科书级别的梳理。他没有直接跳到配置和代码,而是先用大量的篇幅铺陈了传统OLAP在面对PB级数据时的性能瓶颈,那种描述的画面感极强,就好像我能亲眼看到查询在数据库中被活活“拖死”一样。然后,Kylin作为一个解决方案横空出世,作者的论述逻辑清晰,层层递进,把预计算、多维立方体(Cube)的构建原理讲解得深入浅出。我尤其欣赏他对Mondrian、Druid等相关技术的历史性对比,这种站在巨人的肩膀上去审视新技术的态度,让读者能够更全面地理解Kylin的创新之处,而不是盲目地追捧。读完前三章,我感觉自己不仅是学会了一个工具,更是补齐了自己在实时分析领域理论知识上的短板,为后续的实践操作打下了极其坚实的基础。
这本书的封面设计简直是视觉上的盛宴,那种深邃的蓝色调,搭配上金属质感的字体,一下子就抓住了我的眼球。我本身就是个对技术书籍外观有一定要求的人,很多技术书要么过于单调,要么就是那种老掉牙的排版风格。但《基于Apache Kylin构建大数据分析平台》完全不一样,它给人的感觉是既专业又不失现代感,让人一拿到手里就忍不住想翻开看看里面到底藏着什么样的干货。特别是那个抽象的数据流动的图案,暗示了书中内容的复杂性和流动性,让人对即将展开的Kylin探索之旅充满了期待。我尤其欣赏它在细节上的处理,比如书脊的磨砂质感,即便是经常翻阅也不会轻易留下指纹,这对于一个经常在工位和会议室之间奔波的分析师来说,简直是太贴心了。如果光看封面,我可能会认为这是一本关于现代数据架构美学的教科书,那种精心雕琢的感觉,远超出了普通技术手册的范畴,让人不禁猜测作者在内容组织上是否也遵循了如此严谨和美观的原则。
关于与生态系统集成的章节,我认为是这本书的又一大亮点,它成功地将Kylin从一个孤立的工具,提升到了整个大数据平台的核心枢纽地位。作者对Hadoop、Spark、Hive以及主流BI工具(如Tableau和Superset)的对接流程描述得细致入微,特别是对JDBC/ODBC驱动程序的配置细节和常见兼容性问题的排查步骤,详尽到了每一个参数的含义。我尤其欣赏他对Kylin RESTful API的系统性介绍,这使得自动化运维和程序化查询成为可能。过去,我们总是依赖固定的Dashboard,而这本书展示了如何将Kylin的能力封装成微服务,供内部应用调用。这种从分析工具到平台组件的视角转换,极大地拓宽了我对如何利用Kylin赋能业务场景的想象空间,感觉它不再只是一个报表生成器,而是一个强大的数据服务引擎。
书中关于Cube设计和性能调优的部分,简直是为我们这些实战人员量身定做的秘籍。我之前在部门内部尝试部署Kylin时,最头疼的就是Cube构建失败率高和查询延迟难以控制的问题。这本书没有停留在官方文档的层面,而是引入了大量的“陷阱”和“经验之谈”。比如,它详细分析了维度选择对Cube体积的指数级影响,并提供了一套量化的评估模型,告诉我们如何在维度数量和查询灵活性之间找到最佳平衡点。更让我惊喜的是,作者竟然分享了他们团队在处理海量维度组合时的“动态分区策略”,这个具体到代码层面的技巧,是任何官方教程都不会公开的“内幕消息”。我当场就根据书中的建议,回去修改了我们线上一个最耗费资源的Cube配置,效果立竿见影,构建时间缩短了近40%,这直接为我赢得了领导的肯定,这本书的价值此刻就体现出来了。
最后,这本书的排版和示例代码的质量,完全配得上它所讲述的技术深度。我习惯于在阅读技术书籍时同步敲代码验证,遇到代码格式混乱或者注释缺失的书籍,体验感会直线下降。然而,这本书中的所有SQL、Shell脚本和配置文件片段,都采用了规范的、可直接复制粘贴的格式,并且关键语句都有精准的中文解释。作者似乎深谙读者的学习路径,每一个复杂的概念讲解后,都会紧跟着一个小型且完整的案例场景来巩固知识点,这种理论与实践的无缝衔接,极大地提高了我的学习效率。它不像有些书籍那样,把所有细节都堆砌在一起,而是像一位经验丰富的导师,知道何时该放慢脚步讲解原理,何时该加速前进展示实战效果,整体阅读下来,感觉非常流畅且富有成效,是一本真正用心编写的工具书。
清晰明了,美味~~~
至少给一个工具提供了说明书!
适合初学者入门,介绍的很不错
适合kylin小白,有一定kylin基础的看了没用
好像很难用?