具体描述
“数据是重要资产”已成为大家的共识,众多公司都在争相分析、挖掘大数据背后的信息资源。本书在此背景下,对目前大数据及其相关技术的发展进行总结,理论联系实践,既不缺乏理论深度又具有实用价值。
本书共12章,内容包括大数据的概念、特点、发展历史,数据获取与存储,数据抽取和清洗,数据集成,数据的查询、分析与建模,异构数据采集,文档的存储与检索,异种数据的统一访问与转换,基于微博的股票市场预测系统实例,海量视频检索系统实例,HDFS云文件系统实例。
本书适合大数据技术初学者、大数据从业人员和研究人员,也可以作为高等院校相关专业师生的教学参考书。
作者简介
鲍亮,西安电子科技大学博士,西安电子科技大学副教授,主要研究方向为软件工程,软件体系结构和云计算等,并主持完成国家自然科学基金,国防语言等多项课题,发表学术论文30余篇,专著2本。
目录信息
第1章 大数据介绍
1.1 大数据相关概念
1.1.1 大数据的历史
1.1.2 大数据的定义
1.2 大数据研究内容
1.3 大数据研究现状
1.3.1 学术界现状
1.3.2 产业界现状
1.3.3 政府机构现状
1.4 大数据的应用领域
1.4.1 大数据在制造业的应用
1.4.2 大数据在服务业的应用
1.4.3 大数据在交通行业的应用
1.4.4 大数据在医疗行业的应用
1.5 本章小结
第2章 数据存储技术
2.1 数据存储技术介绍
2.2 数据采集与存储技术研究现状
2.2.1 传统关系型数据库
2.2.2 新兴数据存储系统
2.3 海量数据存储的关键技术分析
2.3.1 数据划分
2.3.2 数据一致性与可用性
2.3.3 负载均衡
2.3.4 容错机制
2.3.5 海量数据存储的硬件支持
2.4 数据存储技术的实现与工具
2.4.1 集中式数据存储管理系统Bigtable
2.4.2 非集中式的大规模数据管理系统Dynamo
2.4.3 BigTable的开源实现HBase
2.4.4 MongoDB
2.4.5 CouchDB
2.4.6 Redis
2.4.7 Hypertable
2.4.8 其他开源NoSQL数据库
2.5 本章小结
第3章 数据抽取和清洗
3.1 数据抽取和清洗技术介绍
3.1.1 数据抽取简介
3.1.2 数据清洗简介
3.2 数据抽取和清洗研究现状
3.3 数据抽取技术的实现
3.3.1 Web数据抽取
3.3.2 非结构化数据抽取
3.3.3 基于云计算的海量数据分析
3.4 数据清洗技术的实现
3.4.1 数据清洗流程
3.4.2 数据清洗框架
3.4.3 数据清洗相关技术
3.4.4 基于Hadoop的数据清洗方案
3.5 ETL现状与发展
3.5.1 数据ETL简介
3.5.2 基于MapReduce的ETL框架
3.5.3 ETL工具
3.5.4 ETL展望
3.6 本章小结
第4章 数据集成
4.1 数据集成技术介绍
4.2 数据集成技术研究现状
4.2.1 Information Manifold:具有统一的查询接口
4.2.2 数据集成系统的发展建设
4.2.3 企业信息集成
4.2.4 未来的挑战
4.3 数据集成技术的实现与工具
4.3.1 Oracle Data Integrator(ODI)简介
4.3.2 ODI的特点
4.3.3 Microsoft SQL Server Integration Services(SSIS)简介
4.3.4 SSIS的特点
4.3.5 IBM InfoSphere Information Server简介
4.3.6 Sybase Data Integrator Suite 简介
4.4 本章小结
第5章 数据查询、分析与建模技术
5.1 数据查询、分析与建模技术介绍
5.1.1 数据查询
5.1.2 数据分析
5.1.3 数据建模
5.2 数据查询、分析与建模技术研究现状
5.2.1 并行处理 178
5.2.2 海量数据查询与搜索
5.2.3 数据分析中的OLAP与数据挖掘技术
5.2.4 数据模型与数据建模方法
5.3 数据查询、分析与建模技术的实现与工具
5.3.1 数据查询相关技术实现与工具
5.3.2 数据分析相关技术实现与工具
5.3.3 数据建模相关技术实现与工具
5.4 本章小结
第二篇 大数据深入篇
第6章 采用OSGi框架构建可伸缩的异构数据采集平台
6.1 应用背景
6.2 需求分析与总体设计
6.2.1 功能需求
6.2.2 非功能需求
6.2.3 总体设计
6.3 相关技术介绍
6.3.1 OSGi 框架介绍
6.3.2 多源异构数据的获取
6.4 系统设计与实现
6.4.1 异构数据采集平台的设计
6.4.2 数据采集插件的设计与实现
6.4.3 系统服务框架的设计与实现
6.5 部署与测试
6.5.1 系统部署
6.5.2 系统测试
6.6 本章小结
第7章 采用HBase实现海量小型XML文档的存储与检索
7.1 应用背景
7.2 需求分析与总体设计
7.2.1 需求分析
7.2.2 总体设计
7.3 相关技术介绍
7.3.1 XML相关技术
7.3.2 XQuery语句
7.3.3 XML检索技术
7.3.4 云计算和HBase
7.3.5 JavaCC工具介绍
7.4 详细设计与实现
7.4.1 数据存储模块的详细设计与实现
7.4.2 数据检索模块的详细设计与实现
7.4.3 用户模块的详细设计与实现
7.5 本章小结
第8章 采用Map/Reduce进行大规模社交网络社团发现
8.1 研究背景
8.2 相关理论和技术
8.2.1 社团结构
8.2.2 相关社团发现算法
8.2.3 Hadoop分布计算框架
8.3 RMS算法的并行化实现
8.3.1 RMS算法
8.3.2 RMS算法在MapReduce上的实现
8.4 AP聚类算法的并行化实现
8.4.1 AP聚类算法
8.4.2 AP聚类算法在MapReduce上的实现
8.5 实验与分析
8.5.1 实验环境
8.5.2 实验与结果分析
8.6 本章小结
第9章 数据统一访问与转换平台
9.1 应用背景介绍
9.2 数据统一访问需求分析与总体设计
9.2.1 功能性需求分析
9.2.2 非功能性需求分析
9.2.3 总体设计
9.3 数据统一访问与转换关键技术
9.3.1 SDO编程技术
9.3.2 Hadoop MapReduce框架
9.3.3 HBase数据库技术
9.3.4 模型驱动数据转换技术
9.4 数据统一访问和灵活转换的详细设计与实现
9.4.1 数据分析及预处理
9.4.2 基于DAS的数据源统一访问
9.4.3 映射模式表示与数据存储管理模块
9.4.4 基于MapReduce的数据转换管理模块
9.5 本章小结
第三篇 大数据应用篇
第10章 基于微博的股票市场预测系统
10.1 应用背景介绍
10.2 需求分析与总体设计
10.2.1 需求分析
10.2.2 总体设计
10.3 相关技术介绍
10.3.1 社交网络
10.3.2 社交网络表示方法
10.3.3 信息传播模型
10.4 详细设计与实现
10.4.1 Twitter数据采集模块详细设计
10.4.2 Twitter数据分析模块详细设计
10.4.3 用户行为分析模块详细设计
10.4.4 预测股票价格涨跌模块详细设计
10.4.5 系统实现
10.5 本章小结
第11章 基于内容的海量视频检索系统
11.1 应用背景
11.2 需求分析与总体设计
11.2.1 功能需求
11.2.2 非功能需求
11.2.3 核心业务处理流程
11.2.4 总体设计
11.3 相关技术简介
11.3.1 MPEG-7与OpenCV简介
11.3.2 运动对象提取
11.3.3 星形骨架方法
11.4 详细设计与实现
11.4.1 基于MapReduce的视频预处理
11.4.2 基于HBase的视频数据存储
11.4.3 行为识别与运动规则的组合创建
11.5 系统运行时截图
11.6 本章小结
第12章 基于HDFS的云文件系统
12.1 应用背景介绍
12.2 需求分析与总体设计
12.2.1 需求分析
12.2.2 总体设计
12.3 相关技术介绍
12.3.1 Hadoop HDFS介绍
12.3.2 主控节点和数据节点
12.3.3 页面展现技术
12.3.4 页面控制技术
12.4 详细设计与实现
12.4.1 云文件系统的操作流程
12.4.2 云文件系统的模块设计
12.4.3 云文件系统实现
12.4.4 云文件系统主要功能截图
12.5 本章小结
· · · · · · (收起)
读后感
用户评价
从实用性的角度来看,这本书的价值体现在其无与伦比的“工具箱”属性上。我不是一个只满足于理论探讨的人,我更看重知识的落地能力。这本书并没有停留在空中楼阁的理论构建,而是非常务实地提供了一系列可以立即应用于实践的方法论和工具集。书中附带的那些算法流程图和模型构建步骤,清晰到几乎可以被直接转化为代码框架。更难能可贵的是,作者在介绍每一个工具时,都会坦诚地指出该工具的适用边界和潜在的局限性,而不是一味地鼓吹“万能钥匙”。这种坦诚的态度,对于我们这些需要将理论转化为商业决策的人来说,至关重要。它教会我们如何审慎地选择最合适的工具,而不是盲目地套用最新的流行技术。这本书更像是一位资深顾问的案头记录,充满了经过时间检验的智慧和血泪教训。
这本书的装帧设计简直是艺术品,那种厚重的质感,封面烫金的字体在光线下微微闪烁,让人一拿到手就有一种对知识的敬畏感。我尤其欣赏它在排版上的用心,字体的选择既兼顾了易读性,又透着一股老派的严谨,行距和页边距的把握恰到好处,长时间阅读下来眼睛也不会觉得疲劳。随便翻开其中一页,都能感受到作者对细节的执着。比如,它在引用经典理论时,都会清晰地标注出原作者和出处,甚至连脚注的格式都经过精心设计,这对于需要进行学术研究的读者来说,简直是福音。内容上,虽然我关注的是理论的构建和历史脉络的梳理,但这本书在这方面的处理非常到位,它没有急于跳到复杂的公式推导,而是先用清晰的逻辑语言将整个学科的“前世今生”娓娓道来,让人感觉仿佛在听一位博学的智者讲述一段波澜壮阔的历史。这本书的价值,绝不仅仅是内容本身,它更像是一件值得珍藏的工艺品,体现了出版方对知识的尊重和对读者的体贴。
这本书带给我最大的震撼,是一种跨越学科边界的宏大视野。我原本以为这只是一本专注于某个特定领域的技术手册,但阅读过程中我发现,作者的知识版图远超出了我的预期。它巧妙地将历史、哲学、经济学甚至某些艺术理论的思辨方式,融入到对核心主题的探讨之中。这种多维度的视角,极大地拓宽了我对这个领域的理解深度和广度。它让我意识到,任何一个复杂的问题,如果仅仅局限于单一的学科框架去审视,都必然是片面的。作者仿佛在说服我们,真正的洞察力来源于知识的融会贯通。读完之后,我感觉自己不再只是一个执行具体任务的技术人员,而是拥有了一种更高的视角去审视整个领域的发展趋势和内在联系。这本书的厚度,不仅仅是纸张的堆砌,更是作者多年来积累的、跨界思考的结晶。
这本书的语言风格,用一个词来形容,那就是“老辣而精准”。它绝不是那种试图用网络流行语来讨好年轻读者的“快餐读物”。相反,它保持了一种非常克制和成熟的语调。作者似乎对文字的重量有着深刻的理解,每一个词语的选择都像是经过千锤百炼的,既表达了最精确的含义,又避免了不必要的冗余。特别是在阐述那些高度抽象的概念时,作者展现了惊人的概括能力,寥寥数语就能构建起一个完整的知识体系的骨架。我特别喜欢它在某些段落使用的类比——那些从古典哲学或者自然科学中借用来的比喻,非但没有分散注意力,反而如同点睛之笔,瞬间将原本僵硬的概念变得生动而富有弹性。这种文字功力,无疑是建立在作者深厚的学养之上的,它迫使读者必须集中全部的注意力去捕捉那些稍纵即逝的精妙之处,也正因如此,每一次重读都能发现新的层次和含义。
我是在一个深夜,咖啡因已经失效,理智即将崩溃的边缘,打开这本书的。起初,我以为这会是另一本枯燥的教科书,充斥着晦涩难懂的术语和公式,会让我更加昏昏欲睡。然而,这本书的叙事方式彻底颠覆了我的认知。它像一位经验丰富的向导,带着你穿越迷雾重重的理论丛林。作者似乎深谙读者的心理,总能在关键节点穿插一些极具启发性的案例分析,这些案例不是那种教科书式的、漂浮在空中的“假想”,而是基于真实世界运行逻辑的深度剖析。我记得有一章专门讲到了一个复杂的系统优化问题,作者没有直接给出最优解,而是用了大量的篇幅去描述“为什么其他路径走不通”,这种反向的论证过程,极大地锻炼了我的批判性思维。读完那一章,我感觉自己不仅仅是学到了一个知识点,更是掌握了一套解决问题的思维框架。这种“授人以渔”的教学理念,在这本书里体现得淋漓尽致,让人欲罢不能,直到天边泛白才恋恋不舍地合上书本。
视点较高,示例部分很有挑战。
视点较高,示例部分很有挑战。
视点较高,示例部分很有挑战。
视点较高,示例部分很有挑战。
视点较高,示例部分很有挑战。