具体描述
《DW2.0:下一代数据仓库的构架》是数据仓库和商业智能领域的又一部经典著作,讲述了整个生命周期各个环节的具体工作,从业务需求的视角,引导读者全面认识下一代数据仓库系统的构架。《DW2.0:下一代数据仓库的构架》包含了DW20详细的定义和描述,此外,书中对数据仓库的结构、内容及其前景进行了介绍。
《DW2.0:下一代数据仓库的构架》主要面向数据仓库的业务分析人员、信息构架师、系统开发人员、项目经理、数据仓库技术人员、数据库管理员、数据建模人员、数据管理员等。
作者简介
W. H. Inmon,数据仓库之父。他一直致力于数据库和数据仓库技术方面的研究,在数据管理和数据仓库技术方面以及数据处理的管理方面撰写了49本著作,发表过1000多篇学术论文。他创建了世界上第一个ETL软件公司,最新成立的一个公司是Forest Rim Technology公司,该公司致力于非结构化数据的存取并将其整合到结构化环境中。
Derek Strauss,Gavroshe公司的创始人,CEO和首席顾问。他拥有28年IT界从业经验和22年信息资源管理及商业智能/数据仓库领域的从业经验。
Genia Neushloss,Gavroshe公司的联合创始人和首席顾问。30多年来,她在保险业、金融业、制造业、采矿业及电信业都拥有相当深厚的管理及技术经验。
目录信息
译者序
前言
关于作者
第1章 数据仓库简史及第一代数据仓库
1.1 数据库管理系统
1.2 在线应用
1.3 个人电脑和4GL技术
1.4 蜘蛛网环境
1.5 企业角度的演化
1.6 数据仓库环境
1.7 什么是数据仓库
1.8 整合数据——一个痛苦的经历
1.9 数据的量
1.10 一种不同的开发方法
1.11 演变到DW2.0环境
1.12 数据仓库的商业影响
1.13 数据仓库环境的各种组件
1.13.1 ETL——抽取/转换/装载
1.13.2 ODS——操作数据存储
1.13.3 数据集市
1.13.4 探索仓库
1.14 数据仓库的演变——从企业的角度
1.15 关于数据仓库的其他观念
1.16 主动数据仓库
1.17 联合数据仓库方法
1.18 星状模式方法
1.19 数据集市数据仓库
1.20 建立一个“真正的”数据仓库
1.21 总结
第2章 DW2.0简介
2.1 DW2.0——一种新的范式
2.2 DW2.0——从企业的角度
2.3 数据的生命周期
2.4 设置不同区的原因
2.5 元数据
2.6 数据访问
2.7 结构化数据/非结构化数据
2.8 文本分析
2.9 “废话”
2.10 术语问题
2.11 特定文本/一般文本
2.12 元数据——一个主要组成部分
2.13 本地元数据
2.14 基础技术
2.15 不断变化的业务需求
2.16 DW2.0中的数据流
2.17 数据量
2.18 实用应用程序
2.19 DW2.0和参照完整性
2.20 DW2.0的报告
2.21 总结
第3章 DW2.0组成部分——关于不同区
3.1 交互区
3.2 整合区
3.3 近线区
3.4 归档区
3.5 非结构化处理
3.6 企业用户的观点
3.7 总结
第4章 DW2.0中的元数据
4.1 数据和分析的可复用性
4.2 DW2.0中的元数据
4.3 主动知识库/被动知识库
4.4 主动知识库
4.5 企业元数据
4.6 元数据和记录系统
4.7 分类
4.8 内部分类/外部分类
4.9 归档区元数据
4.10维护元数据
4.11举例说明如何使用元数据
4.12终端用户的观点
4.13总结
第5章 DW2.0技术基础设施的流动性
5.1 技术基础设施
5.2 快速的业务改变
5.3 环状改变
5.4 打破循环
5.5 缩短IT响应时间
5.6 语义暂态、语义常态数据
5.7 语义暂态数据
5.8 语义稳定的数据
5.9 混合语义稳定和不稳定数据
5.10 分离语义稳定和不稳定数据
5.11 减缓业务的改变
5.12 创建数据快照
5.13 历史记录
5.14 数据划分
5.15 终端用户的观点
5.16 总结
第6章 DW2.0的方法与途径
6.1 螺旋式方法——主要特点综述
6.2 七流法——总览
6.3 企业参考模型流
6.4 企业知识协调流
6.5 信息工厂开发流
6.6 数据归档定位流
6.7 数据纠正流(旧称数据清理流)
6.8 基础设施流
6.9 整体信息质量管理流
6.10 总结
第7章 统计处理和DW2.0
7.1 两种类型的处理
7.2 使用统计分析
7.3 比较的完整性
7.4 启发式分析
7.5 冻结的数据
7.6 探索型处理
7.7 分析频率
7.8 探索工具
7.9 探索型处理数据的来源
7.10 更新探索数据
7.11 基于项目的数据
7.12 数据集市和探索工具
7.13 数据回流
7.14 在内部使用探索数据
7.15 企业分析员的观点
7.16 总结
第8章 数据模型与DW2.0
8.1 智能路线图
8.2 数据模型和企业
8.3 整合范围
8.4 区别粒状型数据和概括型数据
8.5 数据模型的层次
8.6 数据模型和交互区
8.7 企业数据模型
8.8 模型转化
8.9 数据模型和非结构化数据
8.10 企业用户的观点
8.11 总结
第9章 监视DW2.0环境
9.1 监视DW2.0环境
9.2 事务监视
9.3 数据质量监视
9.4 数据仓库监视
9.5 事务监视——响应时间
9.6 高峰期处理
9.7 ETL数据质量监视
9.8 数据仓库监视工具
9.9 休眠数据
9.10 企业用户的观点
9.11 总结
第10章 DW2.0与安全
10.1 保护访问数据
10.2 加密技术
10.3 缺点
10.4 防火墙
10.5 使数据脱机
10.6 限制性加密
10.7 直接转储
10.8 数据仓库监视
10.9 检测攻击
10.10 近线区数据的安全
10.11 企业用户的观点
10.12 总结
第11章 时间相关数据
11.1 DW2.0中的所有数据——与时间相关
11.2 交互区中的时间相关性
11.3 DW2.0其他部分中的数据相关
11.4 整合区中的事务处理
11.5 离散数据
11.6 连续时间段数据
11.7 一个记录序列
11.8 非重叠记录集
11.9 开始和结束一个记录序列
11.10 数据的连续性
11.11 时间瓦解数据
11.12 归档区中的时间相关变量
11.13 企业用户的观点
11.14 总结
第12章 DW2.0的数据流
12.1 贯穿整个构架的数据流
12.2 进入交互区
12.3 ETL的角色
12.4 进入整合区的数据流
12.5 进入近线区的数据流
12.6 进入归档区的数据流
12.7 下降的数据访问概率
12.8 数据的异常流
12.9 企业用户的观点
12.10 总结
第13章 ETL处理与DW2.0
13.1 转换数据状态
13.2 ETL适用范围
13.3 应用数据到企业数据的转换
13.4 ETL工作模式
13.5 源和目标
13.6 ETL映射
13.7 状态转换——实例
13.8 更加复杂的转换
13.9 ETL与吞吐量
13.10 ETL与元数据
13.11 ETL与审核记录
13.12 ETL与数据质量
13.13 创建ETL
13.14 代码创建或参数驱动的ETL
13.15 ETL与丢弃
13.16 变化数据的捕获
13.17 ELT
13.18 企业用户的观点
13.19 总结
第14章 DW2.0与粒度管理器
14.1 粒度管理器
14.2 提高粒度级别
14.3 过滤数据
14.4 粒度管理器的功能
14.5 本地与第三方粒度管理器的比较
14.6 粒度管理器的并行化
14.7 作为副产品的元数据
14.8 企业用户眼中的粒度管理器
14.9 总结
第15章 DW2.0和性能
15.1 好的性能——DW2.0的基石
15.2 在线响应时间
15.3 分析响应时间
15.4 数据的流动
15.5 队列
15.6 启发式处理
15.7 分析的生产率和响应时间
15.8 索引
15.9 移除休眠数据
15.10 终端用户培训
15.11 监控环境
15.12 容量规划
15.13 元数据
15.14 批处理的并行
15.15 事务处理的并行
15.16 工作负荷量的管理
15.17 数据集市
15.18 探索工具
15.19 将事务分为不同的类
15.20 服务标准协议
15.21 保护交互区
15.22 数据分割
15.23 选择合适的硬件
15.24 区分“农民”和“探索者”
15.25 数据的物理分组
15.26 检查自动产生的代码
15.27 企业用户的观点
15.28 总结
第16章 迁移
16.1 房屋和城市
16.2 在一个完美情况中迁移
16.3 完美情况几乎永远不会发生
16.4 增量式添加组件
16.5 添加归档区
16.6 建立企业元数据
16.7 建立元数据基础结构
16.8 “吞没”源系统
16.9 作为缓冲器的ETL
16.10 迁移到非结构化的环境
16.11 企业用户的观点
16.12 总结
第17章 成本验证和DW2.0
17.1 DW2.0的成本值吗
17.2 宏观层次的价值验证
17.3 微观层次的价值验证
17.4 公司B拥有DW2.0
17.5 生成新的分析
17.6 按步骤执行
17.7 总成本是多少
17.8 考虑公司B
17.9 考虑DW2.0的成本
17.10 信息的现实情况
17.11 DW2.0真正的经济效益
17.12 信息的时间价值
17.13 整合的价值
17.14 历史信息
17.15 第一代DW和DW2.0——在经济效益上的比较
17.16 企业用户的观点
17.17 总结
第18章 DW2.0中的数据质量
18.1 DW2.0中的数据质量工具集
18.2 数据分析工具和逆向工程数据模型
18.3 数据模型种类
18.4 数据分析不一致对自上而下建模的挑战
18.5 总结
第19章 DW2.0和非结构化数据
19.1 DW2.0和非结构化数据
19.2 文本读取
19.3 在哪里进行文本分析处理
19.4 文本整合
19.5 简单编辑
19.6 无用词
19.7 同义词替换
19.8 同义词串联
19.9 同形异义解析
19.10 建立主题
19.11 外部术语表/分类法
19.12 分词
19.13 替换拼写
19.14 跨语言的文本
19.15 直接搜索
19.16 间接搜索
19.17 术语
19.18 半结构化数据/值=名称数据
19.19 准备数据所需的技术
……
第20章 DW2.0与记录系统
第21章 多方面的话题
第22章 DW2.0环境中的处理
第23章 管理DW2.0环境
· · · · · · (收起)
读后感
网上爬文,爬到了Inmon家,看到了DW2.0的概念。顺藤摸书,顺手翻了两章!了解了盖帽。 原来Inmon这些年也没有闲着,开始整非结构化数据和元数据分层了。其数据生命周期和金球先生的数据仓库生命周期如果能结合在一起还是很有威力的。 第一章驳斥数据仓库各门派。第二章介绍架...
网上爬文,爬到了Inmon家,看到了DW2.0的概念。顺藤摸书,顺手翻了两章!了解了盖帽。 原来Inmon这些年也没有闲着,开始整非结构化数据和元数据分层了。其数据生命周期和金球先生的数据仓库生命周期如果能结合在一起还是很有威力的。 第一章驳斥数据仓库各门派。第二章介绍架...
网上爬文,爬到了Inmon家,看到了DW2.0的概念。顺藤摸书,顺手翻了两章!了解了盖帽。 原来Inmon这些年也没有闲着,开始整非结构化数据和元数据分层了。其数据生命周期和金球先生的数据仓库生命周期如果能结合在一起还是很有威力的。 第一章驳斥数据仓库各门派。第二章介绍架...
网上爬文,爬到了Inmon家,看到了DW2.0的概念。顺藤摸书,顺手翻了两章!了解了盖帽。 原来Inmon这些年也没有闲着,开始整非结构化数据和元数据分层了。其数据生命周期和金球先生的数据仓库生命周期如果能结合在一起还是很有威力的。 第一章驳斥数据仓库各门派。第二章介绍架...
网上爬文,爬到了Inmon家,看到了DW2.0的概念。顺藤摸书,顺手翻了两章!了解了盖帽。 原来Inmon这些年也没有闲着,开始整非结构化数据和元数据分层了。其数据生命周期和金球先生的数据仓库生命周期如果能结合在一起还是很有威力的。 第一章驳斥数据仓库各门派。第二章介绍架...
用户评价
老实说,我一开始对这种篇幅宏大的作品是持保留态度的,总担心会虎头蛇尾,或者在中途因为情节拖沓而弃读。但这本书完全打破了我的固有偏见。它的节奏感把握得极其精妙,张弛有度,绝不拖泥带水。叙事的声音非常独特,带着一种古老而又充满智慧的口吻,仿佛一位年长的智者在向你娓-娓道来一段尘封的往事。书中对细节的关注度令人惊叹,无论是古代的某种工艺流程,还是特定历史时期人们的衣着习惯,都做足了功课,真实感扑面而来。我尤其喜欢作者处理情感冲突的方式,不直白地宣泄,而是通过人物的眼神、细微的动作和沉默来传达,那种“此时无声胜有声”的意境,高明极了。读到某个关键的转折点时,我甚至停下来,反复琢磨了很久作者在这里埋下的伏笔,回味无穷。这本书更像是一幅用文字精心绘制的壁画,每一个角落都充满了值得驻足观赏的纹理和色彩。它不仅仅是在讲述一个故事,更是在构建一个完整的世界观,一个有其自身法则和逻辑的宇宙。对于喜欢结构严谨、文学性极高的作品的读者来说,这绝对是一本值得反复品读的经典之作,每一次重读,都会有新的感悟浮现。
这本书给我带来了一种久违的、被文字力量完全征服的感觉。它的语言本身就是一种享受,充满了古典的韵律美,但又没有丝毫的故作姿态。阅读它,就像是在聆听一场精心编排的交响乐,每一个段落的起承转合都处理得极其优雅和自然。作者对于人物心理的剖析细致入微,特别是对于那些处于巨大压力下的角色的内心挣扎,那种矛盾、自我怀疑和最终的释然或沉沦,都被描绘得入木三分,极具说服力。书中探讨的主题——关于宿命与自由意志的辩证关系,贯穿始终,不断抛出引人深思的问题。我特别欣赏作者对“时间”这一概念的处理,它时而如白驹过隙,时而又被拉伸得缓慢而沉重,完全服务于故事的情感需要。这本书的价值在于,它不仅提供了一个精彩的故事,更提供了一个思考人类处境的绝佳视角。它厚实而扎实的内容,证明了作者绝非昙花一现的写作者,而是一位真正有心力投入到构建宏大世界观的匠人。强烈推荐给所有追求高品质文学体验的读者,这本书绝对值得被放在书架最显眼的位置。
这本书简直是本年度最让人眼前一亮的惊喜!我是在一个朋友的强烈推荐下,抱着试试看的心态翻开它的,没想到一发不可收拾,连续几天没睡好觉就是为了能早点读完它。作者的叙事功力深厚得令人咋舌,笔下的人物仿佛就活生生地站在我面前,他们的喜怒哀乐、他们的挣扎与选择,都清晰地印在了我的脑海里。尤其是对于环境和社会背景的细腻刻画,简直是教科书级别的。那些曾经只存在于历史书中的场景,在他的文字里变得鲜活、可感,让人产生强烈的代入感,甚至能闻到那种特有的气味,感受到那种历史的厚重。故事的主线虽然复杂,牵扯的人物关系错综复杂,但作者的掌控力极强,丝毫没有让读者感到混乱。相反,每一次的转折都恰到好处地吊起了读者的胃口,让你迫不及待地想知道接下来会发生什么。更让我欣赏的是,它没有落入俗套地将世界非黑即白地划分,每一个角色都有其存在的合理性与复杂性,即便是反派,也能从其行为中窥见人性的幽暗与无奈。这本书的厚度其实不薄,但阅读起来毫无负担,那种流畅感和沉浸感,是很多畅销书望尘莫及的。我强烈推荐给所有热爱深度阅读,渴望在文字中体验不同人生的读者。读完之后,我感觉自己的思维方式似乎也受到了某种程度的洗礼,看待一些社会现象时,都有了更深一层的理解。
这是我近年来读过最具“重量感”的一本书了。这种重量并非指物理上的沉重,而是指它在精神层面带来的冲击力和回味悠长。作者的文风非常冷峻,克制而不失力量,他似乎对人性的弱点有着洞察一切的清醒,但又保持着一种悲悯的姿态。书中描写的那些宏大叙事下的个体命运,让人心痛,却又不得不承认那是真实历史的缩影。我注意到,这本书的翻译质量也相当出色,那些精妙的双关语和复杂的从句结构,在译者的笔下依然保持了原著的韵味和张力,这一点对于非母语阅读者来说至关重要,极大地提升了阅读体验。关于情节的推进,它采用了多线并行的叙事手法,不同时间轴和不同人物的故事线交织缠绕,但作者用非常清晰的线索将它们串联起来,像一张巨大的网,将所有的命运都捕获其中。读完后,我花了一整天的时间来整理脑海中的思绪,这本书带来的思考是需要时间来沉淀的。它不是那种读完就扔的快餐文学,而是需要你投入心力去“消化”的佳作。如果你追求的是一种能挑战你的认知边界,并能带给你深刻哲思的作品,那么请务必尝试一下。
我必须承认,初读此书时,我差点被那些复杂的姓氏和陌生的地名劝退。然而,一旦你跨过了最初那道门槛,进入到故事的核心区域,那种被深深吸引的感觉是无法抗拒的。这本书的魅力在于它营造出一种强烈的“在场感”。作者似乎用最精准的词汇,捕捉住了那些转瞬即逝的情绪和氛围。比如对一场暴风雨来临前空气中弥漫的气味,对长时间等待后听到一个关键消息时的耳鸣效应,这些微小的感官细节,都被捕捉得淋漓尽致,让人身临其境。它不试图取悦读者,而是坚持自己的叙事节奏和深度,这使得它拥有了一种难得的纯粹性。阅读过程中,我常常会想象如果这本书被改编成影像作品会是怎样一番景象,但随即又觉得,任何影像都难以捕捉到文字中那种内在的张力和想象空间。它对权力斗争和道德困境的探讨,更是深刻入骨,让人反思自己身处相似情境下会做出怎样的抉择。这是一部需要耐心去品味的艺术品,而不是用来消磨时间的消遣读物。
知道很多道理却仍然过不好这一生系列。看完之后只记得交互区、整合区、近线区、归档区。
浅显易懂的入门读物
图是画蛇添足,翻译水平有点拖后腿,总的来说是一本涉及基础知识非常多的入门书籍,值得学习。
浅显易懂的入门读物
图是画蛇添足,翻译水平有点拖后腿,总的来说是一本涉及基础知识非常多的入门书籍,值得学习。