具体描述
如何能牢牢地黏住老用户、吸引新用户、读懂用户的偏好兴趣和喜怒哀乐,这都是对企业发展至关重要甚至关乎生死存亡的问题,解决这个问题的方法就是推荐系统。本书分为上中下三篇,共13章,上篇为用户画像知识工程基础,包括表征建模、画像计算、存储及各种更新维护等管理操作;中篇为推荐系统与用户画像,包括传统协同过滤等经典推荐算法的介绍,以及涉及用户画像的推荐方法;下篇为应用案例分析,包括Netflix、阿里等数据竞赛的经典数据案例,以及在具体工程开发过程的具体案例,分别从系统需求、总体结构、算法设计、运行流程及测试结果等五个方面提供详细案例指导。
作者简介
牛温佳,男,博士,中国科学院信息工程研究所副研究员。主持国家自然科学基金青年基金项目和广西可信软件重点实验室开放课题各一项,作为骨干先后参与了多个重要项目,包括工信部重大专项、973、863和中科院战略先导专项等。
目录信息
第1章 用户画像概述 3
1.1 用户画像数据来源 3
1.1.1 用户属性 5
1.1.2 用户观影行为 5
1.2 用户画像特性 5
1.2.1 动态性 5
1.2.2 时空局部性 6
1.3 用户画像应用领域 6
1.3.1 搜索引擎 6
1.3.2 推荐系统 7
1.3.3 其他业务定制与优化 7
1.4 大数据给用户画像带来的机遇与挑战 8
第2章 用户画像建模 9
2.1 用户定量画像 9
2.2 用户定性画像 10
2.2.1 标签与用户定性画像 10
2.2.2 基于知识的用户定性画像分析 12
2.2.3 用户定性画像的构建 16
2.2.4 定性画像知识的存储 22
2.2.5 定性画像知识的推理 26
2.3 本章参考文献 29
第3章 群体用户画像分析 31
3.1 用户画像相似度 32
3.1.1 定量相似度计算 32
3.1.2 定性相似度计算 34
3.1.3 综合相似度计算 35
3.2 用户画像聚类 36
第4章 用户画像管理 41
4.1 存储机制 41
4.1.1 关系型数据库 42
4.1.2 NoSQL数据库 43
4.1.3 数据仓库 45
4.2 查询机制 46
4.3 定时更新机制 47
4.3.1 获取实时用户信息 47
4.3.2 更新触发条件 48
4.3.3 更新机制 49
中 篇
第5章 视频推荐概述 55
5.1 主流推荐方法的分类 56
5.1.1 协同过滤的推荐方法 56
5.1.2 基于内容的推荐方法 57
5.1.3 基于知识的推荐方法 59
5.1.4 混合推荐方法 60
5.2 推荐系统的评测方法 61
5.3 视频推荐与用户画像的逻辑关系 61
第6章 协同过滤推荐方法 65
6.1 概述 65
6.2 关系矩阵及矩阵计算 67
6.2.1 U-U矩阵 67
6.2.2 V-V矩阵 70
6.2.3 U-V矩阵 72
6.3 基于记忆的协同过滤算法 74
6.3.1 基于用户的协同过滤算法 75
6.3.2 基于物品的协同过滤算法 78
6.4 基于模型的协同过滤算法 81
6.4.1 基于隐因子模型的推荐算法 82
6.4.2 基于朴素贝叶斯分类的推荐算法 85
6.5 小结 88
6.6 本章参考文献 88
第7章 基于内容的推荐方法 91
7.1 概述 91
7.2 CB推荐中的特征向量 94
7.2.1 视频推荐中的物品画像 94
7.2.2 视频推荐中的用户画像 96
7.3 基础CB推荐算法 97
7.4 基于TF-IDF的CB推荐算法 99
7.5 基于KNN的CB推荐算法 102
7.6 基于Rocchio的CB推荐算法 104
7.7 基于决策树的CB推荐算法 106
7.8 基于线性分类的CB推荐算法 107
7.9 基于朴素贝叶斯的CB推荐算法 109
7.10 小结 111
7.11 本章参考文献 111
第8章 基于知识的推荐方法 113
8.1 概述 113
8.2 约束知识与约束推荐算法 114
8.2.1 约束知识示例 114
8.2.2 约束满足问题 115
8.2.3 约束推荐算法流程 117
8.3 关联知识与关联推荐算法 118
8.3.1 关联规则描述 118
8.3.2 关联规则挖掘 121
8.3.3 关联推荐算法流程 123
8.4 小结 124
8.5 本章参考文献 124
第9章 混合推荐方法 125
9.1 概述 125
9.2 算法设计层面的混合方法 126
9.2.1 并行式混合 126
9.2.2 整体式混合 129
9.2.3 流水线式混合 131
9.2.4 典型混合应用系统 133
9.3 混合式视频推荐实例 136
9.3.1 MoRe系统概览 136
9.3.2 MoRe算法介绍 137
9.3.3 MoRe算法混合 139
9.3.4 MoRe实验分析 140
9.4 小结 142
9.5 本章参考文献 142
第10章 视频推荐评测 145
10.1 概述 145
10.2 视频推荐试验方法 146
10.2.1 在线评测 147
10.2.2 离线评测 149
10.2.3 用户调查 150
10.3 视频离线推荐评测指标 151
10.3.1 准确度指标 151
10.3.2 多样性指标 159
10.4 小结 161
10.5 本章参考文献 162
下 篇
第11章 系统层面的快速推荐构建 165
11.1 概述 165
11.2 本章主要内容 166
11.3 系统部署 166
11.3.1 Hadoop2.2.0系统部署 166
11.3.2 Hadoop运行时环境设置 169
11.3.3 Spark与Mahout部署 175
11.4 Mahout推荐引擎介绍 181
11.4.1 Item-based算法 181
11.4.2 矩阵分解 185
11.4.3 ALS算法 187
11.4.4 Mahout的Spark实现 190
11.5 快速实战 193
11.5.1 概述 193
11.5.2 日志数据 194
11.5.3 运行环境 196
11.5.4 基于Mahout Item-based算法实践 201
11.5.5 基于Mahout ALS算法实践 205
11.6 小结 208
11.7 本章参考文献 208
第12章 数据层面的分析与推荐案例 211
12.1 概述 211
12.2 本章主要内容 212
12.3 竞赛内容和意义 212
12.3.1 竞赛简介 212
12.3.2 竞赛任务和意义 213
12.4 客户-商户数据 215
12.4.1 数据描述 215
12.4.2 数据理解与分析 217
12.5 算法流程设计 219
12.5.1 特征提取 219
12.5.2 分类器设计 220
12.5.3 算法流程总结 222
12.6 小结 222
12.7 本章参考文献 223
· · · · · · (收起)
读后感
行文风格更像是一篇多人作者共同撺出来的硕士毕业论文,很多内容拼凑比较生硬,缺少逻辑承接,要么文字表达十分冗余,一堆空洞的大白话,要么突然冒出一节教科书式的学术段落,很突兀,和后面的内容也没啥关系。举一个小例子,作为奔着书名买的读者,他需要这本书详细介绍各类...
行文风格更像是一篇多人作者共同撺出来的硕士毕业论文,很多内容拼凑比较生硬,缺少逻辑承接,要么文字表达十分冗余,一堆空洞的大白话,要么突然冒出一节教科书式的学术段落,很突兀,和后面的内容也没啥关系。举一个小例子,作为奔着书名买的读者,他需要这本书详细介绍各类...
行文风格更像是一篇多人作者共同撺出来的硕士毕业论文,很多内容拼凑比较生硬,缺少逻辑承接,要么文字表达十分冗余,一堆空洞的大白话,要么突然冒出一节教科书式的学术段落,很突兀,和后面的内容也没啥关系。举一个小例子,作为奔着书名买的读者,他需要这本书详细介绍各类...
行文风格更像是一篇多人作者共同撺出来的硕士毕业论文,很多内容拼凑比较生硬,缺少逻辑承接,要么文字表达十分冗余,一堆空洞的大白话,要么突然冒出一节教科书式的学术段落,很突兀,和后面的内容也没啥关系。举一个小例子,作为奔着书名买的读者,他需要这本书详细介绍各类...
行文风格更像是一篇多人作者共同撺出来的硕士毕业论文,很多内容拼凑比较生硬,缺少逻辑承接,要么文字表达十分冗余,一堆空洞的大白话,要么突然冒出一节教科书式的学术段落,很突兀,和后面的内容也没啥关系。举一个小例子,作为奔着书名买的读者,他需要这本书详细介绍各类...
用户评价
说实话,我抱着一种“业内人士”的审视态度来翻阅《用户网络行为画像》,毕竟我对互联网行业的某些运作模式略知一二。然而,这本书的深度和广度还是远超我的预期。它巧妙地避开了那些已经被嚼烂的流行术语,转而深入探讨了行为画像背后的伦理困境和长期社会影响。书中关于“数据主权”的讨论,非常具有前瞻性,它没有停留在抱怨层面,而是提出了构建更健康数据生态系统的可行性思路。最让我印象深刻的是其中关于“隐性偏好”的分析,很多时候我们自己都无法清晰界定自己的真实需求,但网络画像系统却能比我们自己更早、更准确地捕捉到这些潜在的欲望。这种对人类认知局限性的揭示,让我感到一丝敬畏,也更坚定了我对审慎使用网络工具的决心。这本书的逻辑链条严密,行文风格坚定有力,读起来让人有一种被专业人士引导的踏实感。
初次接触《用户网络行为画像》时,我脑海中浮现的是那种厚重、晦涩的学术专著,需要带着笔记本和查阅大量专业词典才能勉强啃下来的类型。万万没想到,它的叙事方式如此流畅且引人入胜,简直像是在听一位经验丰富的行业老前辈,娓娓道来这些年在大数据洪流中观察到的种种奇闻轶事。书中对“注意力经济”下用户心智模型的拆解,简直是入木三分。我尤其欣赏作者对“碎片化时间利用”这一概念的颠覆性解读,它不再仅仅是提高效率的代名词,更被赋予了一层被算法精密计算和引导的色彩。阅读过程中,我多次停下来,反复琢磨某一段话的深意,那种豁然开朗的感觉,远超我阅读技术书籍的体验。它成功地将冰冷的数据和温暖的人性连接在了一起,让我深刻体会到,每一个“画像”背后,都是一个活生生的、有情感需求的个体。
我通常更偏爱那种充满诗意和哲学思辨的书籍,对于这种偏向“应用科学”的书籍,我的耐心是有限的。但《用户网络行为画像》展现出了一种独特的、近乎文学性的观察角度。它没有堆砌华丽的辞藻,但其对人类在数字化生存状态下“身份构建”过程的描摹,却充满了画面感。想象一下,我们像是在一张巨大的、无形的蛛网上行走,每走一步都会留下震动,而这些震动被精心地记录和分析。书中关于“个性化推荐的悖论”那一部分,简直是神来之笔,它揭示了当我们被过度投喂“想看的东西”时,视野是如何被逐渐压缩的。作者的笔触是冷静且富有同情心的,他像一个耐心的人类学家,记录着我们这个新物种在信息海洋中的迁徙和定居。阅读体验是沉浸式的,让你在不知不觉中,对那些推送的广告和内容,产生全新的、更深层次的理解。
这本书的标题《用户网络行为画像》听起来就充满了现代感,让我对接下来的内容充满了期待。我本以为这会是一本技术性很强的指南,教你如何用复杂的算法构建用户模型。然而,实际阅读下来,我发现它更像是一部深入剖析数字时代人类行为的社会学著作。作者并没有沉溺于枯燥的数学公式,而是用生动的案例和深刻的洞察力,描绘了一幅幅在网络空间中我们“不经意间”留下的数字足迹的群像图。它让我重新审视了自己日常的每一次点击、每一次停留,原来每一次互动都在无声地为我们绘制一张看不见的身份标签。书中对“兴趣漂移”和“信息茧房”现象的探讨尤为精彩,作者没有简单地批判这些现象,而是试图去理解其背后的心理机制,这种平衡的视角让论述显得格外有力量。读完后,我不再只是一个单纯的“网络用户”,而更像是一个能看懂网络“潜规则”的观察者,对那些推送给我的信息,也多了一份理解和审慎。
拿到《用户网络行为画像》时,我正在尝试从一个更宏观的、历史的角度理解技术对社会结构的重塑。这本书恰好提供了一个非常微观但又极具代表性的切入点。它没有宏大地谈论人工智能的未来,而是聚焦于一个具体且已被广泛实施的技术——用户画像。作者的叙事节奏把握得极佳,时而深入到技术实现的细节,时而拔高到社会学理论的高度进行思辨,这种张弛有度的处理,使得全书既有干货,又不失趣味性。我特别欣赏作者对“标签化”风险的警示,强调了行为画像在带来便利的同时,也在无形中固化了人们的认知边界,形成了一种自我实现的预言。这本书读下来,感觉像是完成了一次对自身数字身份的深度体检,它不是要吓唬你,而是提供了一份详尽的“使用说明书”,教你如何更清醒、更有意识地与这个日益数字化的世界共存。
泛而说之,感觉就是把东拉西扯在一起,没有深入下去
本书主要从视频推荐角度,分析大数据中用户网络行为分析与内容推荐应用。
本书主要从视频推荐角度,分析大数据中用户网络行为分析与内容推荐应用。
只是罗列和堆砌,当作索引还行。
本书主要从视频推荐角度,分析大数据中用户网络行为分析与内容推荐应用。