具体描述
人工智能(AI),尤其是生成式语言模型和生成式人工智能(AIGC)模型,正以惊人的速度改变着我们的世界。驾驭这股潮流的关键,莫过于探究自然语言处理(NLP)技术的深奥秘境。本书将带领读者踏上一段扣人心弦的探索之旅,让其亲身感受,并动手搭建语言模型。本书主要内容包括N-Gram,词袋模型(BoW),Word2Vec(W2V),神经概率语言模型(NPLM),循环神经网络(RNN),Seq2Seq(S2S),注意力机制,Transformer,从初代GPT到ChatGPT再到GPT-4等一系列突破性技术的诞生与演进。
本书将以生动活泼的笔触,将枯燥的技术细节化作轻松幽默的故事和缤纷多彩的图画,引领读者穿梭于不同技术的时空,见证自然语言处理技术的传承、演进与蜕变。在这场不断攀登技术新峰的奇妙之旅中,读者不仅能深入理解自然语言处理技术的核心原理,还能自己动手,从零开始搭建起一个又一个语言模型。
无论你是在校学生还是人工智能从业者,这本书都将成为一盏明灯,照亮你探索人工智能无限奥秘的道路。
作者简介
黄佳,笔名咖哥,新加坡科技研究局人工智能研究员。主攻方向为 NLP 大模型的研发与应用、持续学习、AI in FinTech。黄佳深耕人工智能领域多年,积累了丰富的科研项目和政府、银行、能源、医疗等领域 AI 项目落地实战经验,目前正与 PlatoX.AI 展开富有前景的技术合作。曾著有《零基础学机器学习》《数据分析咖哥十话》等多部畅销书。同时,在极客时间开设专栏《零基础实战机器学习》《LangChain 实战课》,在深蓝学院开设视频课程“生成式预训练语言模型:理论与实战”。
目录信息
GPT-4:点亮人工通用智能的火花 002
人工智能演进之路:神经网络两落三起 004
现代自然语言处理:从规则到统计 007
何为语言?信息又如何传播? 008
NLP是人类和计算机沟通的桥梁 009
NLP技术的演进史 010
大规模预训练语言模型:BERT与GPT争锋 012
语言模型的诞生和进化 012
统计语言模型的发展历程 014
基于Transformer架构的预训练模型 016
“预训练+微调大模型”的模式 018
以提示/指令模式直接使用大模型 019
从初代GPT到ChatGPT,再到GPT-4 021
GPT作为生成式模型的天然优势 022
ChatGPT背后的推手——OpenAI 023
从初代GPT到ChatGPT,再到GPT-4的进化史 024
第1课 高楼万丈平地起:语言模型的雏形N-Gram和简单文本表示Bag-of-Words 026
1.1 N-Gram模型 026
1.2 “词”是什么,如何“分词” 030
1.3 创建一个Bigram字符预测模型 032
1.4 词袋模型 036
1.5 用词袋模型计算文本相似度 037
小结 042
思考 043
第2课 问君文本何所似: 词的向量表示Word2Vec和Embedding 044
2.1 词向量 ≈ 词嵌入 045
2.2 Word2Vec:CBOW模型和Skip-Gram模型 047
2.3 Skip-Gram模型的代码实现 050
2.4 CBOW模型的代码实现 061
2.5 通过nn.Embedding来实现词嵌入 063
小结 067
思考 068
第3课 山重水复疑无路:神经概率语言模型和循环神经网络 069
3.1 NPLM的起源 070
3.2 NPLM的实现 072
3.3 循环神经网络的结构 079
3.4 循环神经网络实战 082
小结 086
思考 087
第4课 柳暗花明又一村:Seq2Seq编码器-解码器架构 088
4.1 Seq2Seq架构 089
4.2 构建简单Seq2Seq架构 092
小结 103
思考 103
第5课 见微知著开慧眼:引入注意力机制 104
5.1 点积注意力 105
5.2 缩放点积注意力 114
5.3 编码器-解码器注意力 116
5.4 注意力机制中的Q、K、V 122
5.5 自注意力 125
5.6 多头自注意力 126
5.7 注意力掩码 129
5.8 其他类型的注意力 131
小结 132
思考 132
第6课 层峦叠翠上青天:搭建GPT核心组件Transformer 133
6.1 Transformer架构剖析 133
6.1.1 编码器-解码器架构 135
6.1.2 各种注意力的应用 135
6.1.3 编码器的输入和位置编码 140
6.1.4 编码器的内部结构 141
6.1.5 编码器的输出和编码器-解码器的连接 142
6.1.6 解码器的输入和位置编码 143
6.1.7 解码器的内部结构 145
6.1.8 解码器的输出和Transformer的输出头 146
6.2 Transformer代码实现 148
6.3 完成翻译任务 176
6.3.1 数据准备 177
6.3.2 训练Transformer模型 179
6.3.3 测试Transformer模型 179
小结 181
思考 182
第7课 芳林新叶催陈叶:训练出你的简版生成式GPT 183
7.1 BERT与GPT争锋 184
7.2 GPT:生成式自回归模型 188
7.3 构建GPT模型并完成文本生成任务 191
7.3.1 搭建GPT模型(解码器) 192
7.3.2 构建文本生成任务的数据集 195
7.3.3 训练过程中的自回归 198
7.3.4 文本生成中的自回归(贪婪搜索) 200
7.4 使用WikiText2数据集训练Wiki-GPT模型 201
7.4.1 用WikiText2构建Dataset和DataLoader 202
7.4.2 用DataLoader提供的数据进行训练 206
7.4.3 用Evaluation Dataset评估训练过程 207
7.4.4 文本生成中的自回归(集束搜索) 209
小结 212
思考 213
第8课 流水后波推前波:ChatGPT基于人类反馈的强化学习 214
8.1 从GPT到ChatGPT 215
8.2 在Wiki-GPT基础上训练自己的简版ChatGPT 218
8.3 用Hugging Face预训练GPT微调ChatGPT 225
8.4 ChatGPT的RLHF实战 233
8.4.1 强化学习基础知识 235
8.4.2 简单RLHF实战 237
小结 243
思考 244
第9课 生生不息的循环:使用强大的GPT-4 API 245
9.1 强大的OpenAI API 245
9.2 使用GPT-4 API 249
小结 251
思考 252
后 记 莫等闲,白了少年头 253
· · · · · · (收起)
读后感
作者对GPT有着深厚大模型算法数学功底,将GPT用漫画图画方式完完全全详细讲清楚了,有一点电脑,网络,云空间操作经验,就可以自己实验。 当前GPT非常流行,要掌握了GPT需要大学,科研机构有长时间的数学研究,计算机架构,云空间,GPU,并行运算,方方面面辛苦把挖。作者做到...
我是由《数据分析咖哥十话:从思维到实践促进运营增长》这本书开始关注佳哥的,当时在做数据分析相关的学习,这本书给我提供了很大的帮助,后面又学习了佳哥的《零基础学机器学习》。这两本书对于我理清机器学习相关方法和后续的学习都提供了帮助。 佳哥的书我觉得很适合做技术...
之前阅读过黄佳老师的《数据分析咖哥十话》和《零基础学机器学习》,写得深入浅出,受益匪浅。所以《GPT图解 》一出版,就第一时间拿到手,细细品读。 这本书秉承了他的一贯风格,以生动活泼的笔触,将枯燥的技术细节化作了轻松幽默的故事。书里的中文大模型“雕龙一拍”与百度...
AIGC技术如今已经如火如荼,许多文案写作,绘画制作都依赖于AIGC技术自动生成基础的图片与文案。除了日常聊天,文案写作,基于GPT模型诞生的许多工具陆陆续续步入我们的工作生活。然而,你真的懂什么是GPT么?人工智能、自然语言处理又是如何发展至今的呢? 黄佳(咖哥)是新加...
AIGC技术如今已经如火如荼,许多文案写作,绘画制作都依赖于AIGC技术自动生成基础的图片与文案。除了日常聊天,文案写作,基于GPT模型诞生的许多工具陆陆续续步入我们的工作生活。然而,你真的懂什么是GPT么?人工智能、自然语言处理又是如何发展至今的呢? 黄佳(咖哥)是新加...
用户评价
这本书的阅读体验,对我而言,更像是一次精神上的洗礼。我发现作者在构建知识体系时,有一种近乎人文关怀的温柔。他深知技术学习中的挫败感,所以在行文间穿插着一些关于学习方法论和保持热情的讨论。这种将冰冷的技术与温暖的人文思考结合起来的方式,非常触动我。它不仅仅告诉我“如何做”,更潜移默化地塑造了我的“学习态度”。比如,书中关于如何系统性地构建知识网络的那几页内容,简直是为我量身定制的效率指南。而且,这本书的整体氛围是积极向上的,它让你相信,通过正确的路径和持续的努力,任何高深的技术都可以被掌握。这不仅仅是一本技术参考书,更像是一剂对抗学习倦怠的良药,读完后,我对未来的学习方向充满了清晰的目标感和持久的热情。
说实话,我买书前犹豫了很久,毕竟市面上的资料太多了,质量参差不齐。但这本书的出版信息和作者的履历让我下定决心试一试。拿到手后,我主要关注的是它的实践性和前沿性。非常惊喜的是,这本书在介绍基础原理的同时,紧密结合了当下最新的行业动态和应用案例。它没有停留在纸上谈兵的阶段,而是提供了大量可供参考的实操指南和代码片段(虽然我主要关注的是概念)。更重要的是,作者对未来趋势的把握非常精准,他不仅仅是在复述已有的知识体系,更是在探讨“下一步会发生什么”。阅读过程中,我常常停下来,思考作者提出的那些开放性问题,这极大地激发了我的批判性思维。这本书的结构组织方式非常巧妙,它像是一张不断延展的地图,每读完一章,你都会发现自己对整个领域的认知版图又扩大了一圈。
我是一个对新事物充满好奇心,但动手能力略显不足的入门级爱好者。市面上很多号称“入门”的书籍,读完后感觉自己还是云里雾里,技术名词满天飞,读起来像是在啃一块又硬又涩的石头。然而,这本书彻底颠覆了我的认知。它就像一位耐心至极的导师,始终蹲下来,用我最容易理解的方式引导我一步步向前走。印象最深的是它对一些复杂算法的阐释,作者没有堆砌数学公式,而是构建了一个虚拟的场景,让读者仿佛亲身参与其中,观察每一步决策是如何产生的。这种“沉浸式学习”的体验,让我第一次真正理解了理论背后的逻辑和精髓。每当我觉得快要跟不上节奏时,总能找到一个巧妙的类比或图示来拉我一把。读完后,那种“原来如此”的豁然开朗感,是任何高深理论书籍都无法比拟的。它真正做到了“授人以渔”,让我不仅学会了“是什么”,更明白了“为什么会这样”。
这本厚厚的书拿到手里,首先就被它那沉甸甸的质感和精美的装帧吸引住了。封面设计简约而不失格调,那种沉静的色调让人一看就知道里面内容不俗。我通常对技术类的书籍抱有一种敬畏之心,总觉得晦涩难懂,但翻开这本书的目录,却发现作者的思路异常清晰,脉络分明。他没有一上来就抛出复杂的理论,而是用一种非常生活化的语言,搭建起了一个稳固的知识框架。比如,在讲解某个核心概念时,他会先从一个现实生活中的例子入手,把那个抽象的东西具象化,让人茅塞顿开。而且,排版简直是教科书级别的享受,字里行间留白的恰到好处,阅读起来丝毫没有压迫感。我特别喜欢作者在章节过渡时使用的小插曲或者历史背景介绍,它们不仅丰富了内容,更让整个阅读过程充满了探索的乐趣,而不是单纯的知识灌输。这本书的深度和广度都令人赞叹,读完感觉像是经历了一场精心组织的知识盛宴,每道“菜”都烹饪得恰到好处,回味无穷。
我是一个资深的业内人士,对技术细节要求很高,通常觉得“大而全”的书籍要么浅尝辄止,要么过于学术化。我带着一种审视的眼光来翻阅这本书,原本没抱太大希望它能给我带来什么新的启发。然而,这本书在细节处理上的严谨性,以及对一些细微差别的精准剖析,让我刮目相看。它没有回避那些容易被忽略但至关重要的技术细节,反而深入挖掘了背后的权衡取舍和设计哲学。作者的论述逻辑严密,论据充分,即便是那些被业界广泛接受的“常识”,他也能提供一个全新的、更具洞察力的视角去审视。这本书更像是一场与大师的深度对话,它挑战你既有的认知框架,鼓励你去质疑和求证。对于希望从“熟练使用者”跃升到“设计思考者”的专业人士来说,这本书提供的深度绝对是物超所值的。
这本书很不错。
如果看过咖哥的其它书, 对于他的文风应该会有所了解, 我读过他所著的《数据分析咖哥十话》, 所以开篇就是满目的熟悉感. 那些文学味很浓的画龙点睛的标题, 以及浅显的方式讲述复杂技术的详细内容, 都能吸引我! 技术书以这样的方式呈现背后一定是个有趣的灵魂!! 大家何不一睹为快啊!
大模型现在太火了。这本书教我们如何搭建大模型demo,值得读读
通俗易懂是黄老师写书的特点,这本书让我从一个小白就能看清GPT发展的脉络,从bag of Word 到Seq2Seq,再发展到Transformer,BERT,最后到ChatGPT,这么一步一步的发展过来,一本不厚的书让如醍醐灌顶,对GPT的发展有一个清晰的认识。现在模型太多了,有了这本书让大家知道,你学到哪里,以及后面的road map是什么。感谢作者能用巧妙的文字勾画出这一切,让我读起来饶有兴趣。
黄老师的通俗易懂的作品,出得又快又好