具体描述
《汉语名词短语和动词短语的自动识别方法研究》面向中文信息处理的实际需要,介绍了用规则方法识别汉语名词短语和动词短语的过程,然后介绍了用隐马尔可夫模型识别汉语名词短语,用支持向量机识别汉语动词短语的过程。在此基础上,探讨了解决计算机分析汉语短语结构碰到的各类歧义问题的途径。短语识别是中文信息处理领域的一个重要组成部分。《汉语名词短语和动词短语的自动识别方法研究》可作为高等院校计算机专业高年级学生的教学参考书,也可供从事中文信息处理及人工智能研究的相关人员参考。
作者简介
目录信息
1.1 课题的提出
1.2 面向计算机的语言学研究工作的模式
1.3 开展本课题研究工作的基础
1.3.1 研究意义
1.3.2 研究难点
1.3.3 国内外研究动态
1.4 本书的结构安排
第2章 汉语的计算机理解
2.1 汉语的特点
2.2 汉语理解中的特殊问题
2.2.1 汉语句子的歧义切分问题
2.2.2 未登录词问题
2.2.3 谓语的组成问题
2.2.4 多动词联用问题
2.2.5 词性歧义问题
2.2.6 主语和施事问题
2.2.7 否定词和语义上的混论
2.2.8 形态变化问题
2.2.9 句子的词序问题
2.2.10 汉语的特殊模式问题
2.2.11 汉语的歧义结构
2.3 小结
第3章 汉语短语的基本知识
3.1 汉语短语的标注体系
3.2 短语的组成定义
3.3 短语的句法功能分类框架
3.4 小结
第4章 基于规则的汉语短语识别
4.1汉语短语np、vp结构的统计与分析
4.1.1 汉语短语np的统计与分析
4.1.2 汉语短语vp的统计与分析
4.2 汉语短语np、vp识别的定界规则
4.2.1 获取上下文规则的必要性
4.2.2 名词短语np定界规则的确定
4.2.3 动词短语vp定界规则的确定
4.2.4 上下文规则的获取
4.3 汉语短语np、vp的句法语义分析
4.3.1 汉语短语11p的句法语义分析
4.3.2 汉语短语vp的句法语义分析
4.4 基于规则的汉语短语np、vp的自动识别
4.4.1 识别算法
4.4.2 实验系统
4.4.3 实验数据分析
4.5 小结
第5章 基于HMM的名词短语识别
5.1 相关技术介绍
5.1.1 HMM简介
5.1.2 层次分析法介绍
5.2 相关资源建设
5.2.1 资源建设方法
5.2.2 资源组成
5.2.3 资源建设
5.3 HMM模型的设计
5.3.1 HMM模型的建立
5.3.2 HMM模型的参数估计
5.3.3 NP识别过程
5.4 模型的实验与结果分析
5.4.1 系统总体设计框图
5.4.2 主要模块的算法设计
5.4.3 总体算法流程图
5.4.4 实验结果与分析
5.5 小结
第6章 基于SVM的动词短语识别
6.1 支持向量机介绍
6.1.1 引言
6.1.2 SVM简介
6.2 现代汉语动词短语相关知识介绍
6.2.1 动词短语简介及其分类
6.2.2 用于VP识别的词语句法属性集合的确定
6.2.3 语料选取
6.2.4 动词短语最佳观察窗口的确定
6.2.5 动词短语的分析
6.3 动词短语特征提取
6.3.1 静态特征提取
6.3.2 动态特征提取
6.4 动词短语向量空间模型的建立
6.5 基于SVM的动词短语识别
6.5.1 构造SVM分类器
6.5.2 基于SVM的动词短语识别
6.6 实验模型及结果分析
6.6.1 子语料的形成
6.6.2 基于SVM的动词短语识别方法实验系统及结果分析
6.7 小结
第7章 短语结构歧义类型与消解策略分析
7.1 从计算机处理的角度看汉语短语结构歧义
7.2 包含终结符的歧义格式与不包含终结符的歧义格式
7.3 外显型歧义格式与内含型歧义格式
7.4 真歧义格式、准歧义格式、伪歧义格式
7.5 短语结构歧义的消解策略分析
7.5.1 短语结构歧义的消解策略概述
7.5.2 短语结构歧义的消解方法及举例
7.6 小结
第8章 关于短语识别的评测问题
8.1 评测在软件开发中的位置
8.1.1 引言
8.1.2 评测在软件开发过程中的位置
8.1.3 ISO9126标准
8.2 评测模型的定义
8.2.1 评测中的主要概念——形式和自动化概述
8.2.2 参数化测试台(PTB)
8.3 短语识别的评测框架及部分实现
8.3.1 属性集
8.3.2 需求
8.3.3 方法
8.3.4 测量
8.3.5 翻译评测的度量
8.3.6 评测过程
8.3.7 分词与词性标注自动评测系统
8.3.8 短语分析评测标准及其度量方式
8.3.9 测试结果提交格式
8.4 小结
第9章 结语
9.1 对本课题研究工作的总结
9.2 规则方法与统计方法的比较
9.3 进一步的研究计划
附录1 符号代码说明
附录2 《现代汉语语法信息词典》动词库专有项目
附录3 SMO算法的伪码
附录4 现代汉语短语结构歧义格式举例
附录5 测试句样例
参考文献
后记
· · · · · · (收起)
读后感
用户评价
初翻这本书,我立刻被它严谨的论证结构所吸引。作者似乎采用了“问题提出—现有方法回顾—核心理论建构—实证检验—结论与展望”的标准学术范式,每一步都走得扎实而审慎。特别是对现有方法的梳理部分,我感觉作者并没有简单罗列,而是深入剖析了每种技术或理论的内在逻辑缺陷,这为后续提出自己的新方法奠定了坚实的基础。这种对前人工作的充分尊重和批判性继承,是优秀学术著作的标志之一。我注意到书中引用了大量近十年来的前沿文献,说明作者的研究紧跟时代步伐,而非闭门造车。虽然初步接触,但我能感受到其中蕴含的巨大信息量,恐怕需要反复阅读和笔记才能完全消化。它不是那种可以轻松翻阅的“休闲读物”,更像是需要投入心力去啃食的学术“硬骨头”。
这本书的语言风格,坦率地说,非常“学术化”,充满了专业术语和精确的定义。初读时,确实需要频繁地查阅上下文或后记,才能完全捕捉到作者对某些关键概念的界定。这对于非专业背景的读者来说,门槛略高,可能会产生一定的畏难情绪。然而,一旦适应了这种表达方式,其精确性带来的愉悦感是其他文体难以比拟的。作者在阐述复杂算法或模型时,那种抽丝剥茧般的叙述方式,让人不得不佩服其逻辑的强大。它更像是一份详尽的技术手册,而非通俗科普读物。我尤其关注书中是如何处理那些在实际应用中容易产生歧义的语言现象的,期待它能提供一套清晰、可操作的判断标准。这种追求绝对精确性的写作态度,是其价值的核心所在。
这本书的装帧设计非常朴实,封面的设计风格让我联想到了上世纪八九十年代的学术专著,那种低调、务实的气质扑面而来。内页的纸张选择也偏向于哑光质感,减少了阅读时的反光,长时间阅读下来眼睛不容易疲劳。作为一本专注于语言学核心问题的专著,它在排版上显得相当严谨,公式和例句的对齐都非常规范,这对于需要仔细推敲文本结构的读者来说,是一个非常友好的细节。不过,对于习惯了现代印刷品中大量使用彩色图表或亮色元素的读者来说,这种传统的黑白文本呈现可能会显得有些单调。整体来看,它散发出一种沉淀多年的学术气息,暗示着作者在研究过程中投入了大量的精力和时间,不追求花哨的外表,只专注于内容的打磨。我希望这本书的内页结构也能像它的外表一样,脉络清晰,逻辑严密,能带领我深入理解其复杂的研究领域。
这本书的结构安排,似乎非常注重递进关系,由浅入深,层层递进,像一座精心搭建的知识阶梯。开篇可能奠定了宏观的理论基础和背景,随后逐步深入到具体的语篇切分策略和特征提取技术。我留意到,作者似乎有意将理论的抽象性和实践的操作性有机结合起来,这意味着这本书不仅能满足理论研究者的需求,也能为工程实现者提供直接的指导。在我看来,一本优秀的专著,应当能够激发读者自身的思考,而不只是灌输既有知识。我希望在阅读完最后一章后,我能对现有研究的局限性有一个全新的认识,并能从中受到启发,思考未来的研究方向。它能否提供一个全新的研究范式,或者至少是修正现有范式中的关键缺陷,是我保持阅读动力的主要驱动力之一。
阅读这本书的过程中,我最大的感受是它对“实验设计”的重视程度。在后续章节中,作者似乎花费了大量的篇幅来描述他们如何构建数据集、如何设置对照组以及如何量化识别结果的准确性。这部分内容对我而言尤为关键,因为理论的生命力最终要通过实证来检验。如果理论构想得再精妙,没有可靠的数据支撑,那也只能停留在假说层面。我非常期待看到他们是如何平衡“理论驱动”和“数据驱动”这两种研究范式的。书中对数据预处理的描述,尤其是如何清洗和标注那些边界模糊的语言实例,是检验研究者功底的试金石。我希望作者能提供一个清晰的路线图,展示从原始语料到最终模型的每一步转化过程,这对于试图将此方法应用于其他语言或方言研究的同行来说,具有不可估量的参考价值。