[发明专利]基于线性模型的汉语词法分析方法无效
| 申请号: | 200810114950.1 | 申请日: | 2008-06-13 | 
| 公开(公告)号: | CN101295295A | 公开(公告)日: | 2008-10-29 | 
| 发明(设计)人: | 姜文斌;黄亮;刘群;吕雅娟 | 申请(专利权)人: | 中国科学院计算技术研究所 | 
| 主分类号: | G06F17/27 | 分类号: | G06F17/27 | 
| 代理公司: | 北京泛华伟业知识产权代理有限公司 | 代理人: | 王勇 | 
| 地址: | 100190北京*** | 国省代码: | 北京;11 | 
| 权利要求书: | 查看更多 | 说明书: | 查看更多 | 
| 摘要: | |||
| 搜索关键词: | 基于 线性 模型 汉语 词法 分析 方法 | ||
1.一种提供的基于线性模型的汉语词法分析方法,包括如下步骤:
1)输入汉语语句,设定分析窗口长度,
2)对语句进行逐字分析,对语句中的每一个字,将该字时间窗口内的字或字元组输入感知机分类器,得出当前字标注为某一分词标注和词性标注的感知机模型得分;同时,将该字时间窗口内的字或字元组输入线性词法分析模型,得出当前字标注为某一分词标注和词性标注的线性词法分析模型得分;
3)感知机模型得分和线性词法分析模型得分加权求和得出综合分析得分,将综合分析得分最高的分词标注和词性标注做为当前字的分词标注和词性标注;当所有字的分词标注和词性标注均标注完成时,所述汉语语句的词法分析完毕。
2.根据权利要求1所述的汉语词法分析方法,其特征在于,所述步骤2)中,所述线性词法分析模型为词语序列语言模型、词性标记序列语言模型以及词-词性对集合的共现分数模型中的任意一个或多个加权组合。
3.根据权利要求2所述的汉语词法分析方法,其特征在于,所述步骤2)中,所述当前字的词语序列语言模型得分是在当前字的前n-1个字的分词标注结果为已知的前提下,当前字在语料库中出现某一分词标注的概率,所述n为所述分析窗口长度。
4.根据权利要求2所述的汉语词法分析方法,其特征在于,所述步骤2)中,所述当前字的词性标记序列语言模型得分是在当前字的前n-1个字的词性标注结果为已知的前提下,当前字在语料库中出现某一词性标注的概率,所述n为所述分析窗口长度。
5.根据权利要求2所述的汉语词法分析方法,其特征在于,所述步骤2)中,所述词-词性对集合的共现分数模型得分是以极大似然估计法在训练语料中统计得到的某一词与某一词性共现的概率。
6.根据权利要求1所述的汉语词法分析方法,其特征在于,所述步骤3)中,所述加权求和所需的加权系数通过最小错误率训练方法得到。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于中国科学院计算技术研究所,未经中国科学院计算技术研究所许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/200810114950.1/1.html,转载请声明来源钻瓜专利网。





