[发明专利]一种网页主题提取系统和方法无效
| 申请号: | 200610036003.6 | 申请日: | 2006-06-15 |
| 公开(公告)号: | CN101079031A | 公开(公告)日: | 2007-11-28 |
| 发明(设计)人: | 丁江伟 | 申请(专利权)人: | 腾讯科技(深圳)有限公司 |
| 主分类号: | G06F17/30 | 分类号: | G06F17/30 |
| 代理公司: | 深圳市顺天达专利商标代理有限公司 | 代理人: | 郭伟刚;蔡晓红 |
| 地址: | 518057广东省深圳市高新科*** | 国省代码: | 广东;44 |
| 权利要求书: | 查看更多 | 说明书: | 查看更多 |
| 摘要: | |||
| 搜索关键词: | 一种 网页 主题 提取 系统 方法 | ||
技术领域
本发明涉及本发明涉及网络通信技术,更具体地说,涉及一种网页主题提取系统和方法。
背景技术
所谓网页主题,就是网页正文所描述事件的摘要内容或者关键词列表,标示了该网页的主题内容和中心思想。现有的网页主题提取方法主要有两种。一种是是基于标题的网页主题提取技术。其方法是:采用Html(HyperText MarkupLanguage,超文件链接标记语言)文档解析器,按照html协议分析html网页,按照网页源文件的tag标识建立html语法树,以找出网页的标题、正文等的内容,然后将网页中标题<title>标签的值作为网页的主题思想。该方法是早期比较常用的网页主题提取方法。但是这种计算方法显然过于简单,实际应用中准确率、召回率均很低,并且不可避免的会出现正文部分信息丢失的情况。
另外一种是基于标题的网页主题提取技术。随着统计自然语言处理技术的发展,按照高词频关键词来标示网页主题的方法得到了广泛的应用,具体做法是先将网页源文件去tag标记,然后将文章内容进行分词统计词频,最后按词频对关键词排序,给出前N个高词频作为文章主题。但是由于表义语言发展得很充分,一义多词是普遍现象,再加上修辞法的运用使得词汇稀疏现象客观存在,特别是对于网页类的短文章,该算法整体效果不是很理想。
发明内容
本发明的目的在于针对现有技术的缺陷,提供一种网页主题提取系统和方法,其基于义元集语义分析技术、充分利用网页预分类信息、显示属性信息来增加单纯语义分析技术的准确度。
本发明的技术方案是:一种网页主题提取系统,包括文档解析器,其用于从网页源文件中提取网页标题和具有不同突出显示属性的网页正文;还包括:分词模块,其用于将所述网页正文、网页标题和网页类别信息进行分词,得到第一词汇表;义元处理模块,其用于将所述第一词汇表中的词汇转换为义元,对所述义元计算权重,最后再对计算权重后的义元进行反向还原,得到主题词汇集合。
进一步的,所述分词模块与义元处理模块之间还串联有分词后处理模块;所述分词模块还具有对切分后的词汇进行词性标注的功能;所述分词后处理模块用于根据第一词汇表中词汇的词性,剔除其中的停用词、虚词,得到第二词汇表;所述义元处理模块用于对所述第二词汇表中的词汇进行处理。
具体的,所述义元处理模块包括:义元扩展模块,其用于使用义元词典将所述第二词汇表中的词汇转换成义元,表示为第一义元表;网页主题义元计算模块,其用于对所述第一义元表中的所有义元计算权重;义元复原关键词模块,其用于对计算权重后的义元进行反向还原,得到主题词汇集合。
本发明一种网页主题提取系统还包括网页主题输出接口,其用于将所述主题词汇集合处理为适合应用层调用的词汇列表,所述词汇按照语义密度分别被赋予不同的权重。
本发明还提供了一种网页主题提取方法,包括以下步骤:
(a),所述文档解析器从网页源文件中提取网页标题和具有不同突出显示属性的网页正文;
(b),所述分词模块将所述网页正文、网页标题和网页类别信息进行分词,得到第一词汇表;
(c),所述义元处理模块将所述第一词汇表中的词汇转换为义元,对所述义元计算权重,最后再对计算权重后的义元进行反向还原,得到表征了网页主题的、具有不同权重的主题词汇集合。
其中,步骤(a)中,提取网页标题和网页正文的方法是:所述文档解析器对所述网页的源文件进行解析,得到网页的语法树,然后从语法树上获得网页标题、网页正文中具有不同突出显示属性的正文内容,并将所述正文内容按照其突出显示属性顺序记为body1 body2 body3到bodyN。
进一步的,步骤(b)中,所述分词模块还对切分后的词汇进行词性标注,得到第一词汇表。步骤(b)之后进一步包括步骤(b1),所述分词后处理模块至少对所述第一词汇表中的词汇进行去停用词、去虚词,得到第二词汇表。
具体的,步骤(c)包括步骤:
(c1),所述义元扩展模块按照词典与义元词典的对应关系将所述第二词汇表中的词汇转换成义元,组成第一义元表;
(c2),所述网页主题义元计算模块对所述第一义元表中的所有义元计算权重,得到具有不同权重的第二义元表;
(c3),所述义元复原关键词模块按照义元词典对所述第二义元表中的义元进行反向还原,得到表征了网页主题的、具有不同权重的主题词汇集合。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于腾讯科技(深圳)有限公司,未经腾讯科技(深圳)有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/200610036003.6/2.html,转载请声明来源钻瓜专利网。





