[发明专利]一种网页主题提取系统和方法无效
申请号: | 200610036003.6 | 申请日: | 2006-06-15 |
公开(公告)号: | CN101079031A | 公开(公告)日: | 2007-11-28 |
发明(设计)人: | 丁江伟 | 申请(专利权)人: | 腾讯科技(深圳)有限公司 |
主分类号: | G06F17/30 | 分类号: | G06F17/30 |
代理公司: | 深圳市顺天达专利商标代理有限公司 | 代理人: | 郭伟刚;蔡晓红 |
地址: | 518057广东省深圳市高新科*** | 国省代码: | 广东;44 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 网页 主题 提取 系统 方法 | ||
1、一种网页主题提取系统,包括文档解析器,其用于从网页源文件中提取网页标题和具有不同突出显示属性的网页正文;其特征在于,还包括:
分词模块,其用于将所述网页正文、网页标题和网页类别信息进行分词,得到第一词汇表;
义元处理模块,其用于将所述第一词汇表中的词汇转换为义元,对所述义元计算权重,最后再对计算权重后的义元进行反向还原,得到主题词汇集合。
2、根据权利要求1所述的一种网页主题提取系统,其特征在于:所述分词模块与义元处理模块之间还串联有分词后处理模块;
所述分词模块还具有对切分后的词汇进行词性标注的功能;所述分词后处理模块用于根据第一词汇表中词汇的词性,剔除其中的停用词、虚词,得到第二词汇表;所述义元处理模块用于对所述第二词汇表中的词汇进行处理。
3、根据权利要求1或2所述的一种网页主题提取系统,其特征在于,所述义元处理模块包括:
义元扩展模块,其用于使用义元词典将所述第二词汇表中的词汇转换成义元,组成第一义元表;
网页主题义元计算模块,其用于对所述第一义元表中的所有义元计算权重;
义元复原关键词模块,其用于对计算权重后的义元进行反向还原,得到主题词汇集合。
4、根据权利要求1或2所述的一种网页主题提取系统,其特征在于:还包括网页主题输出接口,其用于将所述主题词汇集合处理为适合应用层调用的词汇列表,所述词汇按照语义密度分别被赋予不同的权重。
5、一种网页主题提取方法,其特征在于,包括以下步骤:
(a),所述文档解析器从网页源文件中提取网页标题和具有不同突出显示属性的网页正文;
(b),所述分词模块将所述网页正文、网页标题和网页类别信息进行分词,得到第一词汇表;
(c),所述义元处理模块将所述第一词汇表中的词汇转换为义元,对所述义元计算权重,最后再对计算权重后的义元进行反向还原,得到表征了网页主题的、具有不同权重的主题词汇集合。
6、根据权利要求5所述的一种网页主题提取方法,其特征在于,步骤(a)中,提取网页标题和网页正文的方法是:
所述文档解析器对所述网页的源文件进行解析,得到网页的语法树,然后从语法树上获得网页标题、网页正文中具有不同突出显示属性的正文内容,并将所述正文内容按照其突出显示属性顺序记为body1 body2 body3到bodyN。
7、根据权利要求5所述的一种网页主题提取方法,其特征在于,进一步的:步骤(b)中,所述分词模块还对切分后的词汇进行词性标注,得到第一词汇表。
8、根据权利要求7所述的一种网页主题提取方法,其特征在于:步骤(b)之后进一步包括步骤(b1),所述分词后处理模块至少对所述第一词汇表中的词汇进行去停用词、去虚词,得到第二词汇表。
9、根据权利要求8所述的一种网页主题提取方法,其特征在于,具体的,步骤(c)包括步骤:
(c1),所述义元扩展模块按照词典与义元词典的对应关系将所述W1中的词汇转换成义元,组成第一义元表;
(c2),所述网页主题义元计算模块对所述第一义元表中的所有义元计算权重,得到具有不同权重的第二义元表;
(c3),所述义元复原关键词模块按照义元词典对所述第二义元表中的义元进行反向还原,得到表征了网页主题的、具有不同权重的主题词汇集合。
10、根据权利要求5所述的一种网页主题提取方法,其特征在于:步骤(c)之后进一步包括步骤(d),所述网页主题输出接口将所述主题词汇集合处理为适合应用层调用的词汇列表,所述词汇按照语义密度分别被赋予不同的权重。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于腾讯科技(深圳)有限公司,未经腾讯科技(深圳)有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/200610036003.6/1.html,转载请声明来源钻瓜专利网。