[发明专利]一种网页内容抽取装置和方法有效
| 申请号: | 201310464472.8 | 申请日: | 2013-10-08 |
| 公开(公告)号: | CN103559202A | 公开(公告)日: | 2014-02-05 |
| 发明(设计)人: | 王志刚 | 申请(专利权)人: | 北京奇虎科技有限公司;奇智软件(北京)有限公司 |
| 主分类号: | G06F17/30 | 分类号: | G06F17/30 |
| 代理公司: | 北京市隆安律师事务所 11323 | 代理人: | 权鲜枝;何立春 |
| 地址: | 100088 北京市西城区新*** | 国省代码: | 北京;11 |
| 权利要求书: | 查看更多 | 说明书: | 查看更多 |
| 摘要: | |||
| 搜索关键词: | 一种 网页 内容 抽取 装置 方法 | ||
技术领域
本发明涉及互联网技术领域,具体涉及一种网页内容抽取装置和方法。
背景技术
网页内容的抽取在搜索引擎、移动阅读等领域有着越来越重要的作用。
现有的一种网页内容抽取方法是将HTML网页转换成文档对象模型(DOM,Document Object Model)树,再根据DOM特征利用人工规则进行抽取。具体为:利用webkit(开源的浏览器引擎)等HTML解析引擎,将网页构建成DOM树,采用后根遍历的方法统计每个结点的文本长度、连接个数、词权重等特征;然后再后根遍历DOM树,利用经验公式和阈值进行判断,如果是需要抽取的内容则取出该结点的文本输出。
但是这种方法的主要问题是,对于几十个甚至上百个维度的特征来说,很难编写有效的规则,即使编写出来规则也是十分繁杂,随着不断演进,规则会越来越复杂,以至于难以维护,解决新问题的周期也会越来越长。
现有的另一种网页内容抽取方法是基于标注好的模板来进行抽取。模板可以利用标注工具生成,也可以人工编写,可以基于网页HTML源码方式,也可以基于DOM树形式。虽然互联网的网站众多,形式各异但是大多数都可以抽象出有限的模板形式,每次抽取只要在模板库中查到最佳匹配的模板,然后使用该模板抽取即可。对于特定网页也可以基于域名、HOST甚至URL和其模板建立映射关系
这种基于标注模板的方式,模板的编写或者标注十分繁琐耗时,且需要人工不断维护,一旦网站改版模板失效,可能造成比较严重的后果。
可见,现有的网页内容抽取方法都存在操作繁琐,复杂度高,难以维护等问题。
发明内容
鉴于上述问题,提出了本发明以便提供一种克服上述问题或者至少部分地解决上述问题的一种网页内容抽取装置和方法。
依据本发明的一个方面,提供了一种网页内容抽取装置,该装置包括:
训练单元,适于根据训练数据定义不同类型的块,以及不同的分类特征;
其中,网页由多个不同类型的块组成,每种类型的块对应一个分类特征值集合,一个分类特征值集合由分别取对应特定值的一个或多个分类特征组成,不同类型的块通过各自对应的分类特征值集合进行区分;
解析单元,适于将当前网页解析成文档对象模型DOM树;
特征获取单元,适于获取所述DOM树的每个结点的分类特征值集合;
块类型确定单元,适于根据所定义的所有分类特征以及每种类型的块对应的分类特征值集合,确定所述DOM树的每个结点是否为块,以及块的类型;
内容抽取单元,适于对所述DOM树的被确定为块的结点,如果对应的块类型为需要抽取的类型,则取出该结点的内容。
可选地,所述特征获取单元,适于采用后根遍历方式获得所述DOM树的每个结点的分类特征值集合。
可选地,所述块类型确定单元,适于将所定义的所有分类特征以及每种类型的块对应的分类特征值集合输入决策树,利用决策树按照先根遍历方式判决所述DOM树的每个结点是否为块,以及块的类型,并按照遍历的顺序输出块序列。
可选地,该装置进一步包括:
纠错单元,适于利用条件随机场CRF对所述块类型确定单元输出的块序列中的块的类型进行纠错处理。
可选地,所述训练单元,进一步适于根据新增的训练数据对分类特征和/或块的类型进行扩充,使得后续根据扩充后的结果进行网页内容抽取。
根据本发明的另一方面,提供了一种网页内容抽取方法,其中,包括:
根据训练数据定义不同类型的块,以及不同的分类特征;其中,网页由多个不同类型的块组成,每种类型的块对应一个分类特征值集合,一个分类特征值集合由分别取对应特定值的一个或多个分类特征组成,不同类型的块通过各自对应的分类特征值集合进行区分;
将当前网页解析成文档对象模型DOM树;
获取所述DOM树的每个结点的分类特征值集合;
根据所定义的所有分类特征以及每种类型的块对应的分类特征值集合,确定所述DOM树的每个结点是否为块,以及块的类型;
对于所述DOM树的被确定为块的结点,如果对应的块类型为需要抽取的类型,则取出该结点的内容。
可选地,所述获取所述DOM树的每个结点的分类特征值集合包括:
采用后根遍历方式获得所述DOM树的每个结点的分类特征值集合。
可选地,所述根据所定义的所有分类特征以及每种类型的块对应的分类特征值集合,确定所述DOM树的每个结点是否为块,以及块的类型包括:
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北京奇虎科技有限公司;奇智软件(北京)有限公司,未经北京奇虎科技有限公司;奇智软件(北京)有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201310464472.8/2.html,转载请声明来源钻瓜专利网。
- 上一篇:粉末冶金链轮及其制备方法
- 下一篇:一种粉末冶金复合轴承材料及其制备方法
- 内容再现系统、内容提供方法、内容再现装置、内容提供装置、内容再现程序和内容提供程序
- 内容记录系统、内容记录方法、内容记录设备和内容接收设备
- 内容服务系统、内容服务器、内容终端及内容服务方法
- 内容分发系统、内容分发装置、内容再生终端及内容分发方法
- 内容发布、内容获取的方法、内容发布装置及内容传播系统
- 内容提供装置、内容提供方法、内容再现装置、内容再现方法
- 内容传输设备、内容传输方法、内容再现设备、内容再现方法、程序及内容分发系统
- 内容发送设备、内容发送方法、内容再现设备、内容再现方法、程序及内容分发系统
- 内容再现装置、内容再现方法、内容再现程序及内容提供系统
- 内容记录装置、内容编辑装置、内容再生装置、内容记录方法、内容编辑方法、以及内容再生方法





