[发明专利]一种基于多视图学习的科学主题提取方法有效
申请号: | 201310416384.0 | 申请日: | 2013-09-12 |
公开(公告)号: | CN103530316A | 公开(公告)日: | 2014-01-22 |
发明(设计)人: | 王灿;王哲;卜佳俊;陈纯;于智 | 申请(专利权)人: | 浙江大学 |
主分类号: | G06F17/30 | 分类号: | G06F17/30 |
代理公司: | 杭州天正专利事务所有限公司 33201 | 代理人: | 王兵;黄美娟 |
地址: | 310027 浙*** | 国省代码: | 浙江;33 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 基于 视图 学习 科学 主题 提取 方法 | ||
技术领域
本发明涉及文本聚类和科学主题提取等技术领域,特别是基于多视图学习的文本聚类方法和主题提取工作。
背景技术
每一篇文章都有自己特定的主题,学术论文更是如此,所有学者和研究人员在进行科学研究和撰写论文之前,都需要对现有的科学主题进行调研,而普通读者在查找资料的时候,也希望首先知道文章的主题。经验丰富的研究人员对自己所在领域的科学主题往往都有很清楚的认识,他们能够很好的发现与自己研究领域相关的论文,理清论文之间的关系,预测某些科学主题的流行程度和发展趋势,而且这些信息对于学者的研究工作以至整个研究领域的发展都起着至关重要的作用。随着互联网的高速发展,信息开始爆棚,凭借经验进行简单的人为处理和分析已经不能解决大数据时代带来的挑战。为了方便普通读者能够更加容易的了解新兴的研究领域,帮助经验不足的研究人员快速掌握各个研究领域的研究成果和代表人物,科学主题的提取工作显得尤为重要。
现有的科学主题提取工作基本上只考虑到论文数据中的单方面数据信息,而忽略了其他可以利用的潜在数据。学术论文主要包括正文,标题,摘要,关键字,共同作者以及参考文献等内容,传统的科学主题提取工作主要依据正文或者摘要等单一方面信息进行处理,很少考虑到多方面数据信息的相互影响和内在联系。因此我们提出了一种基于多视图学习的科学主题提取方法,弥补了传统方法的不足,更好的利用多方面的数据信息,借助它们的互补关系和潜在主题的一致性辅助聚类,得到更好的主题提取效果。
发明内容
为了克服现有的科学主题提取方法只考虑到论文数据中的单方面数据信息,而忽略了其他可以利用的潜在数据的缺点,本发明提出了一种基于多视图学习的科学主题提取方法,以方便普通读者能够更加容易的了解新兴的研究领域,帮助经验不足的研究人员快速掌握各个研究领域的研究成果和代表人物。
本发明所述的一种基于多视图学习的科学主题提取方法:
1、该方法包括以下步骤:
1)从论文数据库中获取论文数据,作为即将进行科学主题提取的目标文档;
2)针对每个目标文档,提取该文档中的多个视图的数据信息,作为科学主题提取的依据;
3)根据不同视图数据信息的内容特点不同,对每个视图的数据信息进行简单的数据预处理;
4)针对每一个视图,将所有目标文档的数据信息表示成一个数据矩阵,每一个目标文档的数据信息是其中的一个行向量;
5)利用多视图学习的方法,借助多个视图的数据信息,对目标文档进行聚类,属于同一类的目标文档对应相同的科学主题;
6)对于每一类目标文档,分别提取它们的科学主题,科学主题以多个关键词的形式表示。
2、步骤2)中所述的多个视图的数据信息,其特征在于:
1)根据应用的实际需求和目标文档所包含数据信息的实际情况,选取t个不同视图的数据信息,论文数据主要包括文章的正文,标题,摘要,关键字,共同作者以及参考文献等多方面的数据信息,当选取其中的四种:标题,摘要,关键字,共同作者这四个视图的数据信息时,t=4。
3、步骤3)中所述的根据不同视图数据信息的内容特点不同,对每个视图的数据信息进行简单的数据预处理,其特征在于:
1)对于论文数据的正文、标题、摘要,去掉所有停止词(a,the,or等使用频率很多但没有特定意义或明显区分价值的字或词,常为冠词、介词、副词或连词等),将单词词干化,即去掉ed,ing等分词形式或ment等词缀,只保留词干形式;
2)对于论文数据的关键字、共同作者和参考文献不需要进行上述操作。
4、步骤4)中所述的针对每一个视图,将所有目标文档的数据信息表示成一个数据矩阵,每一个目标文档的数据信息是其中的一个行向量,其特征在于:
1)共同作者视图、关键字视图和参考文献视图处理方式相同,以共同作者视图为例,遍历所有目标文档的作者部分,统计所有不同的作者姓名,将每一个目标文档的共同作者视图用向量的形式表示,定义向量j表示第j个目标文档,m为所有文档的共同作者部分中不同作者的个数,取值0或1,如果第i个作者是第j个目标文档的作者之一,取值为1,否则取值为0;
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于浙江大学,未经浙江大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201310416384.0/2.html,转载请声明来源钻瓜专利网。