[发明专利]基于字节级n元文法的特征提取方法及垃圾邮件过滤器有效
申请号: | 200910071908.0 | 申请日: | 2009-04-28 |
公开(公告)号: | CN101540017A | 公开(公告)日: | 2009-09-23 |
发明(设计)人: | 齐浩亮;何晓宁;杨沐昀;韩咏;李生;雷国华;李军;安波 | 申请(专利权)人: | 黑龙江工程学院;哈尔滨工业大学 |
主分类号: | G06Q10/00 | 分类号: | G06Q10/00;G06N1/00;H04L12/58 |
代理公司: | 哈尔滨市松花江专利商标事务所 | 代理人: | 张宏威 |
地址: | 150050黑龙江*** | 国省代码: | 黑龙江;23 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 基于 字节 文法 特征 提取 方法 垃圾邮件 过滤器 | ||
1.垃圾邮件过滤系统中的基于字节级n元文法的特征提取方法,其特征 在于,该方法的提取对象是邮件,并且将邮件作为无差别的字节流对待,它对 提取对象信息进行大小为n个字节的滑动窗口操作,获得m个长度为n的字 节片断序列作为特征信息,所述m、n为大于0的整数,它是提取对象信息中 的前m个长度为n的字节片断序列作为特征信息,或者后m个长度为n的字 节片断序列作为特征信息。
2.根据权利要求1所述的基于字节级n元文法的特征提取方法,其特征 在于所述m个长度为n个字节的信息片断是连续选取的,第i+1个字节片断 是以第i个字节片断中的第二个字节为首字节的。
3.采用权利要求1所述的基于字节级n元文法的特征提取方法的垃圾 邮件过滤器,它由分类器、特征权重库和训练器组成,其中
分类器,用于对接收邮件进行特征提取并获得特征信息,还用于根据所述 特征信息和特征权重库中的特征信息将接收邮件分为垃圾邮件和正常邮件;
特征权重库,用于存储垃圾邮件的特征及其权重,并根据训练器提供的信 息实时更新特征信息;所述用户是能够反馈垃圾邮件信息的垃圾邮件过滤器的 使用者,包括垃圾邮件过滤器的实际使用者,即垃圾邮件过滤器的服务对象, 还包括垃圾邮件服务商的工作人员;
训练器,根据用户的反馈对邮件的过滤结果进行在线学习,更新调整特征 权重库中的信息;
其特征在于所述分类器中的特征提取方法采用基于字节级n元文法的特 征提取方法。
4.根据权利要求3所述的基于字节级n元文法的特征提取方法的垃圾邮 件过滤器,其特征在于所述分类器中采用哈希链表或二级索引方式组织存储提 取的特征信息。
5.根据权利要求3所述的基于字节级n元文法的特征提取方法的垃圾邮 件过滤器,其特征在于所述分类器采用逻辑回归模型作为过滤模型。
6.根据权利要求3所述的基于字节级n元文法的特征提取方法的垃圾邮 件过滤器,其特征在于所述训练器采用在线学习方式。
7.根据权利要求3所述的基于字节级n元文法的特征提取方法的垃圾邮 件过滤器,其特征在于所述训练器采用TONE方法调整特征权重。
8.根据权利要求3所述的基于字节级n元文法的特征提取方法的垃圾邮 件过滤器,其特征在于所述训练器对特征权重库的更新方法采用梯度下降方 法。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于黑龙江工程学院;哈尔滨工业大学,未经黑龙江工程学院;哈尔滨工业大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/200910071908.0/1.html,转载请声明来源钻瓜专利网。
- 同类专利
- 专利分类
G06Q 专门适用于行政、商业、金融、管理、监督或预测目的的数据处理系统或方法;其他类目不包含的专门适用于行政、商业、金融、管理、监督或预测目的的处理系统或方法
G06Q10-00 行政;管理
G06Q10-02 .预定,例如用于门票、服务或事件的
G06Q10-04 .预测或优化,例如线性规划、“旅行商问题”或“下料问题”
G06Q10-06 .资源、工作流、人员或项目管理,例如组织、规划、调度或分配时间、人员或机器资源;企业规划;组织模型
G06Q10-08 .物流,例如仓储、装货、配送或运输;存货或库存管理,例如订货、采购或平衡订单
G06Q10-10 .办公自动化,例如电子邮件或群件的计算机辅助管理