[发明专利]基于正则表达式的文档字符串编码识别方法及装置在审
申请号: | 202111387759.6 | 申请日: | 2021-11-22 |
公开(公告)号: | CN114168808A | 公开(公告)日: | 2022-03-11 |
发明(设计)人: | 姚昊;富会佳;胡文勇;任宇阳;史亚琛;楼宝川;潘炼;汤奔;李志鹏;胡琛 | 申请(专利权)人: | 中核核电运行管理有限公司 |
主分类号: | G06F16/903 | 分类号: | G06F16/903;G06F40/126 |
代理公司: | 核工业专利中心 11007 | 代理人: | 王朋 |
地址: | 314300 浙*** | 国省代码: | 浙江;33 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本公开属于核电技术领域,具体涉及一种基于正则表达式的文档字符串编码识别方法及装置。本公开根据正则表达式确定最佳因子集合;采用CW算法确定出现所述最佳因子集合中的最佳因子的文档记录,并将确定的文档记录添加到候选集合中;根据所述正则表达式确定的DFA自动机对候选集合中的最佳因子的字符串进行验证,将得到成功匹配的字符串。在查询正则表达式的时候定义了一个最佳因子,简化了使用正则表达式来查询的方式。根据最佳因子的个数选择CW算法对提取出来的最佳因子集合快速地查询,有效地过滤掉不包含最佳因子的字符串集合,得到候选字符串,并进一步使用DFA自动机对候选集中的字符串编码进行验证,从而提高整体的查询性能。 | ||
搜索关键词: | 基于 正则 表达式 文档 字符串 编码 识别 方法 装置 | ||
【主权项】:
暂无信息
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于中核核电运行管理有限公司,未经中核核电运行管理有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/202111387759.6/,转载请声明来源钻瓜专利网。
- 上一篇:文本存储管理与检索方法及装置
- 下一篇:一种耐酸性胭脂树橙及其制备方法与应用