[发明专利]一种基于访问热度的数据迁移部署方法有效
申请号: | 201910227339.8 | 申请日: | 2019-03-25 |
公开(公告)号: | CN110008199B | 公开(公告)日: | 2023-02-14 |
发明(设计)人: | 杨灿;刘宇 | 申请(专利权)人: | 华南理工大学 |
主分类号: | G06F16/21 | 分类号: | G06F16/21;G06F16/28;G06F9/50 |
代理公司: | 广州市华学知识产权代理有限公司 44245 | 代理人: | 王东东 |
地址: | 510640 广*** | 国省代码: | 广东;44 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 基于 访问 热度 数据 迁移 部署 方法 | ||
本发明公开了一种基于访问热度的数据迁移部署方法,本发明对于已迁移部署于分布式平台的列式数据集,根据其运行时用户访问日志信息,使用预测算法预测下一时段的访问量分布;根据预测得到的访问量分布计算出各个字段的访问次数排序;对预测访问次数最高的一列的字段的数据值的分布重新划分数据子区域,使得该字段的访问次数被均匀分配到新的数据子区域内;系统再根据访问次数最高的列重新划分的数据区域切分数据并在分布式平台上更新其数据部署。本发明结合用户对数据集的实际访问行为实现面向分布式平台的数据迁移部署,使得原始数据集访问热度最高列的访问热度被负载均衡到各个数据节点上,以实现数据集在分布式平台上的综合访问性能最佳。
技术领域
本发明涉及数据处理领域,具体涉及一种基于访问热度的数据迁移部署方法。
背景技术
随着计算机与信息技术的广泛普及应用,数据信息规模在迅猛增大,有大部分企业因其各业务产生的各式各样的数据仍存储在关系型数据库中。随着数据规模的高速增长,对于传统关系型数据库来说,海量数据带来的存储瓶颈问题以及数据分析处理性能低下问题显得尤为突出,已成为企业亟待解决的问题。在云计算与大数据领域中,有突出性意义并且产生实际应用价值的当属其领域内的分布式平台架构。将海量数据向分布式平台迁移,利用分布式平台提供的资源共享和协同计算的能力,可以很好地解决大规模数据的分析处理问题。在将海量数据迁移至分布式平台后,平台提供给用户的对数据的访问性能对企业来说是一个重要考量指标。在大数据迁移领域,传统的数据迁移算法没有考虑到用户对数据集的实际访问行为,只是单一的根据数据字段划分数据区域,进而切分数据,将数据迁移并部署到分布式平台的各个节点。然而,对于一个实际运行的数据系统,人们对于其数据集的查询访问热度其实是动态变化的,为了实现数据的部署方案与用户访问行为的最优匹配,提升数据系统运行性能。
发明内容
为了克服现有技术存在的缺点与不足,本发明提供一种基于访问热度的数据迁移部署方法。本发明优化传统的数据迁移部署算法,结合用户对数据集的实际访问行为实现面向分布式平台的数据迁移和部署,使得原始数据集中访问热度最高列的访问热度被负载均衡到多个数据节点上,可大大优化数据集在分布式平台上的综合访问性能。
本发明采用如下技术方案:
一种基于访问热度的数据迁移部署方法,包括:
S1在分布式平台中获取待迁移数据集的访问日志数据集,并指定待迁移数据集的切分段数及在分布式平台上的部署更新周期,设定n个在该数据集中最关注的访问字段;
S2通过预测算法对下一时段的访问量分布进行预测,得到n个字段的总访问次数排序;
S3根据得到的访问次数排序,通过基于日志的访问热度负载均衡数据切分算法,对访问次数最大的列重新划分数据区域;
S4根据重新划分的数据区域对待迁移数据集进行切分,并根据切分结果更新数据集在分布式平台的部署。
所述S2还包括判断下一时段的访问量分布与前一段访问量分布是否相同,如果相同,则用户指定日志统计的时间周期,通过原始数据切分算法对n个字段划分数据区域;
统计指定时间周期内的n个字段在各自的数据区域的访问次数;
将访问次数存储在一张访问详情表中,进一步得到n个字段在指定统计时间周期内的总访问次数排序。
所述S2还包括判断下一时段的访问量分布与前一段访问量分布是否相同,如果不同,则用户指定日志预测时长,根据预测时长内的日志数据,通过预测算法预测下一个预测时长内的n个字段的访问量分布,生成访问详情表;
根据访问详情表中的数据得到n个字段的总问次数排序。
所述S3中基于日志访问热度负载均衡数据切分算法,具体为:
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于华南理工大学,未经华南理工大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201910227339.8/2.html,转载请声明来源钻瓜专利网。
- 数据显示系统、数据中继设备、数据中继方法、数据系统、接收设备和数据读取方法
- 数据记录方法、数据记录装置、数据记录媒体、数据重播方法和数据重播装置
- 数据发送方法、数据发送系统、数据发送装置以及数据结构
- 数据显示系统、数据中继设备、数据中继方法及数据系统
- 数据嵌入装置、数据嵌入方法、数据提取装置及数据提取方法
- 数据管理装置、数据编辑装置、数据阅览装置、数据管理方法、数据编辑方法以及数据阅览方法
- 数据发送和数据接收设备、数据发送和数据接收方法
- 数据发送装置、数据接收装置、数据收发系统、数据发送方法、数据接收方法和数据收发方法
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置