位置:成果数据库 > 期刊 > 期刊详情页
异构存储系统性能监测技术研究
  • ISSN号:1006-2475
  • 期刊名称:计算机与现代化
  • 时间:2013.1.15
  • 页码:195-199
  • 分类:TP301.6[自动化与计算机技术—计算机系统结构;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]西北工业大学计算机学院,陕西西安710072
  • 相关基金:国家“九七三”重点基础研究发展规划基金资助项目(2012CB316203);国家自然科学基金重点资助项目(61033007);国家“八六三”高技术研究发展基金资助项目(2012AA011004)
  • 相关项目:数据密集型计算环境下的数据管理方法与技术
中文摘要:

基于MapReduce的连接算法的研究是海量数据研究领域的一个重要内容,但都集中在数据分布均匀的情况下进行算法优化,而在实际应用中数据分布往往是不均匀的。本文基于此背景,提出一种适合在数据严重倾斜时使用基于MapReduce编程模型的连接算法Skew Control Join,算法通过采样获取数据集的整体分布,通过全局分区将数据集进行分割,使倾斜数据的处理平均分配到所有的Reduce任务上。实验表明在数据倾斜时,本文提出的算法具有良好的性能,达到研究目标。

英文摘要:

The study of join algorithm based on MapReduce is a hot topic in massive data research area. However, most current optimization work is based on the assumption that the data are evenly distributed. In practical applications, the data to be processed are often skew in distribution. This paper proposes a MapReduce join algorithm called Skew Control Join, which is adaptive for serious skew data. The algorithm gets the overall data distribution by sampling, the partitions the data by total partitioner to distribute the data evenly to all Reduce tasks. Experiment results show that the algorithm is of good performance when the pro- cessed data are skew.

同期刊论文项目
同项目期刊论文
期刊信息
  • 《计算机与现代化》
  • 中国科技核心期刊
  • 主管单位:江西省科学技术厅
  • 主办单位:江西省计算机学会 江西省计算技术研究所
  • 主编:刘波平
  • 地址:南昌市西湖区井冈山大道1416号8楼
  • 邮编:330003
  • 邮箱:jgsdd@163.com
  • 电话:0791-86490996
  • 国际标准刊号:ISSN:1006-2475
  • 国内统一刊号:ISSN:36-1137/TP
  • 邮发代号:44-121
  • 获奖情况:
  • 中国科技核心期刊 中国科技论文统计源期刊 江西省...
  • 国内外数据库收录:
  • 波兰哥白尼索引,中国中国科技核心期刊
  • 被引量:14808