Spark企业级应用开发和调优

2016-09-05 1728

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 1.Spark企业级应用开发和调优Spark项目编程优化历程记录，主要介绍了Spark企业级别的开发过程中面临的问题和调优方法。包含合理分配分片，避免计算中间结果（大数据量）的collect,合理使用map,优化广播变量等操作，降低网络和磁盘IO，提高计算效率。2.核心技术优化方法对比首先如下图（2.1），Spark应用开发在集群（伪分布式）中的记录,每一种不

1.Spark企业级应用开发和调优

Spark项目编程优化历程记录，主要介绍了Spark企业级别的开发过程中面临的问题和调优方法。包含合理分配分片，避免计算中间结果（大数据量）的collect,合理使用map,优化广播变量等操作，降低网络和磁盘IO，提高计算效率。

2.核心技术优化方法对比

首先如下图（2.1），Spark应用开发在集群（伪分布式）中的记录,每一种不同颜色的折线代表一个分布式机器

最终,图4中四条折线并行达到峰值(即CPU100%).降低了处理时间,增大了处理效率.

2.1.重要并行计算模型构建对比

图1 传统方式计算模型在模拟集群计算概览图

这里写图片描述

图2 spark并行模型1在模拟集群并行计算概览图

这里写图片描述

图3 spark并行模型2在模拟集群并行计算概览图

这里写图片描述

图4 spark并行模型3在模拟集群并行计算概览图

这里写图片描述

2.2.Spark优化技术要点

2.2.1.如何构建一个合理的弹性分布式数据集(RDD)

Spark之所以快速,一是分而治之,二是允许基于内存计算.
第一步,常用的构建一个分布式数据方式:

方式一:基于文件读取
- textFile(name, minPartitions=None, use_unicode=True) 返回RDD,可以读取text本地文件,HDFS等等

sc.textFile("file:///native/dir")
sc.textFile("/HDFS/dir")

方式二:基于内存读取
- parallelize(c, numSlices=None) 返回RDD,基于内存读取.

sc.parallelize([0, 2, 3, 4, 6], 5).glom().collect()

在项目模型中,计算模型将的x,y坐标xyload = sc.parallelize(xyload)通过内存读成RDD模式.

2.2.2.如何处理一个弹性分布式数据集

在处理弹性是分布式数据集之前,应该充分利用RDD本质的性质,RDD执行策略是懒操作,在转换和执行两个状态中,只有执行才会真正去计算,如将一个文件textFile至RDD,这个文件并没有做物理上的动作,而RDD只是逻辑映射,当执行college或者split等可以返回一个新RDD时,才会发生资源分配,计算.可以简单理解为,一个RDD转变成另个新的RDD时,才发生了真正的资源调度,计算,IO等操作.

在项目中,

cellist=xyload.map(getCellList)
cellisttxt = cellist.filter(lambda x : x != None)

其中,

map(f, preservesPartitioning=False)

返回一个新的RDD,并对RDD中的每个元素做操作(如功能函数的运算或者定义的循环,针对的元素级别的)
在项目中,实现Celllist循环操作,操作级别对弹性分布式元素中的每个元素.

filter(f)

cellisttxt = cellist.filter(lambda x : x != None)

返回一个新的RDD,包含满足功能函数的元素.
在项目中,实现返回cellist中元素去除None元素,保证RDD后续业务操作正确性.

2.2.3.如何优化处理数据过大的中间结果

RDD的collect操作可以实现元素级别的聚合,但是这个执行过程会造成单一driver大量IO,内存占用过大,网络传输量大等等瓶颈.

所以,在getcellist方法后,将分布式持久化,然后再通过文件批量依次读取过程,避开driver开销过大的难题.

2.2.4.广播变量的合理使用

增加广播变量降低读写。适用于某变量需要反复使用，如在各个分片中都有一个数组固定的计算值，这个数组不要反复从文件读取而直接用广播变量，最大限度降低集群的IO.

这里写图片描述

3.大数据模型开发历程

由图5,在企业中开发Spark应用，以接口的服务方式,第一次post大数据平台文件上传服务,上传所需的数据文件,二次post调用服务接口,传入Spark分布式模型必备的参数,包括执行本次执行ID,输入路径,输出路径.一期模型开始监控大数据平台执行返回的状态.

此时,基于每个RDD内存做计算,map操作得到getcellist,并通过filter去除脏数据(None),形成中间结果,分布式持久化,最后通过numpy依次读取持久化文件,并做排序后保存成最终结果.

图5 分布式Spark模型的主要执行过程示意图

这里写图片描述

最终,业务平台通过大数据平台监控得到执行成功状态信号,get最终结果文件至业务平台.

相关实践学习

简单用户画像分析

本场景主要介绍基于海量日志数据进行简单用户画像分析为背景，如何通过使用DataWorks完成数据采集、加工数据、配置数据质量监控和数据可视化展现等任务。

SaaS 模式云数据仓库必修课

本课程由阿里云开发者社区和阿里云大数据团队共同出品，是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法，从场景到实践，体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库，助力开发者学习了解先进的技术栈，并能在实际业务中敏捷的进行大数据分析，赋能企业业务。通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景，可应用MaxCompute实现数仓搭建，快速进行大数据分析。适合大数据工程师、大数据分析师大量数据需要处理、存储和管理，需要搭建数据仓库？学它！没有足够人员和经验来运维大数据平台，不想自建IDC买机器，需要免运维的大数据平台？会SQL就等于会大数据？学它！想知道大数据用得对不对，想用更少的钱得到持续演进的数仓能力？获得极致弹性的计算资源和更好的性能，以及持续保护数据安全的生产环境？学它！想要获得灵活的分析能力，快速洞察数据规律特征？想要兼得数据湖的灵活性与数据仓库的成长性？学它！出品人：阿里云大数据产品及研发团队专家产品 MaxCompute 官网 https://www.aliyun.com/product/odps 

Spark企业级应用开发和调优

1.Spark企业级应用开发和调优

2.核心技术优化方法对比

2.1.重要并行计算模型构建对比

图1 传统方式计算模型在模拟集群计算概览图

图2 spark并行模型1在模拟集群并行计算概览图

图3 spark并行模型2在模拟集群并行计算概览图

图4 spark并行模型3在模拟集群并行计算概览图

2.2.Spark优化技术要点

2.2.1.如何构建一个合理的弹性分布式数据集(RDD)

2.2.2.如何处理一个弹性分布式数据集

2.2.3.如何优化处理数据过大的中间结果

2.2.4.广播变量的合理使用

3.大数据模型开发历程

热门文章

最新文章

相关课程

相关电子书

相关实验场景