开发者社区大数据文章正文

【Spark Summit East 2017】Drizzle——Spark的低延迟执行

2017-02-19 2385

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 本讲义出自Shivaram Venkataraman在Spark Summit East 2017上的演讲，主要介绍了Spark的低延迟执行引擎——Drizzle，其设计目的在于对流进行处理以及进行迭代工作。

更多精彩内容参见云栖社区大数据频道https://yq.aliyun.com/big-data；此外，通过Maxcompute及其配套产品，低廉的大数据分析仅需几步，详情访问https://www.aliyun.com/product/odps。

本讲义出自Shivaram Venkataraman在Spark Summit East 2017上的演讲，主要介绍了Spark的低延迟执行引擎——Drizzle，其设计目的在于对流进行处理以及进行迭代工作。目前Spark使用BSP计算模型，并每个任务结束时通知调度器，这就增加了额外的开销，导致导致吞吐量降低，延迟增加，而Drizzle引入了组调度，也就是一次可以对于一组的计算进行规划。

e80d14dd7173f6f3691c215d101acebef75fbf3a

ea98ada7e21c150f239848f2e626e5157fff07aa

1f65f6aedf5e0d0c002f2669f56d56a67c21bc24

a8d05dea99f52e1112375529987cca52c9be0472

51fcffc6418ee5e176ef49911a6d0aa304e60d4f

269cbc005a8072218c3e342018e31af0927fde74

8a6652b2055e06080c16be74fedab87882ff9771

118a7a01d635370171b47ca6f424808828380a89

c9a5bd5f2f2e820c85dc20bbead68ec5d1052e1c

943b95c5e892473852b073f393715e8bf1d8b4be

64729729e6fc46d896e89c181d9b893eec691b14

1edfd083b837fe12905b2405bd8b015ad38c42db

a08b4cbb8fdf7d0a54543175d2c999bb3168b557

66d35569f5faea73418ada9cdf4e310ccefc870b

6f73a8f789b1fbbaf683924c1249cd3cb7d91b11

146d999994aabdb700e7ce4eaa61752ce440512f

085d4b6de4c1a86e0d89ad0eb41bbd74ba08e6e3

b83de8e8ab9097c5416db21ee0db868a03f3ee54

f81c60550ccdf940919474e93a23c67d8e8d8eff

5411022f8321c0e716b9f7811ca1e9f5b4c9266b

d9ae4a7e6133c2a164963ca6cabaf0a59038b71c

a3c92ca2cce0c305f67dce8c68d7980e825abf34

68a3928705a8b61bf1659d98deac46a6da874d83

894da5bda3e5ae9bf0c1400740604f8a1a0c0d7c

55712c2f72a2c40e465ba977c95a5442f2cf1f7a

d827984888f6392917c87ae6d558b5a19c2b3c13

03186a5de5d5a45edec4785038e159622f462444

11f2e86327674f568f3b19c219acf26855b893f7

75cf48312360015fbf15da56ec978b2b3f875e17

59d075d96e2243ba9a87ea37f18b91b2e1565b0d

ec980c02332aa21e2f4a1e92632f813db7361364

ac72c3ad4be880161994f330a22482b78bb5a6cc

7e881779196f2ee3afb05bd2a931e4faecaec6cb

724c4971be04825525d843f0b36a74fdcab30a91

dda6fe78cdc644fa3c558cf03f6154f16ed3e36c

文章标签：

大数据

分布式计算

Spark

小猫吃鱼569

疯狂的猿

3月前

机器学习/深度学习 SQL 分布式计算

Apache Spark 的基本概念和在大数据分析中的应用

介绍 Apache Spark 的基本概念和在大数据分析中的应用

疯狂的猿

157 0 0

桃李春风一杯酒

7天前

分布式计算 Hadoop 大数据

大数据技术与Python：结合Spark和Hadoop进行分布式计算

【4月更文挑战第12天】本文介绍了大数据技术及其4V特性，阐述了Hadoop和Spark在大数据处理中的作用。Hadoop提供分布式文件系统和MapReduce，Spark则为内存计算提供快速处理能力。通过Python结合Spark和Hadoop，可在分布式环境中进行数据处理和分析。文章详细讲解了如何配置Python环境、安装Spark和Hadoop，以及使用Python编写和提交代码到集群进行计算。掌握这些技能有助于应对大数据挑战。

桃李春风一杯酒

21 1 1

程序猿～厾罗

3月前

机器学习/深度学习 SQL 分布式计算

介绍 Apache Spark 的基本概念和在大数据分析中的应用。

程序猿～厾罗

70 0 0

jerrywangsap

2月前

分布式计算大数据 Java

Spark 大数据实战：基于 RDD 的大数据处理分析