Hadoop概念学习系列之大数据、Hadoop和云计算（十三）

2017-11-13 1453

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

我们知道，Hadoop最擅长的事情就是可以高效地处理海量规模的数据，这样Hadoop就和大数据及云计算结下了不解之缘。讲解Hadoop、大数据以及云计算之间的关系，使你从大数据和云计算的角度来认识Hadoop。

　　大数据一般是指这样的数据:数据量巨大，需要运用新处理模式才能具有更强的决策力、洞察力和流程优化能力的海量、高增长率和多样化的信息资产。大数据可分成大数据技术、大数据工程、大数据科学和大数据应用等领域。目前人们谈论最多的是大数据技术和大数据应用，大数据工程和大数据科学尚未被重视。大数据工程指大数据的规划建设及其运营管理的系统工程;大数据科学关注的是大数据网络发展和运营过程中发现和验证大数据的规律及其与自然和社会活动之间的关系。

　　大数据的特征有四个层面:

　　第一、数据量巨大。从TB级别，跃升到PB级别;

　　第二、数据类型繁多。包括网络fl志、视频、图片、地理位置信息等;

　　第三，价值密度低。商业价值高，以视频为例.在连续不间断的监控过程中，可能有用的数据仅仅只有一两秒;

　　第四、处理速度快。最后这一点也和传统的数据挖掘技术有着本质的不同。业界将其归纳为4V —— Volume、Variety、Value 和Velocity。

　　上面我们介绍了大数据的基本概念以及其显著的特征，下面将从不同的维度来阐述大数据的核心问题。

　　1.数据态的多样性问题
大数据具有多态性，主要体现在数据源、结构及相关度上。在数据来源上包括(图像、视频、音频、文本、网页、数据流等;在结构上不仅仅包括结构化的数据，还包括非结构化的数据;在相关度上不仅有数据记录彼此间相关性问题，还有时间序列数据的相关性问题。
2.维度复杂性问题
首先，大数据中存在着多元空间的维度问题，例如典型的三元空间中大数据的产生、状态感应以及采集问题，这个问题在物联网中非常常见;其次，就是柔性粒度数据的传输、移动、存储及计算问题;最后，就是数据空间范围和数据密度的不均匀问题。
3.大数据存储问题
大数据最为显著的特征就是数据规模非常巨大，单机系统肯定无法解决存储问题，这就需要分布式存储系统作为大数据的存储支撑服务，而分布式存储系统需要考虑的核心问题包括:高可靠性、扩一展性、伸缩性、容灾及恢复等问题。
4.大数据计算分析问题
由大数据的特征可知，大数据在数据规模上非常巨大，要在一定的时间内达到撷取、管理、处理并整理为能够帮助企业做出经营决策更有效的资讯，传统的顺序计算模式必然不能满足这样的需求，这就要求使用集群计算系统来完成计算分析任务。基于集群的计算模型目前主要包括:基于消息传递的MPI , MapReduce计算模型、流式计算架构Storm , S4、高性能集群计算HPCC，以及基于共享内存RDD的Spark模型。

　　5.大数据价值挖掘问题
由于大数据的价值密度低而商业价值大，这使得大数据的价值挖掘显得格外重要，而价值挖掘主要包括两个阶段:第一个阶段就是过滤清洗，需要在尽量不损失其价值的条件下减小数据规模，同时在不改变数据基本属性的情况下采取数据清洗、抽样、去重、过滤、筛选、压缩、索引、提取元数据等方法，以直接将大数据变小;第二个阶段就是对商业价值的挖掘，主要是发挥大数据探索式考察与可视化作用，人机的交互分析可以将人的智慧融入数据，再者是通过群体智慧、社会计算、认知计算对数据价值进行提炼，从而挖掘出大数据中隐藏的商业价值。

大数据、Hadoop和云计算的关系

　　上面的内容讲述了大数据的基本概念及与大数据相关的几个核心问题，通过这些问题我们已对大数据有了一个初步的了解，那么大数据、Hadoop及云计算之间到底是什么关系呢?为了从大数据和云计算的角度去了解Hadoop，下面将阐述这三个概念之间的关系。
可以这样说，正是由于大数据对系统提出了很多极限的要求，不论是存储、传输还是计算，现有计算技术难以满足大数据的需求，因此整个IT架构的革命性重构势在必行，存储能力的增长远远赶不大数据的增长，设i十最合理的分层存储架构已成为信息系统的关键。分布式存储架构不仅需要scale up式的可扩展性，一也需要scale out式的可扩展性，因此大数据处理离不开云计算技术，云计算可为大数据提供弹性可扩展的基础设施支撑环境以及数据服务的高效模式，大数据则为云计算提供了新的商业价值，大数据技术与云计算技术必将有更完美的结合。

　　我们知道云计算的关键技术包括分布式并行计算、分布式存储以及分布式数据管理技术，而Hadoop就是一个实现了Google云计算系统的开源平台，包括并行计算模型MapReduce、分布式文件系统HDFS，以及分布式数据库Hbase，同时Hadoop的相关项目也很丰富，包括ZooKeeper , Pig , Chukwa , Hive , Elbase , Mahout等，这些项日都使得Hadoop成为一个很大很完备的生态链系统。目前使用Hadoop技术实现的云计算平台包括IBM的蓝云.雅虎、英特尔的“云计划”，百度的云计算基础架构，阿里巴巴云计算平台，以及中国移动的B igCloud大云平台。

　　总而言之，用一句话概括就是云计算因大数据问题而生，大数据驱动了云讨一算的发展，而Hadoop在大数据和云计算之间建起了一座坚实可靠的桥梁。

本文转自大数据躺过的坑博客园博客，原文链接：http://www.cnblogs.com/zlslch/p/5080573.html，如需转载请自行联系原作者

相关实践学习

简单用户画像分析

本场景主要介绍基于海量日志数据进行简单用户画像分析为背景，如何通过使用DataWorks完成数据采集、加工数据、配置数据质量监控和数据可视化展现等任务。

SaaS 模式云数据仓库必修课

本课程由阿里云开发者社区和阿里云大数据团队共同出品，是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法，从场景到实践，体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库，助力开发者学习了解先进的技术栈，并能在实际业务中敏捷的进行大数据分析，赋能企业业务。通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景，可应用MaxCompute实现数仓搭建，快速进行大数据分析。适合大数据工程师、大数据分析师大量数据需要处理、存储和管理，需要搭建数据仓库？学它！没有足够人员和经验来运维大数据平台，不想自建IDC买机器，需要免运维的大数据平台？会SQL就等于会大数据？学它！想知道大数据用得对不对，想用更少的钱得到持续演进的数仓能力？获得极致弹性的计算资源和更好的性能，以及持续保护数据安全的生产环境？学它！想要获得灵活的分析能力，快速洞察数据规律特征？想要兼得数据湖的灵活性与数据仓库的成长性？学它！出品人：阿里云大数据产品及研发团队专家产品 MaxCompute 官网 https://www.aliyun.com/product/odps 

Hadoop概念学习系列之大数据、Hadoop和云计算（十三）

大数据、Hadoop和云计算的关系

热门文章

最新文章

相关课程

相关电子书

相关实验场景