自建Hadoop数据迁移到阿里云EMR

  1. 云栖社区>
  2. 阿里云E-MapReduce(EMR)>
  3. 博客>
  4. 正文

自建Hadoop数据迁移到阿里云EMR

阿里云E-MapReduce团队 2020-01-09 12:44:55 浏览2904
展开阅读全文

作者:云魁、连辙

最佳实践概述

应用场景

客户在IDC或者公有云环境自建Hadoop集群,数据集中保存在HDFS文件系统用于数据分析任务。但是由于自建HDFS空间限制无法保存长期数据,或者客户有Hadoop集群迁移上云的需求。本实践方案提供如下场景的最佳实践:

基于IPSec VPN隧道 + DistCp(Hadoop原生工具),将数据迁移到阿里云EMR集群,目标存储包括HDFS,阿里云OSS和阿里云EMR的Jindo

技术架构

本实践方案基于如下图所示的技术架构和主要流程编写操作步骤:
image.png

方案优势

  • 安全性
    基于IPSec VPN/专线的方式进行数据安全传输。
  • 低成本
    在阿里云创建Hadoop类型的EMR集群和自建Hadoop集群相比有一定成本优势,同时阿里云EMR可以使用OSS作为底层存储空间,进一步降低成本。

在进行本文操作之前,您需要完成以下


网友评论

登录后评论
0/500
评论
阿里云E-MapReduce团队
+ 关注
所属团队号: 阿里云E-MapReduce(EMR)