禾连健康CDO沈金:谈云时代的大数据平台架构

简介: 广告营销团队面对的是国内各种医药保健行业的客户,这些医药客户有非常明确的人群需求,母婴类客户和肿瘤类客户需要是完全不一样的人群,如何有效区分流量,高效利用流量一直是个难题。
11+大数据行业应用实践请见 https://yq.aliyun.com/activity/156 ,同时这里还有流计算、机器学习、性能调优等技术实践。 此外,通过 Maxcompute及其配套产品 ,低廉的大数据分析仅需几步,详情访问 https://www.aliyun.com/product/odps ;更多精彩内容参见 云栖社区大数据频道 https://yq.aliyun.com/big-data  。

禾连健康通过为医院提供无线WIFI网络解决方案作为切入点,让医护和患者在享受高速上网服务的前提,为医护提供提升工作效率的工具,为患者提供健康服务的内容,同时作为国内领先的医院流量运营者,为医药行业提供精准营销服务。在禾连健康,大数据主要被用作在精准营销和内容服务两个部分,一方面为利用大数据做医院流量的精细化运营,另一方面利用大数据在互助问模块道实现自动化问答,从而降低用户获取信息的成本。

近日,笔者有幸与禾连健康CDO沈金进行了简短的交流,就大数据技术架构方面进行了简单的探讨。

以下为实录:

YQ:请介绍一下自己?

沈金:禾连健康CDO,前阿里云数据服务IDMAPPING负责人,后作为阿里云数据工作室成员入驻云栖小镇,参与医疗大数据的创新,案例:“ 云上安心”、“ 安心跑”。

YQ:在大数据实践的过程中,你们业务场景中的主要挑战有?

沈金:广告营销团队面对的是国内各种医药保健行业的客户,这些医药客户有非常明确的人群需求,母婴类客户和肿瘤类客户需要是完全不一样的人群,如何有效区分流量,高效利用流量一直是个难题,再加上对于人群的区分需要考虑在医院的就诊轨迹,结合挂号信息,网络访问URL和搜索行为进行完善补充。历史的解决方案是其他云 + 自建HADOOP,这里主要存在的问题有:维护——没有专人维护、开发任务比较繁琐;费用——在同样的满足性能情况下,阿里云明显费用低,只有以前的1/3。

YQ:阿里云数加的哪些特性帮助你们解决了这些问题?你们所使用的服务有?数加给贵公司带来了哪些收益及业务价值,能否通过一些数字阐述?

da735852f88213d6679a4a7359eaa5f25aad9443

沈金:利用MaxCompute的离线计算能力和PAI在文本挖掘上的能力,帮助我们能快速解决如细分疾病历史人群的问题,利用DataHub和StreamCompute的实时计算能力能帮助我们
解决如何细分在线人群的问题,通过离线圈人和实时圈人使我们在精准营销方面,广告的点击率提升了3%。

YQ: 贵公司大数据解决方案是什么?可否进行简单描述?

8ac232021d17cfaff0575b8ec067b3d007530b9a

沈金:
  • 离线计算:RDS/MongoDB->Datax->MaxCompute(PA)
  • 实时计算:ActiveMQ->DataHub->StreamCompute
  • 日志收集:MongoDB(目前正在尝试SLC)

YQ:当初是什么原因促使您选择阿里云数加产品的?

沈金:能快速帮助企业搭建稳定便捷的大数据处理基本能力,而且成本也相对较低。

YQ: 对比云服务和自建大数据基础设施,你们是怎么衡量的?

沈金:自建维护成本太高,对数据存储和计算框架未来会越来越普遍,会作为一种基础能力,不想投入大量精力。

YQ:你们未来还想借助大数据实现的场景有?阿里云数加是否能满足你们的需求?如果没有,期待有哪些?

沈金:语音识别,智能问答。
相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
11天前
|
存储 分布式计算 Hadoop
大数据处理架构Hadoop
【4月更文挑战第10天】Hadoop是开源的分布式计算框架,核心包括MapReduce和HDFS,用于海量数据的存储和计算。具备高可靠性、高扩展性、高效率和低成本优势,但存在低延迟访问、小文件存储和多用户写入等问题。运行模式有单机、伪分布式和分布式。NameNode管理文件系统,DataNode存储数据并处理请求。Hadoop为大数据处理提供高效可靠的解决方案。
33 2
|
2月前
|
存储 数据可视化 数据管理
基于阿里云服务的数据平台架构实践
本文主要介绍基于阿里云大数据组件服务,对企业进行大数据平台建设的架构实践。
714 2
|
4月前
|
SQL 存储 分布式计算
【大数据技术Hadoop+Spark】Hive数据仓库架构、优缺点、数据模型介绍(图文解释 超详细)
【大数据技术Hadoop+Spark】Hive数据仓库架构、优缺点、数据模型介绍(图文解释 超详细)
169 0
|
4月前
|
存储 分布式计算 Hadoop
【大数据技术Hadoop+Spark】HDFS概念、架构、原理、优缺点讲解(超详细必看)
【大数据技术Hadoop+Spark】HDFS概念、架构、原理、优缺点讲解(超详细必看)
114 0
|
1月前
|
存储 关系型数据库 测试技术
印尼医疗龙头企业Halodoc的数据平台转型之Lakehouse架构
印尼医疗龙头企业Halodoc的数据平台转型之Lakehouse架构
35 4
|
4月前
|
监控 物联网 大数据
助力工业物联网,工业大数据之服务域:AirFlow的架构组件【三十二】
助力工业物联网,工业大数据之服务域:AirFlow的架构组件【三十二】
46 0
|
4月前
|
存储 分布式计算 大数据
首批!阿里云MaxCompute完成中国信通院基于无服务器架构大数据平台测试
近日,阿里云计算有限公司MaxCompute产品顺利完成中国信通院首批无服务器架构(Serverless)大数据平台测试。
221 0
|
4月前
|
存储 数据采集 大数据
大数据必知必会系列——数仓分层架构及三层架构流程[新星计划]
大数据必知必会系列——数仓分层架构及三层架构流程[新星计划]
108 0
|
4月前
|
分布式计算 算法 搜索推荐
阿里巴巴内部:全技术栈PPT分享(架构篇+算法篇+大数据)
我只截图不说话,PPT大全,氛围研发篇、算法篇、大数据、Java后端架构!除了大家熟悉的交易、支付场景外,支撑起阿里双十一交易1682亿元的“超级工程”其实包括以下但不限于客服、搜索、推荐、广告、库存、物流、云计算等。 Java核心技术栈:覆盖了JVM、锁、并发、Java反射、Spring原理、微服务、Zookeeper、数据库、数据结构等大量知识点。 大数据:Spark、Hadoop
|
4月前
|
分布式计算 资源调度 大数据
【大数据技术Hadoop+Spark】Spark架构、原理、优势、生态系统等讲解(图文解释)
【大数据技术Hadoop+Spark】Spark架构、原理、优势、生态系统等讲解(图文解释)
170 0

相关产品

  • 云原生大数据计算服务 MaxCompute