金鑫:基因应用现状解析及华大基因的数据平台架构

本文涉及的产品
全局流量管理 GTM,标准版 1个月
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
公共DNS(含HTTPDNS解析),每月1000万次HTTP解析
简介: 回到10年前,2007年这个世界有基因数据的人不超过10个,那个时候读取一个基因数据需要上亿美金;10年后的今天,成本被降到了1千美金之内,同时基于人们对更高健康水平的需求,统计已按百万计。而着眼当下,基因研究主要可分3个维度。
前不久《金刚狼3:殊死一战》上映,在狼叔休·杰克曼的光环下,仅两周时间,全球票房已高达4.38亿美元,其中精彩的动作戏与狼叔的谢幕无疑是观众追求的热点。然而不管是《金刚狼》抑或是《X战警》,基因突变带来的超能力都是贯穿整个故事的基本元素。

基因科技是什么?时至今日相信大家都已经有了一定的了解,就比如孕妈妈熟知的无创基因检测,又比如说大量场景中用到的DNA亲权鉴定。然而,在这之外,日常生活中基因应用还有哪些方面?是否如电影《生化危机》、《我是传奇》那样遥远又恐惧?借用时下热门的云计算、大数据等技术基因研究这种全人类事业又会产生什么样的助力?近日,云栖社区采访了深圳华大基因股份有限公司研发中心副总监金鑫,就上述几个问题进行了讨论。

科研、医学、人人,基因的研究、应用与探索

10年后的今天,每个新生儿出生后记录的可能不仅是身高体重,还包括了他的基因数据——金鑫。

觉得不太可能?在惊讶的目光中,金鑫表示:回到10年前,2007年这个世界有基因数据的人不超过10个,那个时候读取一个基因数据需要上亿美金;10年后的今天,成本被降到了1千美金之内,同时基于人们对更高健康水平的需求,统计已按百万计。而着眼当下,基因研究主要可分为以下3个维度:

1. 科研的服务。类似大多新技术,基因研究最初也是在科学研究的基础上发展起来,比如寻找一些疾病的致病基因,又比如熊猫为什么不吃肉,通过研究熊猫的基因组会发现,其基因组例感受肉鲜味的基因“坏”掉了。

2. 医学的服务。在之前,医学实践之所以比较少用,原因在于技术上没有突破,同时缺少人类基因组参考序列。时下对于基因的研究已经有了更好的基础,同时成本也飞速下降,所以有了临床应用的可能,就比如生育健康、肿瘤相关、病源感染相关方面,也就是生死染:
  • 生,即生育健康,主要防控出生缺陷遗传病,例如唐氏综合征,发病率大约是800分之一,传统筛查会出现较高的假阳性,提示高风险,从而需要做侵入性检查,带来感染和流产的风险。然而通过基因检测技术,母体抽血就可以避免这种情况,从而对原本检查技术提供了很好的补充。
  • 死,即肿瘤,其最主要就是靶向药物的选择,因为时下治疗方案一般就是手术、化疗放疗及靶向药物,而靶向药的靶点一般都是基因的标记。因此在治疗方案之前,先就肿瘤组织进行检测,知道靶点后确定明确的治疗方案。当然,限于时下的医学水平,治愈还有很大挑战,但是却可以在控制上更推进一步,提高患者生存率或生存时间。
  • 染,即感染,病原微生物,就比如SARS,刚发生时无法得知前因后果,比如究竟是病毒、细菌还是其他,从而造成一定程度的恐慌。直到基因数据被读取,才清楚其病原体。
3.人人服务。在医学服务中的生育健康其实关乎到整个人口质量、社会负担及家庭负担。 时下整个出生缺陷的发病率在5.6%,而华大基因的目标是使用基因技术,使出生缺陷发生率在此基础上降低50%以上。

在基因研究方面,华大基因、Intel、阿里云共同发起了一个2020计划,希望在2020年实现1个人的基因样本采集、处理、测序及初步分析在一天内完成。而在这中间,云一方面提供了海量的资源,加速计算和解读的过程,另一方面,让很多人可以同时对多个数据进行比较,从而更精准地解读。

海量数据、异地,基因研究与应用挑战

2016年3月10日之前,7年华大基因完成了100万例孕妇产检,然而在2016年底已超过170万,同时随着成本降低、人们思想进步、基因技术突破及二胎等政策推出,相信这个数据体量会愈来越大——金鑫。

一个人的基因组数据大约在3个G,为了得到精准的基因数据,通常需要进行几十上百不等次的冗余测讯,而做肿瘤基因检需要进行上万次。因此,联系具体业务,其存在的主要挑战有:
  • 海量数据。一直以来华大基因都在不断地扩展自己的计算集群,也有多个区域的生产中心,比如武汉,天津,也包括面向海外的香港,总部深圳也有自己的测序中心和对应的数据中心。以前,测序中心选址往往决定了数据中心方位,然而随着业务的飞速增长,硬件规模增长已无法匹配数据规模的增长,出现了很严重的任务积压。
  • 异地模式。基因研究更应该是一个多人、多基因序列的对比,然而基因数据本身体量比较大,限于现在的网络环境很难实现这一点。其次,如上所述,虽然有着多地多机房,但是随着任务量剧增,如果将数据在多机房来回切换显然也无法满足时效性。
基于上述挑战,华大基因通过阿里云为BGI Online(安全、⾼效、易⽤的⽣物信息服务云平台,为⽣物信息领域的各类科研工作者和工具开发者提供便利)注入弹性,同时也释放了每个数据中心部署耗费的大量人力、财力和物力,其总体架构如下:

a757a14aa3cbe7ebc85fd7f2999a23004f861a87

  • 前端通过WEB服务呈现系统业务和提供用户操作,WEB请求通过SLB做负载均衡,并在阿里云提供的VPC和云盾的防护下提供高可用的服务。
  • 后端管理系统的业务数据和处理业务逻辑,后端服务部署在多台ECS上,并采用RDS服务存储业务数据。
  • 任务管理引擎接受前端请求,管理计算资源实现生物信息数据的分析,阿里云提供了海量的ECS节点,并对每个ECS节点提供了完整、详细的API文档,通过对接ECS节点实现了计算资源的弹性伸缩和强大的分布式计算能力。
  • 存储管理负责基因数据的存储和管理,运用OSS和OAS实现了基因数据的冷热存储,除了OSS和OAS本身提供的加密存储外,还对接OSS服务实现数据的去身份化,提高了平台的安全性。
  • 文件传输通过部署在ECS上的服务提供,庞大的基因数据上云是数据流的起始端和瓶颈,阿里云通过铺设阿里机房到华大集群的专线,提升了数据传输的速度。
而就在去年,基于华大基因开发的新一代基因云计算平台BGI Online,华大基因、阿里云和安徽医科大学三方共同协作在21小时47分12秒内完成了1000例人类全外显子组数据的分析,创造了基因数据分析的“深圳速度”。

人人服务,基因研究未来的发展

基因行业还在非常早期,现在看到的就是一些非常确定的应用,和非常确定的结果——金鑫。

如果只有一份基因数据,能解释的事情非常少,同时在人的基因之外,动植物、甚至是微生物这些组成人类生活环境的因素同样需要分析。因此,去年建立了我国第一个也是唯一一个国家基因库(由华大基因承接和运营)。而在这之外,华大基因更与多家国际组织达成合作,比如IRDiRC国际罕见病研究联盟,也比如与费城儿童医院在儿童脑癌上的研究。

同时金鑫还表示,时下云计算、大数据、人工智能等技术同样会给基因研究带来很大的助力,比如在计算、存储之外,华大基因已与阿里云展开了大量机器学习相关方面的合作,比如说预测小米性状,通过小米的基因数据,种植环境来预判小米的产量、特性等。同时也正在与阿里云合作,通过更好的算法去预测肿瘤的驱动基因。

在最后,金鑫再次强调了基因研究上“我为人人”这个概念,他表示,就如BGI Online生物信息数据云平台,基于云基础设施能够搭建不同的基因数据分析场景,不同的人可以在上面搭建自己的分析流程,为⽣物信息领域的各类科研工作者和工具开发者提供便利。
相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
打赏
0
1
0
0
78993
分享
相关文章
安全监控系统:技术架构与应用解析
该系统采用模块化设计,集成了行为识别、视频监控、人脸识别、危险区域检测、异常事件检测、日志追溯及消息推送等功能,并可选配OCR识别模块。基于深度学习与开源技术栈(如TensorFlow、OpenCV),系统具备高精度、低延迟特点,支持实时分析儿童行为、监测危险区域、识别异常事件,并将结果推送给教师或家长。同时兼容主流硬件,支持本地化推理与分布式处理,确保可靠性与扩展性,为幼儿园安全管理提供全面解决方案。
JSON数据解析实战:从嵌套结构到结构化表格
在信息爆炸的时代,从杂乱数据中提取精准知识图谱是数据侦探的挑战。本文以Google Scholar为例,解析嵌套JSON数据,提取文献信息并转换为结构化表格,通过Graphviz制作技术关系图谱,揭示文献间的隐秘联系。代码涵盖代理IP、请求头设置、JSON解析及可视化,提供完整实战案例。
118 4
JSON数据解析实战:从嵌套结构到结构化表格
深入解析Tiktokenizer:大语言模型中核心分词技术的原理与架构
Tiktokenizer 是一款现代分词工具,旨在高效、智能地将文本转换为机器可处理的离散单元(token)。它不仅超越了传统的空格分割和正则表达式匹配方法,还结合了上下文感知能力,适应复杂语言结构。Tiktokenizer 的核心特性包括自适应 token 分割、高效编码能力和出色的可扩展性,使其适用于从聊天机器人到大规模文本分析等多种应用场景。通过模块化设计,Tiktokenizer 确保了代码的可重用性和维护性,并在分词精度、处理效率和灵活性方面表现出色。此外,它支持多语言处理、表情符号识别和领域特定文本处理,能够应对各种复杂的文本输入需求。
98 6
深入解析Tiktokenizer:大语言模型中核心分词技术的原理与架构
阿里云服务器架构解析:从X86到高性能计算、异构计算等不同架构性能、适用场景及选择参考
当我们准备选购阿里云服务器时,阿里云提供了X86计算、ARM计算、GPU/FPGA/ASIC、弹性裸金属服务器以及高性能计算等多种架构,每种架构都有其独特的特点和适用场景。本文将详细解析这些架构的区别,探讨它们的主要特点和适用场景,并为用户提供选择云服务器架构的全面指南。
151 18
地铁站内导航系统解决方案:技术架构与核心功能设计解析
本文旨在分享一套地铁站内导航系统技术方案,通过蓝牙Beacon技术与AI算法的结合,解决传统导航定位不准确、路径规划不合理等问题,提升乘客出行体验,同时为地铁运营商提供数据支持与增值服务。 如需获取校地铁站内智能导航系统方案文档可前往文章最下方获取,如有项目合作及技术交流欢迎私信我们哦~
73 1
Bilibili直播信息流:连接方法与数据解析
本文详细介绍了自行实现B站直播WebSocket连接的完整流程。解析了基于WebSocket的应用层协议结构,涵盖认证包构建、心跳机制维护及数据包解析步骤,为开发者定制直播数据监控提供了完整技术方案。
淘宝拍立淘按图搜索API接口系列的应用与数据解析
淘宝拍立淘按图搜索API接口是阿里巴巴旗下淘宝平台提供的一项基于图像识别技术的创新服务。以下是对该接口系列的应用与数据解析的详细分析
深潜数据海洋:Java文件读写全面解析与实战指南
通过本文的详细解析与实战示例,您可以系统地掌握Java中各种文件读写操作,从基本的读写到高效的NIO操作,再到文件复制、移动和删除。希望这些内容能够帮助您在实际项目中处理文件数据,提高开发效率和代码质量。
49 4
2025年阿里云弹性裸金属服务器架构解析与资源配置方案
🚀 核心特性与技术创新:提供100%物理机性能输出,支持NVIDIA A100/V100 GPU直通,无虚拟化层损耗。网络与存储优化,400万PPS吞吐量,ESSD云盘IOPS达100万,RDMA延迟<5μs。全球部署覆盖华北、华东、华南及海外节点,支持跨地域负载均衡。典型应用场景包括AI训练、科学计算等,支持分布式训练和并行计算框架。弹性裸金属服务器+OSS存储+高速网络综合部署,满足高性能计算需求。

热门文章

最新文章

推荐镜像

更多
AI助理

你好,我是AI助理

可以解答问题、推荐解决方案等