强化学习在阿里的技术演进与业务创新 | 免费资料库

简介: 强化学习是最接近于⾃然界动物学习的本质的⼀种学习范式。然⽽强化学习从提出到现在,也差不多有半个世纪左右,它的应⽤场景仍很有限,规模⼤⼀点的问题就会出现维数爆炸,难于计算,所以往往看到的例⼦都是相对简化的场景。

当前的机器学习算法⼤致可以分为有监督的学习、⽆监督的学习和强化学习(Reinforcement Learning)等。强化学习和其他学习⽅法不同之处在于强化学习是智能系统从环境到⾏为映射的学习,以使奖励信号函数值最⼤。如果智能体的某个⾏为策略导致环境正的奖赏,那么智能体以后产⽣这个⾏为策略的趋势便会加强。强化学习是最接近于⾃然界动物学习的本质的⼀种学习范式。然⽽强化学习从提出到现在,也差不多有半个世纪左右,它的应⽤场景仍很有限,规模⼤⼀点的问题就会出现维数爆炸,难于计算,所以往往看到的例⼦都是相对简化的场景。

image.png

最近因为与深度学习结合,解决海量数据的泛化问题,取得了让⼈印象深刻的成果。包括DeepMind 的⾃动学习玩ATARI 游戏,以及AlphaGo 在围棋⼤赛中战胜世界冠军等,其背后的强⼤武器就是深度强化学习技术。相对于DeepMind和学术界看重强化学习的前沿研究,阿⾥巴巴则将重点放在推动强化学习技术输出及商业应⽤。

在阿⾥移动电商平台中,⼈机交互的便捷,碎⽚化使⽤的普遍性,页⾯切换的串⾏化,⽤户轨迹的可跟踪性等都要求们的系统能够对变幻莫测的⽤户⾏为以及瞬息万变的外部环境进⾏完整地建模。平台作为信息的载体,需要在与消费者的互动过程中,根据对消费者(环境)的理解,及时调整提供信息(商品、客服机器⼈的回答、路径选择等)的策略,从⽽最⼤化过程累积收益(消费者在平台上的使⽤体验)。基于监督学习⽅式的信息提供⼿段,缺少有效的探索能⼒,系统倾向于给消费者推送曾经发⽣过⾏为的信息单元(商品、店铺或问题答案)。⽽强化学习作为⼀种有效的基于⽤户与系统交互过程建模和最⼤化过程累积收益的学习⽅法,在⼀些阿⾥具体的业务场景中进⾏了很好的实践并得到⼤规模应⽤。

在搜索场景中,阿⾥巴巴对⽤户的浏览购买⾏为进⾏MDP 建模,在搜索实时学习和实时决策计算体系之上,实现了基于强化学习的排序策略决策模型,从⽽使得淘宝搜索的智能化进化⾄新的⾼度。双11 桶测试效果表明,算法指标取得了近20% 的⼤幅提升。在推荐场景中,阿⾥巴巴使⽤了深度强化学习与⾃适应在线学习,通过持续机器学习和模型优化建⽴决策引擎,对海量⽤户⾏为以及百亿级商品特征进⾏实时分析,帮助每⼀个⽤户迅速发现宝贝,提⾼⼈和商品的配对效率,算法效果指标提升了10%~20%。

在智能客服中,如阿⾥⼩蜜这类的客服机器⼈,作为投放引擎的agent,需要有决策能⼒。这个决策不是基于单⼀节点的直接收益来确定,⽽是⼀个较为长期的⼈机交互的过程,把消费者与平台的互动看成是⼀个马尔可夫决策过程,运⽤强化学习框架,建⽴⼀个消费者与系统互动的回路系统,⽽系统的决策是建⽴在最⼤化过程收益上,来达到⼀个系统与⽤户的动态平衡。
在⼴告系统中,如果⼴告主能够根据每⼀条流量的价值进⾏单独出价,⼴告主便可以在各⾃的⾼价值流量上提⾼出价,⽽在普通流量上降低出价,如此容易获得较好的ROI,与此同时平台也能够提升⼴告与访客间的匹配效率。阿⾥巴巴实现了基于强化学习的智能调价技术,对于来到⼴告位的每⼀个访客,根据他们的当前状态去决定如何操作调价,给他们展现特定的⼴告,引导他们的状态向我们希望的⽅向上做⼀步转移,在双11 实测表明,CTR,RPM 和GMV均得到了⼤幅提升。

当然,强化学习在阿⾥巴巴内部的实践远不⽌此,鉴于篇幅限制,这本电⼦书只介绍了其中的⼀部分。未来深度强化学习的发展必定是理论探索和应⽤实践的双链路持续深⼊。希望这本电⼦书能抛砖引⽟,给⼯业界和学术界带来⼀些输⼊,共同推进深度强化学习的更⼤发展。

点击链接免费下载:

https://developer.aliyun.com/topic/download?id=800

相关文章
|
7月前
|
人工智能 关系型数据库 分布式数据库
新生产力工具AI推动下一级人类文明跃迁? AI如何倒逼数据库的进化? AI加持后的数据库应用场景有哪些变化?
新生产力工具AI会催生下一级人类文明跃迁吗? 数据库进化出了哪些与AI相结合的能力? AI加持后的数据库应用场景有哪些变化?
1045 0
|
3月前
|
机器学习/深度学习 人工智能 Cloud Native
助力 AI 技术共享,蚂蚁开源又一核心技术“因果学习系统 OpenASCE”
技术开源是蚂蚁集团的重要技术战略,我们希望通过开源建立起开放、包容的技术生态,让更多人共享技术红利。
助力 AI 技术共享,蚂蚁开源又一核心技术“因果学习系统 OpenASCE”
|
10月前
|
机器学习/深度学习 人工智能 搜索推荐
参与赢大奖!阿里云机器学习平台PAI助力开发者激发AIGC潜能
为助力开发者能够一站式快速搭建文生图、对话等热门场景应用,阿里云机器学习平台PAI特推出AIGC加油包,为广大开发者加油助力激发AIGC潜能!
|
10月前
|
机器学习/深度学习 人工智能 搜索推荐
|
11月前
|
存储 机器学习/深度学习 安全
《云上社交行业技术服务白皮书》——第五章 展望
《云上社交行业技术服务白皮书》——第五章 展望
71 0
|
11月前
|
机器学习/深度学习 人工智能 达摩院
2022最火的AIGC落地怎么用,阿里达摩院团队深度解读
2022最火的AIGC落地怎么用,阿里达摩院团队深度解读
289 0
|
11月前
|
存储 数据采集 人工智能
数智洞察 | 大国科技博弈,开放科学平台的“四步”开源之旅
编者按: 20世纪末,科学界发起了一系列体现“参与、包容、分享、合作、公开、透明”理念的开放科学运动,包括开源软件、开放获取、开放数据以及开放基础设施和平台等。开放科学运动的发起是为了克服传统封闭的科学模式造成的种种弊端,比如过高付费墙造成知识鸿沟与不平等。 当前,随着时代发展,从开放获取迈向开放科学,已经成为全球共识,全球科研模式也因此发生深刻变革。但我国目前要实现开放科学还面临着许多问题,如何构建开放科学的中国路径、制定互惠共享的国际科技合作战略是我国开放科学发展的未来思路。 本文约3562字,建议阅读时间9分钟。
|
11月前
|
存储 弹性计算 安全
从大模型到大降价,阿里云被集成战略背后的底气
“过去几个月,我碰到的所有客户、所有伙伴,包括我们所有的企业都在思考一个问题,就是如何用新一代的人工智能技术来武装自己。” 4月26日,当阿里巴巴董事会主席兼CEO张勇第一次以阿里云智能CEO的身份出现在阿里云合作伙伴大会上时指出,大模型让所有企业站在了同一起跑线上,再次激活了千行百业。
511 0
|
机器学习/深度学习
《强化学习在阿里的技术演进与业务创新》电子版地址
强化学习是最接近于⾃然界动物学习的本质的⼀种学习范式。然⽽强化学习从提出到现在,也差不多有半个世纪左右,它的应⽤场景仍很有限,规模⼤⼀点的问题就会出现维数爆炸,难于计算,所以往往看到的例⼦都是相对简化的场景。
115 0
《强化学习在阿里的技术演进与业务创新》电子版地址
|
机器学习/深度学习 人工智能 监控
作为今年业务流程领域最热的技术赛道,国产流程挖掘都有哪些特点与优势?
以艺赛旗iS-RPM为例,聊聊国产流程挖掘产品的特性与优势。
440 0
作为今年业务流程领域最热的技术赛道,国产流程挖掘都有哪些特点与优势?