IBM对决微软：“人类对等”级别的语音识别精度纪录再次易手-阿里云开发者社区

IBM对决微软：“人类对等”级别的语音识别精度纪录再次易手

2018-04-16 1093

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

人工智能虽然能够在众多层面实现远超人类的处理能力，但语音识别显然尚不在其中——至少目前尚不在其中。IBM公司在最近的语音识别测试当中已经正式超越微软，并将词汇错误率控制在5.5%水平。

尽管已经拿下最新世界纪录，但IBM公司表示要让机器拥有超越人类的对话内容理解能力，恐怕还需要再等待一段时间。

IBM对决微软：“人类对等”级别语音识别精度纪录再次易手

IBM公司在最近的语音识别测试当中已经正式超越微软，并将词汇错误率控制在5.5%水平。

这样的错误率基本相当于人们在聆听对话时，每听到20个词汇而误解其中1个。这样的比例亦使得IBM公司顺利击败去年10月微软公司最新拿出的5.9%测试错误率结果，并成功超越了IBM自身在2016年创造的6.9%成绩。

不过IBM公司强调称，要让机器拥有超越人类的对话内容理解能力，恐怕还需要再等待一段时间。微软方面认为，其上一次公布5.9%的词汇错误率时，其语音识别方案已经达到了“人类对等”的水平。不过IBM公司则泼下冷水，表示其最新研究证明微软的庆祝还为时过早。

正因为如此，IBM公司首席研究科学家GeorgeSaon表示“我们不会为此次成绩开香槟庆祝。”

Saon同时解释称，“在实现此次里程碑式成就的过程当中，我们发现要实现真正的人类对等级别理解能力，则必须要将词汇理解错误率控制在5.1%以下。”

“尽管我们得到的5.5%成绩确实是一项不小的突破，但将人类对等理解级别确定为5.1%证明了我们未来还有很长的道路要走，而在此之后我们并不能贸然表示自己的技术成果已经拥有与人类相同的语音识别能力。”

为了实现这一5.5%的词汇理解错误率，IBM公司将长/短期记忆（简称LSTM）、一套神经网络以及WaveNet语音模型与三套强大的声学模型加以结合。其利用Switchboard语音资料训对这些模型进行了测试，其中甚至包含陌生人之间正式电话交谈的相关语音集合。

IBM公司还建立了一项“打电话回家（CallHome）”测试方案，希望利用其以更具差异及挑战性的对话内容对自身网络的理解能力进行验证。该测试中包含家庭成员间在多种主题之间进行的偶然性聊天，而且这些主题在事先完全无法确定。

IBM公司在这项测试当中获得了10.3%的词汇理解错误率，并发现人类在这一测试中的错误率仅为6.8%。

蓝色巨人在其研究论文当中强调称，Switchboard测试中存在一项数字难题。其指出，“在40名测试对话者当中，有36名曾经出现在训练数据当中，其中部分甚至参与过多达8项不同对话。我们的声学模型非常准确地记住了其在训练期间所处理过的语音模式。”

而之所以在“打电话回家”测试项目中出现较大差距，是因为声学与语言模型并未收录测试中对话者的数据。

IBM公司强调称，其目前正在努力推进语音识别技术的发展速度，旨在以此为基础将更多新功能引入其沃森语音转文本服务当中。

本文出处：畅享网
本文来自云栖社区合作伙伴畅享网，了解相关信息可以关注vsharing.com网站。

相关实践学习

一键创建和部署高分电影推荐语音技能

本场景使用天猫精灵技能应用平台提供的技能模板，在2-5分钟内，创建一个好玩的高分电影推荐技能，使用模板后无须代码开发，系统自动配置意图、实体等，新手0基础也可体验创建技能的乐趣。

达摩院智能语音交互 - 声纹识别技术

声纹识别是基于每个发音人的发音器官构造不同，识别当前发音人的身份。按照任务具体分为两种：声纹辨认：从说话人集合中判别出测试语音所属的说话人，为多选一的问题声纹确认：判断测试语音是否由目标说话人所说，是二选一的问题（是或者不是）按照应用具体分为两种：文本相关：要求使用者重复指定的话语，通常包含与训练信息相同的文本（精度较高，适合当前应用模式）文本无关：对使用者发音内容和语言没有要求，受信道环境影响比较大，精度不高本课程主要介绍声纹识别的原型技术、系统架构及应用案例等。讲师介绍：郑斯奇，达摩院算法专家，毕业于美国哈佛大学，研究方向包括声纹识别、性别、年龄、语种识别等。致力于推动端侧声纹与个性化技术的研究和大规模应用。

IBM对决微软：“人类对等”级别的语音识别精度纪录再次易手

热门文章

最新文章

相关课程

相关电子书

相关实验场景