备案控制台

开发者社区

开发者社区大数据文摘文章正文

正则表达式太慢？这里有一个提速100倍的方案（附代码）

2017-12-14 6828

版权

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

“当遇到一个文本处理问题时，如果你在第一时间想到了正则表达式，那么恭喜你，你的问题从一个变成了俩！“

如果你曾参与过文本数据分析，正则表达式（Regex）对你来说一定不陌生。词库索引、关键词替换……正则表达式的强大功能使其成为了文本处理的必备工具。然而，在处理大文本的情境下，正则表达式的低效率却常常让人抓耳挠腮。今天，文摘菌将为你介绍一款比正则表达式快数百倍的Python库——FlashText。

让人抓狂的数据清洗工作

即便是最简单的文本分析，我们在进入正式分析之前也需要对文本作出数据清洗。清洗的工作往往涉及到搜索和替换关键词。例如，查询文本中是否出现““Python”这一关键词，或是将所有“python“都替换成”“Python”。如果仅有数百个被搜索和被替换的关键词，正则表达式处理起来会很快。但在自然语言处理任务中，有数万关键词的语料库和数百万的文档早已是家常便饭。这种情况下，运行正则表达式的时间就往往要以“天“来作计数单位了。

65cb4068bf3e996e9c0adc8600e36567ec1fbfb6

吓哭了的文摘菌

当然了，你会觉得并行运算能够解决这一问题，但实际上这一方案却收效甚微。有没有其他办法呢？

FlashText的创造者当年也面临了同样的问题，在经过了一番搜寻而无所获后，他决定自己来编写一个新算法。

在了解FlashText的实现原理之前，让我们先来看看FlashText和正则表达式在搜索任务中的性能对比图。

418f85e8728be9e7a2eac21caaee61d39a8425c5

我们可以看到，当关键词数量上升时，Regex所花费的时间几乎呈线性增长，然而FlashText却几乎没受什么影响。

e46b051b796adfec0f8db2c3e67e51ee5be9de00

开心的文摘菌

再来看一张执行词语替换任务的对比图

1482e71d2e23ab152263a6b638905f4e127dacae

同样的，在词语数量增加时，FlashText的运行时间却几乎不受影响。

所以，什么是FlashText呢？

FlashText是GitHub上的一个开源Python库，正如之前所提到的，它在提取关键字和替换关键字任务上有着极高的性能。

在使用FlashText时，你首先要给它一个关键词列表。这份列表将用于在内部建立一个单词查找树的字典（Trie dictionary）。然后你将一个字符串传递给它，并告诉它是要执行替换还是搜索。

对于替换，它将用替换关键字创建一个新字符串。对于搜索，它将返回字符串中找到的关键字列表。这些任务都只需要遍历字符串一遍。

FlashText为什么这么快？

举个例子吧。我们有一个句子，它由三个单词组成——I like Python，并且假设我们有一个四个单词组成的语料库{Python, Java, J2ee, Ruby}。

如果我们从语料库中拿出每个单词，并且检查它是否出现在句子中，这需要我们遍历字符串四次。

32d176393f33aad8925404296c13cdae94f911fa

如果语料库里有n个词，它将需要n个循环。并且每个搜索步骤（is <word> in sentence?）将花费自己的时间，这就是正则匹配（Regex match）的机制。

还有与第一种方法相反的另一种方法L对于句子中的每个单词，检查它是否存在于语料库中。

b5e1e21bf7d49addd6b1b22a5cb4b3fe51df0e4d

如果这个句子有m个词，它就有m个循环。在这种情况下，所花费的时间只取决于句子中的单词数。这个步骤（ is <word> in corpus? ）可以使用字典查找快速创建。

FlashText算法是基于第二种方法的，该灵感来自于Aho-Corasick算法和单词查找树数据结构（Trie data structure）。

它的工作方式是：

首先根据语料库创建一个单词查找树字典（Trie data structure）。如下图：

80166d63e3723bfdaf71bb1ccdeb938178477baf

start和EOT（End Of Term）表示单词边界，可以是空格，句号或换行符。关键字只有在它的两边有单词边界时才能被匹配。这样可以防止apple和pineapple的匹配。

接下来，我们将输入一个字符串I like Python，并且一个字符一个字符搜索他、它。

f769c0bd6e44b2700434fd5968e6615487d77130

c9ab23f1f0ae17ea1bf3e30aaa76d48a13d1e25b

因为该算法是一个字符接一个字符匹配，在搜索<start>I时，我们可以很容易地跳过<start>like<EOT >在，因为I没有接在<start>后面。这一机制让我们可以很快跳过词库中不存在的词。

FlashText算法只检查输入字符串“I like Python”中的每个字符。即便我们的字典有一百万个关键字，这对它的运行几乎没有影响。这正是FlashText算法的能力所在。

所以你什么时候应用FlashText？

简要回答：当关键词数量>500时

87f53ca8de4af1067e78b643ca533bfa1de18303

对于搜索而言，大约超过500个关键词后FlashText开始优于正则表达式。

补充：正则表达式可以搜索基于特殊字符为关键字，如^,$,*,\d,.但FlashText是不支持的。

所以如果你想匹配部分的单词（如“word\dvec”）是不行的，但它能很好地提取完整的单词（如“word2vec”）。

最后，奉上FlashText的基本功能调用代码！试一试，是不是比正则表达式快了很多呢？

代码：用FlashText查找关键字

代码：用FlashText替换关键字

原文发布时间为：2017-12-14

本文作者：文摘菌

本文来自云栖社区合作伙伴“大数据文摘”，了解相关信息可以关注“大数据文摘”微信公众号

文章标签：

Python

算法

大数据

技术小能手

目录

相关文章

楠竹11

|

1月前

|

人工智能安全测试技术

Infection-2.5登场，训练计算量仅40%、性能直逼GPT-4！

【2月更文挑战第18天】Infection-2.5登场，训练计算量仅40%、性能直逼GPT-4！

楠竹11

33 3 3

Infection-2.5登场，训练计算量仅40%、性能直逼GPT-4！

游客io6musbi47krs

|

7月前

|

设计模式运维 Java

硬核！阿里P8耗时3月撰写700页性能优化笔记：程序优化提升了7倍

前言在我看来，Java性能优化是Java进阶的必经之路，性能优化作为Java工程师必备的一种技术，一直热度不减。 Java是目前软件开发领域中使用最广泛的编程语言之一。Java应用程序在许多垂直领域（银行、电信、医疗保健等）中都有广泛使用。帮助开发者通过专注于JVM内部，性能调整原则和最佳实践，以及利用现有监测和故障诊断工具，来提升应用程序在商业环境中的性能。

游客io6musbi47krs

56 0 0

浅谈架构

|

7月前

|

测试技术 Docker 索引

性能提升40倍——线上真实重构案例分享

性能提升40倍——线上真实重构案例分享

浅谈架构

89 0 0

-编程工程师-

|

11月前

|

自然语言处理数据可视化关系型数据库

用 ChatGPT 写代码，效率杠杠的！

用 ChatGPT 写代码，效率杠杠的！

-编程工程师-

155 0 0

-开发达人-

|

11月前

|

机器学习/深度学习编解码缓存

全面碾压AdamW！谷歌新出优化器内存小、效率高，网友：训练GPT 2果然快

全面碾压AdamW！谷歌新出优化器内存小、效率高，网友：训练GPT 2果然快

-开发达人-

302 0 0

前端小魔女

|

12月前

|

存储 Web App开发缓存

对你的 SPA 提提速

1. 监控 SPA 性能 2. 提升 SPA 性能(6种) a. 延迟渲染首屏下的内容 b. 非必要数据的懒加载 c. 缓存静态内容 d. 对实时性较强的应用使用WebSocket e. 使用JSONP/CORS绕过同源策略 f. CDN处理

前端小魔女

65 0 0

OpenMMLab

|

机器学习/深度学习算法异构计算

视频训练效率太低？试试这个加速算法

在 3D CNN 视频模型中，每一个 mini-batch 的输入 shape 为 Batch_size x T (采样帧数) x H (高度） x W（宽度），通常在训练中 Batch_size，T，H，W 的值都是固定的。为了解决训练效率的问题，论文 "A Multigrid Method for Efficiently Training Video Models" 提出了一种动态改变 Batch_size、采样帧数 T、每一帧的宽度 W 和高度 H 的方式，能在保证训练精度不变的情况下，加速训练收敛。

OpenMMLab

186 0 0

视频训练效率太低？试试这个加速算法

1431649393130558

|

Web App开发缓存网络协议

前端多线程大文件下载实践，提速10倍(拿捏百度云盘)

没错，你没有看错，是前端多线程，而不是Node。这一次的探索起源于最近开发中，有遇到视频流相关的开发需求发现了一个特殊的状态码，他的名字叫做 206~

1431649393130558

876 0 0

前端多线程大文件下载实践，提速10倍(拿捏百度云盘)

李雨前

|

自然语言处理

EdgeNGramFilterFactory 与 NGramFilterFactory的实测效果

假期重新把之前在新浪微博的内容（原新浪这个平台已经下线了）梳理了下，同步搬到这里。主要是Lucene、Solr 应用这块的内容。本文是分词的效果对比。

李雨前

159 1 1

-开发达人-

|

机器学习/深度学习 Web App开发人工智能

推理速度提升29倍，参数少1/10，阿里提出AdaBERT压缩方法

作为当前最佳的自然语言处理模型，BERT 却存在规模大、成本高和实时性差等缺点。为了能在实际应用中部署这种技术，有必要对 BERT 进行压缩。此前机器之心就已经介绍了几种来自不同研究机构的压缩方案，参阅《内存用量 1/20，速度加快 80 倍，腾讯 QQ 提出全新 BERT 蒸馏框架，未来将开源》和《AAAI 2020 | 超低精度量化 BERT，UC 伯克利提出用二阶信息压缩神经网络》。

-开发达人-

140 0 0

推理速度提升29倍，参数少1/10，阿里提出AdaBERT压缩方法

大数据文摘

热门文章

最新文章

阿里云各个地域节点测试IP（国内+海外）Ping值延迟测试（全解析）

基于Flink的实时日志分析系统实践

阿里云的SLB，植入cookie和重写cookie有什么区别？

uni-app 开源资源汇总

一文了解阿里云对象存储OSS

SQL SERVER中的OLEDB等待事件

kindle3使用技巧

sd卡无法写操作

普京顾问警告或征收科技税谷歌苹果可能受创

CIO：传统企业如何做好转型？

手动给docusaurus添加一个搜索

深入白盒测试：代码级透视与质量保证

网络安全与信息安全：防御前线的关键技术与意识

云端守卫：融合云计算与网络安全的未来之路

nginx 配置代理ip访问https的域名配置

基于Java的中国传统面食介绍网站的设计与实现(源码+lw+部署文档+讲解等)

Python搭建代理IP池实现存储IP的方法

外部中断的使用方法

基于Java的快递信息管理系统的设计与实现(源码+lw+部署文档+讲解等)

深入理解MySQL中的UPDATE JOIN语句

相关课程

更多

机器阅读技术与应用

【新人赛】工业蒸汽量预测建模算法代码开源分享合集

云数据库优化十大典型案例

线上Linux服务器优化经验

相关电子书

更多

《更快更稳更安全》

AI让数据库的路走的“更快更远”

十亿级视频播放技术优化揭秘

相关实验场景

更多

函数计算进阶-IP查询工具开发

下一篇

阿里云oss简介和使用流程