利用Python正则表达式抓取京东网商品信息-阿里云开发者社区

利用Python正则表达式抓取京东网商品信息

2018-01-17 1296

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 正则表达式京东（http://JD.com）是中国最大的自营式电商企业，2015年第一季度在中国自营式B2C电商市场的占有率为56.3%。如此庞大的一个电商网站，上面的商品信息是海量的，小编今天就带小伙伴利用正则表达式，并且基于输入的关键词来实现主题爬虫。

img_5230b66936c74481ee2f3993eb0aed3c.jpe

正则表达式

京东（http://JD.com）是中国最大的自营式电商企业，2015年第一季度在中国自营式B2C电商市场的占有率为56.3%。如此庞大的一个电商网站，上面的商品信息是海量的，小编今天就带小伙伴利用正则表达式，并且基于输入的关键词来实现主题爬虫。

首先进去京东网，输入自己想要查询的商品，小编在这里以关键词“狗粮”作为搜索对象，之后得到后面这一串网址：https://search.jd.com/Search?keyword=%E7%8B%97%E7%B2%AE&enc=utf-8，其实参数%E7%8B%97%E7%B2%AE解码之后就是“狗粮”的意思。那么非常明显，只要输入keyword这个参数之后，将其进行编码，就可以获取到我们的目标网址了，请求网页，得到响应，尔后利用选择器便可以进行下一步的精准采集了。

在京东网上，狗粮信息在京东官网上的网页源码如下图所示：

img_0e4c6cbfc9f41a5b8cf3e6ab8d0e2544.jpe

狗粮信息在京东官网上的网页源码

话不多说，直接撸代码，如下图所示。小编用的是py3，也建议大家以后多用py3版本。通常URL编码的方式是把需要编码的字符转化为%xx的形式，一般来说URL的编码是基于UTF-8的，当然也有的于浏览器平台有关。在Python的urllib库中提供了quote方法，可以实现对URL的字符串进行编码，从而可以进入到对应的网页中去。

正则表达式，又称正规表示式、正规表示法、正规表达式、规则表达式、常规表示法（英语：Regular Expression，在代码中常简写为regex、regexp或RE），是一种可以用于模式匹配和替换的强有力的工具。找到目标网页之后，调用urllib中的urlopen函数打开网页并获取源码，之后利用正则表达式实现对目标信息的精准采集。

img_ecede7baa1006cc326c17636f02cf318.jpe

利用正则表达式实现对目标信息的精准采集

正则表达式写在这个程序中确实蛮复杂的，也占据了多行，但是主要用到的正则表达式是[wW]+?和[sS]+?。

[sS]或者[wW]是完全通配的意思，s是指空白，包括空格、换行、tab缩进等所有的空白，而S刚好相反。这样一正一反下来，就表示所有的字符，完全的，一字不漏的。另外，[]这个符号，表示在它里面包含的单个字符不限顺序的出现，比如下面的正则：[ace]*，这表示，只要出现a/c/e这三个任意的字母，都会被匹配。

此外，[s]表示，只要出现空白就匹配；[S]表示，非空白就匹配。那么它们的组合，表示所有的都匹配，与它相对应的，有[wW]等，意义完全相同。其实，[sS] 和 [wW]这样的用法，比"."所匹配的还要多，因为"."是不会匹配换行的，所有出现有换行匹配的时候，人们就习惯使用[sS]或者[wW]这样的完全通配模式。

最后得到的输出效果图如下所示：