Python爬虫入门教程 63-100 Python字体反爬之一,没办法,这个必须写,反爬第3篇

  1. 云栖社区>
  2. python技术进阶>
  3. 博客>
  4. 正文

Python爬虫入门教程 63-100 Python字体反爬之一,没办法,这个必须写,反爬第3篇

梦想橡皮擦 2019-11-12 15:40:48 浏览1447
展开阅读全文

背景交代

在反爬圈子的一个大类,涉及的网站其实蛮多的,目前比较常被爬虫coder欺负的网站,猫眼影视,汽车之家,大众点评,58同城,天眼查......还是蛮多的,技术高手千千万,总有五花八门的反爬技术出现,对于爬虫coder来说,干!就完了,反正也996了~

作为一个系列的文章,那免不了,依旧拿猫眼影视“学习”吧,为什么?因为它比较典型~

猫眼影视

打开猫眼专业版,常规操作,谷歌浏览器,开发者工具,抓取DOM节点,

https://piaofang.maoyan.com/?ver=normal

注意下图所有的数字位置,在DOM结构中,都是方块。
image

字体反爬扫盲

字体反爬,是一种常见的反爬技术,网站采用了自定义的字体文件,在浏览器上正常显示,但是爬虫抓取下来的数据要么就是乱码,要么就是变成其他字符。采用自定义字体文件是CSS3的新特性,熟悉前端的同学

网友评论

登录后评论
0/500
评论
梦想橡皮擦
+ 关注
所属团队号: python技术进阶