NodeJs编写小爬虫

简介: 一,爬虫及Robots协议          爬虫,是一种自动获取网页内容的程序。是搜索引擎的重要组成部分,因此搜索引擎优化很大程度上就是针对爬虫而做出的优化。               robots.txt是一个文本文件,robots是一个协议,而不是一个命令。


一,爬虫及Robots协议


          爬虫,是一种自动获取网页内容的程序。是搜索引擎的重要组成部分,因此搜索引擎优化很大程度上就是针对爬虫而做出的优化。

    

          robots.txt是一个文本文件,robots是一个协议,而不是一个命令。robots.txt是爬虫要查看的第一个文件。robots.txt文件告诉爬虫在服务器上什么文件是可以被查看的,搜索机器人就会按照该文件中的内容来确定访问的范围。

           

          



     如上图,我们可以在网站中直接访问robots.txt文件查看网站禁止访问和允许访问的文件。


二,使用NodeJs爬去网页需要安装的模块


Express

       Express 是一个基于 Node.js 平台的极简、灵活的 web 应用开发框架,它提供一系列强大的特性,帮助你创建各种 Web 和移动设备应用。

        中文API:http://www.expressjs.com.cn/


Request

       简化了http请求。

       API:https://www.npmjs.com/package/request


Cheerio

        以一种类似JQ的方式处理爬取到的网页。

        API:https://www.npmjs.com/package/cheerio



这三个模块在安装NodeJs 之后,可以使用npm命令进行安装。


三,简单爬取网页示例

var express = require('express');
var app = express();
var request = require('request');
var cheerio = require('cheerio');
app.get('/', function(req, res){
    request('http://blog.csdn.net/lhc1105', function (error, response, body) {
      if (!error && response.statusCode == 200) {
        $ = cheerio.load(body);//当前的$,它是拿到了整个body的前端选择器
      console.log($('.user_name').text()); //我博客的获取用户名
      }else{
         console.log("思密达,没爬取到用户名,再来一次");
      }
})
});
app.listen(3000);

之后,




然后在浏览器中访问:http://localhost:3000/,就能看到输出的用户名。


感觉比python爬取方便点儿,主要是对网页元素解析上,省去了很多正则表达式。


     by the way ,新年快乐~~~







目录
相关文章
|
2月前
|
数据采集 JavaScript 前端开发
分享58个NodeJs爬虫源码总有一个是你想要的
分享58个NodeJs爬虫源码总有一个是你想要的
38 4
|
2月前
|
数据采集 Web App开发 JavaScript
 nodejs爬虫框架
 nodejs爬虫框架
114 0
|
数据采集 存储 缓存
用nodejs实现一个小小爬虫
用nodejs实现一个小小爬虫
119 0
|
数据采集 Web App开发 JavaScript
养只爬虫当宠物(Node.js 爬虫爬取 58 同城租房信息)
养只爬虫当宠物(Node.js 爬虫爬取 58 同城租房信息)
172 0
|
数据采集 JavaScript
node.js 爬虫
pc.js 代码 var http=require ("http"); var url="http://sports.sina.com.cn/nba/1.
1365 0
|
Web App开发 自然语言处理 前端开发
node.js爬虫应用——前端程序员的词典command-translator
虽然高考英语考了135分,大学英语四级也过了,可到现在,写了两年代码,经常在写一个变量的时候,想半天也想不出来对应的英文单词是什么,总不能很可 (sha) 爱(bi) 的去用拼音吧,最后还是只能去求助有道了。虽然说打开有道网页,然后输入词语翻译不算太麻烦,担保每次都这样,总觉得不够方便,也不够逼格。
1905 0
|
数据采集 JavaScript Python
nodejs爬虫获取漫威超级英雄电影海报
昨天去看了《复联3》的首映,当我提前15分钟进入影院的时候, 看到了粉丝们取票的长队, 顿时有一种跨年夜的感觉... 最近看了node爬虫的一些知识, 这里用node爬取一下漫威官网的电影海报! marvel // https://marvel.
1095 0