Rumah >hujung hadapan web >tutorial js >多页面爬虫在nodejs中的示例代码分析

多页面爬虫在nodejs中的示例代码分析

黄舟asal: 2017-05-31 10:11:271786semak imbas

本篇文章主要介绍了基于nodejs 的多页面爬虫，小编觉得挺不错的，现在分享给大家，也给大家做个参考。一起跟随小编过来看看吧

前言

前端时间再回顾了一下node.js，于是顺势做了一个爬虫来加深自己对node的理解。

主要用的到是request，cheerio，async三个模块

request

用于请求地址和快速下载图片流。

cheerio

为服务器特别定制的，快速、灵活、实施的jQuery核心实现.

便于解析html代码。

async

异步调用，防止堵塞。

核心思路

用request 发送一个请求。获取html代码，取得其中的img标签和a标签。
通过获取的a表情进行递归调用。不断获取img地址和a地址，继续递归
获取img地址通过request(photo).pipe(fs.createWriteStream(dir + “/” + filename));进行快速下载。

function requestall(url) {

 request({

  uri: url,

  headers: setting.header

 }, function (error, response, body) {

  if (error) {

   console.log(error);

  } else {

   console.log(response.statusCode);

   if (!error && response.statusCode == 200) {

    var $ = cheerio.load(body);

    var photos = [];

    $(&#39;img&#39;).each(function () {

     // 判断地址是否存在

     if ($(this).attr(&#39;src&#39;)) {

      var src = $(this).attr(&#39;src&#39;);

      var end = src.substr(-4, 4).toLowerCase();

      if (end == &#39;.jpg&#39; || end == &#39;.png&#39; || end == &#39;.jpeg&#39;) {

       if (IsURL(src)) {

        photos.push(src);

       }

      }

     }

    });

    downloadImg(photos, dir, setting.download_v);

    // 递归爬虫

    $(&#39;a&#39;).each(function () {

     var murl = $(this).attr(&#39;href&#39;);

     if (IsURL(murl)) {

      setTimeout(function () {

       fetchre(murl);

      }, timeout);

      timeout += setting.ajax_timeout;

     } else {

      setTimeout(function () {

       fetchre("http://www.ivsky.com/" + murl);

      }, timeout);

      timeout += setting.ajax_timeout;

     }

    })

   }

  }

 });

}

防坑

1.在request通过图片地址下载时，绑定error事件防止爬虫异常的中断。

2.通过async的mapLimit限制并发。

3.加入请求报头，防止ip被屏蔽。

4.获取一些图片和超链接地址，可能是相对路径（待考虑解决是否有通过方法）。

function downloadImg(photos, dir, asyncNum) {

 console.log("即将异步并发下载图片，当前并发数为:" + asyncNum);

 async.mapLimit(photos, asyncNum, function (photo, callback) {

  var filename = (new Date().getTime()) + photo.substr(-4, 4);

  if (filename) {

   console.log(&#39;正在下载&#39; + photo);

   // 默认

   // fs.createWriteStream(dir + "/" + filename)

   // 防止pipe错误

   request(photo)

    .on(&#39;error&#39;, function (err) {

     console.log(err);

    })

    .pipe(fs.createWriteStream(dir + "/" + filename));

   console.log(&#39;下载完成&#39;);

   callback(null, filename);

  }

 }, function (err, result) {

  if (err) {

   console.log(err);

  } else {

   console.log(" all right ! ");

   console.log(result);

  }

 })

}

测试：

可以感觉到速度还是比较快的。

Atas ialah kandungan terperinci 多页面爬虫在nodejs中的示例代码分析. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan：

Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Artikel sebelumnya：自定义右键菜单使用JS实现的简单实例分享Artikel seterusnya：关于nodeJS之路径PATH模块的详细介绍

Artikel berkaitan

Lihat lagi