nodejs實現(xiàn)爬取網(wǎng)站圖片功能
更新時間:2017年12月14日 14:16:47 投稿:laozhang
給大家通過一個實例來教學(xué)如何用nodejs實現(xiàn)爬取網(wǎng)站圖片功能,有興趣的朋友收藏一下吧。
通過實例給大家講解nodejs實現(xiàn)爬取網(wǎng)站圖片功能,以下就是全部內(nèi)容:
原理:
爬蟲是最明顯的IO密集型應(yīng)用場景,顯然用node,使得I/O等待開銷小數(shù)據(jù)挖掘比較方便
借助express模塊來搭建node服務(wù)
并使用request模塊獲取目標(biāo)頁面的html代碼
下載cheerio模塊對html代碼做處理(cheerio類似jQuery的語法,所以好用又方便)
環(huán)境配置:
npm install express request cheerio --save
(1)引入各個模塊
var http = require('http');
var request = require('request);
var cheerio = require('cheerio');
var fs = require('fs'); //用來操作文件
var url = 'https://movie.douban.com/cinema/nowplaying/beijing/' //定義要爬的頁面
(2)發(fā)送請求
http.get(function(res){
var html = '';
var titles = [];
res.setEncoding('utf-8') //防止中文亂碼
res.on('data',function(chunk){
html += chrunk; //監(jiān)聽data事件 每次取一塊數(shù)據(jù)
})
res.on('end',function(){
var $ = cheerio.load(html); //獲取數(shù)據(jù)完成后,解析html
//將獲取的圖片存到images文件夾中
$('.mod-bd img').each(function(index, item){
//獲取圖片屬性
var imgName = $(this).parent().next().text().trimg()
var imgfile = imgName + '.jpeg';
var imgSrc = $(this).attr('src')
//采用request模塊,向服務(wù)器發(fā)起請求 獲取圖片資源
request.head(imgSrc, function(error, res,body){
if(error){
console.log('失敗了')
}
});
//通過管道的方式用fs模塊將圖片寫到本地的images文件下
request(imgSrc).pipe.(fs.createWriteStream('./images/' + imgfile));
})
})
})
相關(guān)文章
配置node服務(wù)器并且鏈接微信公眾號接口配置步驟詳解
這篇文章主要介紹了配置node服務(wù)器并且鏈接微信公眾號接口配置步驟詳解,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,,需要的朋友可以參考下2019-06-06
手把手教你把nodejs部署到linux上跑出hello world
本篇文章主要介紹了手把手教你把nodejs部署到linux上跑出hello world,非常具有實用價值,需要的朋友可以參考下2017-06-06

