node.js爬取中關村的在線電瓶車信息

來源：懂視網責編：小采時間：2020-11-27 22:04:04

node.js爬取中關村的在線電瓶車信息

node.js爬取中關村的在線電瓶車信息:背景學習nodejs已經有段時間，網上很多nodejs爬蟲的文章，所以著手練習寫一段，最近打算買一輛電瓶車來上下班，但又不知道哪個好，網上是各說紛紜啊，于是就想著，干脆用node.js自己寫一個小爬蟲，來爬一下中關村在線里面電瓶車的信息吧。簡介該d

推薦度：

點擊下載本文 文檔為doc格式

導讀node.js爬取中關村的在線電瓶車信息:背景學習nodejs已經有段時間，網上很多nodejs爬蟲的文章，所以著手練習寫一段，最近打算買一輛電瓶車來上下班，但又不知道哪個好，網上是各說紛紜啊，于是就想著，干脆用node.js自己寫一個小爬蟲，來爬一下中關村在線里面電瓶車的信息吧。簡介該d

背景

學習nodejs已經有段時間，網上很多nodejs爬蟲的文章，所以著手練習寫一段，最近打算買一輛電瓶車來上下班，但又不知道哪個好，網上是各說紛紜啊，于是就想著，干脆用node.js自己寫一個小爬蟲，來爬一下中關村在線里面電瓶車的信息吧。

簡介

該demo采用node.js作為爬蟲，為方便，有些地方使用es6語法，如有不懂，歡迎咨詢😊

步驟

第一步，引入需要的庫

var cheerio = require('cheerio');
var fetch = require('node-fetch');

// cheerio 是一個類似瀏覽器端的jQuery，用來解析HTML的
// fetch 用來發送請求

第二步，設置初始的爬取的入口(我身處杭州，所以地區選了杭州的🤣)

// 初始url
var url = "http://detail.zol.com.cn/convenienttravel/hangzhou/#list_merchant_loc"
// 由于每個a標簽下是相對路徑，故需要一個根地址來拼接，如下
var urlRoot = "http://detail.zol.com.cn" 
// 存放所有url，之所以用set，是為了防止有相同的而重復爬去
var urls = new Set()
// 存儲所有數據
var data = []

至此，我們的準備部分結束了😅，接下來，開始表演了

分析網頁，思考爬取的方式

每行4款，每頁是48款，一共16頁

思路：

每次獲取當前頁48個鏈接，并點進去之后，拿到該電瓶車的名稱和價格（其他信息獲取方式一樣，自行改就好😂）

第一頁的全部完成之后，翻到下一頁，繼續爬，直到最后一頁結束

首先我們定義一個函數如下

// 這是得到每個頁面的48個鏈接，并開始發送請求

function ad(arg){
// 參數 arg 先不管
// 本地化一下需要爬取的鏈接
let url2 = arg || url;
// 請求第一頁該網頁，拿到數據之后，復制給 app
var app = await fetch(url2).then(res=>res.text())
// 然后假裝用jQuery解析了
var $ = cheerio.load(app)
// 獲取當前頁所有電瓶車的a標簽
var ele = $("#J_PicMode a.pic")
// 存放已經爬取過的url，防止重復爬取
var old_urls = []
var urlapp = []
//拿到所有a標簽地址之后，存在數組里面，等會兒要開始爬的
for (let i = 0; i < ele.length; i++) {
old_urls.push(fetch(urlRoot+$(ele[i]).attr('href')).then(res=>res.text()))
}
// 用把URL一塊丟給promise處理
urlapp = await Promise.all(old_urls)
// 處理完成之后，循環加入jQuery😂
for (let i = 0; i < urlapp.length; i++) {
let $2 = cheerio.load(urlapp[i],{decodeEntities: false})
data.push({
name:$2(".product-model__name").text(),
price:$2(".price-type").text()
})
}
// 至此，一頁的數據就爬完了
// console.log(data);

// 然后開始爬取下一頁
var nextURL = $(".next").attr('href')
// 判斷當前頁是不是最后一頁
if (nextURL){
let next = await fetch(urlRoot+nextURL).then(res=>res.text())
// 獲取下一頁的標簽，拿到地址，走你
ad(urlRoot+nextURL)
}
return data
}
ad()

完整代碼如下

var cheerio = require('cheerio');
var fetch = require('node-fetch');
var url = "http://detail.zol.com.cn/convenienttravel/hangzhou/#list_merchant_loc"
var urlRoot = "http://detail.zol.com.cn"
// var url = "http://localhost:3222/app1"
var urls = new Set()
var data = [] 
async function ad(arg){
let url2 = arg || url;
var app = await fetch(url2).then(res=>res.text())
var $ = cheerio.load(app)
var ele = $("#J_PicMode a.pic")
var old_urls = []
var urlapp = []
for (let i = 0; i < ele.length; i++) {
old_urls.push(fetch(urlRoot+$(ele[i]).attr('href')).then(res=>res.text()))
}
urlapp = await Promise.all(old_urls)
for (let i = 0; i < urlapp.length; i++) {
let $2 = cheerio.load(urlapp[i],{decodeEntities: false})
data.push({
name:$2(".product-model__name").text(),
price:$2(".price-type").text()
})
}

var nextURL = $(".next").attr('href')
if (nextURL){
let next = await fetch(urlRoot+nextURL).then(res=>res.text())
ad(urlRoot+nextURL)
}
return data
}
ad()

總結

聲明：本網頁內容旨在傳播知識，若有侵權等問題請及時與本網聯系，我們將在第一時間刪除處理。TEL:177 7030 7066 E-MAIL:11247931@qq.com

node.js爬取中關村的在線電瓶車信息

推薦度：

點擊下載本文 文檔為doc格式

標簽：電瓶車 node.js Nodejs

熱門焦點

node.js爬取中關村的在線電瓶車信息

node.js爬取中關村的在線電瓶車信息

node.js爬取中關村的在線電瓶車信息

最新推薦

猜你喜歡

熱門推薦