我使用 superagent cheerio 去抓取*東的商品 但是返回的中文亂碼 響應頭如下
是經過 gzip壓縮的 但是按道理 superagent好像會默認解壓
#*東商品地址https://item.jd.com/5025518.html
我取了商品標題 結果如下
#核心程式碼如下:
var url = 'https://list.jd.com/list.html?cat=670,671,672' //京东电脑
var totalData = [] // 存储总数据
superagent.get(url).end(function (err, res) {
if (err) {
return console.error(err)
}
var topicUrls = []; // 页面里面的所有url
var $ = cheerio.load(res.text) // 拿到页面
$('#plist .gl-item').each(function (i, e) {
$e = $(e)
var href = 'https:' + $e.find('.p-img >a').attr('href') // 拿到所有url
topicUrls.push(href)
})
var ep = new eventproxy();//
//异步调用结束后,执行某些操作
ep.after('topic_html', topicUrls.length, function (topics) { //接收res.text
topics = topics.map(function (topicHtml) {
var $ = cheerio.load(topicHtml, {decodeEntities: false});
return ({
title: $('.sku-name').text().trim()
});
});
totalData.push(topics)
console.log(totalData);
})
topicUrls.forEach(function (e) {
superagent.get(e).end(function (err, res) {
ep.emit('topic_html', res.text);
})
})
})