javascript - 怎么使用CasperJs抓取网页？

Question

在知乎上看到有个php爬虫的思路是这样写的： pcntl_fork或者swoole_process实现多进程并发。按照每个网页抓取耗时500ms，开200个进程，可以实现每秒400个页面的抓取。 curl实现页面抓取，设置cookie可以实现模拟...

阿神 · Answer

你可以看它的文档。这里有例子http://docs.casperjs.org/en/latest/quickstart.html

简单讲casperjs是基于phantomjs的script，模拟浏览器的意思是它不需要浏览器来渲染页面，但是也可以来navigate, 对DOM进行操作什么的