python - 爬虫爬取网页后，如何保存网页？

Question

爬虫从 Internet 中爬取众多的网页作为原始网页库存储于本地，然后网页分析器抽取网页中的主题内容交给分词器进行分词，得到的结果用索引器建立正排和倒排索引，这样就得到了索引数据库，用户查询时，在通过分词...

黄舟 · Answer

雷雷

迷茫 · Answer

他这里的意思是抓取到的网页直接以文件的方式存放到本地磁盘

ringa_lee · Answer

可以使用对象存储组件。

PHP中文网 · Answer

推荐大家使用下神箭手云爬虫（ http://www.shenjianshou.cn ），完全在云上编写和执行爬虫，不需要配置任何开发环境，快速开发快速实现。

简单几行 javascript 就可以实现复杂的爬虫，同时提供很多功能函数：反反爬虫、 js 渲染、数据发布、图表分析、反防盗链等，这些在开发爬虫过程中经常会遇到的问题都由神箭手帮你解决。
采集到的数据：
(1)可以选择发布到网站，如wecenterwordpressdiscuzdede帝国等cms系统
(2)也可以发布到数据库
(3)或者导出文件到本地
具体设置都在“数据发布&导出”中

python - 爬虫爬取网页后，如何保存网页？

全部回复(4)我来回复