Scrapy命令行常用命令有哪些?

云婷酱_7199

云婷酱_7199

2026-08-18

515人浏览

原创

scrapy开发需掌握核心命令:scrapy startproject创建项目,scrapy genspider生成爬虫,scrapy list查看爬虫,scrapy shell调试响应,scrapy crawl运行爬虫,scrapy fetch独立抓取,scrapy runspider运行单文件爬虫,scrapy view可视化页面。

scrapy命令行常用命令有哪些? - php中文网

快速上手Scrapy开发,必须掌握命令行中哪些命令能创建项目、调试响应、运行爬虫、检查代码——这些操作不靠IDE点击,全靠终端输入准确指令完成。

创建和进入Scrapy项目

第一步永远是建项目:在任意空目录下执行 scrapy startproject myspider,这会生成 myspider/ 文件夹和 scrapy.cfg 配置文件。注意:项目名必须是合法的 Python 包名,不能含短横线(-)或空格,否则后续 import 会报错。

建好后用 cd myspider 进入项目根目录——所有项目命令(如 crawl、genspider)都要求在此目录或其子目录下运行,否则提示 “no active project”。

在项目内快速生成爬虫文件

方法一:最常用的是 scrapy genspider example quotes.toscrape.com。它会自动在 spiders/ 目录下创建 example.py,并预填 allowed_domains = ['quotes.toscrape.com'] 和 start_urls = ['http://quotes.toscrape.com/']。

方法二:指定模板生成更复杂的爬虫,比如 scrapy genspider -t crawl douban movie.douban.com,这会基于 crawl 模板生成支持 follow 链接的爬虫类,适合全站抓取。

【domain 必须只写域名,不能带 http:// 或 https://】 否则 start_urls 里会拼出 http://http://xxx 的错误地址,导致 DNSLookupError。

Scrapy 2.18.0
Scrapy 2.18.0

Scrapy 2.18.0 官方源码包下载,适合 Python 网页抓取、选择器解析、Item Pipeline 和异步请求调度项目升级。

下载

启动与调试爬虫的三种方式

第一步:查看当前项目有哪些爬虫可用 → 执行 scrapy list,输出每行一个爬虫 name,比如 example、douban。

第二步:本地调试响应结构 → 运行 scrapy shell "https://quotes.toscrape.com",进入交互环境后可直接用 response.css('span.text::text').getall() 测试选择器,无需启动完整爬虫。

第三步:正式运行爬虫 → 执行 scrapy crawl example -o result.json,-o 参数会把 yield 的 item 自动保存为 JSON;若不想看刷屏日志,加 --nolog 即可。

不依赖项目的独立爬取操作

fetch 命令能模拟爬虫下载行为:在任意目录下运行 scrapy fetch --nolog --headers https://httpbin.org/headers,它会输出响应头和响应体,且完全复用 Scrapy 下载器中间件(如 User-Agent、重试逻辑)。

runspider 命令跳过项目约束:写一个独立的 spider.py 文件,里面定义 class MySpider(scrapy.Spider),然后执行 scrapy runspider spider.py —— 这种方式适合临时脚本或教学演示,但无法使用 pipelines、middlewares 等项目级配置。

view 命令用于可视化验证:运行 scrapy view https://example.com,Scrapy 会用默认浏览器打开该 URL 渲染后的页面,效果等同于爬虫拿到的 response.body,对 JS 渲染页面无效。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

4013

9

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

2026.09.22

0

25

Vibeknow在线使用入口合集
Vibeknow在线使用入口合集

本专题汇总了Vibeknow在线创作视频的官方入口及网页版使用教程,涵盖PPT、PDF、Word等文档一键转讲解视频的核心操作,并整理了免费版水印规则与手机端浏览器访问指南,助你快速将知识内容视频化。

2026.09.21

20

20

NumPy随机数文件读写与dtype数据类型
NumPy随机数文件读写与dtype数据类型

本专题整理 NumPy 随机数、文件读写与 dtype 数据类型相关教程,覆盖 Generator/random、随机数种子、正态分布采样、npy/npz/CSV/TXT 保存读取、loadtxt/savetxt、memmap、大文件处理、astype 类型转换、结构化 dtype、整数溢出和精度丢失等场景。

2026.09.21

20

24

NumPy矩阵运算与线性代数计算
NumPy矩阵运算与线性代数计算

本专题整理 NumPy 矩阵运算与线性代数计算相关教程,覆盖矩阵乘法、dot 与 @ 运算符、逆矩阵、行列式、特征值与特征向量、SVD、线性方程组、欧氏距离、矩阵分解和大规模矩阵性能优化等内容,帮助读者掌握 np.linalg 与矩阵计算实战。

2026.09.21

0

20

NumPy广播机制数学运算与统计分析
NumPy广播机制数学运算与统计分析

本专题整理 NumPy 广播机制、数组数学运算与统计分析相关教程,覆盖广播规则、维度对齐、矩阵与数组加减除法、向量化计算、均值方差、分位数、中位数、直方图和 unique 频次统计等场景,帮助读者掌握 ndarray 高效计算与统计处理方法。

2026.09.21

0

17

NumPy数组创建索引切片与数据选择
NumPy数组创建索引切片与数据选择

本专题整理 NumPy 数组创建、索引、切片与数据选择相关教程,覆盖 np.array、zeros/ones、多维数组形状、基础切片、花式索引、布尔索引、条件筛选、视图与副本等常用场景,帮助读者系统掌握 ndarray 数据构造与高效提取方法。

2026.09.21

0

12

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

40

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

20

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Scrapy 官方文档与教程
Scrapy 官方文档与教程

共0课时 | 0人学习

Python Scrapy 网络爬虫实战视频教程
Python Scrapy 网络爬虫实战视频教程

共16课时 | 5.9万人学习