ThinkPHP6.x 内容采集:编写采集规则自动抓取并清洗第三方资讯数据

千晨同学_8103

千晨同学_8103

2026-06-05

231人浏览

原创

thinkphp6.x可通过集成guzzle和domcrawler等第三方库实现结构化网页采集与清洗。需配置采集规则、编写命令行指令、执行字段清洗、去重入库,并注意反爬策略、编码处理及安全过滤。

thinkphp6.x 内容采集:编写采集规则自动抓取并清洗第三方资讯数据

ThinkPHP6.x 本身不内置采集功能,但可以借助第三方 HTTP 客户端(如 guzzlehttp/guzzle)和 HTML 解析库(如 symfony/dom-crawler 或 sunra/php-simple-html-dom-parser),结合 TP6 的命令行指令、模型和数据库操作,实现结构化内容采集与清洗。

一、环境准备与依赖安装

在 ThinkPHP6 项目根目录执行:

composer require guzzlehttp/guzzle
composer require symfony/dom-crawler
composer require symfony/css-selector

若需处理编码乱码或简单 DOM 操作,也可选装:

composer require sunra/php-simple-html-dom-parser

注意:TP6 默认使用 PHP 7.2+,确保扩展兼容;部分目标站点含反爬机制,建议配置 User-Agent、Referer 和延迟请求。

二、定义采集规则配置(可存数据库或 YAML/JSON 文件)

采集规则应包含:目标 URL、选择器(CSS 或 XPath)、字段映射、清洗规则(如去空格、过滤 script 标签、截取摘要)、发布时间正则提取等。例如:

ThinkPHP5.1企业站点快速开发-源码课件
ThinkPHP5.1企业站点快速开发-源码课件

ThinkPHP5.1企业站点快速开发

下载
[
  "site" => "example-news",
  "url" => "https://example.com/news/list?page={page}",
  "list_selector" => ".news-item",
  "fields" => [
    "title" => "h2 a|text",
    "url" => "h2 a|attr:href",
    "summary" => ".intro|text|strip_tags|trim",
    "pubtime" => ".date|text|regex:/\d{4}-\d{2}-\d{2}/"
  ],
  "page_range" => [1, 3],
  "delay_ms" => 800
]

说明:| 表示管道式处理,支持链式清洗;规则可动态加载,便于多站点管理。

三、编写命令行采集指令(推荐)

运行:php think make:command CollectNews,然后在 app/command/CollectNews.php 中编写:

  • 使用 GuzzleHttp\Client 请求页面,自动处理重定向和 gzip
  • 用 Symfony\Component\DomCrawler\Crawler 解析 HTML,按规则提取节点
  • 对每个字段执行清洗逻辑(如 strip_tags()、mb_substr()、正则替换联系方式或广告语)
  • 检查重复(如通过源 URL 哈希去重),调用模型 NewsModel::updateOrCreate() 写入
  • 记录日志(think\Log::record())和异常捕获,避免单条失败中断整体流程

四、清洗与防重关键实践

清洗不只是去标签,更需业务适配:

  • 正文图片路径补全:将 src="/uploads/1.jpg" 转为完整 URL https://example.com/uploads/1.jpg
  • 时间标准化:把 “3小时前”、“昨天”、“2024年5月6日” 统一转为 Y-m-d H:i:s 格式
  • 敏感词过滤:加载本地词库,用 str_replace() 或正则批量替换
  • 标题/摘要去重:入库前用 md5($source_url) 或 sha1($title . $content) 生成唯一键
  • 内容安全:禁用 eval、javascript:、onerror= 等潜在 XSS 片段

清洗逻辑建议封装成独立服务类(如 app/service/ContentCleaner.php),便于复用和单元测试。

不复杂但容易忽略:采集频率需遵守 robots.txt,生产环境加 Redis 分布式锁防并发重复采集,重要数据建议保留原始 HTML 片段作审计备份。

php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!

相关文章

PHP速学教程(入门到精通)
PHP速学教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

thinkphp thinkphp6.x版本

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
php文件怎么打开
php文件怎么打开

打开php文件步骤:1、选择文本编辑器;2、在选择的文本编辑器中,创建一个新的文件,并将其保存为.php文件;3、在创建的PHP文件中,编写PHP代码;4、要在本地计算机上运行PHP文件,需要设置一个服务器环境;5、安装服务器环境后,需要将PHP文件放入服务器目录中;6、一旦将PHP文件放入服务器目录中,就可以通过浏览器来运行它。

2023.09.01

10244

6

php怎么取出数组的前几个元素
php怎么取出数组的前几个元素

取出php数组的前几个元素的方法有使用array_slice()函数、使用array_splice()函数、使用循环遍历、使用array_slice()函数和array_values()函数等。本专题为大家提供php数组相关的文章、下载、课程内容,供大家免费下载体验。

2023.10.11

6041

5

php反序列化失败怎么办
php反序列化失败怎么办

php反序列化失败的解决办法检查序列化数据。检查类定义、检查错误日志、更新PHP版本和应用安全措施等。本专题为大家提供php反序列化相关的文章、下载、课程内容,供大家免费下载体验。

2023.10.11

2095

5

php怎么连接mssql数据库
php怎么连接mssql数据库

连接方法:1、通过mssql_系列函数;2、通过sqlsrv_系列函数;3、通过odbc方式连接;4、通过PDO方式;5、通过COM方式连接。想了解php怎么连接mssql数据库的详细内容,可以访问下面的文章。

2023.10.23

3808

4

php连接mssql数据库的方法
php连接mssql数据库的方法

php连接mssql数据库的方法有使用PHP的MSSQL扩展、使用PDO等。想了解更多php连接mssql数据库相关内容,可以阅读本专题下面的文章。

2023.10.23

4494

6

html怎么上传
html怎么上传

html通过使用HTML表单、JavaScript和PHP上传。更多关于html的问题详细请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.03

3531

9

PHP出现乱码怎么解决
PHP出现乱码怎么解决

PHP出现乱码可以通过修改PHP文件头部的字符编码设置、检查PHP文件的编码格式、检查数据库连接设置和检查HTML页面的字符编码设置来解决。更多关于php乱码的问题详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.09

5037

8

php文件怎么在手机上打开
php文件怎么在手机上打开

php文件在手机上打开需要在手机上搭建一个能够运行php的服务器环境,并将php文件上传到服务器上。再在手机上的浏览器中输入服务器的IP地址或域名,加上php文件的路径,即可打开php文件并查看其内容。更多关于php相关问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.13

3942

8

sprintf函数用法详解
sprintf函数用法详解

sprintf函数的用法:1、格式化字符串;2、指定输出宽度和精度;3、返回值。更多关于sprintf函数用法详解的内容,大家可以阅读下面的文章。

2023.11.27

11902

4

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程