PHP批量采集下载美女图片的实现代码

首頁

後端開發

php教程

PHP批量采集下载美女图片的实现代码_PHP

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 01, 2016 pm 12:07 PM

圖片

设计思路

考虑到单纯的采集一个网页的图片，太麻烦，所以直接采集他的列表页，获取列表的url然后在一一采集，但是用php匹配列表页的url太麻烦，第一列表页有很多无效url这对我这个正则小菜鸟实在是个问题，看了一下列表页的结构，果断采用jquery获取url，jquery的万能选择器又再次强大起来了。

jquery获取url，然后ajax传递url—>对应PHP文件，遍历url参数—->单页面采集保存图片

jquery程序
复制代码代码如下:

<script> $(document).ready(function(){ var hrefs =''; $('.f_folder>a').each(function(i){ var href = $('.f_folder:eq('+i+')>a:eq(0)').attr('href'); if(href!='undefined'){ hrefs +=href+','; } }) $.getJSON("http://www.****.com/365/getimg.php?hrefs="+hrefs+"&callback=?", function(data){ //alert(data.info); }); }); </script>

这里把url拼接成‘，'分割的字符串传递url，使用getjson是为了跨域需要，关于getjson常见的几个问题可以参看

PHP采集程序
复制代码代码如下:
// 抓起365图片
error_reporting(E_ALL ^ E_NOTICE);
set_time_limit(0);//设置PHP超时时间
/**
* 得到当前时间
*/
function getMicrotime() {

list ($usec, $sec) = explode(" ", microtime());
return ((float) $usec + (float) $sec);
}
$stime = getMicrotime();

$callback = $_GET['callback'];
$hrefs = $_GET['hrefs'];
$urlarray = explode(',',$hrefs);

//获取指定url的所有图片
function getimgs($url){
$dirname = basename($url,".php");
if(!file_exists($dirname)){
mkdir('365/'.$dirname.'');
}
clearstatcache();
$data = file_get_contents($url);
preg_match_all("/(href|src)=(["|']?)([^ "'>]+.(jpg|png|PNG|JPG|gif))\2/i", $data, $matches);
//$matches[3] = array_unique($matches[3]);
unset($data);
$i=0;

if(count($matches[3])>0){
foreach($matches[3] as $k=>$v){
//简单判断是否是标准url，而不是相对路径
if(substr($v,0,4)=='http'){

$ext = pathinfo($v,PATHINFO_EXTENSION);//图片扩展

if(!file_exists('365/'.$dirname.'/'.$k.'.'.$ext)){
file_put_contents('365/'.$dirname.'/'.$k.'.'.$ext,file_get_contents($v));
$i++;
}else{
unset($v);
}
clearstatcache();
}else{
unset($v);
}
}
unset($matches);
return $i;
}
}

foreach($urlarray as $k=>$v){
if($v!=''){
$j +=getimgs($v);
}
}
$etime = getMicrotime();
echo "合计采集了".$j."张图片";
echo "用时".($etime-$stime)."秒";

考虑到性能问题：在getimgs方法中所用的变量都是使用后便注销（unset）了，以便释放内存。

设计到的几个知识点

判断是否是标准有效图片url
if(substr($v,0,4)=='http')这个只是简单的判断一下匹配到的图片url是否是标准的url，因为采集的图片可能是相对路径的，这里我直接放弃这种图片的采集，当然你也可以把这种图片还原成标准图片路径，还有一个问题就是即使是标准url格式，这样的图片也未必可以采集，因为你不知道这个图片是否还有，也许这个图片url已经无效了，如果你想更严格的判断这个图片url是否真实有效可以推荐看我之前的《PHP判断远程url是否有效的几种方法》有三种方法可以验证是否是有效url。

获取图片格式

$ext = pathinfo($v,PATHINFO_EXTENSION);//图片扩展

这里使用了pathinfo的方法，总结有7种方法可以获取到文件的格式，推荐文章：《PHP判断图片格式的七种方法》

下载保存到本地

file_put_contents('365/'.$dirname.'/'.$k.'.'.$ext,file_get_contents($v));
file_put_contents() 函数把一个字符串写入文件中。
与依次调用 fopen()，fwrite() 以及 fclose() 功能一样。
file_get_contents() 函数把整个文件读入一个字符串中。

因为服务器支持file_get_contents，如果服务器把这个函数禁用了，可以使用curl，这个工具要比file_get_contents更加强大，推荐学习《CURL的学习和应用(附多线程)》，可以使用curl的多线程下载存储，效果更牛逼

清除文件操作缓存

clearstatcache() 函数清除文件状态缓存。clearstatcache() 函数会缓存某些函数的返回信息，以便提供更高的性能。但是有时候，比如在一个脚本中多次检查同一个文件，而该文件在此脚本执行期间有被删除或修改的危险时，你需要清除文件状态缓存，以便获得正确的结果。要做到这一点，就需要使用 clearstatcache() 函数。官方手册：

程序执行时间计算

复制代码代码如下:
/**

* 得到当前时间

*/

function getMicrotime() {
list ($usec, $sec) = explode(" ", microtime());
return ((float) $usec + (float) $sec);
}

可以参考本博客文章；《获取php页面执行时间，数据库读写次数，函数调用次数等【THINKPHP】》

最后看一下效果；

PHP批量采集下载美女图片的实现代码_PHP

409秒采集了214张图片，大概2秒下载保存了一张图片，图片总大小约62M，这样看来：

一个小时60*60可以大约下载1800张美女图片。

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

超简单！用 Python 为图片和 PDF 去掉水印Apr 12, 2023 pm 11:43 PM

网上下载的 pdf 学习资料有一些会带有水印，非常影响阅读。比如下面的图片就是在 pdf 文件上截取出来的，今天我们就来用Python解决这个问题。安装模块PIL：Python Imaging Library 是 python 上非常强大的图像处理标准库，但是只能支持 python 2.7，于是就有志愿者在 PIL 的基础上创建了支持 python 3的 pillow，并加入了一些新的特性。pip install pillow pymupdf 可以用 python 访问扩展名为*.pdf、

如何使用 Vue 实现图片预加载？Jun 25, 2023 am 11:01 AM

在网页开发中，图片预载是一种常见的技术，可以提升用户的体验感。当用户浏览网页时，图片可以提前下载并加载，减少图片加载时的等待时间。在Vue框架中，我们可以通过一些简单的方法来实现图片预载。本文将介绍Vue中的图片预载技术，包括预载的原理、实现的方法和使用注意事项。一、预载的原理首先，我们来了解一下图片预载的原理。传统的图片加载方式是等到图片全部下载完成才显示

PHP和GD库实现图片裁剪的方法Jul 14, 2023 am 08:57 AM

PHP和GD库实现图片裁剪的方法概述：图片裁剪是网页开发中常见的需求之一，它可以用于调整图片的尺寸，剪裁不需要的部分，以适应不同的页面布局和展示需求。在PHP开发中，我们可以借助GD库来实现图片裁剪的功能。GD库是一个强大的图形库，可提供一系列函数来处理和操控图像。代码示例：下面我们将详细介绍如何使用PHP和GD库来实现图片裁剪。首先，确保你的PHP环境已经

如何在uniapp中实现图片滤镜效果Jul 04, 2023 am 11:05 AM

如何在uniapp中实现图片滤镜效果在移动应用开发中，图片滤镜效果是一种常见且受用户喜爱的功能之一。而在uniapp中，实现图片滤镜效果也并不复杂。本文将为大家介绍如何通过uniapp实现图片滤镜效果，并附上相关代码示例。导入图片首先，我们需要在uniapp项目中导入一张图片，以供后续滤镜效果的处理。可以在项目的资源文件夹中放置一张命名为“filter.jp

vue报错找不到图片怎么办Nov 19, 2022 pm 05:01 PM

vue报错找不到图片的解决办法：1、修改配置文件，将绝对路径改为相对路径；2、将图片作为模块加载进去，并将图片放到static目录下；3、将imageUrls引入响应的vue文件中，解析引用即可。

AI去除马赛克，可还行？Apr 09, 2023 pm 07:11 PM

哈喽，大家好。你有没有想过用 AI 技术去除马赛克？仔细想想这个问题还挺难的，因为我们之前使用的 AI 技术，不管是人脸识别还是OCR识别，起码人工能识别出来。但如果给你一张打上马赛克的图片，你能把它复原吗？显然是很难的。如果人都无法复原，又怎能教会计算机去复原呢？还记得前几天我写的一篇《用AI生成头像》文章吗。在那篇文章中，我们训练了一个DCGAN模型，它可以从任意随机数生成一个图像。随机数作为像素生成的噪声图模型从随机数生成正常头像DCGAN包含生成器模型和判别器模型两个模型组成，生成

PS AI修图免费平替来了！Stability AI又放大招，核弹级更新一键扩图Jun 12, 2023 pm 07:27 PM

此前，PS的重建图像功能就让人无比振奋，让无数人惊呼今天，StabilityAI又放大招了。它联合Clipdrop推出了UncropClipdrop——一个终极图像比例编辑器。从Uncrop这个名字上，我们就能看出它的用途。它是一个AI生成的「外画」工具，通过创建扩展背景，这个工具可以补充任何现有照片或图像，来更改任何图像的比例。敲黑板：通过Clipdrop网站，就可以免费试用这个工具了，无需登录！比例任意调，满意为止Uncrop基于StabilityAI的文本到图像模型StableDiffus

如何通过Vue实现图片的排列和堆叠效果？Aug 17, 2023 am 08:07 AM

如何通过Vue实现图片的排列和堆叠效果？在网页设计中，图片的排列和堆叠效果常被用于展示产品、展览图片或者设计画廊等。Vue是一款流行的前端框架，它提供了很多方便易用的工具，可以帮助我们实现图片的排列和堆叠效果。本文将介绍如何通过Vue实现这些效果，并提供相应的代码示例。首先，我们需要引入Vue的开发环境。可以通过以下方式引入Vue：<scriptsr

See all articles