搜索
首页后端开发php教程使用PHP采集远程图片_PHP教程

使用PHP采集远程图片_PHP教程

Jul 20, 2016 am 11:17 AM
php使用内容图片我们目标网络网页远程采集需要

   当我们需要采集网络上的某个网页内容时,如果目标网站上的图片做了防盗链的话,我们直接采集过来的图片在自己网站上是不可用的。那么我们使用程序将目标网站上的图片下载到我们网站服务器上,然后就可调用图片了。

    本文将使用PHP实现采集远程图片功能。基本流程:     1、获取目标网站图片地址。     2、读取图片内容。     3、创建要保存图片的路径并命名图片名称。     4、写入图片内容。     5、完成。     我们通过写几个函数来实现这一过程。     函数make_dir()建立目录。判断要保存的图片文件目录是否存在,如果不存在则创建目录,并且将目录设置为可写权限。     function make_dir($path){     if(!file_exists($path)){//不存在则建立     $mk=@mkdir($path,0777); //权限     @chmod($path,0777);     }     return true;     }     函数read_filetext()取得图片内容。使用fopen打开图片文件,然后fread读取图片文件内容。     function read_filetext($filepath){     $filepath=trim($filepath);     $htmlfp=@fopen($filepath,"r");     //远程     if(strstr($filepath,"://")){     while($data=@fread($htmlfp,500000)){     $string.=$data;     }     }     //本地     else{     $string=@fread($htmlfp,@filesize($filepath));     }     @fclose($htmlfp);     return $string;     }     函数write_filetext()写文件,将图片内容fputs写入文件中,即保存图片文件。     function write_filetext($filepath,$string){     //$string=stripSlashes($string);     $fp=@fopen($filepath,"w");     @fputs($fp,$string);     @fclose($fp);     }     函数get_filename()获取图片名称,也可以自定义要保存的文件名。     function get_filename($filepath){     $fr=explode("/",$filepath);     $count=count($fr)-1;     return $fr[$count];     }     然后将几个函数组合,在函数save_pic()中调用,最后返回保存后的图片路径。     function save_pic($url,$savepath=''){     //处理地址     $url=trim($url);     $url=str_replace(" ","%20",$url);     //读文件     $string=read_filetext($url);     if(empty($string)){     echo '读取不了文件';exit;     }     //文件名     $filename = get_filename($url);     //存放目录     make_dir($savepath); //建立存放目录     //文件地址     $filepath = $savepath.$filename;     //写文件     write_filetext($filepath,$string);     return $filepath;     }     最后一步就是调用save_pic()函数保存图片,我们使用以下代码做测试。     //目标图片地址     $pic = "/program/UploadPic/2013-4/201343155341353.jpg";     //保存目录     $savepath = "images/";     echo save_pic($pic,$savepath);     实际应用中,我们可能会采集某个站点的内容,比如产品信息,包括采集防盗链的图片保存到网站上服务器上。这时我们可以使用正则匹配页面内容,将页面中相匹配的图片都找出来,然后分别下载到网站服务器上,完成图片的采集。以下代码仅供测试:     function get_pic($cont,$path){     $pattern_src = '//';     $num = preg_match_all($pattern_src, $cont, $match_src);     $pic_arr = $match_src[1]; //获得图片数组     foreach ($pic_arr as $pic_item) { //循环取出每幅图的地址     save_pic($pic_item,$path); //下载并保存图片     echo "[OK]..!";     }     }     然后我们通过分析页面内容,将主体内容找出来,调用get_pic()实现图片的保存。     //我们采集太平洋电脑网上一篇关于手机报道内容页的图片 
$url = "http://gz.pconline.com.cn/321/3215791.html"; 
 
$content = file_get_contents($url);//获取网页内容 
$preg = '#<div>(.*)<div></div>#iUs'; 
preg_match_all($preg, $content, $arr); 
$cont = $arr[1][0];  
get_pic($cont,'img/'); 
 
  以上代码笔者亲测,可以采集图片,但是还有些场景没考虑进去,比如目标网站做了302多次跳转的,目标网站做了多种防采集的,留给喜欢折腾的同学去试试吧。
 
<p align="left"></p>
<div style="display:none;">
<span id="url" itemprop="url">http://www.bkjia.com/PHPjc/371938.html</span><span id="indexUrl" itemprop="indexUrl">www.bkjia.com</span><span id="isOriginal" itemprop="isOriginal">true</span><span id="isBasedOnUrl" itemprop="isBasedOnUrl">http://www.bkjia.com/PHPjc/371938.html</span><span id="genre" itemprop="genre">TechArticle</span><span id="description" itemprop="description">当我们需要采集网络上的某个网页内容时,如果目标网站上的图片做了防盗链的话,我们直接采集过来的图片在自己网站上是不可用的。那...</span>
</div>
</div>
<div class="art_confoot"></div>
声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
您如何防止与会议有关的跨站点脚本(XSS)攻击?您如何防止与会议有关的跨站点脚本(XSS)攻击?Apr 23, 2025 am 12:16 AM

要保护应用免受与会话相关的XSS攻击,需采取以下措施:1.设置HttpOnly和Secure标志保护会话cookie。2.对所有用户输入进行输出编码。3.实施内容安全策略(CSP)限制脚本来源。通过这些策略,可以有效防护会话相关的XSS攻击,确保用户数据安全。

您如何优化PHP会话性能?您如何优化PHP会话性能?Apr 23, 2025 am 12:13 AM

优化PHP会话性能的方法包括:1.延迟会话启动,2.使用数据库存储会话,3.压缩会话数据,4.管理会话生命周期,5.实现会话共享。这些策略能显着提升应用在高并发环境下的效率。

什么是session.gc_maxlifetime配置设置?什么是session.gc_maxlifetime配置设置?Apr 23, 2025 am 12:10 AM

thesession.gc_maxlifetimesettinginphpdeterminesthelifespanofsessiondata,setInSeconds.1)它'sconfiguredinphp.iniorviaini_set().2)abalanceIsiseededeedeedeedeedeedeedto to to avoidperformance andununununununexpectedLogOgouts.3)

您如何在PHP中配置会话名?您如何在PHP中配置会话名?Apr 23, 2025 am 12:08 AM

在PHP中,可以使用session_name()函数配置会话名称。具体步骤如下:1.使用session_name()函数设置会话名称,例如session_name("my_session")。2.在设置会话名称后,调用session_start()启动会话。配置会话名称可以避免多应用间的会话数据冲突,并增强安全性,但需注意会话名称的唯一性、安全性、长度和设置时机。

您应该多久再生一次会话ID?您应该多久再生一次会话ID?Apr 23, 2025 am 12:03 AM

会话ID应在登录时、敏感操作前和每30分钟定期重新生成。1.登录时重新生成会话ID可防会话固定攻击。2.敏感操作前重新生成提高安全性。3.定期重新生成降低长期利用风险,但需权衡用户体验。

如何在PHP中设置会话cookie参数?如何在PHP中设置会话cookie参数?Apr 22, 2025 pm 05:33 PM

在PHP中设置会话cookie参数可以通过session_set_cookie_params()函数实现。1)使用该函数设置参数,如过期时间、路径、域名、安全标志等;2)调用session_start()使参数生效;3)根据需求动态调整参数,如用户登录状态;4)注意设置secure和httponly标志以提升安全性。

在PHP中使用会议的主要目的是什么?在PHP中使用会议的主要目的是什么?Apr 22, 2025 pm 05:25 PM

在PHP中使用会话的主要目的是维护用户在不同页面之间的状态。1)会话通过session_start()函数启动,创建唯一会话ID并存储在用户cookie中。2)会话数据保存在服务器上,允许在不同请求间传递数据,如登录状态和购物车内容。

您如何在子域中分享会议?您如何在子域中分享会议?Apr 22, 2025 pm 05:21 PM

如何在子域名间共享会话?通过设置通用域名的会话cookie实现。1.在服务器端设置会话cookie的域为.example.com。2.选择合适的会话存储方式,如内存、数据库或分布式缓存。3.通过cookie传递会话ID,服务器根据ID检索和更新会话数据。

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热工具

SublimeText3 Linux新版

SublimeText3 Linux新版

SublimeText3 Linux最新版

VSCode Windows 64位 下载

VSCode Windows 64位 下载

微软推出的免费、功能强大的一款IDE编辑器

MinGW - 适用于 Windows 的极简 GNU

MinGW - 适用于 Windows 的极简 GNU

这个项目正在迁移到osdn.net/projects/mingw的过程中,你可以继续在那里关注我们。MinGW:GNU编译器集合(GCC)的本地Windows移植版本,可自由分发的导入库和用于构建本地Windows应用程序的头文件;包括对MSVC运行时的扩展,以支持C99功能。MinGW的所有软件都可以在64位Windows平台上运行。

Dreamweaver Mac版

Dreamweaver Mac版

视觉化网页开发工具

DVWA

DVWA

Damn Vulnerable Web App (DVWA) 是一个PHP/MySQL的Web应用程序,非常容易受到攻击。它的主要目标是成为安全专业人员在合法环境中测试自己的技能和工具的辅助工具,帮助Web开发人员更好地理解保护Web应用程序的过程,并帮助教师/学生在课堂环境中教授/学习Web应用程序安全。DVWA的目标是通过简单直接的界面练习一些最常见的Web漏洞,难度各不相同。请注意,该软件中