>백엔드 개발 >PHP 튜토리얼 >PHP 컬렉션 클래스 스누피 예제 소개

PHP 컬렉션 클래스 스누피 예제 소개

小云云
小云云원래의
2018-03-10 13:11:348474검색

Snoopy는 웹 브라우저의 기능을 모방하는 데 사용되는 PHP 클래스로, 웹 콘텐츠를 얻고 양식을 보내는 작업을 완료할 수 있습니다. 공식 웹사이트 http://snoopy.sourceforge.net/

스누피의 일부 기능:

  • 웹 페이지의 콘텐츠 가져오기 fetch()

  • 웹 페이지의 텍스트 콘텐츠 캡처(HTML 태그 제거) fetchtext()

  • 웹 링크 캡처, fetchlinks 양식() fetchform()

  • 프록시 호스트 지원

  • 기본 사용자 이름/비밀번호 확인 지원

  • user_agent, 리퍼러(소스), 쿠키 설정 지원 헤더 콘텐츠(헤더 파일)

  • 브라우저 리디렉션 지원 및 리디렉션 깊이 제어 가능

  • 웹 페이지의 링크를 고품질 URL로 확장 가능(기본값)

  • 데이터 제출 및 반환 값 가져오기

  • HTML 프레임워크 추적 지원

  • 리디렉션 시 쿠키 전달 지원

php4 이상이 필요합니다. PHP 클래스이므로 지원을 확장할 필요가 없습니다. 서버가 컬을 지원하지 않는 경우 최선의 선택입니다.

클래스 메소드

1.fetch($uri)

웹 페이지의 내용을 가져오는 데 사용되는 메소드입니다. $URI 매개변수는 크롤링된 웹페이지의 URL 주소입니다. 가져온 결과는 $this->results에 저장됩니다.

프레임을 스크랩하는 경우 스누피는 각 프레임을 추적하여 배열에 저장한 다음 $this->result에 저장합니다.

  1. <?php  
    $url = "http://www.nowamagic.net/librarys/veda/";  
    include("./Snoopy.class.php");  
    $snoopy = new Snoopy;  
    $snoopy->fetch($url);        //获取所有内容
    echo $snoopy->results;       //显示结果
    ?>

2.fetchtext($URI)

이 방법은 fetch()와 유사하지만 유일한 차이점은 이 방법은 HTML 태그 및 기타 관련 없는 데이터를 제거하고 웹의 텍스트 콘텐츠만 반환한다는 것입니다. 페이지.

  1. <?php  
    $url = "http://www.nowamagic.net/librarys/veda/";  
    include("./Snoopy.class.php");  
    $snoopy = new Snoopy;  
    $snoopy->fetchtext($url);        //获取文本内容
    echo $snoopy->results;       //显示结果
    ?>

3.fetchform($URI)

이 메서드는 fetch()와 유사하지만 유일한 차이점은 이 메서드는 HTML 태그 및 기타 관련 없는 데이터를 제거하고 양식 내용(form)만 반환한다는 것입니다. 웹 페이지에서.

4. fetchlinks($URI)

이 방법은 fetch()와 유사하지만 유일한 차이점은 이 방법은 HTML 태그 및 기타 관련 없는 데이터를 제거하고 웹 페이지의 링크만 반환한다는 것입니다. 기본적으로 상대 링크는 자동으로 완성되고 전체 URL로 변환됩니다.

5. submit($URI,$formvars)

$URL에 지정된 링크 주소로 확인 양식을 보내는 메소드입니다. $formvars는 양식 매개변수를 저장하는 배열입니다.

6. submittext($URI,$formvars)

이 메소드는 submit()과 유사하지만, 유일한 차이점은 이 메소드는 HTML 태그 및 기타 관련 없는 데이터를 제거하고 이후 웹 페이지의 텍스트 내용만 반환한다는 것입니다. 로그인.

7. submitlinks($URI)

이 메소드는 submit()과 유사하지만 유일한 차이점은 이 메소드는 HTML 태그 및 기타 관련 없는 데이터를 제거하고 웹 페이지의 링크만 반환한다는 것입니다. 기본적으로 상대 링크는 자동으로 완성되고 전체 URL로 변환됩니다.

클래스 속성 (기본값은 괄호 안에 있음)

  • $host

  • $port에 연결할 호스트

  • $proxy_host 사용할 프록시 호스트(있는 경우)

  • $ Proxy_port 사용된 프록시 호스트 포트(있는 경우)

  • $agent 사용자 에이전트 위장(Snoopy v0.1)

  • $referer 소스 정보(있는 경우)

  • $cookies 쿠키(있는 경우) If

  • $rawheaders 기타 헤더 정보(있는 경우)

  • $maxredirs 최대 리디렉션 수, 0=허용되지 않음(5)

  • $offsiteok 오프사이트 리디렉션 허용 여부(true)

  • $expandlinks 전체 주소에 대한 모든 링크를 완료할지 여부(true)

  • $user 인증 사용자 이름(있는 경우)

  • $pass 인증 사용자 이름(있는 경우)

  • $accept http 허용 유형( image/gif, image/x-xbitmap, image/jpeg, image/pjpeg, */*)

  • $error 오류가 있는 경우 보고할 위치

  • $ response_code 서버에서 반환된 응답 코드

  • $headers 서버에서 반환된 헤더 정보

  • $maxlength 반환된 최대 데이터 길이

  • $read_timeout 읽기 작업 시간 초과(PHP 4 Beta 4+ 필요), 설정 0은 시간 초과 없음을 의미함

  • $timed_out If 읽기 작업이 시간 초과되면 이 속성은 true를 반환합니다(PHP 4 Beta 4+ 필요)

  • $maxframes 추적이 허용되는 최대 프레임 수

  • $status Catch http 상태 가져오기

  • $temp_dir 웹 서버가

  • $curl_path cURL 바이너리 디렉토리에 쓸 수 있는 임시 파일 디렉토리(/tmp), cURL 바이너리가 없으면 false로 설정

Demo

  1. include "Snoopy.class.php";  
    $snoopy = new Snoopy;  
    $snoopy->proxy_host = "http://www.nowamagic.net/librarys/veda/";  
    $snoopy->proxy_port = "80";  
    $snoopy->agent = "(compatible; MSIE 4.01; MSN 2.5; AOL 4.0; Windows 98)";  
    $snoopy->referer = "http://www.4wei.cn";  
    $snoopy->cookies["SessionID"] = 238472834723489l;  
    $snoopy->cookies["favoriteColor"] = "RED";  
    $snoopy->rawheaders["Pragma"] = "no-cache";  
    $snoopy->maxredirs = 2;  
    $snoopy->offsiteok = false;  
    $snoopy->expandlinks = false;  
    $snoopy->user = "joe";  
    $snoopy->pass = "bloe";  
    if($snoopy->fetchtext("http://www.4wei.cn"))  
    {  
    echo "<PRE>".htmlspecialchars($snoopy->results)."
    n"; } else echo "error fetching document: ".$snoopy->error."n";

Get 지정된 URL 콘텐츠:

  1. <?  
    $url = "http://www.nowamagic.net/librarys/veda/";  
    include("snoopy.php");  
    $snoopy = new Snoopy;  
    $snoopy->fetch($url); //获取所有内容
    echo $snoopy->results; //显示结果
    //可选以下
    //$snoopy->fetchtext //获取文本内容(去掉html代码)
    //$snoopy->fetchlinks //获取链接
    //$snoopy->fetchform  //获取表单
    ?>

양식 제출:

  1. <?php  
    $formvars["username"] = "admin";  
    $formvars["pwd"] = "admin";  
    $action = "http://www.nowamagic.net/librarys/veda/";//表单提交地址  
    $snoopy->submit($action,$formvars);//$formvars为提交的数组
    echo $snoopy->results; //获取表单提交后的 返回的结果
    //可选以下
    $snoopy->submittext; //提交后只返回 去除html的 文本
    $snoopy->submitlinks;//提交后只返回 链接
    ?>

이제 양식이 제출되었으므로 많은 작업을 수행할 수 있습니다. 다음으로 IP와 브라우저를 위장해 보겠습니다.

  1. <?php  
    $formvars["username"] = "admin";  
    $formvars["pwd"] = "admin";  
    $action = "http://www.4wei.cn";  
    include "snoopy.php";  
    $snoopy = new Snoopy;  
    $snoopy->cookies["PHPSESSID"] = &#39;fc106b1918bd522cc863f36890e6fff7&#39;; //伪装sessionid
    $snoopy->agent = "(compatible; MSIE 4.01; MSN 2.5; AOL 4.0; Windows 98)"; //伪装浏览器
    $snoopy->referer = http://www.4wei.cn; //伪装来源页地址 http_referer
    $snoopy->rawheaders["Pragma"] = "no-cache"; //cache 的http头信息
    $snoopy->rawheaders["X_FORWARDED_FOR"] = "127.0.0.101"; //伪装ip
    $snoopy->submit($action,$formvars);  
    echo $snoopy->results;
  2. ?>

原来我们可以伪装session 伪装浏览器 ,伪装ip, haha 可以做很多事情了。例如 带验证码,验证ip 投票, 可以不停的投。

ps:这里伪装ip ,其实是伪装http头,所以一般的通过 REMOTE_ADDR 获取的ip是伪装不了,反而那些通过http头来获取ip的(可以防止代理的那种) 就可以自己来制造ip。

关于如何验证码 ,简单说下:首先用普通的浏览器, 查看页面 , 找到验证码所对应的sessionid,同时记下sessionid和验证码值,接下来就用snoopy去伪造 。

原理:由于是同一个sessionid 所以取得的验证码和第一次输入的是一样的。

有时我们可能需要伪造更多的东西,snoopy完全为我们想到了:

  1. <?php  
    $snoopy->proxy_host = "http://www.nowamagic.net/librarys/veda/";  
    $snoopy->proxy_port = "8080"; //使用代理
    $snoopy->maxredirs = 2; //重定向次数
    $snoopy->expandlinks = true; //是否补全链接 在采集的时候经常用到
    // 例如链接为 /images/taoav.gif 可改为它的全链接 <a href="http://www.4wei.cn/images/taoav.gif">http://www.4wei.cn/images/taoav.gif</a>
    $snoopy->maxframes = 5 //允许的最大框架数
    //注意抓取框架的时候 $snoopy->results 返回的是一个数组
    $snoopy->error //返回报错信息
    ?>

比较完整的示例:

  1. /**
    * You need the snoopy.class.php from 
    * http://snoopy.sourceforge.net/
    */
    include("snoopy.class.php");  
    $snoopy = new Snoopy;  
    // need an proxy?:
    //$snoopy->proxy_host = "my.proxy.host";
    //$snoopy->proxy_port = "8080";
    // set browser and referer:
    $snoopy->agent = "Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1)";  
    $snoopy->referer = "http://www.jonasjohn.de/";  
    // set some cookies:
    $snoopy->cookies["SessionID"] = &#39;238472834723489&#39;;  
    $snoopy->cookies["favoriteColor"] = "blue";  
    // set an raw-header:
    $snoopy->rawheaders["Pragma"] = "no-cache";  
    // set some internal variables:
    $snoopy->maxredirs = 2;  
    $snoopy->offsiteok = false;  
    $snoopy->expandlinks = false;  
    // set username and password (optional)
    //$snoopy->user = "joe";
    //$snoopy->pass = "bloe";
    // fetch the text of the website www.google.com:
    if($snoopy->fetchtext("http://www.google.com")){   
        // other methods: fetch, fetchform, fetchlinks, submittext and submitlinks
        // response code:
        print "response code: ".$snoopy->response_code."<br/>n";  
        // print the headers:
        print "<b>Headers:</b><br/>";  
        while(list($key,$val) = each($snoopy->headers)){  
            print $key.": ".$val."<br/>n";  
        }  
        print "<br/>n";  
        // print the texts of the website:
        print htmlspecialchars($snoopy->results)."n";  
    }  
    else {  
        print "Snoopy: error while fetching document: ".$snoopy->error."n";  
    }

用Snoopy类完成一个简单的图片采集:

  1. <meta http-equiv=&#39;content-type&#39; content=&#39;text/html;charset=utf-8&#39;>  
    <?php      
    include &#39;Snoopy.class.php&#39;;   //加载Snoopy类     
    $snoopy = new Snoopy();       //实例化一个对象
    $sourceURL = "http://www.nowamagic.net/librarys/veda/";    //要抓取的网页  
    $snoopy->fetchlinks($sourceURL);        //获得网页的链接
    $a = $snoopy->results;     //得到网页链接的结果
    $re = "/d+.html$/";     //匹配的正则
    //过滤获取指定的文件地址请求  
    foreach ($a as $tmp) {   
        if (preg_match($re, $tmp)) {  
            $aa=$tmp;          
        }      
    }    
    getImgURL($aa);  
    function getImgURL($siteName)   
    {          
        $snoopy = new Snoopy();          
        $snoopy->fetch($siteName);                  
        $fileContent = $snoopy->results;    //获取过滤后的页面的内容            
        //匹配图片的正则表达式        
        $reTag = "/<img[^s]+src="(http://[^"]+).(jpg|png|gif|jpeg)"[^/]*/>/i";                
        if (preg_match($reTag, $fileContent)) {    
            //过滤图片
            $ret = preg_match_all($reTag, $fileContent, $matchResult);                       
            for ($i = 0, $len = count($matchResult[1]); $i < $len; ++$i)   
            {        
                saveImgURL($matchResult[1][$i], $matchResult[2][$i]);              
            }          
        }      
    }          
    function saveImgURL($name, $suffix) {   
        $url = $name.".".$suffix;                  
        echo "请求的图片地址:".$url."<br/>";                  
        $imgSavePath = "E:/123/images/";  //图片保存地址      
        $imgId =mt_rand(); //产生一个随机的文件名
        if ($suffix == "gif") {   
            //根据图片类型,放入不同的文件夹下面           
            $imgSavePath .= "emotion";          
        }   
        else
        {              
            $imgSavePath .= "topic";          
        }          
        $imgSavePath .= ("/".$imgId.".".$suffix);  //组装要保存的文件名
        if (is_file($imgSavePath)) {     
            //判断文件名是否存在,存在则删除         
            unlink($imgSavePath);              
            echo "<p style=&#39;color:#f00;&#39;>文件".$imgSavePath."已存在,将被删除</p>";          
        }    
        $imgFile = file_get_contents($url); //读取网络文件     
        $flag = file_put_contents($imgSavePath,$imgFile);   //写入到本地 
        if ($flag) {              
            echo "<p>文件".$imgSavePath."保存成功</p>";          
        }      
    }  
    ?>

相关推荐:

php使用snoopy与curl模拟登陆的实例分享

php数据抓取类Snoopy使用

snoopy(强大的PHP采集类) 详细介绍

위 내용은 PHP 컬렉션 클래스 스누피 예제 소개의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

성명:
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.