搜尋
首頁後端開發php教程3種PHP實現資料擷取的方法

3種PHP實現資料擷取的方法

Mar 10, 2018 pm 01:22 PM
php數據採集方法

什麼叫採集?就是使用PHP程序,把其他網站的資訊抓取到我們自己的資料庫中、網站中。本文主要和大家分享的是3種PHP實現資料收集的方法,希望能幫助大家。

PHP製作採集的技術:

從底層的socket到高層的檔案操作函數,一共有3種方法可以實現採集。

1. 使用socket技術收集:

socket採集是最底層的,它只是建立了一個長連接,然後我們要自己建構http協定字串去發送請求。

  1. <?php  
    //连接,$error错误编号,$errstr错误的字符串,30s是连接超时时间
    $fp=fsockopen("www.youku.com",80,$errno,$errstr,30);  
    if(!$fp) die("连接失败".$errstr);  
    //构造http协议字符串,因为socket编程是最底层的,它还没有使用http协议
    $http="GET /?spm=a2hww.20023042.topNav.5~1~3!2~A HTTP/1.1\r\n";   //  \r\n表示前面的是一个命令
    $http.="Host:www.youku.com\r\n";  //请求的主机
    $http.="Connection:close\r\n\r\n";   // 连接关闭,最后一行要两个\r\n
    //发送这个字符串到服务器
    fwrite($fp,$http,strlen($http));  
    //接收服务器返回的数据
    $data=&#39;&#39;;  
    while (!feof($fp)) {  
    $data.=fread($fp,4096);  //fread读取返回的数据,一次读取4096字节
    }  
    //关闭连接
    fclose($fp);  
    var_dump($data);  
    ?>

列印出的結果如下,包含了傳回的頭資訊及頁面的原始碼:

 

2. 使用curl_一套函數

curl把HTTP協定都封裝成了很多函數,直接傳送對應參數即可,降低了編寫HTTP協定字串的難度。

前提:在php.ini中要開啟curl擴充。

  1. //生成一个curl对象
    $curl=curl_init();  
    //设置URL和相应的选项
    curl_setopt($curl, CURLOPT_URL, "http://www.youku.com");  
    curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);  //将curl_exec()获取的信息以字符串返回,而不是直接输出。
    //执行curl操作
    $data=curl_exec($curl);  
    var_dump($data);

列印出的結果如下,只包含頁面的原始碼:

3. 直接使用file_get_contents(最頂層的)

#」前提:在php.ini中設定允許開啟一個網路的url位址。

 

[php] view plain copy

  1. //使用file_get_contents()
    $data=file_get_contents("http://www.youku.com");  
    var_dump($data);


#3種方式的選擇

網路之間通訊主要使用的是上述三種。其中後兩種用的較多:如果要批量採集大量的資料時使用第二種【CURL】,效能好、穩定。

偶爾發幾個請求發送的頻繁不密集時使用第三種。

擴充:圖片的防盜鏈如何破?

例如7060網站上的圖片做了防盜鏈:在他的網站中可以看到圖片,把圖片拿到站外就無法訪問。

 

原則:在HTTP協定中有一個referer項,代表發這個請求的來源位址,伺服器會判斷如果這個請求不是這個網站發來的就會過濾掉這個請求:

 

解決方法:發HTTP時自己模擬referer即可:

 

# 擴充功能:有些要擷取資料時必須先登錄,可以使用模擬的試模擬登入狀態下的採集:

a. 先用瀏覽登入一下,登入完,瀏覽器的COOKIE中就會有SESSIONID

b . 發PHP發HTTP協定時,把瀏覽器中的SESSIONID放到PHP的HTTP協定請求裡,這樣就在以登入的狀態發請求。

總結:所有客戶端發過來的資料都可以被模擬,所以伺服器上的程式必須要必要的地方過濾客戶端的資料。

什麼時候用以上東西?介面開發時、採集時。

二、資料收集

例如我要收集這個url裡的所有美國電影的資訊,

#則先要知道電影所在的節點的結構,我們使用firebug來查看。

 

然後開始寫入程式碼:完整程式碼如下

  1. /**
     * 发一个GET请求获取数据
     */
    function get($url)  
    {  
       global $curl;  
       // 配置curl中的http协议->可配置的荐可以查PHP手册中的curl_
       curl_setopt($curl, CURLOPT_URL, $url);  
       curl_setopt($curl, CURLOPT_RETURNTRANSFER, TRUE);  
       curl_setopt($curl, CURLOPT_HEADER, FALSE);  
       // 执行这个请求
       return curl_exec($curl);  
    }  
    // 生成一个curl对象
    $curl = curl_init();  
    $url=&#39;http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html&#39;;  
    $data=get($url);  
    // 匹配电影所在位置
    $list_preg = &#39;/<li class="yk-col4 mr1">.+<\/li>/Us&#39;;  
    // 匹配img标签上的src和alt
    $img_preg = &#39;/<img class="quic lazy"  src="/static/imghwm/default1.png"  data-src="(.*)"   _  alt="(.*)" \/>/U&#39;;  
    //匹配电影的url
    $video_preg=&#39;/<a href="(.*)" title="(.*)" target="(.*)"><\/a>/U&#39;;  
    //把所有的li存到$list里,$list是个二维数组
    preg_match_all($list_preg,$data,$list);  
       //var_dump($list);
    foreach ($list[0] as $k => $v) {   //这里$v就是每一个li标签
    /* 获取图片及电影名称
        preg_match($img_preg,$v,$img);  //把匹配到的图片的信息存到$img里
        var_dump($img);
        */
        /*获取电影地址
        preg_match($video_preg,$v,$video);  //把匹配到的电影的信息存到$video里
        var_dump($video);
    */
        preg_match($img_preg,$v,$img);  
        preg_match($video_preg,$v,$video);  
        echo $img[0].&#39;<a href="&#39;.$video[1].&#39;">&#39;.$video[2].&#39;</a>&#39;;  
    }

测试:

打印$list;

 

打印$img

 

打印$video

 

 

最终效果:

 

如果需要把图片拷贝到硬盘上,则在foreach循环里加上以下代码:

  1. $imgData = get($img[1]);  
       // 把图片文件写到硬盘上【下载】
       // 因为操作系统是GBK的,所以要把UTF8转成GBK
       is_dir(&#39;./youkuimg/&#39;) ? &#39;&#39;: mkdir(&#39;./youkuimg/&#39;);  
    file_put_contents(&#39;./youkuimg/&#39;.mb_convert_encoding($img[3], &#39;gbk&#39;, &#39;utf-8&#39;).&#39;.jpg&#39;, $imgData);


 

效果如下:在当前目录下的youkuimg目录下就会有下载好的图片。


相关推荐:

php获取(curl) 带有cookie的网页数据采集方法

php 一个数据采集类实例代码

PHP实现数据采集的三种方法

以上是3種PHP實現資料擷取的方法的詳細內容。更多資訊請關注PHP中文網其他相關文章!

陳述
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn
超越炒作:評估當今PHP的角色超越炒作:評估當今PHP的角色Apr 12, 2025 am 12:17 AM

PHP在現代編程中仍然是一個強大且廣泛使用的工具,尤其在web開發領域。 1)PHP易用且與數據庫集成無縫,是許多開發者的首選。 2)它支持動態內容生成和麵向對象編程,適合快速創建和維護網站。 3)PHP的性能可以通過緩存和優化數據庫查詢來提升,其廣泛的社區和豐富生態系統使其在當今技術棧中仍具重要地位。

PHP中的弱參考是什麼?什麼時候有用?PHP中的弱參考是什麼?什麼時候有用?Apr 12, 2025 am 12:13 AM

在PHP中,弱引用是通過WeakReference類實現的,不會阻止垃圾回收器回收對象。弱引用適用於緩存系統和事件監聽器等場景,需注意其不能保證對象存活,且垃圾回收可能延遲。

解釋PHP中的__ Invoke Magic方法。解釋PHP中的__ Invoke Magic方法。Apr 12, 2025 am 12:07 AM

\_\_invoke方法允許對象像函數一樣被調用。 1.定義\_\_invoke方法使對象可被調用。 2.使用$obj(...)語法時,PHP會執行\_\_invoke方法。 3.適用於日誌記錄和計算器等場景,提高代碼靈活性和可讀性。

解釋PHP 8.1中的纖維以進行並發。解釋PHP 8.1中的纖維以進行並發。Apr 12, 2025 am 12:05 AM

Fibers在PHP8.1中引入,提升了並發處理能力。 1)Fibers是一種輕量級的並發模型,類似於協程。 2)它們允許開發者手動控制任務的執行流,適合處理I/O密集型任務。 3)使用Fibers可以編寫更高效、響應性更強的代碼。

PHP社區:資源,支持和發展PHP社區:資源,支持和發展Apr 12, 2025 am 12:04 AM

PHP社區提供了豐富的資源和支持,幫助開發者成長。 1)資源包括官方文檔、教程、博客和開源項目如Laravel和Symfony。 2)支持可以通過StackOverflow、Reddit和Slack頻道獲得。 3)開發動態可以通過關注RFC了解。 4)融入社區可以通過積極參與、貢獻代碼和學習分享來實現。

PHP與Python:了解差異PHP與Python:了解差異Apr 11, 2025 am 12:15 AM

PHP和Python各有優勢,選擇應基於項目需求。 1.PHP適合web開發,語法簡單,執行效率高。 2.Python適用於數據科學和機器學習,語法簡潔,庫豐富。

php:死亡還是簡單地適應?php:死亡還是簡單地適應?Apr 11, 2025 am 12:13 AM

PHP不是在消亡,而是在不斷適應和進化。 1)PHP從1994年起經歷多次版本迭代,適應新技術趨勢。 2)目前廣泛應用於電子商務、內容管理系統等領域。 3)PHP8引入JIT編譯器等功能,提升性能和現代化。 4)使用OPcache和遵循PSR-12標準可優化性能和代碼質量。

PHP的未來:改編和創新PHP的未來:改編和創新Apr 11, 2025 am 12:01 AM

PHP的未來將通過適應新技術趨勢和引入創新特性來實現:1)適應云計算、容器化和微服務架構,支持Docker和Kubernetes;2)引入JIT編譯器和枚舉類型,提升性能和數據處理效率;3)持續優化性能和推廣最佳實踐。

See all articles

熱AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

Undress AI Tool

免費脫衣圖片

Clothoff.io

Clothoff.io

AI脫衣器

AI Hentai Generator

AI Hentai Generator

免費產生 AI 無盡。

熱門文章

R.E.P.O.能量晶體解釋及其做什麼(黃色晶體)
3 週前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.最佳圖形設置
3 週前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.如果您聽不到任何人,如何修復音頻
3 週前By尊渡假赌尊渡假赌尊渡假赌
WWE 2K25:如何解鎖Myrise中的所有內容
3 週前By尊渡假赌尊渡假赌尊渡假赌

熱工具

mPDF

mPDF

mPDF是一個PHP庫,可以從UTF-8編碼的HTML產生PDF檔案。原作者Ian Back編寫mPDF以從他的網站上「即時」輸出PDF文件,並處理不同的語言。與原始腳本如HTML2FPDF相比,它的速度較慢,並且在使用Unicode字體時產生的檔案較大,但支援CSS樣式等,並進行了大量增強。支援幾乎所有語言,包括RTL(阿拉伯語和希伯來語)和CJK(中日韓)。支援嵌套的區塊級元素(如P、DIV),

DVWA

DVWA

Damn Vulnerable Web App (DVWA) 是一個PHP/MySQL的Web應用程序,非常容易受到攻擊。它的主要目標是成為安全專業人員在合法環境中測試自己的技能和工具的輔助工具,幫助Web開發人員更好地理解保護網路應用程式的過程,並幫助教師/學生在課堂環境中教授/學習Web應用程式安全性。 DVWA的目標是透過簡單直接的介面練習一些最常見的Web漏洞,難度各不相同。請注意,該軟體中

SecLists

SecLists

SecLists是最終安全測試人員的伙伴。它是一個包含各種類型清單的集合,這些清單在安全評估過程中經常使用,而且都在一個地方。 SecLists透過方便地提供安全測試人員可能需要的所有列表,幫助提高安全測試的效率和生產力。清單類型包括使用者名稱、密碼、URL、模糊測試有效載荷、敏感資料模式、Web shell等等。測試人員只需將此儲存庫拉到新的測試機上,他就可以存取所需的每種類型的清單。

記事本++7.3.1

記事本++7.3.1

好用且免費的程式碼編輯器

MinGW - Minimalist GNU for Windows

MinGW - Minimalist GNU for Windows

這個專案正在遷移到osdn.net/projects/mingw的過程中,你可以繼續在那裡關注我們。 MinGW:GNU編譯器集合(GCC)的本機Windows移植版本,可自由分發的導入函式庫和用於建置本機Windows應用程式的頭檔;包括對MSVC執行時間的擴展,以支援C99功能。 MinGW的所有軟體都可以在64位元Windows平台上運作。