Maison  >  Article  >  développement back-end  >  PHP 简易爬虫

PHP 简易爬虫

WBOY
WBOYoriginal
2016-07-25 09:08:501017parcourir
  1. function get_urls($url)
  2. {
  3. $url_array=array();
  4. $the_first_content=file_get_contents($url);
  5. $the_second_content=file_get_contents($url);
  6. $pattern1 = "/http:\/\/[a-zA-Z0-9\.\?\/\-\=\&\:\+\-\_\'\"]+/";
  7. $pattern2="/http:\/\/[a-zA-Z0-9\.]+/";
  8. preg_match_all($pattern2, $the_second_content, $matches2);
  9. preg_match_all($pattern1, $the_first_content, $matches1);
  10. $new_array1=array_unique($matches1[0]);
  11. $new_array2=array_unique($matches2[0]);
  12. $final_array=array_merge($new_array1,$new_array2);
  13. $final_array=array_unique($final_array);
  14. for($i=0;$i {
  15. echo $final_array[$i]."
    ";
  16. }
  17. }
  18. get_urls("http://www.baidu.com");
复制代码


Déclaration:
Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn
Article précédent:PHP subistr 截取字符串无码 Article suivant:页面图片处理