cari
Rumahpembangunan bahagian belakangtutorial phpPHP中怎样实现文章采集_PHP教程
PHP中怎样实现文章采集_PHP教程Jul 13, 2016 pm 05:40 PM
phpBawahmemperkenalkantanahbagaimanacapaibagaimanasayaPengumpulan dataartikelyabiasagunadaripadaMudahungkapankoleksi

  数据采集,大部分是用正则表达式,我简单地介绍下如何实现采集的思路.这里说的是php的实现.一般是本机运行,放到空间上是不明智的,因为不但很耗资源还需要支持远程抓取函数,比如file_get_contents($urls)file($url)等.

  1,文章列表页面的自动切换,以及文章路径的获得.

  2,获得:标题,内容

  3,入库

  4,问题

  1,文章列表页面的自动切换,以及文章路径的获得.

  a,列表页面的自动切换一般依赖动态页面来实现.比如

  http://www.phpfirst.com/foru ... d=1&page=$i

  可以在后面利用$i的自动增加或范围来实现,比如$i++;

  也可以像penzi演示的那个一样,要从第几页到第几页,代码方面控制$i的范围就可以.

  b,文章路径的获得分需要填正则和无需填正则2种:

  1)无需填正则就是获得上面的文章列表页面的所有连接

  但是最好对连接进行过滤,处理---判断重复连接,只留一个,处理相对路径,变成绝对路径.比如../ 和./等.

  以下是我写的乱七八糟的实现函数:

  PHP:

  --------------------------------------------------------------------------------

  

  //$e=clinchgeturl("http://phpfirst.com/forumdisplay.php?fid=1");

  //var_dump($e);

  function clinchgeturl($url)

  {

  //$url="http://127.0.0.1/1.htm";

  //$rootpath="http://fsrootpathfsfsf/yyyyyy/";

  //var_dump($rrr);

  if(eregi((.)*[.](.)*,$url)){

  $roopath=split("/",$url);

  $rootpath="http://".$roopath[2]."/";

  $nnn=count($roopath)-1;for($yu=3;$yu

  // var_dump($rootpath); //http: ,,127.0.0.1,xnml,index.php

  }

  else{$rootpath=$url; //var_dump($rootpath);

  }

  if(isset($url)){

  echo "$url 有下列裢接:
";

  $fcontents = file($url);

  while(list(,$line)=each($fcontents)){

  while(eregi((href[[:space:]]*=[[:space:]]*"?[[:alnum:]:@/._-]+[?]?[^"]*"?),$line,$regs)){

  //$regs[1] = eregi_replace((href[[:space:]]*=[[:space:]]*"?)([[:alnum:]:@/._-]+)("?),"\2",$regs[1]);

  $regs[1] = eregi_replace((href[[:space:]]*=[[:space:]]*["]?)([[:alnum:]:@/._-]+[?]?[^"]*)(.*)[^"/]*(["]?),"\2",$regs[1]);

  if(!eregi(^http://,$regs[1])){

  if(eregi(^..,$regs[1])){

  // $roopath=eregi_replace((http://)?([[:alnum:]:@/._-]+)[[:alnum:]+](.*)[[:alnum:]+],"http://\2",$url);

  $roopath=split("/",$rootpath);

  $rootpath="http://".$roopath[2]."/";

  //echo "这是根本d :"." ";

  $nnn=count($roopath)-1;for($yu=3;$yu

  //var_dump($rootpath);

  if(eregi(^..[/[:alnum:]],$regs[1])){

  //echo "这是../目录/ :"." ";

  //$regs[1]="../xx/xxxxxx.xx";

  // $rr=split("/",$regs[1]);

  //for($oooi=1;$oooi

  $rrr=$regs[1];

  // {$rrr.="/".$rr[$oooi];

  $rrr = eregi_replace("^[.][.][/]",,$rrr); //}

  $regs[1]=$rootpath.$rrr;

  }

  }else{

  if(eregi(^[[:alnum:]],$regs[1])){ $regs[1]=$rootpath.$regs[1]; }

  else{ $regs[1] = eregi_replace("^[/]",,$regs[1]); $regs[1]=$rootpath.$regs[1]; }

  }

  }

  $line = $regs[2];

  if(eregi((.)*[.](htm|shtm|html|asp|aspx|php|jsp|cgi)(.)*,$regs[1])){

  $out[0][]=$regs[1]; }

  }

  }

  }for ($ouou=0;$ouou

  {

  if($out[0][$ouou]==$out[0][$ouou+1]){

  $sameurlsum=1;

  //echo "sameurlsum=1:";

  for($sameurl=1;$sameurl

  if($out[0][$ouou+$sameurl]==$out[0][$ouou+$sameurl+1]){$sameurlsum++;}

  else{break;}

  }

  for($p=$ouou;$p

  { $out[0][$p]=$out[0][$p+$sameurlsum];}

  }

  }

  $i=0;

  while($out[0][++$i]) {

  //echo $root.$out[0][$i]." ";

  $outed[0][$i]=$out[0][$i];

  }

  unset($out);

  $out=$outed; return $out;

  }

  ?>

  上面的东西只能zend,不然有碍市容:(

  得到所有唯一的连接后,放到数组

  2)需要填正则的处理

  如果要准确地获得需要的文章连接,就用这个办法

  按照ketle的思路

  用

  PHP:

  --------------------------------------------------------------------------------

  function cut($file,$from,$end){

  $message=explode($from,$file);

  $message=explode($end,$message[1]);

  return $message[0];

  }

  $from是列表前面的html代码

  $end是列表后面的html代码

  以上可以通过表单提交参数.

  对列表页面不是列表的部分去除,剩下的是需要的连接,

  只要再通过下面正则得到:

  PHP:

  --------------------------------------------------------------------------------

  preg_match("/^(http://)?(.*)/i",

  $url, $matches);

  return $matches[2];

  2,获得:标题,内容

  a首先,利用得到的文章路径,读取目标路径

  可以通过以下函数:

  PHP:

  --------------------------------------------------------------------------------

  function getcontent($url) {

  if($handle = fopen ($url, "rb")){

  $contents = "";

  do {

  $data = fread($handle, 2048);

  if (strlen($data) == 0) {

  break;

  }

  $contents .= $data;

  } while(true);

  fclose ($handle);

  }

  else

  exit("........");

  return $contents;

  }

  或者直接

  PHP:

  --------------------------------------------------------------------------------

  file_get_contents($urls);

  后者比较方便,但是缺点对比上面的就知道.

  b,接下来得到标题:

  一般用这个实现:

  PHP:

  --------------------------------------------------------------------------------

  preg_match("||",$allcontent,$title);

  里面的部分通过提交表单得到.

  也可以通过一系列的cut函数

  比如上面提过的function cut($file,$from,$end),具体的字符串切割可以通过字符处理函数切割实现,后面"取得内容"详细讲.

  c,取得内容

  取得内容方面和取得标题思路一样但情况比较复杂,因为内容附近不会是这么简单.

  1)内容附近的特征字符串有双引号,空格,换行符号等是大障碍

  双引号需要变成 "  可以通过addslashes()处理

  换行符号要去掉 可以通过

  PHP:

  --------------------------------------------------------------------------------

  $a=ereg_replace(" ", , $a);

  $a=ereg_replace("", , $a);

  去掉.

  2)思路2,利用一大堆切割相关的函数对内容提取,需要大量的实践,调试,我正在弄这里,没有获得什么突破~~~~~~~~

  3,入库

  a,切保你的数据库可以插入

  比如我的可以这样直接插入:

  PHP:

  --------------------------------------------------------------------------------

  $sql="INSERT INTO $articles VALUES (, $title, , $article,, , clinch, from, 关键词, 1, $栏目id, $time, 1); ";

  其中

  PHP:

  --------------------------------------------------------------------------------

  (,

  是自动升序的

www.bkjia.comtruehttp://www.bkjia.com/PHPjc/486262.htmlTechArticle数据采集,大部分是用正则表达式,我简单地介绍下如何实现采集的思路.这里说的是php的实现.一般是本机运行,放到空间上是不明智的,...
Kenyataan
Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn
php怎么把负数转为正整数php怎么把负数转为正整数Apr 19, 2022 pm 08:59 PM

php把负数转为正整数的方法:1、使用abs()函数将负数转为正数,使用intval()函数对正数取整,转为正整数,语法“intval(abs($number))”;2、利用“~”位运算符将负数取反加一,语法“~$number + 1”。

php怎么实现几秒后执行一个函数php怎么实现几秒后执行一个函数Apr 24, 2022 pm 01:12 PM

实现方法:1、使用“sleep(延迟秒数)”语句,可延迟执行函数若干秒;2、使用“time_nanosleep(延迟秒数,延迟纳秒数)”语句,可延迟执行函数若干秒和纳秒;3、使用“time_sleep_until(time()+7)”语句。

php字符串有没有下标php字符串有没有下标Apr 24, 2022 am 11:49 AM

php字符串有下标。在PHP中,下标不仅可以应用于数组和对象,还可应用于字符串,利用字符串的下标和中括号“[]”可以访问指定索引位置的字符,并对该字符进行读写,语法“字符串名[下标值]”;字符串的下标值(索引值)只能是整数类型,起始值为0。

php怎么除以100保留两位小数php怎么除以100保留两位小数Apr 22, 2022 pm 06:23 PM

php除以100保留两位小数的方法:1、利用“/”运算符进行除法运算,语法“数值 / 100”;2、使用“number_format(除法结果, 2)”或“sprintf("%.2f",除法结果)”语句进行四舍五入的处理值,并保留两位小数。

php怎么读取字符串后几个字符php怎么读取字符串后几个字符Apr 22, 2022 pm 08:31 PM

在php中,可以使用substr()函数来读取字符串后几个字符,只需要将该函数的第二个参数设置为负值,第三个参数省略即可;语法为“substr(字符串,-n)”,表示读取从字符串结尾处向前数第n个字符开始,直到字符串结尾的全部字符。

php怎么根据年月日判断是一年的第几天php怎么根据年月日判断是一年的第几天Apr 22, 2022 pm 05:02 PM

判断方法:1、使用“strtotime("年-月-日")”语句将给定的年月日转换为时间戳格式;2、用“date("z",时间戳)+1”语句计算指定时间戳是一年的第几天。date()返回的天数是从0开始计算的,因此真实天数需要在此基础上加1。

php怎么查找字符串是第几位php怎么查找字符串是第几位Apr 22, 2022 pm 06:48 PM

查找方法:1、用strpos(),语法“strpos("字符串值","查找子串")+1”;2、用stripos(),语法“strpos("字符串值","查找子串")+1”。因为字符串是从0开始计数的,因此两个函数获取的位置需要进行加1处理。

php怎么替换nbsp空格符php怎么替换nbsp空格符Apr 24, 2022 pm 02:55 PM

方法:1、用“str_replace(" ","其他字符",$str)”语句,可将nbsp符替换为其他字符;2、用“preg_replace("/(\s|\&nbsp\;||\xc2\xa0)/","其他字符",$str)”语句。

See all articles

Alat AI Hot

Undresser.AI Undress

Undresser.AI Undress

Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover

AI Clothes Remover

Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool

Undress AI Tool

Gambar buka pakaian secara percuma

Clothoff.io

Clothoff.io

Penyingkiran pakaian AI

AI Hentai Generator

AI Hentai Generator

Menjana ai hentai secara percuma.

Artikel Panas

R.E.P.O. Kristal tenaga dijelaskan dan apa yang mereka lakukan (kristal kuning)
3 minggu yang laluBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Tetapan grafik terbaik
3 minggu yang laluBy尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. Cara Memperbaiki Audio Jika anda tidak dapat mendengar sesiapa
3 minggu yang laluBy尊渡假赌尊渡假赌尊渡假赌
WWE 2K25: Cara Membuka Segala -galanya Di Myrise
3 minggu yang laluBy尊渡假赌尊渡假赌尊渡假赌

Alat panas

Versi Mac WebStorm

Versi Mac WebStorm

Alat pembangunan JavaScript yang berguna

Dreamweaver Mac版

Dreamweaver Mac版

Alat pembangunan web visual

Pelayar Peperiksaan Selamat

Pelayar Peperiksaan Selamat

Pelayar Peperiksaan Selamat ialah persekitaran pelayar selamat untuk mengambil peperiksaan dalam talian dengan selamat. Perisian ini menukar mana-mana komputer menjadi stesen kerja yang selamat. Ia mengawal akses kepada mana-mana utiliti dan menghalang pelajar daripada menggunakan sumber yang tidak dibenarkan.

VSCode Windows 64-bit Muat Turun

VSCode Windows 64-bit Muat Turun

Editor IDE percuma dan berkuasa yang dilancarkan oleh Microsoft

Notepad++7.3.1

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma