Heim  >  Artikel  >  php教程  >  PHP实现抓取网页的所有超链接的代码

PHP实现抓取网页的所有超链接的代码

WBOY
WBOYOriginal
2016-06-21 08:57:221028Durchsuche

因为最近要做一个类似专业搜索引擎的东西,需要抓取网页的所有超链接。大家帮忙测试一下子,下面的代码是否可以针对所有的标准超链接。

通用HTML标准超链接参数取得正则表达式测试

因为最近要做一个类似专业搜索引擎的东西,需要抓取网页的所有超链接。
大家帮忙测试一下子,下面的代码是否可以针对所有的标准超链接。

测试代码如下:
 

<?php  
<br/>// --------------------------------------------------------------------------
<br>// File name   : Noname1.php
<br>// Description : 通用链接参数获取正则表达式测试
<br>// Requirement : PHP4 (http://www.php.net)
<br>// Copyright(C), HonestQiao, 2005, All Rights Reserved.
<br>// Author: HonestQiao (honestqiao@hotmail.com)
<br>// 参数说明:
<br>// $strSource: 包含标准链接的HTML网页
<br>// $strResult: 处理的结果
<br>// 附加说明:
<br>// 标准链接,使用<a></a>形势包含的链接
<br>// --------------------------------------------------------------------------
<br>$strSource = <a>t1</a>
<br><a>t2</a>
<br><a>t3</a>
<br><a>t4</a>
<br>HTML;
<br>preg_match_all('/<a.>(.+?)/sim', $strSource, $strResult, PREG_PATTERN_ORDER);
<br>for($i = 0; $i {
<br>    printf("%d href=(%s) title=(%s) \n", $i, $strResult[1][$i], $strResult[2][$i]);
<br>} 
<br>
<br>?></a.>



如果您的测试数据,符合标准链接,但是此处没有被处理出来,请告诉我测试数据,以及你的测试环境。

谢谢。
 



Stellungnahme:
Der Inhalt dieses Artikels wird freiwillig von Internetnutzern beigesteuert und das Urheberrecht liegt beim ursprünglichen Autor. Diese Website übernimmt keine entsprechende rechtliche Verantwortung. Wenn Sie Inhalte finden, bei denen der Verdacht eines Plagiats oder einer Rechtsverletzung besteht, wenden Sie sich bitte an admin@php.cn