Home >Backend Development >PHP Tutorial >用PHP代替JS玩转DOM

用PHP代替JS玩转DOM

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB
WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOriginal
2016-06-23 13:55:271052browse

事情的起源比较简单,我需要把一个导航页的数据整理好写入数据库。一个比较直观的方法是对html文件进行分析,通用的方法是用php的正则表达式来匹配。但是这样做开发和维护都很困难,代码可读性非常差。

导航页的数据都是规则的排列在DOM树当中的,用JS可以用几个循环轻松的对其进行操作,而且JS需要依赖浏览器,操作数据库很困难。其实PHP就有现成的类库对DOM树种的节点进行增删改查操作,在此做一些笔记。

这里涉及到2个类 DOMDocument 和 DOMXPath。

其实思路比较明确,就是通过DOMDocument将一个html file转换成DOM树的数据结构,再用DOMXPath的实例去搜索这个DOM树,拿到想要特定节点,接下来就可以对当前节点的子树进行遍历,得到想要的结果。

写一个最简单的demo

在当前目录下有一个这样一个导航的html文件 "./hao.html"

现在需要得到所有标签的中文内容,php代码如下:

<?php //将html/xml文件转换成DOM树$dom = new DOMDocument();$dom->loadHTMLFile("hao.html");//得到所有class为fix的dl标签// example 1: for everything with an id//$elements = $xpath->query("//*[@id]");// example 2: for node data in a selected id//$elements = $xpath->query("/html/body/div[@id='yourTagIdHere']");// example 3: same as above with wildcard//$elements = $xpath->query("*/div[@id='yourTagIdHere']");$xpath = new DOMXPath($dom);$dls = $xpath->query('//dl[@class="fix"]');foreach ($dls as $dl) {    $spans = $dl->childNodes;    foreach ($spans as $span) {        echo trim($span->textContent)."\t";    }    echo "\n";}      ?>

 

 输出结果如下:

注意:值得注意的一点是DOMDocument的默认编码方式是Latin,所以在处理utf编码的中文的时候,需要在

后面紧跟着填入

<meta http-equiv="content-type" content="text/html; charset=utf-8">

 在其他位置,或者是只写上都是不识别的哦

Statement:
The content of this article is voluntarily contributed by netizens, and the copyright belongs to the original author. This site does not assume corresponding legal responsibility. If you find any content suspected of plagiarism or infringement, please contact admin@php.cn
Previous article:怎么给数据排序Next article:编码风格转换