Sphider + SCWS，打造完美PHP中文搜索引擎-php手册-php.cn

집

php教程

php手册

Sphider + SCWS，打造完美PHP中文搜索引擎

PHP中文网

Jun 06, 2016 pm 07:59 PM

php중국인완벽한짓다검색 엔진

今日需要为几个网站做个全文搜索引擎，找了几个PHP开源项目，先试了一下Sphinx ，可惜是基于数据库的，相当于数据库搜索的扩展。Sphider还不错，不过中文的分词不行，基本只能靠空格和符号进行分词。想用luence的话只能用Java和.net了，没有php版的，因此只好尝试自己修改Sphider的分词了。还好找到了SCWS这个不错的中文分词系统，只需要把他的功能加入到Sphider里面就可以了。

先按照他们的安装文档部署好Sphider和SCWS，这里使用的SCWS-1.1.6，需要部署好PHP扩展，注意Linux下要修改词库的权限，否则分词会把所有汉字单独分开。Sphider这里使用的丁廷臣简体中文完美汉化版带蜘蛛搜索引擎。

两者部署无误后，修改Sphider，找到admin文件夹下的spider文件，首先在开始加入代码初始化分词程序

$cws = scws_new();  
$cws->set_charset(&#39;gbk&#39;);  
$cws->set_rule(&#39;/usr/local/scws/etc/rules.ini&#39;); //注意路径  
$cws->set_dict(&#39;/usr/local/scws/etc/dict.xdb&#39;);  
$cws->set_ignore(true);

注意这里使用的gbk，如果你的网页用的utf8编码，要把这里以及词典和规则文件的位置更改一下

在index_url函数中，把原有的英文分词替换掉，在$wordarray = unique_array(explode(" ", $data['content']));前面加上

$cws->send_text($data[&#39;content&#39;]);
$list = $cws->get_tops(1000, $xattr);
settype($list, &#39;array&#39;);
$wordarray=array();
$i=0;
// segment
foreach ($list as $tmp)
{		
    $wordarray[$i][1]=$tmp[&#39;word&#39;];
    $wordarray[$i][2]=$tmp[&#39;times&#39;];
    $i++;
}

删除

$wordarray = unique_array(explode(" ", $data[&#39;content&#39;]));

和

$wordarray = calc_weights ($wordarray, $title, $host, $path, $data[&#39;keywords&#39;]);

两个语句，因为Sphider原有的英文分词这里就完全没必要用了，这里可以自行对$wordarray进行限制和优化，这里我写的很简单。

修改完成后，爬虫就能正常对中文进行分词了，效果还不错，注意如果出现乱码注意网页或者辞典编码是utf8还是gb2312。

성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

뜨거운 도구

MinGW - Windows용 미니멀리스트 GNU

이 프로젝트는 osdn.net/projects/mingw로 마이그레이션되는 중입니다. 계속해서 그곳에서 우리를 팔로우할 수 있습니다. MinGW: GCC(GNU Compiler Collection)의 기본 Windows 포트로, 기본 Windows 애플리케이션을 구축하기 위한 무료 배포 가능 가져오기 라이브러리 및 헤더 파일로 C99 기능을 지원하는 MSVC 런타임에 대한 확장이 포함되어 있습니다. 모든 MinGW 소프트웨어는 64비트 Windows 플랫폼에서 실행될 수 있습니다.