搜索
首页后端开发php教程集成 PHP 应用和 Solr 搜索引擎

集成 PHP 应用和 Solr 搜索引擎

Mar 24, 2017 pm 01:25 PM
phpsolr应用搜索引擎集成

你为什么需要搜索引擎?单纯数据库不够用?如果你只是创建小网站,数据库就够了。但当你创建中性或大型应用的时候,搜索引擎是更明智的选择。当然如是一说,小网站也可以利用Solr,获得高相关性的搜索结果。

想象一下你在写一个电子商务网站的搜索查询程序。最直接的想法就是如下的数据库查询语句:

SELECT * FROM PRODUCTS
WHERE LOWER(title) like LOWER('%$phrase%')
OR LOWER(description) like LOWER('%$phrase%');

查询标题或描述中的短语时,它工作正常。但是现实事物很复杂,比如说Apple iPhone 4G black 16GB(苹果4G网络iPhone黑色16GB)。搜索“iPhone 16G”的时候,就没结果。你可以用%替换空格应付这种情况。

$phrase = str_replace(' ', '%', $phrase);

那么查询“iPhone 16GB 4G”的时候呢?显然词序改变了,它又无法正常工作。我猜你又会添加一个字段保存词序。那么写错词怎么办?同义词怎么办?为如此的搜索系统想一个好的解决方案很有挑战性。



设计一个精妙的算法不是解决这类问题的关键. 文本的搜素是需要消耗资源的. 将太多的压力放在数据库端永远不是一个好办法. 原因是数据库不能很方便的扩展. 你不能像web server 或者 Memcached一样,简单的增加一个实例.扩展数据库需要一些准备, 代码的修改, 配置, down机维护时间, 总之成本是非常昂贵的. 好消息是Solr就是专门解决这类问题的.

Solr是一个基于Apache Lucene的企业级搜索平台. 快,稳定, 有很好的文档当然扩展起来也很方便. 由于Solr是有个强大的解决方案, 他的所有特性就不在这篇文章里面一一列举了. 这家伙上收起来也是相当easy哦.


首先从官方网站下载最新的版本。Solr是一个由Java语言编写的应用程序,你需要Java Runtime环境才可以运行。

$ cd solr-4.1.0/example/
$ java -jar start.jar

大概几秒钟后你就可以看到下面的信息:

2013-03-09 18:47:41.177:INFO:oejs.AbstractConnector:Started SocketConnector@0.0.0.0:8983

Solr有一个web界面,工作在8983端口下,打开浏览器访问http://localhost:8983/solr/.

在左手边的导航区你会找到“collection1″。在Solr中,Collections类似于数据库的表,你可以查询数据。点击一个collection,选择她的子菜单 “query”。

第一个选项叫 “Request-Handler (qt)”,拥有默认值 “/select”。Request handlers是一组预定义查询. 如果你查看Solr config文件,你就会看到是这样的:

$ vim solr-4.1.0/example/solr/collection1/conf/solrconfig.xml
<requestHandler name="/select" class="solr.SearchHandler">
    <lst name="defaults">
        <str name="echoParams">explicit</str>
       <int name="rows">10</int>
       <str name="df">text</str>
    </lst></requestHandler>

第二个参数才是我们最感兴趣的。默认值 “*:*” 意味着查询任何内容,如果你点击“execute query” ,你可以得到像下面这样的内容:

<?xml version="1.0" encoding="UTF-8"?><response>
    <lst name="responseHeader">
        <int name="status">0</int>
        <int name="QTime">1</int>
        <lst name="params">
        <str name="indent">true</str>
        <str name="q">*:*</str>
        <str name="wt">xml</str>
        </lst>
    </lst>
    <result name="response" numFound="0" start="0" /></response>

索引结果为空,但这不是什么问题,你需要插入一些示例数据。

$ cd solr-4.1.0/example/exampledocs/
$ java -jar post.jar monitor.xml
 
SimplePostTool version 1.5
Posting files to base url http://localhost:8983/solr/update using content-type application/xml..
POSTing file monitor.xml1 files indexed.
COMMITting Solr index changes to http://localhost:8983/solr/update..

现在你可以返回查询界面,这次就会有一个文档返回。

Collection的数据结构是在schema文件中定义的。

$ vim solr-4.1.0/example/solr/collection1/conf/schema.xml

这个文件有非常多的注释,你可以很容易分辨出他们是做什么的。如果你要修改scheme文件,请不要删除名叫“text”的字段(如果没很好的理由),他是和另外的字段和查询语句中关联的(包括select, look等等)。

$ grep text solr-4.1.0/example/solr/collection1/conf/schema.xml | grep copy
 
<copyField source="cat" dest="text"/>
<copyField source="name" dest="text"/>
<copyField source="manu" dest="text"/>
<copyField source="features" dest="text"/>
<copyField source="includes" dest="text"/>
<copyField source="title" dest="text"/>
<copyField source="author" dest="text"/>
<copyField source="description" dest="text"/>
<copyField source="keywords" dest="text"/>
<copyField source="content" dest="text"/>
<copyField source="content_type" dest="text"/>
<copyField source="resourcename" dest="text"/>
<copyField source="url" dest="text"/>

如果你使用的是关系数据库,你不希望有重复的数据。Solr不是一个数据库,多数字段也被处理成文本字段,默认request handler就是这样。


从PHP访问Solr需要一个客户端。我建议从PECL下载一个。它快速,API清晰,文档优良。不过要注意,这个扩展现在版本1.0.2,不支持Solr 4.x。Solr 3.x和4.x的协议有微小不同。不过别担心,我已经做了修改,你可以从https://github.com/lukaszkujawa/php-pecl-solr下载兼容版本。我已经用了一段时间,是可靠的。它和官方的有点差别在SolrClient构造函数中多一个Solr版本参数。这个补丁将会发布在官方版本中,你不用担心此后的兼容性。

$ git clone https://github.com/lukaszkujawa/php-pecl-solr.git$ cd php-pecl-solr/
$ phpize
$ whereis php-config
php-config: /usr/bin/php-config /usr/bin/X11/php-config
$ ./configure --with-php-config=/usr/bin/php-config
$ make
$ make install

添加到你的php.ini

extension=solr.so

重启Web服务器

$ /etc/init.d/apache2 restart

现在就可以写php添加内容到索引中了。

<?php
 $options = array (    &#39;hostname&#39; => &#39;127.0.0.1&#39;,
);
 
$client = new SolrClient($options, "4.0"); // 参数4.0针对Solr4.x,其他版本时忽略
 $doc = new SolrInputDocument();
 
$doc->addField(&#39;id&#39;, 100);
$doc->addField(&#39;title&#39;, &#39;Hello Wolrd&#39;);
$doc->addField(&#39;description&#39;, &#39;Example Document&#39;);
$doc->addField(&#39;cat&#39;, &#39;Foo&#39;);
$doc->addField(&#39;cat&#39;, &#39;Bar&#39;);
 
$response = $client->addDocument($doc);
 
$client->commit(); 
/* ------------------------------- */
 $query = new SolrQuery();
 
$query->setQuery(&#39;hello&#39;);
 
$query->addField(&#39;id&#39;)
->addField(&#39;title&#39;)
->addField(&#39;description&#39;)
->addField(&#39;cat&#39;);
 
$queryResponse = $client->query($query);
 
$response = $queryResponse->getResponse();
 
print_r( $response->response->docs );

如果你添加的文档不止一条,她也可以处理得很好,而不需要频繁的commit。

知道Solr如何工作是很有价值的,你可以在很多项目中使用。她有个很棒的功能可以让你一次请求就可以拉取所有需要的数据。当然,你掌握她需要耗费一些时间,但这值得你付出。Solr拥有一个活跃的社区和完整的文档资源,如果你还担心在项目中使用,请翻阅Solr 3 企业搜索服务器,她不仅仅是让你快速搭建起搜索服务,还是你数据挖掘的基础。

相关文章:

php的solr的操作类及demo

安装php-solr扩展

搜索方案 solr+php如何安装配置?

声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
如何计算PHP多维数组的元素总数?如何计算PHP多维数组的元素总数?May 15, 2025 pm 09:00 PM

计算PHP多维数组的元素总数可以使用递归或迭代方法。1.递归方法通过遍历数组并递归处理嵌套数组来计数。2.迭代方法使用栈来模拟递归,避免深度问题。3.array_walk_recursive函数也能实现,但需手动计数。

PHP中do-while循环有什么特点?PHP中do-while循环有什么特点?May 15, 2025 pm 08:57 PM

在PHP中,do-while循环的特点是保证循环体至少执行一次,然后再根据条件决定是否继续循环。1)它在条件检查之前执行循环体,适合需要确保操作至少执行一次的场景,如用户输入验证和菜单系统。2)然而,do-while循环的语法可能导致新手困惑,且可能增加不必要的性能开销。

PHP中如何哈希字符串?PHP中如何哈希字符串?May 15, 2025 pm 08:54 PM

在PHP中高效地哈希字符串可以使用以下方法:1.使用md5函数进行快速哈希,但不适合密码存储。2.使用sha256函数提高安全性。3.使用password_hash函数处理密码,提供最高安全性和便捷性。

PHP中如何实现数组滑动窗口?PHP中如何实现数组滑动窗口?May 15, 2025 pm 08:51 PM

在PHP中实现数组滑动窗口可以通过函数slidingWindow和slidingWindowAverage来完成。1.使用slidingWindow函数可以将数组分割成固定大小的子数组。2.使用slidingWindowAverage函数可以在每个窗口内计算平均值。3.对于实时数据流,可以使用ReactPHP进行异步处理和异常值检测。

PHP中__clone方法怎么用?PHP中__clone方法怎么用?May 15, 2025 pm 08:48 PM

PHP中的__clone方法用于在对象克隆时进行自定义操作。使用clone关键字克隆对象时,如果对象有__clone方法,会自动调用该方法,允许在克隆过程中进行定制化处理,如重置引用类型属性以确保克隆对象的独立性。

PHP中goto语句如何使用?PHP中goto语句如何使用?May 15, 2025 pm 08:45 PM

在PHP中,goto语句用于无条件跳转到程序中的特定标签。1)它可以简化复杂嵌套循环或条件语句的处理,但2)使用goto可能导致代码难以理解和维护,3)建议优先使用结构化控制语句。整体而言,goto应谨慎使用,并遵循最佳实践以确保代码的可读性和可维护性。

PHP中如何实现数据统计?PHP中如何实现数据统计?May 15, 2025 pm 08:42 PM

在PHP中,数据统计可以通过使用内置函数、自定义函数和第三方库来实现。1)使用内置函数如array_sum()和count()进行基本统计。2)编写自定义函数计算中位数等复杂统计。3)利用PHP-ML库进行高级统计分析。通过这些方法,可以高效地进行数据统计。

PHP中如何使用匿名函数?PHP中如何使用匿名函数?May 15, 2025 pm 08:39 PM

是的,PHP中的匿名函数是指没有名字的函数。它们可以作为参数传递给其他函数,并作为函数的返回值,使代码更加灵活和高效。使用匿名函数时需要注意作用域和性能问题。

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热门文章

热工具

Atom编辑器mac版下载

Atom编辑器mac版下载

最流行的的开源编辑器

SublimeText3 英文版

SublimeText3 英文版

推荐:为Win版本,支持代码提示!

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

mPDF

mPDF

mPDF是一个PHP库,可以从UTF-8编码的HTML生成PDF文件。原作者Ian Back编写mPDF以从他的网站上“即时”输出PDF文件,并处理不同的语言。与原始脚本如HTML2FPDF相比,它的速度较慢,并且在使用Unicode字体时生成的文件较大,但支持CSS样式等,并进行了大量增强。支持几乎所有语言,包括RTL(阿拉伯语和希伯来语)和CJK(中日韩)。支持嵌套的块级元素(如P、DIV),

Dreamweaver Mac版

Dreamweaver Mac版

视觉化网页开发工具