solr4.4.0 集成 carrot2 支持中文和添加自己的中文分词器的方法-mysql教程-PHP中文网

首页

数据库

mysql教程

solr4.4.0 集成 carrot2 支持中文和添加自己的中文分词器的方法

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 07, 2016 pm 03:37 PM

中文支持添加集成

默认 carrot2中是支持中文的，但是需要一个参数进行指定 carrot.lang= CHINESE_SIMPLIFIED carrot2支持的语言可以参考http://doc.carrot2.org/#div.attribute.lingo.MultilingualClustering.defaultLanguage 但是默认， carrot2使用的分词类是org.apache.luc

默认 carrot2中是支持中文的，但是需要一个参数进行指定

carrot.lang=CHINESE_SIMPLIFIED

carrot2支持的语言可以参考http://doc.carrot2.org/#div.attribute.lingo.MultilingualClustering.defaultLanguage

但是默认，carrot2使用的分词类是 org.apache.lucene.analysis.cn.smart.SentenceTokenizer，这是看 carrot源代码找到的源码如下(在org.apache.solr.handler.clustering.carrot2.LuceneCarrot2TokenizerFactory类中)

private ChineseTokenizer() throws Exception {
this.tempCharSequence = new MutableCharArray(new char[0]);

// As Smart Chinese is not available during compile time,
// we need to resort to reflection.
final Class> tokenizerClass = ReflectionUtils.classForName(
"org.apache.lucene.analysis.cn.smart.SentenceTokenizer", false);
this.sentenceTokenizer = (Tokenizer) tokenizerClass.getConstructor(
Reader.class).newInstance((Reader) null);
this.tokenFilterClass = ReflectionUtils.classForName(
"org.apache.lucene.analysis.cn.smart.WordTokenFilter", false);
}

如果，没有这个类，carrot2默认就会使用一个 ExtendedWhitespaceTokenizer 使用空格进行切词，所以如果要使用carrot2自己的中文切词，需要加入 lucene-analyzers-smartcn-4.4.0.jar

当然也可以使用自己的分词包，比如IK等等，把上述源码替换成相应的类即可。

声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

MySQL和其他SQL方言之间的语法有什么区别？Apr 27, 2025 am 12:26 AM

mysqldiffersfromothersqldialectsinsyntaxforlimit，自动启动，弦乐范围，子征服和表面上分析。1）MySqluessLipslimit，whilesqlserverusestopopandoraclesrontersrontsrontsrontsronnum.2）

什么是mysql分区？Apr 27, 2025 am 12:23 AM

MySQL分区能提升性能和简化维护。1）通过按特定标准（如日期范围）将大表分成小块，2）物理上将数据分成独立文件，3）查询时MySQL可专注于相关分区，4）查询优化器可跳过不相关分区，5）选择合适的分区策略并定期维护是关键。

您如何在MySQL中授予和撤销特权？Apr 27, 2025 am 12:21 AM

在MySQL中，如何授予和撤销权限？1.使用GRANT语句授予权限，如GRANTALLPRIVILEGESONdatabase_name.TO'username'@'host'；2.使用REVOKE语句撤销权限，如REVOKEALLPRIVILEGESONdatabase_name.FROM'username'@'host'，确保及时沟通权限变更。

说明InnoDB和Myisam存储引擎之间的差异。Apr 27, 2025 am 12:20 AM

InnoDB适合需要事务支持和高并发性的应用，MyISAM适合读多写少的应用。1.InnoDB支持事务和行级锁，适用于电商和银行系统。2.MyISAM提供快速读取和索引，适合博客和内容管理系统。

MySQL中有哪些不同类型的连接？Apr 27, 2025 am 12:13 AM

MySQL中有四种主要的JOIN类型：INNERJOIN、LEFTJOIN、RIGHTJOIN和FULLOUTERJOIN。1.INNERJOIN返回两个表中符合JOIN条件的所有行。2.LEFTJOIN返回左表中的所有行，即使右表中没有匹配的行。3.RIGHTJOIN与LEFTJOIN相反，返回右表中的所有行。4.FULLOUTERJOIN返回两个表中所有符合或不符合JOIN条件的行。

MySQL中有哪些不同的存储引擎？Apr 26, 2025 am 12:27 AM

mysqloffersvariousStorageengines，每个suitedfordferentusecases：1）InnodBisidealForapplicationsNeedingingAcidComplianCeanDhighConcurncurnency，supportingtransactionsancions and foreignkeys.2）myisamisbestforread-Heavy-Heavywyworks，lackingtransactionsactionsacupport.3）记忆