1:项目地址:
https://github.com/chenlb/mmseg4j-solr
https://github.com/chenlb/mmseg4j-solr/wiki
2: solr的shcema.xml:
<fieldtype name="textComplex" class="solr.TextField" positionIncrementGap="100"> <analyzer> <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="complex" dicPath="dic"/> </analyzer> </fieldtype> <fieldtype name="textMaxWord" class="solr.TextField" positionIncrementGap="100"> <analyzer> <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="max-word" /> </analyzer> </fieldtype> <fieldtype name="textSimple" class="solr.TextField" positionIncrementGap="100"> <analyzer> <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="simple" dicPath="n:/custom/path/to/my_dic" /> </analyzer> </fieldtype>
tokenizer 的参数:
- dicPath 参数 - 设置自定义的扩展词库,支持相对路径(相对于 solr_home).
- mode 参数 - 分词模式。
如果没有自定义的词库, dicPath 参数可以省略
3:
简单分词使用textSimple(分词粒度不过精确但耗时少), 复杂分词使用 textComplex(分词粒度精确但耗时多)
4:
下载地址: http://yun.baidu.com/s/1dD7qMFf#dir/path=%2Fmmseg4j-solr
下载后解压 mmseg4j-solr-2.2.0-with-mmseg4j-core.zip
将 mmseg4j-core-1.10.0.jar 和 mmseg4j-solr-2.2.0.jar放到 solr.war/WEB-INF/lib 目录中
solr会自动使用 mmseg4j-core-1.10.0.jar中的data目录下的分词文件
mmseg4j中的词库:(强制使用 UTF-8):
- data/chars.dic 是单字与语料中的频率,一般不用改动,1.5版本中已经加到mmseg4j的jar里了,我们不需要关心它,当然你在词库目录放这个文件可以覆盖它。
- data/units.dic 是单字的单位,默认读jar包里的,你也可以自定义覆盖它,这个功能是试行,如果不喜欢它,可以用空的units.dic文件(放到你的词库目录下)覆盖它。
- data/words.dic 是词库文件,一行一词,当然你也可以使用自己的,1.5版本使用 sogou 词库,1.0的版本是用 rmmseg 自带的词库。
- data/wordsxxx.dic 1.6版支持多个词库文件,data 目录(或你定义的目录)下读到"words"前缀且".dic"为后缀的文件。如:data/words-my.dic。
- 由于 utf-8 文件有带与不带 BOM 之分,建议词库第一行为空行或为无 BOM 格式的 utf-8 文件。
5:
solr支持在索引了一部分数据后 IK Analisis 分词转换为 mmseg4j
相关推荐
mmseg4j中文分词器 mmseg4j-core-1.10.0.jar mmseg4j-solr-2.3.0.jar两个主要依赖包
solr6.3下好用的mmseg4j分词库,测试可用。
本人用的solr是4.10的,经过本人亲测可用,放心下载,包含以下3个jar包: mmseg4j-analysis-1.9.1.jar, mmseg4j-core-1.9.1.jar, mmseg4j-solr-2.2.0.jar
里面包含了mmseg4j-solr-2.0.0.jar,mmseg4j-solr-2.1.0.jar,mmseg4j-solr-2.2.0.jar,mmseg4j-solr-2.3.0.jar总共4个文件,其中: mmseg4j-solr-2.0.0.jar 要求 lucene/solr >= 4.3.0。在 lucene/solr [4.3.0, 4.7.1]...
该压缩包包含`mmseg4j-solr-2.3.2.jar`和`mmseg4j-core-1.10.0.jar`,其中solr-2.3.2不是官方的版本,该版本有改动,使得mmseg4j可以很好的支持Solr6,如果你的Solr低于Solr6,请使用官方的mmseg4j-solr-2.3.0.jar...
mmseg4j-solr-mmseg4j-solr-2.2.0.zip
mmseg4j-solr-2.3.0-with-mmseg4j-core是Solr的中文分词包,该压缩包含有mmseg4j-core-1.10.0.jar和mmseg4j-solr-2.3.0.jar。
包里包含了至今mmseg4j的所有版本及版本对应solr版本说明,还有solr配置和自定义词典路径相关配置文章
mmseg4j-core-1.10.0+mmseg4j-solr-2.3.0()mmseg4j-solr-2.3.0.jar 要求 lucene/solr [5.0, ])
与solr4.8匹配的mmseg4j分词器的版本
mmseg4j-solr-2.3.1-SNAPSHOT.jar
中文分词支持Solr 4.9版本,
mmseg4j-1.9.1 分词器 包含修复bug的mmseg4j-analysis-1.9.1.jar dist\修复bug下是修复bug后的mmseg4j-analysis-1.9.1.jar
mmseg4j-core-1.10.0,非常好用的中文分词器
中文分词包使用 1.mmseg4j中文分词包(下载、安装与运行) 2.分词方法与效果分析 3.分词包算法学习 4.分词结果 5.词云分析
lucene中文分词 mmseg4j-1.8.5与lucene3.1兼容
mmseg4j-analysis修改版直接用
mmseg4j-1.8.5中文分词器API
mmseg4j-all-1.8.5中文分词器
mmseg4j-core-1.10.1-SNAPSHOT.jar