关于一些中文分词器

elasticsearch教程--中文分词器作用和使用 目录 概述 环境准备 认识中文分词器 常用的中文分词器 IK Analyzer hanlp中文分词器 彩蛋 概述         上一篇博文记录了elasticsearch插件安装和管理, 在地大物博的祖国使用es,不得不考虑中文分词器,es内置的分词器对中文分词的支持用惨不忍睹来形容不为过,看这篇博文之前,建议先看一下博文elasticsearch... 阅读详情
 找了一些,列出来,备忘.部分内容来自http://lihaiyan.javaeye.com/blog/1276 74

1 计算所汉语词法分析系统 ICTCLAS
中 国科学院计算技术研究所在多年研究基础上,耗时一年研制出� ��基于多层隐马模型的汉语词法分析系统 ICTCLAS(Institute of Computing Technology, Chinese Lexical Analysis System),该系统的功能有:中文分词;词性标注;未登录词识别。 分词正确率高达97.58%(最近的973专家组评测结果),基于角色标注� �未登录词识别能取得高于90%召回率,其中中国人名的识别召回率 接近98%,分词和词性标注处理速度为31.5KB/s。ICTCLAS 和计算所其他14项免费发布的成果被中外媒体广泛地报道,国内� �多免费的中文分词模块都或多或少的参考过ICTCLAS的代码。

下载页面: http://www.nlp.org.cn/project/project.php?proj_id=6

由于 ICTCLAS 是由 C 语言写成的,现在主流的开发工具用起来不太方便,于是有一些� ��心的程序员把 ICTCLAS 改为 Java 和 C# 等其他语言。

(1)fenci,Java 的 ICTCLAS,下载页面: http://www.xml.org.cn/printpage.asp?BoardID=2&id=11502

(2)AutoSplit,另一个 Java 的 ICTCLAS,已经找不到下载页面,点击本地下载

(3)小叮咚中文分词,曾经有下载页面,现在找不到了。据作者 介绍,从 ICTCLAS 中改进,有 Java,C# 和 C++ 三个版本,介绍页面: http://www.donews.net/accesine

2 海量智能分词研究版

海量智能计算技术研究中心为了使中文信息处理领域的研究者们� ��够共同分享海量智能中心的研究成果,共同提高中文信息处理� �平,特此发布《海量智能分词研究版》,供专家、学者和爱好者 进行研究。

下载页面: http://www.hylanda.com/cgi-bin/download/download.asp?id=8


3 CSW中文智能分词组件

运行环境:Windows NT、2000、XP 或更高,可以在 ASP,VB 等微软的开发语言中调用。

简介: CSW中文智能分词DLL组件,可将一段文本自动的按常规汉语词组进� ��拆分,并以指定方式进行分隔,且可对其拆分后的词组进行语义� ��词频标注。其广范应用于各行各业的信息资料检索、分析。

下载页面: http://www.vgoogle.net/

4 C# 写的中文分词组件

据作者介绍,一个 DLL 文件,可以做中英文分词组件。完全C#托管代码编写,独立开发� �

下载页面: http://www.rainsts.net/article.asp?id=48

5 (C) scws-1.0.0 正式发布 (含php扩展及2文本词典) http://www.hightman.cn/


6 MMSeg Java开源实现http://www.solol.org/projects/mmseg/


7 小麻雀搜索引擎http://www.sqlet.com/

8 (C#) 开源 ShootSearch 分词组件 1.0 bate 070312 (支持dotlucene)http://www.shootsoft.net/home/show.aspx?id=38&cid=8

9 (Java) Paoding Analysis(庖丁解牛)http://code.google.com/p/paoding/

10 (Java) lucene开源中文分词器 IKAnalyzer2.0.2 共享及源码发布http://linliangyi2007.javaeye.com/blog/165287

11 (ruby) RMMSeg 作者,一些介绍
根据作者自己博客上面的测试,中文分词的准确率可以达到98%以� ��.应该是MMSEG的Ruby实现.

12 (C) MMSEGhttp://technology.chtsai.org/mmseg/

13 (C++)FirteX 是一个功能强大、高性能、灵活的全文索引和检索平台http://www.fi rtex.org/


其他:
搜索引擎资料收集(转)http://wind-bell.javaeye.com/blog/81504
几个免费的中文分词模块http://lihaiyan.javaeye.com/blog/127674
开源研究,中文分词http://www.j-kanban.com/bbs/thread-1806-1-1.html
ElasticSearch:为中文分词器增加对英文的支持(让中文分词器可以处理中英文混合文档) 当我们使用中文分词器的时候,其实也希望它能够支持对于英文的分词。试想,任何一个存储文字的字段都有可能是中英文夹杂的。 我们的项目中使用IKAnalyzer作为中文分词器,它在处理文档过程中遇到英文时,利用空格和标点将英文单词取出来,同时也会对其转全小写处理。其实这和真正的英文分词已经很接近了,只有一墙之隔:词干提取。一个真正的英文分词器除了 阅读详情

相关推荐

ElasticSearch —— 中文分词器 IK

中文分词器下载 下载 elasticsearch-analysis 中文分词器,下载地址:https://github.com/medcl/elasticsearch-analysis-ik/releases/ 安装中文分词器 elasticsearch-plugin elasticsearch 提供了一个安装插件的批处理文件,该 elasticsearch-plugin 文件在 elastic...

Woo_home的博客 4181

中文分词器

什么是中文分词器 学过英文的都知道,英文是以单词为单位的,单词与单词之间以空格或者逗号句号隔开。而中文则以字为单位,字又组成词,字和词再组成句子。所以对于英文,我们可以简单以空格判断某个字符串是否为一个单词,比如I love China,love和China很容易被程序区分开来;但中文“我爱中国”就不一样了,电脑不知道“中国”是一个词语还是“爱中”是一个词语。把中文的句子切分成有意义的词,就...

年轻就是资本的专栏 756

Mac安装elasticsearch中文分词器

{ "name" : "1vFT9YZ", "cluster_name" : "elasticsearch_gwz", "cluster_uuid" : "lxBMLC2DRpKOYoGBHDCpwQ", "version" : { "number" : "6.8.1", "build_flavor" : "oss", "build_type" : "ta...

PHP开光程序员的博客 1906

在Elasticsearch中中文分词器怎么设置?

创建自定义分词器在索引的映射中定义一个新的分词器,并指定分词器类型为custom。},"type": "ik_max_word" // 使用IK Analyzer的分词器应用自定义分词器将自定义分词器应用到具体的字段。通过这些步骤,你可以在Elasticsearch中设置中文分词器,以提高中文文本处理的准确性和效率。有意找工作的同学,请参考博主的原创:《面试官心得--面试前应该如何准备》,《面试官心得--面试时如何进行自我介绍》, 《做好面试准备,迎接2024金三银四或关注博主免费专栏【

借雨醉东风的博客 1788

Lucene中文分词器

注意: 在lucene 4.6.0以上版本使用IKAnalyzer时可能会出现以下异常: java.lang.illegalstateexception:tokenstream contract violation: reset()/close() call missing, reset() calledmultiple times, or subclass does not call ...

张育嘉的博客 987

ElasticSearch 中文分词器对比

常用的中文分词器 Smart Chinese Analysis:官方提供的中文分词器,不好用。 IK Analyzer:免费开源的java分词器,目前比较流行的中文分词器之一,简单、稳定,想要特别好的效果,需要自行维护词库,支持自定义词典。 结巴分词:开源的python分词器,github有对应的java版本,有自行识别新词的功能,支持自定义词典。 Ansj中文分词:基于n-Gram+CRF+HMM的中文分词的java实现,免费开源,支持应用自然语言处理。 hanlp:免费开源,国人自然处理语言牛人无私奉献

jesseXu的博客 3471

ansj中文分词器详解

ansj中文分词器详解   最近在做一个人工智能的项目,其中用到了分词功能。从网上找了一些java用于分词的工具,最终选择了ansj中文分词器。个人认为效果和功能是比较优秀的。本文将对ansj的所有功能进行详解并提供收集到的文本,下面开始正文: 一、基本使用   引入如下maven依赖配置: <!-- ansj分词插件依赖 --> <dependency> <...

student_zz的博客 7106

中文分词器(jcseg)

jcseg是基于 mmseg 算法的一个轻量级 Java 中文分词器,同时集成了关键字提取、关键短语提取、关键句子提取和文章自动摘要等功能。它提供了多种切分模式,包括简易模式、复杂模式、检测模式、检索模式、分隔符模式和 NLP 模式,以满足不同的应用场景需求。可以从官方网站或开源代码托管平台获取 jcseg 的 JAR 包或源代码。将 jcseg 添加到你的 Java 项目中。如果是使用 Maven 或 Gradle 等构建工具,可以在项目配置文件中添加相应的依赖。

weixin_43156294的博客 1141

Docker安装ES,以及界面、中文分词器的插件

前提条件:确保你的机器上面已经安装了Docker和Java。 一、安装ElasticSearch 1、下载镜像 docker pull docker.elastic.co/elasticsearch/elasticsearch:6.3.2 用docker images查看已下载的镜像 (可选)对镜像命名:docker tag IMAGEID(镜像id) REPOSITORY:TAG(...

周先生丶的博客 2788

Lucene中文分词器

1什么是中文分词器    学过英文的都知道,英文是以单词为单位的,单词与单词之间以空格或者逗号句号隔开。   而中文的语义比较特殊,很难像英文那样,一个汉字一个汉字来划分。   所以需要一个能自动识别中文语义的分词器。 2.Lucene自带的中文分词器    StandardAnalyzer       单字分词:就是按照中文一个字一个字地进行分词。如:“我爱中国”, ...

weixin_34234823的博客 262

Elasticsearch 支持哪些中文分词器

在实际应用中,IK Analyzer因其强大的自定义能力和高准确率,成为Elasticsearch中文分词的首选。安装IK Analyzer插件后,可以通过简单的API调用来配置和使用IK分词器,从而改善中文搜索体验。不仅学会如何编程,还将学会如何将AI技术应用到实际问题中,为您的职业生涯增添一笔宝贵的财富。,让人能紧跟时代的浪潮。从普通网站,到公众号、小程序,再到AI大模型网站。有意找工作的同学,请参考博主的原创:《

借雨醉东风的博客 1107

Elasticsearch:使用中文分词器及简单操作示例

Elasticsearch:使用中文分词器及简单操作示例

Liu_y_xin的博客 2058

中文分词器性能比较

原文: http://www.cnblogs.com/wgp13x/p/3748764.html 摘要:本篇是本人在Solr的基础上,配置了中文分词器,并对其进行的性能测试总结,具体包括 使用mmseg4j、IKAnalyzer、Ansj,分别从创建索引效果、创建索引性能、数据搜索效率等方面进行衡量。   具体的Solr使用方法假设读者已有了基础,关于So

1万+

中文分词器:原理、工具与应用综述

中文分词器:原理、工具与应用综述

闲余知道 1088

ES7 IK中文分词器

IK中文分词器的安装 ES默认是没有IK中文分词器的,我们要将IK中文分词器作为一个插件安装到ES中,安装的步骤也很简单: 从GitHub上下载适合自己ES版本的IK中文分词器,地址如下:https://github.com/medcl/elasticsearch-analysis-ik/releases。 在我们的ES的插件目录中(${ES_HOME}/plugins)创建ik目录, 将我们下载好的IK分词器解压到ik目录。 重启我们所有的ES服务。 到这里,我们的IK中文分词器就安装完了。 IK中文

随风飘雁 1869

ElasticSearch安装中文分词器 ik

ElasticSearch安装中文分词器 ik (1)下载中文分词器elasticsearch-analysis-ik-master.zip(一定要下载和你的es版本一致的) 官方下载:https://github.com/medcl/elasticsearch-analysis-ik csdn下载:https://download.csdn.net/download/u014646662/...

周天祥的博客 3万+

中文分词器分词效果评估对比

中文分词器分词效果评估对比 中文分词是自然语言处理(NLP)领域的基础任务之一,其目的是将连续的文本分割成一个个有意义的词。不同的分词器在准确性、速度和适用场景上各有优劣。本文将对比分析当前流行的中文分词器的分词效果,以帮助用户选择最适合自己的分词工具。 项目介绍 本文介绍的中文分词器分词效果评估对比项目,旨在提供一个公平、统一的平台,对多种中文分词器进行性能评估。项目包含两个主要文件:test-...

gitblog_00204的博客 918

Elasticsearch 安装中文分词器

ik_max_word: 会将文本做最细粒度的拆分,比如会将“中华人民共和国国歌”拆分为“中华人民共和国,中华人民,中华,华人,人民共和国,人民,人,民,共和国,共和,和,国国,国歌”,会穷尽各种可能的组合;为什么要在elasticsearch中要使用ik这样的中文分词呢,那是因为es提供的分词是英文分词,对于中文的分词就做的非常不好了,因此我们需要一个中文分词器来用于搜索和使用。1,Elasticsearch中文分词我们采用Ik分词,ik有两种分词模式,ik_max_word,和ik_smart模式;

weizhennan123的博客 1356
上一篇: 开源中文分词软件
下一篇: 一个简单的数字输出
digmouse
博客等级 码龄18年 10粉丝 16原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值