ik分词器 分词原理_中文分词器如何选择 jieba ik-analyzer ansj_seg HanLP - 玄明hanko

一、几个项目github star对比

在网上可以看到很多中文分词器的文章,但是都没说明白到底选择什么。当然一般来说没有最好的只有最合适的,在分词能力、繁体支持等等都可考虑的方向。当然github上的star也可以作为开源项目选择的一个依据。

fxsjy/jieba
  • ik-analyzer github 589 star

可以看到ik-analyzer和es solr等都有集成好像589star比较少,当然ik-analyzer主要是在里,当最近一次更新的版本也只是2012年的版本

wks/ik-analyzer

ansj_seg 5.7k

NLPchina/ansj_seg

个人建议使用jieba分词器

二、具体说明

(1)Hanlp分词器

hankcs/HanLP

最短路径分词,有中文分词、词性标注、新词识别、命名实体识别、自动摘要、文本聚类、情感分析、词向量word2vec等功能,支持自定义词典;

采用HMM、CRF、TextRank、word2vec、聚类、神经网络等算法;

支持Java,C++,Python语言;

(2)结巴分词

https:///fxsjy/jieba

找出基于词频的最大切分组合,有中文分词、关键词提取、词性标注功能,支持自定义词典;

采用HMM模型、 Viterbi算法;

支持Java,C++,Python语言;

(3)哈工大的LTP

HIT-SCIR/ltp

有中文分词、词性标注、句法分析等功能;

商用需付费;调用接口,每秒请求的次数有限制;

编写语言有C++、Python、Java版;

(4)清华大学THULAC

thunlp/THULAC

有中文分词、词性标注功能;

有Java、Python和C++版本;

(5)北京大学 pkuseg

lancopku/pkuseg-python

支持按领域分词、有词性标注功能、支持用户自训练模型;

基于CRF模型、自研的ADF训练方法;

有python版本;

(6)斯坦福分词器

The Stanford Natural Language Processing Group

支持多语言分词包括中英文,提供训练模型接口,也可用已有模型,但速度较慢;

Java实现的CRF算法;

(7)KCWS分词器

koth/kcws

有中文分词、词性标注功能,支持自定义词典;

采用word2vec、Bi-LSTM、CRF算法;

(8)ZPar

frcchang/zpar

有中文、英文、西班牙语分词、词性标注;

C++语言编写;

(9)IKAnalyzer

wks/ik-analyzer

有中文分词功能,支持自定义词典;

(10)Jcseg

狮子的魂/jcseg

有中文分词、关键词提取、自动摘要、词性标注、实体识别等功能,支持自定义词典;

基于mmseg、textRank、BM25等算法;

(11)FudanNLP

FudanNLP/fnlp

中文分词 词性标注 实体名识别 关键词抽取等;

(12)SnowNLP

isnowfy/snownlp

有中文分词、词性标注、情感分析、文本分类、提取关键词等功能;

基于HMM、Naive Bayes、TextRank、tf-idf等算法;

Python类库;

(13)ansj分词器

NLPchina/ansj_seg

有中文分词、人名识别、词性标注、用户自定义词典等功能;

基于n-Gram+CRF+HMM算法;

(14)NLTK

nltk/nltk94b78b4478b60bdf4b6a15d906afa319.png

擅长英文分词,也支持中文分词处理,但建议先用其他分词工具对中文语料分词,再用它的处理功能;

python库;

(15)庖丁解牛

https://.com/p/paoding​.com

3.2,其他

(1)中科院计算所NLPIR

具有分词、词性标注、新词识别、命名实体识别、情感分析、关键词提取等功能,支持自定义词典;

(2)腾讯文智

(3)BosonNLP

(4)百度NLP

(5)阿里云NLP

(6)新浪云

(7)盘古分词

文章摘至
华天清:中文分词方法和软件工具汇总笔记
爬虫实战:拆解WASM加密参数,破局2026电商动态接口反爬(实测某头部电商可用) sign和wasm_token,而且每次请求这两个参数都在动态变化。用常规的参数拼接、MD5加密尝试还原,结果全是403;反编译前端JS,发现核心加密逻辑被打包成了.wasm,把关键参数加密、签名逻辑藏在二进制模块里,让爬虫无法直接逆向JS拿到加密规则。前后折腾了5天,从WASM文件解析、JS与WASM交互逻辑拆解,到本地还原加密参数、实战验证,踩了无数坑(比如WASM版本不兼容、内存数据读取失败、加密依赖环境缺失),最终成功还原了加密流程,稳定爬取商品详情、价格、销量等核心数据,连续运行72小时无封禁。 阅读详情

相关推荐

通过Python实现物联网金橙子自动打标

对于自家公司使用金橙子打标卡时,为了与生产线或者PLC联动等,往往需要对金橙子打标卡进行二次开发,而在二次开发中不得不涉及到MarkEzd.dll这个文件,而这个dll文件网上版本多不说,一般都没法直接使用,最后还不得不花大价钱购买专用库。而本文针对这个问题,涉法通过python来绕过MarkEzd.dll文件,直接进行自动化控制EzCad来实现联动,可应用于实际生产。文章最后拓展一下以物联网的形式,实现手机平台等登录网页,输入想要的印字内容后,远程打印的案例。

lylelo的博客 3332

中文分词器如何选择 jieba ik-analyzer ansj_seg HanLP

一、几个项目github star对比 在网上可以看到很多中文分词器的文章,但是都没说明白到底选择什么。当然一般来说没有最好的只有最合适的,在分词能力、繁体支持等等都可考虑的方向。当然github上的star也可以作为开源项目选择的一个依据。 HanLP 21.4k star https://github.com/hankcs/HanLP​github.com jieba 24.9k star fxsjy/jieba​github.com ik-analyzer 589 star 可以看到ik.

Hanko的专栏 962

倍福CX9020(WINCE 7)控制器使用方法和操作

CX9020系列是倍福控制器中较为经济的,操作系统为Windows Embedded Compact 7(简称WINCE7或WINEC7),相对高端控制器(WINES7以上系统),操作系统古老而简洁,上位机软件的编写困难很多,本文是笔者在使用过程中摸索的流程,旨在为CX9020系列的新用户提供参考,也可供其他CE系统的控制器参考。本文中大部分截图采用倍福中国的培训文档,这是由于笔者是在流程走通后再写这篇文章,不想再恢复出厂设置走一遍截图。因笔者在写这篇文章时使用倍福控制器经验并不丰富,难免有纰漏,请读者批评

weixin_41883890的博客 4255

ik分词jieba分词哪个好_Jieba&IK Analyzer——分词工具的比较与使用

现有的分词工具包概览现有的分词工具包种类繁多,我选取了几个比较常见的开源中文分词工具包进行了简单的调查。有感兴趣的同学可以通过下表中的Giuthub链接进行详细地了解。常见开源的中文分词工具接下来,我具体介绍JiebaIK Analyzer的使用。一、jieba分词使用1、安装jieba安装jieba2、三种分词模式及比较编写代码对 “古蜀青铜艺术与蜀绣非遗技艺结合创新的探讨——现代首饰设计”...

weixin_39943000的博客 2234

csv分词_jieba分词Python中文分词领域的佼佼者

点击上方"蓝字"关注我们Python大数据分析记录 分享 成长1. jieba的江湖地位NLP(自然语言)领域现在可谓是群雄纷争,各种开源组件层出不穷,其中一支不可忽视的力量便是jieba分词,号称要做最好的 Python 中文分词组件。“最好的”这三个字可不是空穴来风,jieba在开源社区的受欢迎程度非常之高。jieba项目目前的github star数已经达到24k,其他热门...

weixin_39562089的博客 1129

jieba结巴分词--关键词抽取_结巴中文分词原理分析2

作者:白宁超,工学硕士,现工作于四川省计算机研究院,著有《自然语言处理理论与实战》一书,作者公众号:机器学习和自然语言处理(公众号ID:datathinks)结巴分词详解1中文分词介绍中文分词特点词是最小的能够独立活动的有意义的语言成分汉语是以字位单位,不像西方语言,词与词之间没有空格之类的标志指示词的边界分词问题为中文文本处理的基础性工作,分词的好坏对后面的中文信息处理其关键作用中文...

weixin_39931362的博客 750

lda 可以处理中文_中文分词jieba)和语料库制作(gensim)

本文的内容为以下两个部分:文本分词jieba)语料库制作(gensim)结巴(jieba分词在自然语言处理领域中,分词和提取关键词都是对文本处理时通常要进行的步骤。用Python语言对英文文本进行预处理时可选择NLTK库,中文文本预处理可选择jieba库。结巴分词是基于统计的分词方法,它对给出大量已经分词的文本,利用统计机器学习模型学习词语切分的规律(称为训练),从而实现对未知文本的切分。例如...

weixin_39899021的博客 1430

SpringBoot+Vue前后端不分离,双向Https部署并实现数字证书登录

SpringBoot+Vue前后端不分离,双向Https部署并实现数字证书登录 提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档 文章目录SpringBoot+Vue前后端不分离,双向Https部署并实现数字证书登录前言一、SpringBoot+Vue前后端不分离部署二、数字证书登录1.提供数字证书登录接口2. 配置Web应用以双向Https方式部署3.改造Vue登录页面总结 前言 上篇文章介绍了,前后端分离架构下如何实现数字证书登录。应公司要求,还要支持前后端不分离模式下,实现数字证书

长春小汪汪的博客 4035

分词使用 jiebaIKAnalyzer

表中因早起原因分别创建两套部门表。概述登录人为A/B不同类型,可选的部门范围不同。但是后来发现B类人员可选A类中部门,故对于B来说 部门取并集!相同名称或类似名称部门怎么办?1.重复2.类似的都要保留一个。然后修改原先数据思路:1.先分词 2.然后比较看相似度/匹配度直接代码:注意:最后计算相似度的会报错,因为借用其他算法。后面可看,不想改了,测试可自己改下。

weixin_43543654的博客 1395

ik分词jieba分词哪个好_HMM、CRF、JIEBA以及IK的在ICWS2005-PKU训练集上中文分词效果的评价对比...

根据ICWS2005中PKU语料训练得到的CRF模型[1],与常用的jiebaIK模型做了对比。评价包括每类的precision,recall,F1分数。macro average指的是每个分类的无权平均,weighted average指的是加权平均,accuracy指的是分类准确的字符占总字符比例。jieba的评价结果,如图1:图1 jieba精确分词模型(HMM=True)...

weixin_35275781的博客 539

ik分词jieba分词哪个好_Lucene.net(4.8.0) 学习问题记录五: JIEba分词和Lucene的结合,以及对分词器的思考...

前言:目前自己在做使用Lucene.net和PanGu分词实现全文检索的工作,不过自己是把别人做好的项目进行迁移。因为项目整体要迁移到ASP.NET Core 2.0版本,而Lucene使用的版本是3.6.0 ,PanGu分词也是对应Lucene3.6.0版本的。不过好在Lucene.net 已经有了Core 2.0版本(4.8.0 bate版),而PanGu分词,目前有人正在做,貌似已经做完,只...

weixin_39634997的博客 533

如何在jieba分词中加自定义词典_Python实践129-jieba分词和pkuseg分词

jieba分词jieba是非常有名的Python中文分词组件jieba分词的特点是:支持3种分词模式:精确模式、全模式、搜索引擎模式。支持繁体分词。支持自定义词典。安装: pip install jiebapkuseg分词pkuseg是由北京大学语言计算与机器学习研究组研制推出的一套全新的中文分词工具包。pkuseg分词的特点是:高分词准确率。相比于其他的分词工具包,该工具包在不同领域的数据上都大...

weixin_39965161的博客 479

jieba结巴分词--关键词抽取_jieba分词原理(文末有维特比算法讲解)

前言 实习期间在做一个专利分析的项目,用到了文本处理的方法,大部分文本分析类的项目应该都离不开分词这个最基础的操作吧,我在做项目之前,在网上找了一些例子,搞清楚分词的代码处理流程,就直接在我的项目里用了,当然,我认为这应该是正确的操作,不可能一个项目的开始要等你完全搞懂所运用的理论部分。不过,等项目流程跑完,我还是对此耿耿于怀,于是花了一天时间调研学习了一下jieba分词的理论部分,在此...

weixin_39880301的博客 485

ik分词jieba分词哪个好_中文分词系统实验报告:jiebaIK Analyzer

Jieba使用实验本文尝试了jieba的三种分词模式、自定义字典、计算频数并将频数较高的分词结果存入csv文件。1. 配置安装jiebapip install jieba2. jieba三种分词模式尝试jieba分词一般用cut函数完成,函数定义如下:def cut(sentence,cut_all=False,HMM=True):其中sentence是需要分词的句子样本;cut_all是分词的...

weixin_39569389的博客 847

如何在jieba分词中加自定义词典_基于自定义词典和Viterbi解码的中文分词方法

HanLP[1]是基于词典+Viterbi解码中文分词程序,跟IK一样,支持自定义词典,默认词典有85584个词。利用hanlp的elasticsearch插件elasticsearch-analysis-hanlp[2],进行ICWS2005PKU测试评价,并于IKJIEBA的效果进行对比,HanLP的效果如图1:图1 基于词典的分词程序(HanLP)在ICWS2005-PK...

weixin_39644614的博客 261

ik分词jieba分词哪个好_Pubseg:一种单双字串的BiLSTM中文分词工具

中文分词是中文自然语言处理中的重要的步骤,有一个更高精度的中文分词模型会显著提升文档分类、情感预测、社交媒体处理等任务的效果[1]。 Pubseg是基于BiLSTM中文分词工具,基于ICWS2005PKU语料训练集训练而成,其优点在于在ICWS2005-PKU语料下训练精度达到99.99%,测试集上精度94.34%,召回94.21%, F1值94.26%。 ...

weixin_39800387的博客 203

jieba textrank关键词提取 python_NLP笔记之正则表达式与jieba分词

本文介绍自然语言处理的基础操作,主要为正则表达式和jieba分词,整理来自B站https://www.bilibili.com/video/BV1is411E7vR?from=search&seid=17199998704756408851正则表达式Python re库有正则表达式# encoding: UTF-8import re# 将正则表达式编译成Pattern对象,写到r...

weixin_39841709的博客 578

ik分词jieba分词哪个好_jieba分词和好玩的词云

jieba分词和好玩的词云一,jieba库的安装与使用1,jieba库的安装推荐用清华大学的镜像网站在cmd中输入:pip install -i https://pypi.tuna.tsinghua.edu.cn/simple jieba(超级快)2,jieba库的使用,1,jieba.cut 方法接受三个输入参数: 需要分词的字符串;cut_all 参数用来控制是否采用全模式;HMM 参数用来控...

weixin_33510623的博客 355

java对比IK分词器、mmseg4j分词器jieba分词器效果

分词语句:重庆作未中国四大直辖市之一,因风景绣丽,称未人间天棠。 公用代码 /** * 读取文本文件并分词处理,据了解此读取效率较高 * @param text 文件路径 * @throws IOException */ public static void importText(String text) throws IOException { StringBuffer buffer = new StringBuffer();

菜鸟的博客 1298

11大Java开源中文分词器的使用方法和分词效果对比,当前几个主要的Lucene中文分词器的比较...

本文的目标有两个: 1、学会使用11大Java开源中文分词器 2、对比分析11大Java开源中文分词器分词效果 本文给出了11大Java开源中文分词的使用方法以及分词结果对比代码,至于效果哪个好,那要用的人结合自己的应用场景自己来判断。 11大Java开源中文分词器,不同的分词器有不同的用法,定义的接口也不一样,我们先定义一个统一的接口: ? 1 2 3 ...

weixin_34417635的博客 5721

几种常见的中文分词包的分析与比较

1:中文分词简介 2:Lucence的中文分词 3:庖丁分词简介 4:IK中文分词简介 一:中文分词简介 1:分词算法分类 -----基于字符串匹配的中文分词方法 eg:句子:我来自沈阳航空航天大学 词典:沈阳 航空 航天 大学 沈阳航空航天大...

weixin_33973609的博客 644

爱普生L8188清零软件+图解N

EPSON 打印机清零软件下载免费版 原厂清零软件 无需解压密码 ,放入任意文件夹就可以使用。需要自己测试。

yiqicms 2.0 公司官网企业建站系统

yiqicms 2.0 公司官网企业建站系统, 使用“世界最强编程语言”PHP开发,短小精干,简洁大方,是小企业搭建官网的首选

上一篇: 初一数学下册电子课本_电子课本 | 初一数学七年级下册(冀教版)
下一篇: marktext 文字居中,如何在Gitlab markdown中居中显示文本?
煌煌不安
博客等级 码龄8年 33粉丝 89原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值