中文分词工具安装教程及分词和词性标注应用(jieba、pyhanlp、pkuseg、foolnltk、thulac、snownlp、nlpir)

1、NLP分词 NLP 阅读详情

2.1 jieba

2.1.1 jieba简介

Jieba中文含义结巴,jieba库是目前做的最好的python分词组件。首先它的安装十分便捷,只需要使用pip安装;其次,它不需要另外下载其它的数据包,在这一点上它比其余五款分词工具都要便捷。另外,jieba库支持的文本编码方式为utf-8。

Jieba库包含许多功能,如分词、词性标注、自定义词典、关键词提取。基于jieba的关键词提取有两种常用算法,一是TF-IDF算法;二是TextRank算法。基于jieba库的分词,包含三种分词模式:

  • 精准模式:试图将句子最精确地切开,适合文本分析);
  • 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义);
  • 搜索引擎模式:搜索引擎模式,在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

Jieba官方文档:https://pypi.org/project/jieba/

2.1.2 jieba安装

Jieba库安装比较便捷,只需要在命令框中输入:pip install jieba;或者在pycharm中,通过setting-project安装。

2.1.3 jieba分词和词性标注的简单应用

import jieba
import jieba.posseg as posseg
txt1 ='''
文本一:
人民网华盛顿3月28日电(记者郑琪)据美国约翰斯·霍普金斯大学疫情实时监测系统显示,截至美东时间3月28日下午6时,
美国已经至少有新冠病毒感染病例121117例,其中包括死亡病例2010例。
与大约24小时前相比,美国确诊病例至少增加了20400例,死亡病例至少增加了466例。
目前美国疫情最为严重的仍是纽约州,共有确诊病例至少52410例。此外,新泽西州有确诊病例11124例,加利福尼亚州有5065例,
密歇根州有4650例,马塞诸塞州有4257例,华盛顿州有4008例。
'''
# 精确模式
seg_list = jieba.cut(txt1,cut_all=False)
# seg_list = jieba.cut_for_search(txt1)
print("jieba分词:" + "/ ".join(seg_list)) # 精确模式
list = posseg.cut(txt1)
tag_list =[]
for tag in list :
    pos_word = {  }
    pos_word[1] = tag.word
    pos_word[2] = tag.flag
    tag_list.append(pos_word)
print('jieba词性标注:',tag_list)
结果展示:
jieba分词:
/ 文本/ 一/ :/ 
/ 人民网/ 华盛顿/ 3/ 月/ 28/ 日电/ (/ 记者/ 郑琪/ )/ 据/ 美国/ 约翰斯/ ·/ 霍普金斯大学/ 疫情/ 实时/ 监测/ 系统/ 显示/ ,/ 截至/ 美/ 东/ 时间/ 3/ 月/ 28/ 日/ 下午/ 6/ 时/ ,/ 
/ 美国/ 已经/ 至少/ 有/ 新冠/ 病毒感染/ 病例/ 121117/ 例/ ,/ 其中/ 包括/ 死亡/ 病例/ 2010/ 例/ 。/ 
/ 与/ 大约/ 24/ 小时/ 前/ 相比/ ,/ 美国/ 确诊/ 病例/ 至少/ 增加/ 了/ 20400/ 例/ ,/ 死亡/ 病例/ 至少/ 增加/ 了/ 466/ 例/ 。/ 
/ 目前/ 美国/ 疫情/ 最为/ 严重/ 的/ 仍/ 是/ 纽约州/ ,/ 共有/ 确诊/ 病例/ 至少/ 52410/ 例/ 。/ 此外/ ,/ 新泽西州/ 有/ 确诊/ 病例/ 11124/ 例/ ,/ 加利福尼亚州/ 有/ 5065/ 例/ ,/ 
/ 密歇根州/ 有/ 4650/ 例/ ,/ 马塞诸塞/ 州/ 有/ 4257/ 例/ ,/ 华盛顿州/ 有/ 4008/ 例/ 。/ 

jieba词性标注: [{1: '\n', 2: 'x'}, {1: '文本', 2: 'n'}, {1: '一', 2: 'm'}, {1: ':', 2: 'x'}, {1: '\n', 2: 'x'}, {1: '人民网', 2: 'n'}, {1: '华盛顿', 2: 'ns'}, {1: '3', 2: 'm'}, {1: '月', 2: 'm'}, {1: '28', 2: 'm'}, {1: '日电', 2: 'j'}, {1: '(', 2: 'x'}, {1: '记者', 2: 'n'}, {1: '郑琪', 2: 'nr'}, {1: ')', 2: 'x'}, {1: '据', 2: 'p'}, {1: '美国', 2: 'ns'}, {1: '约翰斯', 2: 'nrt'}, {1: '·', 2: 'x'}, {1: '霍普金斯大学', 2: 'nt'}, {1: '疫情', 2: 'n'}, {1: '实时', 2: 'd'}, {1: '监测', 2: 'vn'}, {1: '系统', 2: 'n'}, {1: '显示', 2: 'v'}, {1: ',', 2: 'x'}, {1: '截至', 2: 'v'}, {1: '美', 2: 'ns'}, {1: '东', 2: 'ns'}, {1: '时间', 2: 'n'}, {1: '3', 2: 'm'}, {1: '月', 2: 'm'}, {1: '28', 2: 'm'}, {1: '日', 2: 'm'}, {1: '下午', 2: 't'}, {1: '6', 2: 'm'}, {1: '时', 2: 'n'}, {1: ',', 2: 'x'}, {1: '\n', 2: 'x'}, {1: '美国', 2: 'ns'}, {1: '已经', 2: 'd'}, {1: '至少', 2: 'd'}, {1: '有', 2: 'v'}, {1: '新', 2: 'a'}, {1: '冠', 2: 'n'}, {1: '病毒感染', 2: 'n'}, {1: '病例', 2: 'n'}, {1: '121117', 2: 'm'}, {1: '例', 2: 'v'}, {1: ',', 2: 'x'}, {1: '其中', 2: 'r'}, {1: '包括', 2: 'v'}, {1: '死亡', 2: 'v'}, {1: '病例', 2: 'n'}, {1: '2010', 2: 'm'}, {1: '例', 2: 'v'}, {1: '。', 2: 'x'}, {1: '\n', 2: 'x'}, {1: '与', 2: 'p'}, {1: '大约', 2: 'd'}, {1: '24', 2: 'm'}, {1: '小时', 2: 'n'}, {1: '前', 2: 'f'}, {1: '相比', 2: 'v'}, {1: ',', 2: 'x'}, {1: '美国', 2: 'ns'}, {1: '确诊', 2: 'v'}, {1: '病例', 2: 'n'}, {1: '至少', 2: 'd'}, {1: '增加', 2: 'v'}, {1: '了', 2: 'ul'}, {1: '20400', 2: 'm'}, {1: '例', 2: 'v'}, {1: ',', 2: 'x'}, {1: '死亡', 2: 'v'}, {1: '病例', 2: 'n'}, {1: '至少', 2: 'd'}, {1: '增加', 2: 'v'}, {1: '了', 2: 'ul'}, {1: '466', 2: 'm'}, {1: '例', 2: 'v'}, {1: '。', 2: 'x'}, {1: '\n', 2: 'x'}, {1: '目前', 2: 't'}, {1: '美国', 2: 'ns'}, {1: '疫情', 2: 'n'}, {1: '最为', 2: 'd'}, {1: '严重', 2: 'a'}, {1: '的', 2: 'uj'}, {1: '仍', 2: 'd'}, {1: '是', 2: 'v'}, {1: '纽约州', 2: 'ns'}, {1: ',', 2: 'x'}, {1: '共有', 2: 'v'}, {1: '确诊', 2: 'v'}, {1: '病例', 2: 'n'}, {1: '至少', 2: 'd'}, {1: '52410', 2: 'm'}, {1: '例', 2: 'v'}, {1: '。', 2: 'x'}, {1: '此外', 2: 'c'}, {1: ',', 2: 'x'}, {1: '新泽西州', 2: 'ns'}, {1: '有', 2: 'v'}, {1: '确诊', 2: 'v'}, {1: '病例', 2: 'n'}, {1: '11124', 2: 'm'}, {1: '例', 2: 'v'}, {1: ',', 2: 'x'}, {1: '加利福尼亚州', 2: 'ns'}, {1: '有', 2: 'v'}, {1: '5065', 2: 'm'}, {1: '例', 2: 'v'}, {1: ',', 2: 'x'}, {1: '\n', 2: 'x'}, {1: '密歇根州', 2: 'ns'}, {1: '有', 2: 'v'}, {1: '4650', 2: 'm'}, {1: '例', 2: 'v'}, {1: ',', 2: 'x'}, {1: '马塞诸塞', 2: 'nr'}, {1: '州', 2: 'n'}, {1: '有', 2: 'v'}, {1: '4257', 2: 'm'}, {1: '例', 2: 'v'}, {1: ',', 2: 'x'}, {1: '华盛顿州', 2: 'ns'}, {1: '有', 2: 'v'}, {1: '4008', 2: 'm'}, {1: '例', 2: 'v'}, {1: '。', 2: 'x'}, {1: '\n', 2: 'x'}]

2.2 thulac

2.2.1 thulac简介

THULAC(THU Lexical Analyzer for Chinese)由清华大学自然语言处理与社会人文计算实验室研制推出的一套中文词法分析工具包,具有中文分词和词性标注功能。THULAC集成了目前世界上规模最大的人工分词和词性标注中文语料库(约含5800万字),模型标注能力强大。该工具包在标准数据集Chinese Treebank(CTB5)上分词的F1值可达97.3%,词性标注的F1值可达到92.9%。同时进行分词和词性标注速度为300KB/s,每秒可处理约15万字。只进行分词速度可达到1.3MB/s。总的来说,可以理解为thulac训练的分词、词性标注语料库很大,性能优良。

Thulac的简单分词,可以通过python程序import thulac,新建thulac.thulac(args)类,其中args为程序的参数,之后可以通过调用thulac.cut()进行单句分词。

Thulac使用参考文档:http://thulac.thunlp.org/

2.2.2 thulac安装

Thulac库的安装也较为简单,不需要下载特别的数据包

jieba中文分词模块,详细使用教程 如果有大量术语(比如。 阅读详情

相关推荐

NLP自然语言处理中英文分词工具集锦与基本使用 jieba,snowNLP ,StanfordCoreNLP,thulac

目录 NLP分词工具集锦 分词实例用文件 一、中文分词工具 (1)Jieba (2)snowNLP分词工具 (3)thulac分词工具 (4)pynlpir 分词工具 (5)StanfordCoreNLP分词工具 (6)Hanlp分词工具 二、英文分词工具 1. NLTK: 2. SpaCy: 3. StanfordCoreNLPNLP分词工具集锦 分词实例用文件...

种花家的奋斗兔的博客 7144

自然语言处理入门(4)——中文分词原理及分词工具介绍

本文首先介绍下中文分词的基本原理,然后介绍下国内比较流行的中文分词工具,如jiebaSnowNLPTHULACNLPIR,上述分词工具都已经在github上开源,后续也会附上github链接,以供参考。 1.中文分词原理介绍 1.1 中文分词概述 中文分词(Chinese Word Segmentation) 指的是将一个汉字序列切分成一个一个单独的词。分词就是将连续的字序列按照一定的

FlySky1991的专栏 11万+

中文分词词库:自然语言处理的关键工具

本文还有配套的精品资源,点击获取 简介:中文分词词库在中文自然语言处理中起着基础性的作用,负责将汉字序列切分为有意义的词汇单位。这些词库经过精心构建优化,用于提升分词的准确性效率。它们不仅用作分词算法的训练与优化,还作为评估不同分词技术效果的标准。中文分词在广告精准投放、搜索引擎推荐系统中尤为重要,专业扩充词库标准词库分别为特定通用文本处理提供了支持。随着词库的持...

weixin_42453228的博客 2034

NLP常用的三种中文分词工具对比

本文将对三种中文分词工具进行使用尝试,这三种工具分别为:哈工大的LTP,结巴分词以及北大的pkuseg

学习,是熵减的最有效途径。 2507

NLP算法-中文分词工具-Jieba

jieba的主要功能是做中文分词,可以进行简单分词、并行分词、命令行分词,当然它的功能不限于此,目前还支持关键词提取、词性标注、词位置查询等。 更让人愉悦的是jieba虽然立足于python,但同样支持其他语言平台,诸如:C++、Go、R、Rust、Node.js、PHP、 iOS、Android等。所以jieba能满足各类开发者的需求。

Albert_weiku的博客 4847

详细介绍NLP中文分词原理及分词工具

本文详细介绍了中文分词方法的原理,以及常用的分词工具

zag666的博客 7804

常见的三种分词工具

常见的三种分词工具 这节课主要讲了三种常见的分词工具jieba分词 ltp分词 ir分词 一、 分词的概念: 中文分词(Chinese Word Segmentation) 指的是将一个汉字序列切分成一个一个单独的词。分词就是将连续的字序列按照一定的规范重新组合成词序列的过程。 二、 中文分词工具 jieba分词:比较常用,用法比较简单,主要有三种分词模式 python安装jieba...

qq_43791470的博客 7079

几款开源的中文分词系统

PhpanAlysis分词系统是基于字符串匹配的分词方法 ,这种方法又叫做机械分词方法,它是按照一定的策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。ICTCLAS 3.0 商业版是收费的,而免费提供的 ICTCLAS 3.0 共享版不开源,词库是根据人民日报一个月的语料得出的,很多词语不存在。功能:盘古分词提供中文人名识别,简繁混合分词,多元分词,英文词根化,强制一元分词,词频优先分词,停用词过滤,英文专名提取等一系列功能。

草根上的须子 2450

干货 | 史上最全中文分词工具整理

作者 |fendouai 一.中文分词 分词服务接口列表 二.准确率评测: THULAC:与代表性分词软件的性能对比 我们选择LTP-3.2.0、ICTCLAS(2015版)jieba(C++版)等国内具代表性的分词软件与THULAC做性能比较。我们选择Windows作为测试环境,根据第二届国际汉语分词测评(The SecondInternational Chinese Word Segmentation Bakeoff)发布的国际中文分词测评标准,对不同软件进行了速度准确率测试。...

NicolasLearner的博客 2908

NLP笔记:中文分词工具简介

中文分词工具简介 0. 引言 1. jieba分词 1. jieba分词的基本用法 2. jieba分词的进阶版用法 1. 全模式的分词 2. 自定义领域词表加入 3. 使用jieba进行关键词抽取 1. tf-idf关键词抽取 2. TextRank关键词抽取 2. pyltp分词 1. 分词模块调用方法 2. pos模块调用方法 3. ner模块调用方法 4. dp模块调用方法 5. srl模块调用方法 3. sentencepiece分词 1. sentencepiec..

codename_cys的博客 2938

中文分词工具使用方法及比较

中文分词工具分词背景介绍安装及介绍(jiebapyhanlppkusegthulacsnownlpnlpir)windowst系统分词工具安装Linux系统分词工具安装数据集介绍实验结果及比较参考文献 分词背景介绍        不管在平时的实验还是比赛中,NLP的绝大多数任务(情感分析、阅读理解、对话系统、文本分类、...

厚积而薄发 4281

自然语言处理(一)——中英文分词

文章目录一、Jieba分词二、SnowNlp分词三、nltk分词四、thunlp分词五、nlpIR分词六、Stanford分词七、结论 中英文分词工具有很多,今天我们来使用Jieba分词SnowNlp分词、nltk分词、thunlp分词NLPIR分词、Stanford分词等六种分词工具来对给定中英文文本进行分词。 一、Jieba分词 结巴分词是用于中文分词分词工具安装与使用都比较容易掌握,...

南木的博客 9287

分词工具汇总

分词工具汇总 常见分词工具介绍: jieba(结巴分词) 免费使用 HanLP(汉语言处理包) 免费使用 SnowNLP(中文的类库) 免费使用 FoolNLTK(中文处理工具包) 免费使用 Jiagu(甲骨NLP) 免费使用 pyltp(哈工大语言云) 商用需要付费 THULAC(清华中文词法分析工具包) 商用需要付费 NLPIR(汉语分词系统) 付费使用 ...

weixin_41021342的博客 3540

深入理解IK Analyzer中文分词工具

本文还有配套的精品资源,点击获取 简介:IK Analyzer 是一款开源的中文分词工具,旨在提供简单易用性能优良的中文分词解决方案。该工具支持正向与逆向最大匹配算法,自定义词典扩展,以及多种优化策略以提升分词效率。它适用于搜索引擎、信息检索、文本分析等多场景应用,并提供详细的源码解析使用方法说明。 1. IK Analyzer开源中文分词工具简介 1....

weixin_42350014的博客 2201

分词工具比较及使用(ansj、hanlpjieba)

一、分词工具 ansj、hanlpjieba 二、优缺点 1.ansj 优点:  提供多种分词方式  可直接根据内部词库分出人名、机构等信息  可构造多个词库,在分词时可动态选择所要使用的词库缺点:  自定义词典时,系统词典还是被优先使用,导致词性不是自定义词典中的词性  多单词英文姓名无法分出适用场景   若不使用自定义分词,可直接使用ansj 2.hanlp 优点:  自定义分...

weixin_30457551的博客 1270

Python中文分词工具大合集:安装、使用测试

转自:AINLP这篇文章事实上整合了之前文章的相关介绍,同时添加一些其他的Python中文分词相关资源,甚至非Python中文分词工具,仅供参考。首先介绍之前测试过的8...

AI蜗牛车 1万+

中文分词分词工具及使用实践总结

本文总结了13种主流中文分词工具,包括jieba、cutword、pkuseg、baidu lac、jiagu、HanLP等,涵盖通用工具与垂域能力。这些工具基于不同算法实现,如统计词典、机器学习、深度学习等,支持精确、全模式搜索引擎模式等分词方式。部分工具还提供词性标注、专名识别等附加功能。文章详细介绍了各工具的简介、GitHub地址、开源协议、安装方法测试案例,为开发者在项目中快速选型应用提供参考。

故事猝不及防,发量秃如其来 1437
上一篇: pyhanlp安装教程
下一篇: 爬虫学习笔记:爬取百度贴吧(美女吧)图片
明的大世界
博客等级 码龄10年 94粉丝 19原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值