中文自动分词学习小结

NLP之汉语自动分词 汉语自动分词就是让计算机识别出汉语文本中的‘词’,在词与词之间自动加上空格或其他边界标记。 目录 一.汉语自动分词中的基本问题 1.1分词规范问题 2.2歧义切分问题 3.未登录词问题 二.汉语分词方法 1.N-最短路径方法 2.基于词的n元语法模型的分词方法 3.由字构词的汉语分词方法 4.基于词感知机算法的汉语分词方法 5.基于字的生成式模型和区分式模型相结合的汉语分词方... 阅读详情

自从本科毕业设计选择了中文分词这个题目我就与中分分词结下了不解之缘。到现在学习和研究中分分词有半年了,只能说知道点皮毛,在这里想对自己了解到的中文分词知识做个总结。一方面是对自己工作的阶段小结同时希望对刚开始学习和研究中文分词的朋友有一些帮助。

首先从我的本科毕业设计开始介绍,当时的题目是《中文自动分词系统研究与实现》。现有的分词方法可分为三大类:基于字符串匹配的分词方法、基于理解的分词方法和基于统计的分词方法。我按照常规从最简单的基于字符串匹配的分词方法开始研究。这种方法又叫做机械分词方法,它是按照一定的策略将有待分析的汉字串与一个充分大的机器词典中的词条进行配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。按照扫描方向的不同,串匹配分词方法可以分为正向匹配和逆向匹配;按照不同长度优先匹配的情况,可以分为最大(最长)匹配和最小(最短)匹配;按照是否与词性标注过程相结合,又可以分为单纯分词方法和分词与标注相结合的一体化方法。

基于字符串匹配的分词方法可以说是一种简单而有效的分词方法,但近些年基于统计的方法越来越表现出优越的性能。从形式上看,词是稳定的字的组合,因此在上下文中,相邻的字同时出现的次数越多,就越有可能构成一个词。因此字与字相邻共现的频率或概率能够较好的反映成词的可信度。基于统计的分词方法所应用的主要统计量或统计模型有:互信息、N元文法模型、神经网络模型、隐Markov模型和最大熵模型等。这些统计模型主要是利用词与词的联合概率作为分词的信息。

提到中文分词,可能不得不提中科院的中文自动分词系统。不仅因为它是基于统计模型更重要的是它是一个开源程序代码的系统,无论对于初学者还是研究者都有重要的意义。本人就用了将近一个学期来学习和java实现中科院的中文分词系统,当然因为要上课和其他事情耽误所以实现用了很长时间。在我的学习和研究中,网上很多朋友的博客和google的论坛给了我很多帮助。

1.     http://blog.csdn.net/DanceFire/category/294373.aspx  DanceFire的专栏

2.     http://blog.csdn.net/eaglet/MyArticles.aspx  eaglet的专栏

3.     http://www.cnblogs.com/zhenyulu/category/85598.html   吕震宇的blog

4.     http://qxred.yculblog.com/post.1204714.html    风暴红QxRed

5.     http://groups.google.com/group/ictclas/topics?hl=zh-CN  ICTCLAS研究学习组

学习中科院的中文分词系统,有两篇论文也很重要。

  1. 刘群,张华平,俞鸿魁,程学旗.基于层叠隐马模型的汉语词法分析研究.pdf
  2. 基于N-最短路径方法的中文词语粗分模型.pdf

学习了一个学期的中文分词,觉得公开的高质量的语料库太少了,基本上都是人民日报语料库,好的训练集和测试集也很少,大多都要收费,可以说阻碍中文分词技术的发展(个人观点)。

过去的十年间,尤其是2003年国际中文分词评测活动Bakeoff开展以来,中文自动分词技术有了可喜的进步。其主要表现为:(1)通过“分词规范+词表+分词语料库”的方法,使中文词语在真实文本中得到了可计算的定义,这是实现计算机自动分词和可比评测的基础;(2)实践证明,基于手工规则的分词系统在评测中不敌基于统计学习的分词系统;(3)在Bakeoff数据上的评估结果表明,未登录词造成的分词精度失落至少比分词歧义大5倍以上;(4)实验证明,能够大幅度提高未登录词识别性能的字标注统计学习方法优于以往的基于词(或词典)的方法,并使自动分词系统的精度达到了新高。(详细介绍见中文分词十年回顾.pdf

 
中文主题建模实战:LDA与BERTopic双轨工作 主题建模是将非结构化文本转化为可解释业务洞察的核心技术,其本质是通过概率分布或语义嵌入发现文档中潜在的主题结构。原理上,LDA基于词袋假设与狄利克雷先验实现可解释的统计建模,而BERTopic依托预训练语言模型与聚类算法捕捉深层语义关联。该技术的价值在于 bridging the gap(弥合鸿沟)——既支撑客服工单自动归类、产品评论情感溯源等轻量级AI应用,又为知识图谱构建、智能搜索增强提供高质量主题标签。典型应用场景涵盖金融投诉分析、医疗病历挖掘、电商评论聚类等真实中文语料环境,尤其适用于短文本爆炸、中 阅读详情

相关推荐

Jiayan:甲言,专注于古代汉语(古汉语古文文言文文言)处理的NLP工具包,支持文言词库合成,分词,词性标注,断句和标点。Jiayan是为古典汉语设计的工具包,支持词典构建。 ,标记,POS标记,句子分段和标点符号

甲言Jiayan 简介 甲言,取“Oracle言”之意,是一种专注于古汉语处理的NLP工具包。目前通用的汉语NLP工具均以现代汉语为核心语料,对古代汉语的处理效果很差(详见)。本项目的初衷,便是辅助古汉语信息处理,帮助有志于挖掘古文化矿藏的古汉语学者,爱好者等更好的地分析和利用文言资料,从“文化遗产”中创造出“文化新产”。当前版本支持,,,和五项功能,更多功能正在开发中。 功能 利用无监督的双,以及左右进行文言词库自动生成。 利用无监督,无词典的和进行古汉语自动分词。 利用词库合成功能产生的文言词典,基于有向无环词图,句子最大概率路径和动态规划算法进行分词。 根据词的的序列标注,词性详见。 基

甲言Jiayan安装教程-python

Jiayan安装:安装anaconda+安装visual studio installers+离线装包

qq_43288368的博客 2294

基于java中文自动分词(自然语言处理)

java语言实现的中文自动分词软件,包含工程源码、可执行文件以及测试文件。该分词程序的切词正率和召回率较高。

汉语自动分词简介(转贴)

原文曾由 doubtfire张贴在 清华 BBS 语言与语言学讨论区 一、引言 1、汉语自动分词的必要性 汉语自动分词是对汉语文本进行自动分析的第一个步骤。此过程的一个主要问题是 对大量歧义现象的处理。 词是最小的、能独立活动的、有意义的语言成分。计算机的所有语言知识都来自机器 词典(给出词的各项信息)、句法规则(以词类的各种组合方式来描述词的聚合现象) 以及有关词和句子...

eric的学习笔记 1008

【自然语言处理】详说中文自动分词

文章目录中文自动分词前言一、 what is 中文分词二、中文分词的用途三、中文分词的特点和难点四、常见的中文分词方法五、中文分词工具1、HanLP 中文分词A、 python调用hanlp进行中文分词2、 BosonNLP3、 语言云:4、 NLPIR5、 新浪云6、 搜狗分词7、 结巴分词8、 SCWS9、 腾讯文智10、盘古分词11、IKAnalyzer 中文自动分词 前言  &n...

贾继康的博客 9755

汉语自动分词小结

中文分词存在的问题是分词规范(怎么才算是一个词)和歧义切分(交集型歧义:结合成且为结合|成、结|合成。组合型歧义:他站|起|身|来。他明天|起身|去北京。),以及未登录词,如中文名准确率较高,外文译名准确率很低,地名可以由词表解决,组织机构名词表可以解决部分。 分词方法总的分为基于词表和基于统计和规则。 正向最大匹配、逆向最大匹配法、双向扫描、逐词遍历法都是基于词表的。基于词表可以解决普通词汇...

ya hoho~ 177

基于词频统计的中文分词系统的设计与实现

这样,才能开发出一个真正能满足中文分词业务需求的中文分词分析系统。通过“中文分词分析可视化分析”按钮,进入中文分词分析可视化分析界面,用户可以看到中文分词分析可视化列表,例如:中文分词分析可视化名称、所属类别、长度、中文分词分析可视化目的地、中文分词分析可视化源、中文分词分析可视化时间的详细信息。本章主要分析了基于Flask的中文分词分析可视化分析系统开发过程中使用到的技术和具体的实现步骤,这其中主要介绍了基于Flask框架的中文分词分析可视化分析系统的搭建环境和开发步骤,包括程序中的一些数据库配置等。

2301_76817904的博客 1042

计算机中文输入法教案,智能ABC输入法教案

导语:汉字输入技术是用计算机进行文字处理的基础,每个同学必须掌握一至二种汉字输入法,智能abc输入法作为一种新型的输入法,很适合青少年朋友们学习掌握。下面的是百分网小编为大家搜集的智能ABC输入法教案,欢迎阅读,谢谢!课题:(第三单 第2节第2课~第3课)教学目的:(1) 了解智能abc输入法的特点和功能。(2) 初步掌握智能abc输入法的使用。教学过程:引言: 汉字输入技术是用计算机进行文字处理...

weixin_32644565的博客 488

日语初学者必看:如何用 Fudoki 轻松读懂日语句子?10 个实用技巧

很多日语初学者在背完五十音之后,都会卡在同一个地方:明明单词都认识,可连成句子就读不懂了。助词、动词变形、省略主语……日语句子的"结构感"对新手来说太模糊。这时候,一款好用的**日语学习工具**就能帮你把句子"拆开来看"。今天要介绍的 **Fudoki**(フドキ)就是这样的工具——它是一个基于浏览器的**日语文本分析与语音朗读工具**,能自动完成**日语分词**、词性标注、假名与罗马音标注,还能

gitblog_00667的博客 1010

简单的中文自动分词程序

1. 解压缩后运行freqci.exe即可。 2. 本程序以Visual FoxPro 9.0编写,词表文件必须为DBF格式,词语字段名必须为“词形”。 3. 本程序的分词只用了最简单的词表匹配法,没做任何歧义字段消解和未登录词识别。 4. 本程序所用词表是从拼音加加的词表中整理出来的。

中文分词软件,支持自动标引

这是一个好用的中文分词软件。。。。。。。 支持自动标引,自动分词。。。。。。。。 支持全文检索。。。。。 还有统计功能

关键词自动分词工具

分词工具,关键词自动分词,SEO关键词自动分词,采集关键词自动分词,划分根词,长尾词,问答词,百科词,均可以一键分词

汉语自然语言分词词典

分词 词典 同义词词典 汉语 有18万分词词典和5000个同义词词典

Pytorch项目实战聊天机器人(02.项目的准备阶段)

Pytorch项目实战聊天机器人(02.项目的准备阶段)02.项目的准备阶段二、2-2 NLP涉及知识三、2-3 NLTK库四 ,2-4 语料和词性标注五 ,2-5 分词六 , 2-6 TF-IDF七, 2-7 NLTK安装八, 2-8 代码小练 来自慕课网 02.项目的准备阶段 —# 一、2-1 NLP基础 第一个呢,就是我们NLP的基础,我们会从NLP的定义,包括它的这个发展方向,我们做一个简单的介绍。第二个呢,就是NRP所涉及的知识,包括一些分词啊,包括我们一些句法分析啊,还有所涉及的一些知识和技术

qq_44294428的博客 1338

自然语言处理应用方向和专业英语

自然语言处理是计算机科学领域与人工智能领域中的一个重要方向。它研究能实现人与计算机之间用自然语言进行有效通信的各种理论和方法。自然语言处理处理的内容涉及到语言的各个层次,包括字、词、句、段落、篇章和语义。 目前自然语言处理的主要研究和应用方向有: 1、  统计语言模型: 统计语言模型是自然语言处理的主流技术之一。我们研究的主要内容包括各种语言模型的构建、改进以及应用,包括N元文法模型、隐马尔科

zhoubl668的专栏:远帆,梦之帆! 3103

jiayan(甲言)配置过程

用PyCharm+Anaconda配置jiayan(甲言)分词

qq_75277091的博客 1205
上一篇: Three perspectives of data mining
下一篇: Java学习从入门到精通
hellojzz
博客等级 码龄20年 9粉丝 12原创
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值