与Lucene 4.10配合的中文分词比较(转)

本文对比了多种用于Lucene的中文分词器,包括paoding、mmseg4j、IK-analyzer等,通过精度、召回率等指标评估其性能,并依据SIGHAN提供的公开数据进行测试。


比较目的

衡量每种分词的指标,内存消耗、CPU消耗,得到一个在Lucene中比较好的分词版本。


  • paoding: 庖丁解牛最新版在 中最多支持Lucene 3.0,且最新提交的代码在 2008-06-03,在svn中最新也是2010年提交,已经过时,不予考虑。

  • mmseg4j:最新版已从 ,支持Lucene 4.10,且在github中最新提交代码是2014年6月,从09年~14年一共有:18个版本,也就是一年几乎有3个大小版本,有较大的活跃度,用了mmseg算法。

  • 伦理片 http://www.dotdy.com/

  • IK-analyzer: 最新版在https://code.google.com/p/ik-analyzer/上,支持Lucene 4.10从2006年12月推出1.0版开始, IKAnalyzer已经推出了4个大版本。最初,它是以开源项目Luence为应用主体的,结合词典分词和文法分析算法的中文分词组件。从3.0版本开 始,IK发展为面向Java的公用分词组件,独立于Lucene项目,同时提供了对Lucene的默认优化实现。在2012版本中,IK实现了简单的分词 歧义排除算法,标志着IK分词器从单纯的词典分词向模拟语义分词衍化。 但是也就是2012年12月后没有在更新。

  • ansj_seg:最新版本在 tags仅有1.1版本,从2012年到2014年更新了大小6次,但是作者本人在2014年10月10日说明:“可能我以后没有精力来维护ansj_seg了”,现在由”nlp_china”管理。2014年11月有更新。并未说明是否支持Lucene,是一个由CRF(条件随机场)算法所做的分词算法。

  • imdict-chinese-analyzer:最新版, 最新更新也在2009年5月,下载源码,不支持Lucene 4.10 。是利用HMM(隐马尔科夫链)算法。

  • Jcseg:最新版本在git.oschina.net/lionsoul/jcseg,支持Lucene 4.10,作者有较高的活跃度。利用mmseg算法。


分词算法衡量指标及测试代码

 

黄金标准/Golden standard

评价一个分词器分词结果的好坏,必然要有一份“公认正确”的分词结果数据来作为参照。 SIGHAN(国际计算语言学会(ACL)中文语言处理小组)举办的国际中文语言处理竞赛Second International Chinese Word Segmentation Bakeoff(http://sighan.cs.uchicago.edu/bakeoff2005/)所提供的公开数据来评测,它包含了多个测试集以及对应的黄金标准分词结果。在所有分词器都使用同一标准来评测的情况下,也就会很公平,并不会影响到最终的结论,所以本文用此测评标准,并针对创建索引,做了些改动。

评价指标

  • 精度(Precision):精度表明了分词器分词的准确程度。

  • 召回率(Recall):召回率也可认为是“查全率”。

  • F值(F-mesure):F值综合反映整体的指标。

  • 错误率(Error Rate --ER)(带选项):分词器分词的错误程度。

公式

影音先锋电影 http://www.iskdy.com/

Tip
公式参数说明

N:黄金标准分割的单词数; e:分词器错误标注的单词数; c:分词器正确标注的单词数.

总结:P、R、F越大越好,ER越小越好。一个完美的分词器的P、R、F值均为1,ER值为0。

正确及错误标注的计数算法

要先计算出e和c,才能计算出各指标值。e和c是按如下算法来统计的: 在“黄金标准”和“待评测的结果”中,理论上,除了分词后添加的空格之外,它们所有的文字都是相同的;唯一的不同就在于那些有差异的分词结果的位置上。例如,“计算机 是个 好东西”(黄金标准)与“计算机 是 个 好东西”(待评测的结果)的差异就在于“是个”与“是 个”的差异,其余分词结果都是相同的。因此,只需要找到这种差异的个数,就可以统计出分词器正确标注了多少个词、错误标注了多少个词。为了完成测试指标,同时,对应Lucene的检索实际需要对黄金标准的 *_test_gold和分词结果做了如下改动:

【下垂控制虚拟同步机】下垂控制虚拟同步机两种并网型(grid-forming)控制策略的性能研究(Simulink仿真实现)内容概要:本文围绕下垂控制虚拟同步机(VSG)两种并网型(grid-forming)控制策略,通过Simulink仿真平台对其性能进行了系统性对比研究。重点分析了二者在电网频率调节、电压支撑、动态响应特性、抗扰能力及并网稳定性等方面的差异优劣,旨在为不同应用场景下的逆变器控制策略选型提供理论依据和技术支撑。研究涵盖了控制原理建模、仿真系统搭建、典型工况测试(如负载突变、电网波动)以及性能指标评估,充分展示了两种技术在现代电力电子并网系统中的应用潜力局限性。; 适合人群:具备电力电子、自动控制或新能源并网相关基础知识的研究生、科研人员及从事新能源系统仿真的工程技术人员。; 使用场景及目标:①掌握下垂控制虚拟同步机的核心控制原理及实现方法;②理解两类grid-forming控制策略在动态响应、频率电压支撑方面的性能差异;③为微电网、构网型逆变器等系统的控制方案设计仿真验证提供参考。; 阅读建议:读者应结合Simulink仿真模型进行实践操作,重点关注控制器参数设计对系统性能的影响,并可通过修改工况条件进一步探究两种策略在复杂电网环境下的适应性。
内容概要:本文提出了一种考虑N-1安全准则的分布鲁棒机会约束低碳经济调度模型,旨在应对电力系统中由可再生能源出力不确定性带来的调度风险。该模型深度融合分布鲁棒优化机会约束规划方法,在确保系统在单一元件故障(N-1)条件下仍能安全稳定运行的前提下,实现经济性低碳化双重目标的协同优化。通过Matlab编程实现,结合先进优化算法高效求解复杂调度问题,有效平衡了系统经济性、环保性安全可靠性之间的矛盾,并提供了完整的代码复现资源,便于科研验证工程应用。; 适合人群:具备一定电力系统分析基础和Matlab编程能力,从事电力系统优化调度、低碳运行、不确定性建模、鲁棒优化机会约束等领域研究的研究生、科研人员及工程技术人员。; 使用场景及目标:①用于复现和验证顶级EI期刊中关于低碳经济调度的前沿研究成果;②为高比例可再生能源接入的电力系统提供兼具安全性经济性的调度决策支持;③深入学习和掌握分布鲁棒优化、机会约束建模、N-1安全约束处理及其在电力系统中的集成应用方法; 阅读建议:读者应结合所提供的Matlab代码进行实践操作,重点剖析N-1故障集的构建逻辑、分布鲁棒对不确定性的建模方式、机会约束的化技巧以及低碳目标经济调度的耦合机制,建议配合YALMIP等优化建模工具进行调试、结果分析模型扩展研究。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值