命名实体识别学习-数据集介绍-conll03

conll2003数据集下载与预处理 包括 1,393 篇英文新闻文章和 909 篇德文新闻文章。我们将查看英文数据。 阅读详情

title: ’ 命名实体识别学习-数据集介绍-conll03 ’
date: 2020-07-14 22:46:05
tags:


命名实体识别学习-数据集介绍-conll03

文章目录


conll 2003 是命名实体中最常见的公开数据集。其官网: https://www.clips.uantwerpen.be/conll2003/ner/

有很详细的介绍。

一 类别个数

Named entities are phrases that contain the names of persons, organizations, locations, times and quantities. Example:

[ORG U.N. ] official [PER Ekeus ] heads for [LOC Baghdad ] .

The shared task of CoNLL-2003 concerns language-independent named entity recognition. We will concentrate on four types of named entities: persons, locations, organizations and names of miscellaneous entities that do not belong to the previous three groups.The participants of the shared task will be offered training and test data for two languages. They will use the data for developing a named-entity recognition system that includes a machine learning component. For each language, additional information (lists of names and non-annotated data) will be supplied as well. The challenge for the participants is to find ways of incorporating this information in their system.

上文来自官网,高亮部分介绍其所要分的类别。总共四类:persons, locations, organizations ,miscellaneous entities

二 数据集样例

image-20200714231551083

这是其训练集中某个部分。

通过其官网介绍,可知改数据集第一例是单词,第二列是词性,第三列是语法快,第四列是实体标签。在NER任务中,只关心第一列和第四列。实体类别标注采用BIO标注法,前面博客介绍这种标注法。

以下是官网的介绍:

The CoNLL-2003 shared task data files contain four columns separated by a single space. Each word has been put on a separate line and there is an empty line after each sentence. The first item on each line is a word, the second a part-of-speech (POS) tag, the third a syntactic chunk tag and the fourth the named entity tag. The chunk tags and the named entity tags have the format I-TYPE which means that the word is inside a phrase of type TYPE. Only if two phrases of the same type immediately follow each other, the first word of the second phrase will have tag B-TYPE to show that it starts a new phrase. A word with tag O is not part of a phrase. Here is an examp

【NLP公开数据集CoNLL-2003数据集 CoNLL-2003命名的实体数据由八个文件组成,涵盖两种语言:英语和德语。 每种语言都包含:训练集、开发集、测试集、无标签数据;其中wu'biao 阅读详情

相关推荐

命名实体识别学习-用lstm+crf处理conll03数据集

title: 命名实体识别学习-用lstm+crf处理conll03数据集 date: 2020-07-18 16:32:31 tags: 命名实体识别学习-用lstm+crf处理conll03数据集 文章目录命名实体识别学习-用lstm+crf处理conll03数据集一 整合时要解决的问题二 mask和padlstm读入涉及转移分矩阵的计算三 将for循环改为矩阵运算gold_score的计算forward_score的计算结果:总结 一直想写的一篇文章,虽然好像也不是很忙,但是一直拖着没做。就是讲下.

StarLib的博客 3677

conll2003.rar_2003.con_CONLL2003下载_conll_education2mc_命名实体

conll2003命名实体识别数据,可用于训练与开发

BERT-NER:使用Google的BERT进行命名实体识别CoNLL-2003作为数据集

为了获得更好的性能,您可以尝试NLPGNN,有关更多详细信息,请参见 。 BERT-NER版本2 使用Google的BERT进行命名实体识别CoNLL-2003作为数据集)。 原始版本(有关更多详细信息,请参见old_version)包含一些硬代码,并且缺少相应的注释,因此不方便理解。 因此,在此更新版本中,有一些新的想法和技巧(关于数据预处理和图层设计)可以帮助您快速实现微调模型(您只需尝试修改crf_layer或softmax_layer)。 资料夹说明: BERT-NER |____ bert # need git from [h

Conll-2003 数据集:第一列是单词,第二列是词性,第三列是语法,第四列是实体标签。在NER任务中,只关心一和四列。

Conll-2003 数据集:第一列是单词,第二列是词性,第三列是语法,第四列是实体标签。在NER任务中,只关心一和四列。

[代码实践]利用LSTM构建基于conll2003数据集的命名实体实体识别NER模型

执行结果. 一共应用了12个Epoch,训练集上的准确率是99.7%,测试集上准确率是98%。1. conll2003数据集介绍以及数据集预处理请看下面博客。3. 创建基于lstm网络的NER模型。7. main方法来训练模型与测试模型。6. 保存文件以及加载文件的方法。2. 取预处理过的数据集

Harry的博客 2328

一文读懂命名实体识别

本文对自然语言基础技术之命名实体识别进行了相对全面的介绍,包括定义、发展历史、常见方法、以及相关数据集,最后推荐一大波 Python 实战利器,并且包括工具的用法。01定...

CSDN人工智能头条 2万+

构建AIDA-CoNLL数据集操作指南

操作指南介绍操作流程下载基础文件构建CoNLL2003构建AIDA-CoNLL参考 介绍   AIDA-CoNLL也称AIDA CoNLL-YAGO,是实体消歧和实体链接常用的公共数据集,它发布于EMNLP2011的论文Robust Disambiguation of Named Entities in Text。AIDA-CoNLL包含了实体分配给为原始的CoNLL 2003实体识别任务注释的命名实体的表述(mention)。实体由YAGO2实体名称、Wikipedia URL或Freebase mid确

面包猎人 2261

【ACL 2023-NER注入到PLM】数据集+实验解读:基于上下文学习命名实体识别 Learning In-context Learning for Named Entity Recognitio

论文:Learning In-context Learning for Named Entity Recognition 标题:基于上下文学习命名实体识别 作者:Jiawei Chen, Yaojie Lu, Hongyu Lin, Jie Lou, Wei Jia, Dai Dai, Hua Wu, Boxi Cao, Xianpei Han and Le Sun 地址:[\[2305.11038\] Learning In-context Learning for Named Entity Recog

定期分享我的发现和想法,感谢你的陪伴和支持 7540

命名实体识别数据集到算法实现-标注法记录-技术很旧

命名实体识别(Named Entity Recognition, NER)是 NLP 的基础任务,指从文本中识别出命名性指称项,为关系抽取等任务做铺垫。狭义上,是识别出人名、地名和组织机构名这三类命名实体(时间、货币名称等构成规律明显的实体类型可以用正则等方式识别)。当然,在特定领域中,会相应地定义领域内的各种实体类型。目前的主流工作,是将 NER当做深度学习任务来做,所以,我们需要大量的、高质量...

1624

【AdaSeq基础】30+NER数据汇总,涉及多行业、多模态命名实体识别数据集收集

命名实体识别NER是NLP基础任务,一直以来受到学术界和业界的广泛关注,本文汇总了常见的中英文、多语言、多模态NER数据集介绍。本列表由达摩院NLP团队和天池数据科学团队长期维护,相关数据可以通过序列理解统一框架AdaSeq进行模型训练。

JohnsonZh的博客 1万+

CoNLL-2003 eng.train

数据集CoNLL-2003,这一数据集是用于测试命名实体识别的早期训练数据,文本来源是报纸新闻。英文数据eng.train

分享本人收集的命名实体识别(NER)数据集及其下载地址

命名实体识别(NER)数据集,及其介绍和下载地址

simon469660451的博客 1996

命名实体识别数据集到算法实现

命名实体识别(Named Entity Recognition, NER)是 NLP 的基础任务,指从文本中识别出命名性指称项,为关系抽取等任务做铺垫。狭义上,是识别出人名、地名和组织机构名这三类命名实体(时间、货币名称等构成规律明显的实体类型可以用正则等方式识别)。当然,在特定领域中,会相应地定义领域内的各种实体类型。目前的主流工作,是将 NER当做深...

weixin_34408717的博客 2167

从0基础入门NLP自然语言处理系列之命名实体识别(二)

CoNNL2003数据集详解 CoNLL-2003共享任务数据文件包含四列,并用一个空格分隔。每个单词都放在单独的行上,每个句子后面都有一个空行。每行的第一项是单词,第二项是词性(POS)标记,第三个是句法块标记,第四个是命名实体标记。块标签和命名实体标签的格式为I-TYPE,这意味着该单词在TYPE类型的短语内。仅当两个相同类型的短语立即紧随其后时,第二个短语的第一个单词才会带有标签B-TYPE...

AI编程技术 713

【NLP任务】CoNLL-2003独立于语言的命名实体识别(II)

pass

Elvira521yan的博客 1708

自然领域中的数据集

引言 这将会是一个不断更新的博客,提供了一些数据集下载来源或者数据集信息介绍。在我的研究中,我可能会碰到一些相关任务的数据集,在此做个记录,顺便分享给大家。 一、实体、关系抽取相关的数据集 CoNLL CoNLL: The SIGNLL Conference on Computational Natural Language Learning。具体的解释可以参见这里 或者这里 其中,SIGNLL ...

秋水顽石 4532

NLP命名实体识别

命名实体识别(Named Entity Recognition, **NER**)是指在文本中识别出特殊对象,如人、地点、组织机构等。

zag666的博客 2758

elmo(BiLSTM-CRF+elmo)(Conll-2003 命名实体识别NER)

文章目录elmo(Bi-lm)(命名实体识别BiLSTM-CRF+elmo)一、文件目录二、语料集三、数据处理(data_utils.py)(vocabulary.py)四、模型(mem_transformer.py)五、训练(train.py)六、计算loss值(proj_adaptive_softmax.py)实验结果 elmo(Bi-lm)(命名实体识别BiLSTM-CRF+elmo) Bidirectional laguage models: elmo: elmo下游任务: 一、文件

weixin_42318554的博客 4145
上一篇: 面试中常见的图论问题
下一篇: 命名实体识别学习-用lstm+crf处理conll03数据集
StarLib
博客等级 码龄8年 31粉丝 23原创
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值