【NLP】推荐一些NER的英文数据集

 1   MUC Data Sets

https://www-nlpir.nist.gov/related_projects/muc/

 2   CoNLL-2002

https://www.clips.uantwerpen.be/conll2002/ner/

 3   CoNLL-2003

CoNLL 2003是由新闻通讯社的文章以四种不同的语言(西班牙语、荷兰语、英语和德语)创建的,重点关注4个实体:PER(人员),LOC(位置),ORG(组织)和MISC(其他,包括所有其他类型的实体)

https://www.clips.uantwerpen.be/conll2003/ner/

 4   2010 I2B2

2010 I2B2 NER任务考虑了临床数据,重点关注临床问题、测试和治疗实体类型

https://www.i2b2.org/NLP/Relations/

 5   DDIExtraction2013(Drug NER)

重点关注药品、品牌、集团和药品n(未批准或新药)实体类型

https://www.cs.york.ac.uk/semeval-2013/task9/index.html

 6   CHEMPROT(Similar to 5)

相比5更侧重于化学和药物实体,例如缩写、配方、家族、标识符等

https://biocreative.bioinformatics.udel.edu/

 7   microbiology NER datasets

从PubMed和生物学网站收集,并且主要关注细菌、栖息地和地理位置实体

http://2016.bionlp-st.org/tasks/bb2    

(需要FQ访问)

往期精彩回顾适合初学者入门人工智能的路线及资料下载机器学习及深度学习笔记等资料打印机器学习在线手册深度学习笔记专辑《统计学习方法》的代码复现专辑
AI基础下载机器学习的数学基础专辑


本文来自互联网用户投稿,文章观点仅代表作者本人,不代表本站立场,不承担相关法律责任。如若转载,请注明出处。 如若内容造成侵权/违法违规/事实不符,请点击【内容举报】进行投诉反馈!

相关文章

立即
投稿

微信公众账号

微信扫一扫加关注

返回
顶部