Coder Social home page Coder Social logo

wainshine / company-names-corpus Goto Github PK

View Code? Open in Web Editor NEW
1.2K 1.2K 373.0 267.25 MB

公司名语料库。机构名语料库。公司简称,缩写,品牌词,企业名。可用于中文分词、机构名实体识别。

Home Page: https://open.namemoe.com/

License: Apache License 2.0

company corpus dataset dict ner

company-names-corpus's Introduction

公司名语料库(Company-Names-Corpus)

关于萌名(NameMoe)

萌名是一个基于大数据和自然语言处理技术的新取名产品。

通过分词工具对海量文本进行分词和词频统计。数据清洗后,得到千万级的人名词典。再对其进行性别、年龄、拼音、情感、人名指数等标记,最终形成5600万+的中文人名图谱。

为剔除人名、机构名中的badcase,个人收集并建立了大量行业词典,公司名语料库(Company-Names-Corpus)即是其中之一。

本子项目可用于中文分词、机构名识别等场景。


PS1:维护此项目,除个人兴趣外,主要是在此过程中,可通过任务驱动来不断学习和实践NLP、KG以及AI等相关前沿技术。

PS2:正在找工作,求内部推荐~ 移动医疗/SaaS后台/人工智能方向的 高级产品经理一枚。

PS3:请勿提交涉政issue,谢谢。

PS4:如将本项目转存到国内的某平台,请设置成0积分下载,并保留GitHub链接。


公司名语料库(Company-Names-Corpus)

数据大小:480万。

语料来源:多个词典汇总。

数据清洗:已清洗,但仍存有大量badcase。


机构名语料库(Organization-Names-Corpus)

数据大小:110万。

语料来源:多个词典汇总。

数据清洗:已清洗,但仍存有大量badcase。


公司简称、品牌词等(Company-Shorter-Form)

数据大小:28万。

语料来源:多个词典汇总。

数据清洗:已清洗,但仍存有大量badcase。


Stargazers over time

Stargazers over time


更新时间:

删除了3000余非公司名。 -2018.10.31

新增了10万公司简称、品牌词。 -2018.12.30

新增了28万公司简称、品牌词。 -2019.03.23

删除了2万余质量不高的公司名、机构名。 -2019.04.15

删除了3000余非公司名。 -2019.07.27

删除了2万余质量不高的公司名、机构名。 -2019.12.25

删除了2万余质量不高的公司名、机构名。 -2020.12.13

删除了2万余质量不高的公司名、机构名、简称。 -2021.05.05

删除了2万余质量不高的公司名、机构名、简称。 -2022.11.30


@萌名NameMoe 整理

2024.03.27

company-names-corpus's People

Contributors

wainshine avatar

Stargazers

 avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar

Watchers

 avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar  avatar

company-names-corpus's Issues

Recommend Projects

  • React photo React

    A declarative, efficient, and flexible JavaScript library for building user interfaces.

  • Vue.js photo Vue.js

    🖖 Vue.js is a progressive, incrementally-adoptable JavaScript framework for building UI on the web.

  • Typescript photo Typescript

    TypeScript is a superset of JavaScript that compiles to clean JavaScript output.

  • TensorFlow photo TensorFlow

    An Open Source Machine Learning Framework for Everyone

  • Django photo Django

    The Web framework for perfectionists with deadlines.

  • D3 photo D3

    Bring data to life with SVG, Canvas and HTML. 📊📈🎉

Recommend Topics

  • javascript

    JavaScript (JS) is a lightweight interpreted programming language with first-class functions.

  • web

    Some thing interesting about web. New door for the world.

  • server

    A server is a program made to process requests and deliver data to clients.

  • Machine learning

    Machine learning is a way of modeling and interpreting data that allows a piece of software to respond intelligently.

  • Game

    Some thing interesting about game, make everyone happy.

Recommend Org

  • Facebook photo Facebook

    We are working to build community through open source technology. NB: members must have two-factor auth.

  • Microsoft photo Microsoft

    Open source projects and samples from Microsoft.

  • Google photo Google

    Google ❤️ Open Source for everyone.

  • D3 photo D3

    Data-Driven Documents codes.