重庆分公司,新征程启航
为企业提供网站建设、域名注册、服务器等服务
本篇内容介绍了“Python分词工具有哪些”的有关知识,在实际案例的操作过程中,不少人都会遇到这样的困境,接下来就让小编带领大家学习一下如何处理这些情况吧!希望大家仔细阅读,能够学有所成!
创新互联服务项目包括金牛网站建设、金牛网站制作、金牛网页制作以及金牛网络营销策划等。多年来,我们专注于互联网行业,利用自身积累的技术优势、行业经验、深度合作伙伴关系等,向广大中小型企业、政府机构等提供互联网行业的解决方案,金牛网站推广取得了明显的社会效益与经济效益。目前,我们服务的客户以成都为中心已经辐射到金牛省份的部分城市,未来相信会继续扩大服务区域并继续获得客户的支持与信任!
https://github.com/fxsjy/jieba
“结巴”分词,可以说是 GitHub 最受欢迎的分词工具,支持自定义词典,支持多种分词模式,立志成为 Python 中最好的中文分词组件。
https://github.com/lancopku/pkuseg-python
pkuseg 的特点是支持多种不同的分词领域,新闻、网络、医药、v旅游等领域的分词训练模型,相比于其他分词工具,不但可以自由的选择不同模型,而且可以提供更高的分词准确率。
https://github.com/rockyzhengwu/FoolNLTK
FoolNLTK 分词是基于BiLSTM模型训练而来的,支持用户自定义词典,有人说它是最准确的开源中文分词,不知道你有没有尝试过呢?
https://github.com/thunlp/THULAC-Python
THULAC由清华大学自然语言处理与社会人文计算实验室,研制推出的具有词性标注功能的中文词法分析工具包。能分析出某个词是名词还是动词或者形容词。利用我们集成的目前世界上规模最大的人工分词和词性标注中文语料库(约含5800万字)训练而成,模型标注能力强大。该工具包在标准数据集Chinese Treebank(CTB5)上分词的F1值可达97.3%,词性标注的F1值可达到92.9%,与该数据集上最好方法效果相当。速度较快。
跟同事聊起分词工具,他们很多人在用的还是结巴分词,配合用户自定义词典,解决常见的网络词语。你在用哪个工具呢?
“Python分词工具有哪些”的内容就介绍到这里了,感谢大家的阅读。如果想了解更多行业相关的知识可以关注创新互联网站,小编将为大家输出更多高质量的实用文章!