准确率创新高，北大开源中文分词工具包 pkuseg-白红宇

准确率创新高，北大开源中文分词工具包 pkuseg

阅读量：3523 次

发布时间：2019-05-20

本文共 565 字，大约阅读时间需要 1 分钟。

北京大学近日开源了一个全新的中文分词工具包 pkuseg ，相比于现有的同类开源工具，pkuseg 大幅提高了分词的准确率。

pkuseg 由北大语言计算与机器学习研究组研制推出，具备如下特性：

高分词准确率。相比于其他的分词工具包，pkuseg 在不同领域的数据上都大幅提高了分词的准确度。根据项目文档给出的测试结果，pkuseg 分别在示例数据集（ MSRA 和 CTB8 ）上降低了 79.33% 和 63.67% 的分词错误率。

性能对比

在 Linux 环境下，各工具在新闻数据 (MSRA) 和混合型文本 (CTB8) 数据上的准确率测试情况如下：

预训练模型

分词模式下，用户需要加载预训练好的模型。我们提供了三种在不同类型数据上训练得到的模型，根据具体需要，用户可以选择不同的预训练模型。以下是对预训练模型的说明：

MSRA : 在 MSRA（新闻语料）上训练的模型。新版本代码采用的是此模型。

CTB8 : 在 CTB8（新闻文本及网络文本的混合型语料）上训练的模型。

WEIBO : 在微博（网络文本语料）上训练的模型。

更多详情可查阅。

原文地址：

转载地址：http://iuzhj.baihongyu.com/

你可能感兴趣的文章