最近把自己写的中文分词工具 Wapic 整理并发布到了 PyPI ,想请大家试用、拍砖。
Wapic 是一个使用 C++17 实现的线性链 CRF 中文分词工具,提供 Python API ,也支持从头训练模型。
现在安装时会自动带上默认模型,不需要另外下载或现场编译:
pip install wapic
使用示例:
import wapic
seg = wapic.Segmenter()
print(seg.segment("中华人民共和国成立了"))
输出:
['中华人民共和国', '成立', '了']
目前支持:
- CPython 3.9–3.14
- Linux 、Windows 、Intel Mac 、Apple Silicon Mac
- 单句分词、BMES 标签和多核批量推理
- 加载自定义模型
- SGD-L1 、L-BFGS/OWL-QN 训练
- MIT License
发布模型在 PeopleDaily 和自建测试集上的 F1 分别为 98.01 和 97.95。
模型约 30 MB ,底层是传统 CRF ,不依赖 PyTorch 等大型运行时。
项目地址:
- GitHub:https://github.com/Ismantic/Wapic
- PyPI:https://pypi.org/project/wapic/
- 模型:https://huggingface.co/Ismantic/Wapic-CWS
目前尤其想收集人名、机构名、中英混排和数字表达方面的 bad case 。
如果大家愿意试一下,欢迎直接贴出分错的句子,或者在 GitHub 提交 issue 。