基于字的用感知机实现的中文分词系统。
完全训练后对微软的测试集精度可以达到96%多。
我上传的版本是完整的代码(训练和分词),大家自己用附带的微软训练数据训练就可以了,只有一个文件。
代码总的来说写的还是很清楚的,方便自己也方便别人阅读。
欢迎大家共讨论,xiatian@ict.ac.cn。
2024/3/7 22:35:58 4.92MB python 分词 感知机
1
代码对10个txt文件进行分词、去除停止词,并提取每个词的tfidf特征值输出
2024/3/2 14:18:22 1.32MB IK分词 tfidf特征
1
用于开发分词所使用的词库,自整理,后续还有更新,词根带词性以及排序
2024/3/1 11:32:25 8.3MB 中文词库 词性
1
人民日报语料库,适合机器学习训练使用,分词等。
2024/2/28 18:23:12 17.65MB 语料
1
在使用jiba分词的情况下,使用这个词典有助于提高你的分词准确度,因为这个分词词典包含了众多领域词汇,这些词汇出自某dog的几十个细胞词库。
已使用转换器转换成txt,欢迎下载。
2024/2/24 8:01:03 7.29MB 分词词典 中文分词 jieba gensim
1
ROSTCM6是武汉大学沈阳教授研发编码的国内目前唯一的以辅助人文社会科学研究的大型免费社会计算平台。
该软件可以实现微博分析、聊天分析、全网分析、网站分析、浏览分析、分词、词频统计、英文词频统计、流量分析、聚类分析等一系列文本分析,遍布海内外100多所大学,包括剑桥大学、日本北海道大学、北京大学、清华大学、香港城市大学、澳门大学众多高校。
写论文的一把利器。
2024/2/21 10:56:09 8.61MB ROSTCM6
1
文本分析软件ROSTCM6,支持文本分词,词频分析,社会网络和语义网络分析,情感分析与标签云等。
2024/2/20 19:49:22 9.2MB ROST ROST CM
1
参考网络资源使用IKAnalyzer分词组件,实现了纯Java语言、MapReduce模式及Spark框架三种方式对唐诗宋词等国学经典进行中文分词统计排序的功能,你可以轻松发现唐诗宋词中最常用的词是那几个。
2024/2/20 1:54:30 379KB Spark Java MapReduce IKAnalyzer
1
贡献本人本科毕业论文(代码+答辩PPT+论文文档)细节:基于java的文本搜索引擎的设计与实现,页面使用css+html+jsp实现,分词器使用lucene,网络爬虫使用java实现,数据库使用mysql
2024/2/14 9:48:32 3.97MB 毕业设计 lucene 网络爬虫
1
主要是读取文本,然后进行分词、词干提取、去停用词、计算词频,有界面,很实用
2024/2/7 14:50:15 70KB 词频计算
1
共 172 条记录 首页 上一页 下一页 尾页
在日常工作中,钉钉打卡成了我生活中不可或缺的一部分。然而,有时候这个看似简单的任务却给我带来了不少烦恼。 每天早晚,我总是得牢记打开钉钉应用,点击"工作台",再找到"考勤打卡"进行签到。有时候因为工作忙碌,会忘记打卡,导致考勤异常,影响当月的工作评价。而且,由于我使用的是苹果手机,有时候系统更新后,钉钉的某些功能会出现异常,使得打卡变得更加麻烦。 另外,我的家人使用的是安卓手机,他们也经常抱怨钉钉打卡的繁琐。尤其是对于那些不太熟悉手机操作的长辈来说,每次打卡都是一次挑战。他们总是担心自己会操作失误,导致打卡失败。 为了解决这些烦恼,我开始思考是否可以通过编写一个全自动化脚本来实现钉钉打卡。经过一段时间的摸索和学习,我终于成功编写出了一个适用于苹果和安卓系统的钉钉打卡脚本。
2024-04-09 15:03 15KB 钉钉 钉钉打卡