基于朴素贝叶斯的中文垃圾电子邮件分类
基于朴素贝叶斯的中文垃圾电子邮件分类
训练数据和测试数据
本次主要使用了github上的开源数据
数据处理
首先使用正则表达式对训练集中的中文邮件的内容进行过滤,去除其中中文之外的其他字符,再将剩下的内容使用jieba进行分词,过滤掉中文停用字表中的内容。将垃圾邮件以及正常邮件的处理结果分别存放。
本次主要使用了github上的开源数据
首先使用正则表达式对训练集中的中文邮件的内容进行过滤,去除其中中文之外的其他字符,再将剩下的内容使用jieba进行分词,过滤掉中文停用字表中的内容。将垃圾邮件以及正常邮件的处理结果分别存放。