数据集:中文垃圾邮件分类数据集

中文垃圾邮件分类数据集简介
本数据集是针对电子邮件分类任务构建的规范化中文语料库,旨在为垃圾邮件检测模型的训练与评估提供多维度特征支持。其核心特点如下:

1. 数据集概述

  • 规模与结构:共包含3980个规范化JSON文件,每个文件独立存储一封邮件的完整信息,并按垃圾邮件(spam)与正常邮件(normal)两类进行标注,形成二元分类基础。
  • 数据来源:邮件内容覆盖商业推广、虚假中奖通知、金融诈骗、日常通信等典型场景,贴近中文用户真实邮箱环境。
  • 标注质量:所有邮件均经过人工或自动化验证,确保类别标签的准确性,可直接用于监督学习任务。

2. 数据组成与特征

每封邮件的JSON结构包含以下关键字段,支持从语义、统计、时间等多角度进行特征分析:

a. 核心字段

  • 邮件主题(subject):反映邮件意图的短文本,垃圾邮件常含“免费领取”“限时特惠”“账户异常”等诱导性词汇。
  • 邮件正文(body):长文本内容,垃圾邮件多含重复促销信息、嵌入超链接或诱导用户点击的互动话术。
  • 发件时间(date):精确到分钟的时间戳,可用于分析垃圾邮件的发送时段规律(如深夜或节假日高发)。
  • 邮件头信息(header):包含发件服务器IP、传输路径等技术信息,辅助识别伪造发件地址或可疑邮件源。

b. 结构化特征字段

  • 文本特征(text_features):基于分词与词频提取的关键词(如“中奖”“投资机会”“VIP特权”)及高频词组,凸显垃圾邮件的语义倾向。
  • 结构
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值