WhatCanJevDo
返回
researchmoderationdata-search开源

jev-spam-eval

把 zero-shot Jev 邮件分类与训练过的 TF-IDF baseline 放在同一套可复现实验中比较。

Jev 决定什么

在主实验中判断邮件属于正常、垃圾还是钓鱼。

主实验用 Choice 把 5,733 封邮件分成正常、垃圾和钓鱼邮件,保存逐封预测,并与监督学习 baseline 及新的分布外数据集比较。

CHOICENOUL
Jev 的职责
把每封邮件分配到少量、明确的消息类别中。
输入
由评估脚本整理的邮件主题、正文和部分元数据。
输出
ham、spam 和 phishing 三类上的 Choice 概率分布。
决策频率
评估数据集中每封邮件一次。
兜底方式
与训练过的 TF-IDF baseline 比较,并检查混淆矩阵和保存的逐条预测。
作者自报 · 已核对来源

运行方式

输入
由评估脚本整理的邮件主题、正文和部分元数据。
Jev
CHOICE + NOUL
输出
ham、spam 和 phishing 三类上的 Choice 概率分布。

公开性能数据

Reported Jev accuracy

98.64 %

Three-way ham, spam, and phishing classification on 5,733 emails.

作者自报 · 已核对来源

采集于 2026年9月21日

Reported best TF-IDF accuracy

98.87 %

Same three-way 5,733-email classification dataset.

作者自报 · 已核对来源

采集于 2026年9月21日

项目概览

jev-spam-eval 更适合被视为研究资料,而不是产品 Demo。仓库包含数据集准备、运行器、缓存预测、评估脚本、混淆矩阵和成本分析。主三分类实验中,zero-shot Jev 报告 98.64% accuracy,最佳训练 TF-IDF baseline 为 98.87%。

这些是作者运行的结果,不是独立 benchmark。较新的邮件集合上表现更弱,也暴露了上下文错配,例如 newsletter 容易被看成 spam。当前三分类实验使用 Choice,较早的二分类 spam 实验使用 Noul。

开发语言
Python
许可证
MIT
作者
bitnovus
来源核对于 2026年9月21日

信息来源

相关项目