jev-spam-eval
把 zero-shot Jev 邮件分类与训练过的 TF-IDF baseline 放在同一套可复现实验中比较。
Jev 决定什么
在主实验中判断邮件属于正常、垃圾还是钓鱼。
主实验用 Choice 把 5,733 封邮件分成正常、垃圾和钓鱼邮件,保存逐封预测,并与监督学习 baseline 及新的分布外数据集比较。
- Jev 的职责
- 把每封邮件分配到少量、明确的消息类别中。
- 输入
- 由评估脚本整理的邮件主题、正文和部分元数据。
- 输出
- ham、spam 和 phishing 三类上的 Choice 概率分布。
- 决策频率
- 评估数据集中每封邮件一次。
- 兜底方式
- 与训练过的 TF-IDF baseline 比较,并检查混淆矩阵和保存的逐条预测。
运行方式
公开性能数据
Reported Jev accuracy
98.64 %
Three-way ham, spam, and phishing classification on 5,733 emails.
作者自报 · 已核对来源采集于 2026年9月21日
Reported best TF-IDF accuracy
98.87 %
Same three-way 5,733-email classification dataset.
作者自报 · 已核对来源采集于 2026年9月21日
项目概览
jev-spam-eval 更适合被视为研究资料,而不是产品 Demo。仓库包含数据集准备、运行器、缓存预测、评估脚本、混淆矩阵和成本分析。主三分类实验中,zero-shot Jev 报告 98.64% accuracy,最佳训练 TF-IDF baseline 为 98.87%。
这些是作者运行的结果,不是独立 benchmark。较新的邮件集合上表现更弱,也暴露了上下文错配,例如 newsletter 容易被看成 spam。当前三分类实验使用 Choice,较早的二分类 spam 实验使用 Noul。
- 开发语言
- Python
- 许可证
- MIT
- 作者
- bitnovus
信息来源
相关项目
pg-jev
直接在 PostgreSQL 的筛选、排序和分类中调用 Jev。
Jev 决定什么
一行是否匹配、匹配程度,或最适合哪个给定标签。
Jev Search
把自然语言请求转换成来源选择、搜索通道和带可见分数的链接排序,不生成拼接答案。
Jev 决定什么
使用哪个查询、来源和时间范围,以及每条返回结果与请求有多相关。
blink
让多个 Jev walker 每次做一次目录选择,沿代码树寻找答案。
Jev 决定什么
walker 下一步应该进入当前可见的哪个文件或子目录。