K12
SMOTE 类重采样在梯度提升分类器与阈值调优对照下的真实收益——PR-AUC 与概率校准双口径的独立复检
1 · 研究问题
Elor 等(2022)「对强分类器而言 SMOTE 类重采样基本无益」的结论,在极端不平衡(正类 <0.5%)的公开数据集与概率校准(calibration)这一新评价维度上是否仍然成立?重采样带来的排序指标变化与校准恶化之间是否存在系统性权衡?
2 · 研究背景与空白
SMOTE(Synthetic Minority Oversampling Technique, 2002)在少数类样本间线段上合成新样本,是不平衡分类最常被套用的预处理。Elor & Averbuch-Elor(2022, "To SMOTE, or not to SMOTE?")在 73 个数据集上系统检验,结论:对 XGBoost/Catboost 等强分类器,重采样在排序指标上无稳定收益,对弱分类器才有益;后续 benchmark(arXiv:2303.03094, 2023)进一步支持「恰当调阈值即可替代重采样」。
空白在:这批审计集中在中度不平衡与排序/分类指标;正类占比 <0.5% 的极端区间覆盖稀疏,且重采样对预测概率校准质量(欺诈风控、医疗分诊真正消费的量)的破坏少有系统量化。数据全公开、单模型训练秒级,结论正负都成立。
3 · 可检验假设
- H1:在 ≥10 个正类占比 0.02%–2% 的公开数据集上,LightGBM + 阈值调优相对 LightGBM + SMOTE 的 PR-AUC 差异的 95% 置信区间包含 0(即极端区间上原结论复现)。
- H2:SMOTE 使预测概率系统性偏高,Brier 分数与期望校准误差(ECE)相对不重采样恶化 ≥30%,且恶化幅度随过采样倍率单调上升。
4 · 量化验收标准
- 方法学校验(硬门槛):用原论文开源代码/协议在其 3 个数据集上重现「强分类器下 SMOTE 无益」的方向性结论,且 PR-AUC 数值偏差 ≤5%。不过关则后续全部结论无效。
- 统计口径预先写死:报 PR-AUC、召回、精确率、Brier、ECE 与可靠性图;不报 accuracy——正类 0.2% 时全预测负类即得 99.8% accuracy,该指标无信息。
- 5×2 分层交叉验证 × 5 随机种子,报均值 ± 标准差;配对差用自助法给 95% 置信区间。
- 不平衡率控制实验:对同一数据集降采样正类至 2%/0.5%/0.1%/0.02% 四档,画收益–不平衡率曲线(≥4 个参数点)。
- 对照方法 ≥5 种:不处理、类权重、阈值调优、SMOTE、Borderline-SMOTE、随机欠采样。
- 全部管线开源,第三方一键重跑;总计算量预估 <20 CPU 小时。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 极端不平衡数据 | ULB Credit Card Fraud(Kaggle 公开,284,807 行,正类 0.17%);KDD Cup 1998、Santander、保险理赔等 OpenML 公开集(openml.org 按 imbalance 检索下载)——仅作输入,不计入本项目数据贡献 |
| 校验对照 | Elor 2022 论文开源代码与其数据清单——仅用于校验,不计入贡献 |
| 重采样实现 | imbalanced-learn(内置 SMOTE 全家族;文档层面核实默认 k 近邻参数与原论文一致) |
| 分类器 | LightGBM / XGBoost / logistic 回归(CPU 上单数据集训练秒–分钟级) |
| 校准度量 | scikit-learn calibration_curve、自实现 ECE(需自行实现分箱,写明箱数判据) |
6 · 方法路径
- 装环境,复现原论文 3 个数据集结论,完成硬门槛校验。
- 核实 imbalanced-learn 各实现与原始算法论文的参数差异,写成对照表。
- 按不平衡率与领域分层选定 ≥10 个公开数据集,冻结清单后不再增删。
- 跑全因子实验:数据集 × 6 种处理 × 3 分类器 × 5 种子。
- 做不平衡率降采样控制实验,绘收益曲线。
- 分析排序指标与校准指标的权衡结构(H2),配可靠性图。
- 交叉校验:用另一套独立实现(如自写朴素 SMOTE)核对合成样本分布一致。
7 · 新颖性边界
- 本课题不声称提出新重采样方法;「强分类器下 SMOTE 无益」由 Elor et al. (2022) 与 2023 年 benchmark 已发表,不得声称为本项目发现。
- 已有工作:Elor 2022 覆盖 73 个中度不平衡数据集、排序指标口径;2303.03094 加入调参对照。历届丘奖中 2025 优胜「Class-Imbalanced Semi-Supervised rPPG」是把不平衡学习应用于具体任务,与本题的方法审计方向不同。
- 本项目贡献(主结论):把审计推进到极端不平衡区间(评价样本切片扩展)+ 校准维度(评价维度转换),并给出「排序收益 vs 校准代价」的量化权衡。
- 价值:校准恶化直接影响风控/医疗中概率的可用性,这一代价在教程与实践中普遍被忽略;若校准并不恶化(H2 否证),同样是对社区流行说法的有效纠正。
8 · 决策门槛(go / no-go)
- 第 3 周末:原论文代码若无法运行或结果偏差 >5% → 排查至第 5 周;仍不过则降级:以 imbalanced-learn 标准实现 + 自建协议重建基线,校验对象改为「重现 ULB 欺诈集上已发表的 LightGBM PR-AUC 区间」,审计框架不变。
- 第 8 周末:确认 ≥10 个满足不平衡率区间且列可用的数据集;不足 → 用降采样构造(已在设计中),并明确标注为半合成切片。
- 第 30 周:若 H1、H2 均呈「无显著差异」→ 不改题;以等价性检验(TOST)报告效应量上界,负结论成文。
- 预算裁剪顺序:先砍 Borderline-SMOTE 等变体,再砍分类器至 2 种;数据集下限 8 个不可再砍。