K13
神经推荐是否真的在进步——MovieLens 与 Amazon 2023 新类目切片上的等墙钟基线审计,加测长尾覆盖与新颖度
1 · 研究问题
Ferrari Dacrema 等(2019)「多数神经推荐模型可被近邻/线性基线打败」的结论,在 Amazon Reviews 2023 新类目切片上、以纯 CPU 等墙钟成本口径衡量时是否仍成立?把评价维度从准确类指标扩展到长尾覆盖率与新颖度后,基线与神经模型的排序是否改变?
2 · 研究背景与空白
Ferrari Dacrema, Cremonesi & Jannach(RecSys 2019)审计了 18 个顶会神经推荐模型:仅 7 个可复现,其中 6 个被 ItemKNN 等简单启发式打败;Rendle 等(2020)进一步证明调好参的矩阵分解(matrix factorization, MF)仍是强基线。此后 EASE(2019)等线性模型持续刷新「简单方法上限」。
空白在:该审计(a)评价维度只覆盖 HR/NDCG 准确类指标,长尾覆盖率、新颖度、流行度集中度这些部署侧关键维度未进入胜负判定;(b)数据止于 2019 年前的基准,Amazon Reviews 2023(时间与类目全新)上无人重做;(c)成本口径按「训练到收敛」,消费级 CPU 等墙钟预算下的排序未被报告。数据公开、基线全部分钟级,适合学生课题。
3 · 可检验假设
- H1:在 MovieLens-1M 与 Amazon 2023 两个类目切片上,等 CPU 墙钟预算(每模型 2 小时)下,EASE/ItemKNN 的 NDCG@10 不低于 NeuMF 的 95%(即基线结论在新样本、新口径下复现)。
- H2:若把胜负指标换成目录覆盖率(coverage@10)与平均推荐新颖度(负 log 流行度),至少一处排序反转:神经模型或 MF 在 beyond-accuracy 维度显著优于近邻基线(配对自助 95% CI 不含 0)。
4 · 量化验收标准
- 方法学校验(硬门槛):用 Dacrema 开源评测框架重现其 MovieLens-1M 上 ItemKNN 与一个神经模型的 HR@10 / NDCG@10,偏差 ≤5%。不过关则后续全部结论无效。
- 统计口径预先写死:排序指标报 HR@10 / NDCG@10 / MRR;beyond-accuracy 报 coverage@10、新颖度、推荐列表基尼系数;不报 accuracy(top-N 推荐无意义)。
- 划分口径双轨:留一法(与原文对齐)+ 按时间划分(防泄漏),并量化两者差异——推荐评测的划分泄漏本身是已知问题(Meng et al. 2020),本项目给新数据上的量化。
- 每模型 5 个随机种子,报均值 ± 标准差。
- 等墙钟口径:每模型固定 2 CPU 小时训练+调参预算(含早停),同时报「官方默认配置」口径,两种都报。
- 全部脚本与切片构造代码开源,一键重跑。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 校验基准 | MovieLens-1M / 20M(GroupLens 官网直接下载)——仅作输入与校验,不计入本项目数据贡献 |
| 新样本 | Amazon Reviews 2023(McAuley Lab,HuggingFace 按类目切片下载);选 2 个类目并降采样至 ≤500 万交互,5-core 过滤 |
| 评测框架 | Dacrema 官方仓库(GitHub: RecSys2019_DeepLearning_Evaluation);RecBole(内置 NeuMF/EASE/ItemKNN——需核实其指标实现与 Dacrema 框架一致,不一致则统一用自建评测层) |
| 模型 | ItemKNN、EASE、MF(implicit 库 ALS)、NeuMF;NeuMF 在 ML-1M 上 CPU 单轮约 5–15 分钟、30 轮过夜可行;EASE 为闭式解,ML-1M 上分钟级 |
| 算力边界 | Amazon 全类目(数亿交互)超出范围;≤500 万交互切片内全部模型 CPU 可行 |
6 · 方法路径
- 装环境,跑通 Dacrema 框架自带算例,完成硬门槛校验。
- 核实 RecBole 与 Dacrema 框架的负采样评测差异(已知会显著改变指标),冻结统一评测协议。
- 构造 Amazon 2023 两个类目切片(5-core、降采样),发布切片构造脚本。
- 跑全部模型 × 数据集 × 5 种子,双成本口径、双划分口径。
- 计算 beyond-accuracy 指标,检验 H2 的排序反转。
- 汇总胜负表与置信区间,分析反转与数据集长尾结构的关系。
- 交叉校验:ItemKNN 用两套独立实现互核 NDCG(偏差 ≤1%)。
7 · 新颖性边界
- 本课题不声称提出新推荐算法;「基线打败神经模型」由 Dacrema et al. (2019)、Rendle et al. (2020) 发表,不得声称为本项目发现。
- 已有工作:Dacrema 覆盖 2015–2018 顶会模型、准确类指标、留一法口径;Meng et al. (2020) 指出划分方式问题但未在 2023 数据上量化。
- 本项目贡献(主结论):其一,Amazon 2023 新切片 + 等 CPU 墙钟口径下的独立复检;其二,把胜负判定扩展到覆盖率/新颖度维度并检验排序反转。
- 价值:若基线结论在新数据继续成立,是对「进步幻觉」的又一次独立支持;若 beyond-accuracy 维度反转,则给「神经模型价值在多样性而非精度」提供量化证据——两个方向都成文。
8 · 决策门槛(go / no-go)
- 第 3 周末:Dacrema 框架在本机跑通且校验达标;若框架依赖损坏(2019 年代码)→ 限期 2 周迁移到 RecBole 并用其复现论文数字作为替代校验,评测协议声明差异。
- 第 8 周末:Amazon 2023 切片清洗完成且 NeuMF 在切片上单轮 ≤20 分钟;超时 → 具名降级:切片降到 ≤100 万交互,或砍 NeuMF 改为只审计 EASE/MF/ItemKNN 三强基线(审计框架与 H2 均保留)。
- 第 26 周:若双数据集结论方向不一致 → 不视为失败,改以「结论的数据依赖性」为主轴成文,加做第三切片仲裁。
- 预算裁剪顺序:先砍 20M 规模实验,再砍时间划分双轨(保留声明),种子下限 3。