Yau Awards Archive 2020 — 2025

B07

肠道微生物组疾病分类器的临床有用性再评估:把跨队列评价维度从 AUROC 换成真实患病率下的 PR-AUC 与决策曲线净获益

优先级:中分族:微生物组公开数据参赛子类:微生物组信息学 / 生物统计资源需求:纯 CPU 笔记本,物种丰度表 ≤ 2 GB,无需处理原始测序数据技能取向:R/Python 机器学习 + 临床预测模型评价

1 · 研究问题

已发表的肠道微生物组疾病分类器在留一队列(leave-one-dataset-out, LODO)验证下报出的 AUROC 约 0.7–0.8,若把评价维度换成真实人群患病率下的 PR-AUC 与决策曲线净获益(net benefit, decision curve analysis),这些分类器在筛查场景中还剩多少实际价值?在哪些疾病、哪个阈值概率区间内,模型的净获益仍高于"全部筛查"与"全部不筛查"两条参照线?

2 · 研究背景与空白

背景。 用肠道微生物组做疾病无创诊断是过去十年的热门方向:从粪便宏基因组或 16S 数据提取物种/功能丰度,训练随机森林或梯度提升机,报告 AUROC。但 AUROC 是一个与患病率无关的判别指标,而临床筛查的价值取决于在真实患病率下阳性预测值有多高、以及在医生实际使用的阈值处相对"不筛查"能净挽回多少真阳性。结直肠癌人群患病率约 0.05%–0.5%,即便 AUROC 0.80 的模型在这种患病率下的阳性预测值也可能低于 5%。

已有工作到哪一步。 Duvallet 等(2017)建立了 MicrobiomeHD 跨疾病 16S 元分析;Wirbel 等(2019)做了结直肠癌宏基因组的多队列元分析并报 LODO AUROC;一项 2023 年的系统评估(Gut Microbes)用 curatedMetagenomicData 对 20 种疾病做跨队列验证,报告队列内 AUROC 约 0.77 而跨队列仅在肠道疾病上保持约 0.73,非肠道疾病显著更低,并报告了标志物一致性;另有 2022 年的 IBD 基准工作(15 个 16S 数据集、7,707 样本)系统比较了归一化、批次校正与模型的组合,并用 LODO 评估泛化。

空白在于:这一整条文献线全部以 AUROC(及少量 AUPRC)为终点,没有任何一项做过真实患病率下的净获益评估 而这恰恰是"微生物组能否用于筛查"这一实际问题的唯一相关指标。决策曲线分析在临床预测模型领域早已是标准做法(TRIPOD 指南推荐),却几乎没有进入微生物组领域。这个空白适合学生课题:所有数据已统一处理并可通过 R 包一行代码获取、算力在小时级、方法学成熟且公开、结论正负都成立

3 · 可检验假设

  • H1:在文献报告的真实人群患病率下,跨队列(LODO)训练的分类器对非肠道疾病在全部临床相关阈值概率区间(0.5%–20%)内的净获益均不高于"全部筛查"策略(差值 95% 自助法置信区间上界 < 0);而对肠道疾病(结直肠癌、IBD)存在一个宽度 ≥ 5 个百分点的阈值区间使净获益显著为正。
  • H2(机制/量化假设):AUROC 与净获益之间不存在单调对应——存在至少一对 (疾病 A, 疾病 B),使 AUROC(A) > AUROC(B) 但在各自真实患病率下净获益(A) < 净获益(B)。若这样的反转对存在,即证明现有以 AUROC 排序疾病的做法会误导优先级判断。

4 · 量化验收标准

  1. 方法学校验(硬门槛):用自建管线复现两项已发表结果:(a) 复现 Wirbel 等(2019)或上述 2023 年 Gut Microbes 工作中结直肠癌的 LODO AUROC,要求各队列的 AUROC 与原文报告值偏差 ≤ 0.05(绝对值),且队列间排序的 Spearman 相关 ≥ 0.7;(b) 复现该工作中"跨队列 AUROC 显著低于队列内 AUROC"的定性反差,方向与量级(差值 ≥ 0.03)一致。任一项不达标,管线不可信,后续净获益结论全部无效。
  2. 统计口径预先写死:(a) 主指标为在真实患病率下重标定后的 PR-AUC 与决策曲线净获益,明确不报 accuracy——原因是在患病率 0.5% 的筛查场景中,全判阴性即得 99.5% accuracy,该指标完全无信息;(b) AUROC 仅作为与文献对齐的辅助指标;(c) 由于研究队列中病例/对照比例被人为设为接近 1:1,必须做患病率重标定:用 Bayes 先验修正把模型输出概率映射到目标患病率,重标定公式与来源写入方法;(d) 校准必须评估——报 calibration slope/intercept 与 Brier 分数,并做 Platt scaling 或等距回归重校准后的对照;(e) 所有指标给 ≥ 1,000 次自助法(按队列整体重抽样,不按样本,以尊重队列层级结构)95% 置信区间;(f) 多疾病比较报 BH-FDR。
  3. 批次效应必须检查并写明校正方法:全部使用 curatedMetagenomicData 的统一 MetaPhlAn 管线输出以消除生信管线差异;对剩余的测序平台/国家差异,用 PERMANOVA(vegan::adonis2)量化其解释的方差比例,并做一次 ConQuR 或 MMUPHin 批次校正的敏感性分析,报告校正前后 AUROC 与净获益的差值。
  4. 规模下限:≥ 6 种疾病,每种疾病 ≥ 3 个独立队列,每队列 ≥ 50 例病例与 50 例对照;每种疾病必须能从一级文献(WHO/国家疾控/系统综述)查到可引用的人群患病率,患病率来源与年份逐条写入表格,并对患病率做 ±50% 的敏感性分析。
  5. 公开注释与已发表模型的地位:curatedMetagenomicData 的物种注释、已发表模型的超参数与特征列表仅作为对照与输入使用,不计入本项目的数据贡献
  6. 可复现性:全部脚本、包版本、随机种子、每疾病的患病率来源表开源;提供 2 疾病的降规模复现包(≤ 1 小时可跑完)。

5 · 数据与工具

用途 来源 / 工具
统一处理的宏基因组物种丰度 curatedMetagenomicData(Bioconductor R 包,https://waldronlab.io/curatedMetagenomicData/ )。约 2 万份公开人体宏基因组样本,全部用同一 MetaPhlAn/HUMAnN 管线处理,附人工策展的元数据(年龄、BMI、国家、疾病状态、用药)。按疾病切片下载,单疾病数据 < 200 MB;全库物种丰度表约 1–2 GB,16 GB 内存可处理
16S 备用数据 MicrobiomeHD(Duvallet 等 2017,公开于 Zenodo)与 Qiita 公开研究。仅在宏基因组队列不足时启用(见 go/no-go)
受控访问核查 curatedMetagenomicData 与 MicrobiomeHD 收录的均为已公开发表并开放下载的数据,元数据已去标识化,无需 DAC 审批。HMP2/iHMP 的部分详细临床字段属受控访问,本项目一律不使用。不涉及人体实验与可识别个人信息,无需伦理审批
人群患病率 WHO、GBD(Global Burden of Disease,http://ghdx.healthdata.org/ )、各国疾控年报、系统综述。每种疾病取一个主值 + 一个区间
机器学习 R mlr3 / caret 或 Python scikit-learn(随机森林、弹性网 logistic、LightGBM)。样本量千级、特征数千级,单次 5 折交叉验证在 CPU 上 < 2 min;LODO 全流程(6 疾病 × 约 4 队列 × 3 模型)约 2–6 小时
决策曲线分析 R 包 dcurvesrmda(标准实现,秒级);净获益公式须在论文中显式写出并自行实现一遍做交叉校验
校准与重标定 R CalibrationCurves、Platt scaling / 等距回归(scikit-learnCalibratedClassifierCV
批次校正 MMUPHin(Bioconductor)或 ConQuR
对照基准 Wirbel 等 2019、2023 Gut Microbes 20 疾病评估、2022 IBD 基准的已发表 AUROC 表。仅用于校验与对比,不计入本项目的数据贡献
明确排除的路径 从原始 fastq 重跑 MetaPhlAn/HUMAnN 属超出范围:单份粪便宏基因组原始数据 3–10 GB,2,000 份即 6–20 TB 下载;MetaPhlAn4 数据库索引约 20 GB 且比对阶段建议 ≥ 32 GB 内存,单样本 4 核约 20–60 分钟。本项目只消费已统一处理的丰度表,此点须在论文方法部分明写

6 · 方法路径

  1. 装环境(R + curatedMetagenomicData + mlr3 + dcurves),跑通包内示例,先完成验收标准第 1 条的结直肠癌 LODO 复现,把 AUROC 对比表写入 validation/
  2. 按预先写死的规则锁定 ≥ 6 种疾病与其队列集合(规则:≥ 3 队列、每队列 ≥ 50/50、元数据完整度 ≥ 80%),生成"疾病–队列–样本数–国家–平台"总表并冻结。
  3. 从一级来源查取每种疾病的人群患病率,形成带出处与年份的患病率表;此表必须先于任何净获益计算冻结
  4. 跑 LODO 训练与预测,得到每个样本的预测概率;报 AUROC(对齐文献)、AUPRC、校准曲线与 Brier 分数。
  5. 做患病率重标定与概率重校准,然后计算每种疾病在阈值概率 0.5%–20% 网格上的净获益曲线,与"全筛"、"全不筛"两条参照线并列作图;自助法给区间。检验 H1。
  6. 检验 H2:在疾病之间比较 AUROC 排序与净获益排序,用 Kendall τ 量化两种排序的一致性,并点名所有反转对。
  7. 独立交叉校验:其一,用 MMUPHin 批次校正后的特征重跑全流程,验证结论不由批次伪迹驱动;其二,用一个完全不同的模型族(弹性网 logistic 而非树模型)重算主曲线;其三,对患病率做 ±50% 敏感性分析,检验结论是否稳健。

7 · 新颖性边界

本课题提出新的分类模型、提出新的批次校正方法、声称发现新的微生物标志物,声称"跨队列泛化性能下降"为本项目发现——这一点由 Duvallet 等(2017)、Wirbel 等(2019)与 2023 年 Gut Microbes 的 20 疾病评估明确报告。

已有工作具体完成了什么:Duvallet 等建立跨疾病 16S 元分析框架;Wirbel 等在结直肠癌上做多队列宏基因组元分析与 LODO;2023 年 Gut Microbes 工作在 curatedMetagenomicData 上系统评估 20 种疾病的队列内(约 0.77)与跨队列(肠道疾病约 0.73)AUROC 并比较 16S 与宏基因组、报告标志物一致性;2022 年 IBD 基准比较了处理流程与模型组合。这四项工作的终点全部是判别力指标,均未做患病率重标定、未做校准评估、未做决策曲线净获益。

本项目的贡献(且是主结论):把评价维度从"判别力(AUROC)"换成"真实患病率下的临床有用性(PR-AUC + 校准 + 净获益)",并检验一个可否证的命题——AUROC 排序与净获益排序会发生反转(H2)。交付物是一张"疾病 × 阈值概率 → 是否有净获益"的可查表。

为什么有价值:微生物组诊断的产业化宣传普遍引用 AUROC。给出同一批数据在真实患病率下的净获益,把"这个模型能不能用于筛查"从修辞变成可读数的判断。

风险声明:"净获益普遍为正、AUROC 排序与净获益排序高度一致"同样是有效结论,它会为该领域提供一次重要的正面背书。但必须给出按队列重抽样的自助法误差棒,证明本设计有能力分辨净获益曲线与参照线之间的差异。

8 · 决策门槛(go / no-go)

  • 第 5 周末:确认 curatedMetagenomicData 中满足"≥ 3 队列、每队列 ≥ 50/50"的疾病数量。若 < 4 种,立即降级:其一,把队列下限降到 30/30 并把疾病数补足;其二,启用 MicrobiomeHD 的 16S 队列作为补充,代价是需分数据类型报结果(16S 与宏基因组不合并)。两条降级都保留"重标定 + 校准 + 净获益 + 排序反转"的主结论框架。
  • 第 9 周末(硬门槛):验收标准第 1 条必须通过。若结直肠癌 LODO AUROC 与文献偏差 > 0.05,先排查特征预处理(相对丰度 vs CLR 变换)与队列纳入范围;四周内仍不通过则降级:把校验基准改为"复现原文公开代码仓库的输出"(若有),阈值提到偏差 ≤ 0.02;若原文无代码,则把校验改为"在同一队列上队列内 5 折交叉验证的 AUROC 落入原文报告区间",并在论文中明写复现受限的原因。
  • 第 14 周末:确认能否为每种疾病从一级来源取到可引用的人群患病率。若某疾病取不到,立即降级:该疾病改用"患病率区间扫描"呈现(在 0.1%–10% 全区间上画净获益热图),而非单点患病率。主结论框架不变,且这种呈现方式信息量更大。
  • 第 26 周末:若 H2 的反转对不存在(AUROC 与净获益排序 Kendall τ > 0.9),按风险声明写"两种评价一致"结论,并把净获益可查表作为核心交付物。
  • 第 36 周结果冻结,第 44 周英文 PPT 初稿。
  • 需提前核实而非边做边发现:(a) curatedMetagenomicData 当前版本收录的疾病与队列清单(版本间会变动,须固定版本号);(b) 目标复现论文是否公开了逐队列 AUROC 数值表;(c) 决策曲线在类别不平衡且经重标定后的正确实现方式(须手工推一遍公式,不能只调包)。三项在第 8 周前查清。
  • 选择前提:适合对临床统计有兴趣、能理解"判别力 ≠ 有用性"这一区分的学生。本课题的技术门槛不高,说服力全部来自评价框架的正确性,因此对概念清晰度要求高。
  • 预算裁剪顺序:先砍 MMUPHin 批次校正对照,再砍第三个模型族,再砍疾病数(从 6 降到 4)。砍到只剩"4 疾病 × LODO × 随机森林 × 重标定净获益曲线"时,主结论仍成立。