B02
AlphaFold DB 的 pLDDT 作为内在无序预测器:按分类群与同源序列深度分层,检验"低置信度"混淆了真无序与预测不确定
1 · 研究问题
把 AlphaFold DB 中的 pLDDT(predicted local distance difference test)当作内在无序区(intrinsically disordered region, IDR)预测器时,其性能在不同分类群(taxon)与不同同源序列深度(以 UniRef50 簇大小为代理)之间是否存在系统性偏置?若存在,"低 pLDDT" 在多大程度上是在报告真实无序,又在多大程度上只是在报告多序列比对(MSA)太浅导致的预测不确定?
2 · 研究背景与空白
背景。 AlphaFold2 对每个残基输出一个 0–100 的 pLDDT 置信分。作者在原文中即指出低 pLDDT 区域与内在无序区高度相关,随后 1 − pLDDT/100 被广泛当作免费的无序预测器使用,并被整合进 AlphaFold-disorder 等工具(同时使用 pLDDT 与相对溶剂可及性 RSA)。内在无序蛋白在信号转导、相分离、转录调控中至关重要,因此这个"免费预测器"被大量下游研究直接采信。
已有工作到哪一步。 Piovesan / Necci 等的 AlphaFold-disorder 工作报告 pLDDT 在 CAID(Critical Assessment of protein Intrinsic Disorder)的 PDB-DisProt 参照集上表现优异,加入 RSA 后成为该基准上准确率最高的方法之一;但同一批评估明确指出,在 Disorder-NOX 参照集上 pLDDT 与 RSA 都无法正确优先排序无序位点。CSBJ 2023 的系统比较进一步发现,用于识别"完全无序蛋白"时 pLDDT 系统性欠预测,总是预测出一些残余结构。CAID 第二轮(Proteins, 2023)给出了跨方法的完整排名。
空白在于:所有这些评估都把 pLDDT 当成一个整体性能数字来报,没有沿"这条蛋白在序列数据库里有多少同源序列"这一维度做分层。 而 AlphaFold2 的置信度在机制上依赖 MSA 深度——同一条蛋白若同源序列稀少,pLDDT 会因信息不足而降低,这与"该区域真的无序"是两件事,但在 1 − pLDDT 的用法里被混为一谈。CAID 的参照集又以人类与模式生物的热门蛋白为主,同源序列普遍很深,因此这个混淆在现有基准上被系统性掩盖。这个空白适合学生课题:所有数据可匿名下载、算力需求近乎为零、结论正负都成立。
3 · 可检验假设
- H1:把评估蛋白按 UniRef50 簇大小分成四分位组后,pLDDT 作为无序预测器的 ROC-AUC 在最深四分位与最浅四分位之间的差值 ≥ 0.05,且经 1,000 次自助法重抽样后 95% 置信区间不跨 0;方向为"同源越浅、AUC 越低"。
- H2(机制/备择假设):这一偏置主要作用于假阳性而非假阴性——在浅同源组中,被标注为有序(ordered)却被 pLDDT 判为无序的残基比例,比深同源组高 ≥ 50%(相对值);而无序残基的召回率在两组间差异 < 0.05。若 H2 成立,说明可用一个依赖 MSA 深度的阈值校正来改善;若 H2 被否证(偏置对称出现在两类错误上),则说明 pLDDT 在浅同源蛋白上整体不可用,这是更强的警示结论。
4 · 量化验收标准
- 方法学校验(硬门槛):用自建评估脚本,在 CAID2 的 Disorder-PDB 与 Disorder-NOX 两个参照集上重算
1 − pLDDT的 ROC-AUC 与 APS(average precision score),要求与 AlphaFold-disorder 原文/CAID2 官方发布的对应数值偏差 ≤ 0.02(AUC 绝对值)。同时必须重现已发表的定性反差——Disorder-PDB 上 AUC 明显高于 Disorder-NOX。此项不过关(偏差 > 0.02 或反差方向不符),后续全部分层结论无效。 - 统计口径预先写死:无序残基在多数参照集中是少数类,属不平衡分类,因此主指标报 PR-AUC(precision–recall AUC)与在固定召回 0.8 处的精确率,不报 accuracy——原因是负类(有序残基)占比常达 70–90%,全判有序即可得到虚高的 accuracy,无法反映方法价值。ROC-AUC 仅作为与文献对齐的辅助指标报出。所有分层间比较用 1,000 次自助法(按蛋白整条重抽样,不按残基,避免同一蛋白内残基的非独立性)给 95% 置信区间;多组比较报 BH 校正后的 FDR。
- 混杂控制:分层比较必须同时报"未调整"与"按蛋白长度、无序内容占比、是否有实验结构覆盖三项做分层/回归调整"两套结果。若调整后效应量衰减 > 60%,判定 H1 的表观效应主要由混杂驱动,须在结论中明确写出。
- 样本量与检验力:评估集必须 ≥ 500 条有 AlphaFold 模型且有残基级无序标注的蛋白,每个四分位组 ≥ 100 条。开工前先做检验力估计:在给定组内蛋白数下,能分辨的最小 AUC 差值是多少(用自助法模拟),写入方案。若最小可分辨差值 > 0.05,必须先扩充评估集。
- 可复现性:全部脚本、UniProt/AFDB 的下载时间戳与版本号、每条蛋白的中间特征表开源;提供一份
≤ 30 分钟可重跑的降规模复现包。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 残基级无序金标准 | DisProt(https://disprot.org/ ,可整库 JSON/TSV 下载,约 2,900 条蛋白、数万条区域标注,确切数量需核实当前版本);CAID2 官方参照集与官方预测结果(https://caid.idpcentral.org/ ) |
| 独立的第二套标签(NMR 化学位移推断) | CheZOD Z-score 数据集(约 1,300 条蛋白,公开于文献补充材料/GitHub)。用作"标签来源不同"的稳健性检验 |
| pLDDT 与结构 | AlphaFold Protein Structure Database(https://alphafold.ebi.ac.uk/ )。按 UniProt accession 逐条取 mmCIF/PDB,B-factor 字段即 pLDDT。3,000 条 × 约 0.3–1 MB ≈ 1–3 GB,REST 逐条下载约 1–3 小时(须加限速与断点续传)。也可用官方 FTP 的按物种打包文件 |
| 分类群与序列元数据 | UniProt REST API(https://rest.uniprot.org/ ),按 accession 批量取 taxonomy lineage、序列长度、是否有 PDB 交叉引用 |
| 同源深度代理变量 | UniRef50 簇成员数,经 UniProt REST 的 UniRef 端点按 accession 查询(数千次调用,纯网络开销)。代理变量的有效性需核实:应额外用一个小子集(≤ 200 条)跑 MMseqs2 对 UniRef50 的实际检索得到 Neff,检验两者相关系数 ≥ 0.6,否则该代理不可用 |
| 相对溶剂可及性(复现 AlphaFold-disorder 所需) | DSSP(mkdssp)或 biotite 的 SASA 计算,纯 CPU,每条蛋白 < 1 s |
| 统计与绘图 | Python + numpy / pandas / scikit-learn(PR-AUC、ROC)/ statsmodels(BH 校正、回归调整)/ matplotlib |
| 对照基准 | AlphaFold-disorder、flDPnn、SPOT-Disorder 等在 CAID2 上的官方发布预测与得分。仅用于校验与对比,不计入本项目的数据贡献 |
| 明确排除的路径 | 自行运行 AlphaFold2/3 推理属超出范围:完整 AlphaFold2 需约 2.2 TB 遗传数据库(BFD 约 1.7 TB)、MSA 检索阶段单条蛋白数小时 CPU,推理阶段需 16 GB 以上显存 GPU。ColabFold 在纯 CPU 上对 300 残基蛋白通常需数小时至十余小时/条,不可用于数千条规模。本项目只消费 AlphaFold DB 已发布的模型,此点须在论文方法部分明写 |
6 · 方法路径
- 装环境(Python 3.11 + biotite/DSSP),下载 CAID2 参照集与官方得分文件,先完成验收标准第 1 条的 AUC/APS 复现,把复现表与文献值并列写入
validation/。 - 构建评估集:交叉 DisProt/CAID2 蛋白列表与 AlphaFold DB 覆盖,逐条抓取 mmCIF、提取残基级 pLDDT,抓取 UniProt 元数据与 UniRef50 簇大小;剔除无 AF 模型、序列不一致(AFDB 与 DisProt 序列须完全一致)的条目,剔除规则与数量逐条记录。
- 核实同源深度代理变量的有效性:在 ≤ 200 条子集上用 MMseqs2 检索 UniRef50 得到真实 Neff,与簇大小求相关;相关不足则改用 Pfam 家族大小或直接放弃分层维度(见 go/no-go)。
- 按 UniRef50 簇大小四分位与分类群(人 / 其他真核 / 原核 / 病毒)双向分层,计算每层的 PR-AUC、固定召回 0.8 处精确率与两类错误率,自助法给区间。
- 做混杂调整:以残基级 logistic 回归(无序标签 ~ pLDDT + 蛋白长度 + 无序内容 + 有无 PDB 覆盖 + 同源深度分组 + pLDDT×同源深度交互项),报交互项系数与 FDR;交互项显著即为 H1 的模型化证据。
- 用 CheZOD 这套标注方式完全不同的标签重跑第 4、5 步,检验结论不依赖 DisProt 的标注习惯。
- 独立交叉校验:换一个不依赖 AlphaFold 的经典无序预测器(如 IUPred3,纯 CPU、秒级)做同样的分层评估。若 IUPred3 不表现出同样的同源深度依赖,则该依赖确属 AlphaFold 的 MSA 机制而非评估集人为构造——这是本课题最关键的一次对照。
7 · 新颖性边界
本课题不声称提出新的无序预测方法,不运行任何结构预测推理,不声称"pLDDT 与无序相关"这一已被 AlphaFold 原文与 Piovesan 等发表的事实为本项目发现;也不声称"pLDDT 在 Disorder-NOX 上表现差"为本项目发现(CSBJ 2023 与 CAID2 已报)。
已有工作具体完成了什么:AlphaFold-disorder 在 CAID/DisProt-PDB 上报出了 pLDDT 与 pLDDT+RSA 的总体 AUC 排名;CSBJ 2023 报出了在识别完全无序蛋白时的欠预测;CAID2 给出了跨方法的整体排名与两套参照集之间的性能反差。这三项工作都只报整体数字,评估集以人类与模式生物的深同源蛋白为主。
本项目的贡献(且是主结论):把评价维度从"整体性能"换成"沿同源序列深度与分类群的分层性能",并检验一个可否证的机制命题——低 pLDDT 同时编码"真无序"与"MSA 浅导致的不确定",两者的混淆程度随同源深度系统变化。第 7 步的 IUPred3 对照使这个命题真正可被否证。
为什么有价值:大量下游研究(尤其是对非模式生物、环境宏基因组来源蛋白的研究)把
1 − pLDDT当无序注释直接用,而这些蛋白恰恰处在同源最浅的一端。若偏置存在,本项目给出一条"何时不该这么用"的可操作判据;若不存在,则为这种廉价用法提供一次独立背书。风险声明:"分层间无显著差异"同样是有效结论,但必须由第 4 条的检验力估计证明本设计有能力分辨 0.05 的 AUC 差异,否则该结论无效。
8 · 决策门槛(go / no-go)
- 第 3 周末:确认 DisProt/CAID2 与 AlphaFold DB 的可交叉条目数。若序列完全一致且有残基级标注的蛋白 < 500,立即降级:其一,把标签来源扩到 MobiDB 的"共识无序"注释(规模大一个数量级,代价是标签质量下降,须在论文中标注为弱标签);其二,把残基级评估改为蛋白级评估(是否为"高无序含量蛋白"的二分类),此时可用蛋白数上万。两条降级都保留"分层 + 混杂调整 + IUPred3 对照"的主结论框架。
- 第 6 周末(硬门槛):验收标准第 1 条必须通过。若自建脚本的 AUC 与官方值偏差 > 0.02,先排查残基映射与缺失值处理;两周内仍不通过则降级为直接使用 CAID2 官方发布的 pLDDT 预测得分文件(放弃自建特征提取,把方法学校验改为"官方得分复算一致性 ≥ 0.99"),分层分析照常进行。
- 第 10 周末:核实同源深度代理变量。若 UniRef50 簇大小与 MMseqs2 实测 Neff 的相关 < 0.6,立即降级:改用"是否属于模式生物 / 是否有 PDB 实验结构覆盖 / Pfam 家族大小"三个可直接查得的分层变量替代,主结论从"同源深度依赖"改述为"注释充分度依赖",框架与全部分析步骤不变。
- 第 30 周:若 H1 与 H2 都未达阈值,按风险声明写"无显著偏置"结论,并把检验力估计作为核心证据放进正文。第 36 周结果冻结,第 44 周英文 PPT 初稿。
- 需提前核实而非边做边发现:(a) AlphaFold DB 的 REST 逐条下载是否有速率限制与配额;(b) DisProt 序列版本与 AFDB 所用 UniProt 版本是否一致(版本漂移会造成残基编号错位,这是本课题最隐蔽的坑);(c) CAID2 官方得分文件的格式与缺失值约定。三项必须在第 5 周前查清。
- 选择前提:适合数学与统计感觉较好、能耐心处理序列坐标映射的学生。本路线不需要任何湿实验与大算力,但对"评估设计的严谨性"要求高——这也正是它在评委面前的说服力来源。
- 预算裁剪顺序:先砍 CheZOD 第二套标签(保留 DisProt 主线),再砍分类群维度(只保留同源深度维度),最后砍混杂回归(只留分层比较)。砍到只剩"同源深度四分位 + PR-AUC + IUPred3 对照"时,主结论仍成立。