Yau Awards Archive 2020 — 2025

C08

预训练机器学习势在域外化学基元上的可迁移性审计:以扭转能垒与非共价二聚体扫描为探针、以不确定度指标能否预警失效为判据

推荐优先级 中分族 机器学习势 / 模型评估资源需求 纯 CPU,推理为主;需数 GB 内存技能取向 PyTorch 推理 + 量子化学参考计算失败风险 中高

1 · 研究问题

在训练集覆盖薄弱的化学基元上(如高价态硫/磷、卤键、两性离子、罕见杂环),预训练机器学习原子间势(machine-learned interatomic potential, MLIP)MACE-OFF23 与 ANI-2x 的扭转能垒与二聚体相互作用能误差,比其在训练分布内的报告误差放大多少倍?模型自带或可廉价构造的不确定度指标(如集成方差、近邻描述符距离)能否在不看参考值的前提下预警这种失效?

2 · 研究背景与空白

MLIP 以经典力场的成本交付量子化学精度,是近年计算化学最实质的进展之一。MACE-OFF23(Kovács、Csányi 等,JACS 2025)是面向有机分子的短程可迁移力场,基于高阶 E(3) 等变消息传递网络,训练在 SPICE 数据集(药物样分子,含 H/C/N/O/F/P/S/Cl/Br/I 十种元素)上;ANI-2x 是更早的基于原子环境对称函数的模型。MACE-OFF 原文报告其多项性质优于 ANI-2x 与 AIMNet(如分子液体密度 MAE 0.09 g/cm³,ANI-2x 约为其两倍),并展示对未见分子二面角扫描的准确描述。2026 年的工作(arXiv:2605.00640,Knowing when to trust machine-learned interatomic potentials)开始系统讨论 MLIP 的可信度判定问题。

空白在:模型作者的自评天然倾向于覆盖良好的化学空间;而使用者真正需要知道的是在自己那个可能没被覆盖的角落里,误差会放大到什么程度,以及有没有一个不需要参考值就能算的预警指标。SPICE 的元素虽覆盖十种,但对高价态硫(磺酰、亚砜)、三价/五价磷、卤键给体、两性离子等基元的采样密度差异很大(具体覆盖情况须回 SPICE 原文与数据统计核实)。本课题属于换样本切片 + 换评价维度:切片是刻意选取的域外化学基元,评价维度是"不确定度指标的预警能力"而非平均精度。算力可控,正负结论都明确。

3 · 可检验假设

H1 在刻意构造的域外基元子集上,MACE-OFF23 的扭转能垒 MAE 相对其在分布内基元上的 MAE 放大 ≥ 3 倍(放大倍数的自助 95% 置信区间下界 > 2)。

H2 廉价可算的不确定度代理指标(模型集成方差,或测试构型的原子环境描述符到训练分布的最近邻距离)与实际误差的 Spearman 相关系数 ρ ≥ 0.5(自助 95% CI 下界 > 0.3);即失效可以被事先预警。若 H2 被否证,则给出"现有廉价不确定度指标不足以预警域外失效"的负结论,这对 MLIP 的实际部署是重要的警示。

4 · 量化验收标准

  1. 方法学校验(硬门槛):用自建推理管线在 MACE-OFF 原文或 SPICE 公开测试集中的已发表算例上重算能量/力,与原文报告的能量 MAE 对比,偏差 ≤ 0.5 kcal/mol(或原文单位下的等价阈值);同时对至少 3 个分子做"MLIP 扭转扫描 vs 原文图中扫描曲线"的目视与数值对照,峰位偏差 ≤ 5°、峰高偏差 ≤ 0.5 kcal/mol。此条不过关意味着模型权重、单位换算(eV vs kcal/mol)或元素映射有误,后续全部可迁移性结论无效
  2. 参考值口径预先写定:域外基元的参考能垒由 PySCF 在明确写定的水平上自算(如 ωB97X-D/def2-SVP 或 B3LYP-D3/6-31G,具体水平在第 8 周前冻结),并对其中 ≥ 10 个点用更大基组做一次收敛检查(能垒变化 ≤ 0.3 kcal/mol 方接受)。参考水平低于 SPICE 的训练水平这一事实必须显式声明*,并把由此引入的系统偏置作为独立的误差项报告,不得混入 MLIP 误差。
  3. 统计口径预先写死:误差报 MAE 与 RMSE(kcal/mol),分层为"域内基元 / 域外基元"两组,放大倍数与所有相关系数给 1,000 次自助(自助单位为分子)95% 置信区间。域外/域内的划分判据必须明确、可复现且事先冻结(基于 SMARTS 定义的基元清单 + SPICE 中该基元出现频次的统计阈值)。
  4. 样本量下限:域外基元 ≥ 5 类、每类 ≥ 8 个分子;扭转扫描每分子 ≥ 24 个角度点;非共价二聚体 ≥ 30 对(可取自 S22/S66 公开集的相关子集)。
  5. 计时口径:报告每个模型在本机 CPU 上的单帧推理时间(同机、同线程、三次中位数),以及"MLIP 推理 vs PySCF 参考计算"的成本比——这是使用者关心的第二维信息。
  6. 全部模型版本号、权重来源、扫描结构、参考计算输入输出、不确定度指标实现与统计脚本开源,一条命令可重跑。

5 · 数据与工具

用途 来源 / 工具
预训练模型 MACE-OFF23(GitHub ACEsuit/mace,权重按其许可发布——许可条款与是否允许中学生个人非商业使用须在第 4 周前核实);ANI-2x(torchani,MIT 许可,权重随包分发)。两者均可通过 ASE calculator 接口调用
参考计算 PySCF(见 C05 的能力说明)。域外基元分子须控制在 ≤ 12 重原子,否则参考计算成本失控
非共价对照集 S22 / S66 公开二聚体基准集(含高精度参考相互作用能)。仅用于校验与对比,不计入本项目的数据贡献
训练分布统计 SPICE 数据集(公开,HDF5 格式,体积较大,是否需全量下载须核实;仅需其化学基元频次统计,可考虑用已发布的统计表或按需下载子集)
结构生成 RDKit(ETKDG 生成构象、SMARTS 定义基元、约束二面角扫描)
算力 纯 CPU。MLIP 推理:MACE-OFF23(S) 对 20–40 原子体系单帧约 数十毫秒到 1 秒(强依赖线程数与 PyTorch 版本,必须本机实测);40 分子 × 24 点 × 2 模型 ≈ 2,000 次推理,分钟到小时级。参考 DFT:≤ 12 重原子在 def2-SVP 下单点约 10–60 秒,2,000 个点约 6–30 小时,可后台分批。内存:MACE 模型加载需数 GB,须确认本机内存 ≥ 16 GB超出范围的方案(明确列出):用 MLIP 跑长时 MD 生产轨迹、自行训练或微调 MLIP、在 SPICE 训练水平(ωB97M-D3/def2-TZVPPD)上自算参考值——三者一律不做

6 · 方法路径

  1. 装 PyTorch(CPU 版)、mace-torchtorchani、ASE,加载权重跑通官方示例,实测单帧推理时间与内存占用(第 1–5 周)。若内存或速度不达标,立即走降级路径。
  2. 通过方法学校验硬门槛:复现原文算例的能量 MAE 与 3 条扭转扫描曲线。
  3. 核实工具能力边界与许可:MACE-OFF23 权重的使用条款;模型对形式电荷/自由基的支持情况(MACE-OFF23 与 ANI-2x 均为闭壳层中性分子设计,自由基与带电体系很可能不在支持范围——这一点须核实并据此界定域外基元清单)。
  4. 冻结域外基元清单(SMARTS + SPICE 频次阈值),用 RDKit 生成分子与约束扭转扫描结构。
  5. 跑 MLIP 推理与 PySCF 参考计算,组装能垒表;同时计算两类不确定度代理指标(多模型/多 size 集成方差、描述符最近邻距离)。
  6. 做分层统计:域内 vs 域外 MAE、放大倍数、不确定度-误差相关性,全部给自助 95% CI;并把参考水平引入的系统偏置单列一项。
  7. 独立交叉校验:对 S22/S66 子集用 MLIP 算相互作用能,与该集的高精度参考值直接对比(不经自算 DFT),确认"域外放大"的结论在完全独立的参考体系上方向一致。

7 · 新颖性边界

  • 本课题声称训练或改进任何 MLIP,声称发现 MACE-OFF23 的新架构缺陷,声称自己的参考计算精度高于 SPICE 的训练水平,把 SPICE、S22/S66 的数据计入学生的数据贡献。
  • 已有工作具体完成了什么:Kovács、Csányi 等(JACS 2025)发布 MACE-OFF23 系列并在分子液体密度、扭转扫描、分子晶体等性质上自评,报告优于 ANI-2x 与 AIMNet(如液体密度 MAE 0.09 g/cm³,ANI-2x 误差约两倍);arXiv:2605.00640(2026)开始讨论 MLIP 的可信度判定框架。
  • 本项目的贡献有两条且都是主结论:其一,换样本切片——以训练分布频次统计为依据、用可复现判据刻意构造域外基元集,量化误差放大倍数;其二,换评价维度——不评"模型准不准",而评"廉价不确定度指标能不能在没有参考值时预警失效",这是使用者实际部署时唯一能依赖的信息。
  • 为什么有价值:MLIP 正在被大量非专业使用者当作黑箱调用。一份"哪些基元上会失效、失效能否被预警"的独立审计,正是这类模型从论文走向使用最缺的一环。
  • "差异不显著"同样是有效结论:若域外基元上误差并未显著放大,说明 MACE-OFF23 的可迁移性优于预期,这对社区是正面且有分量的独立验证——但必须给出自助置信区间证明本研究有能力分辨 2 倍以上的放大。

8 · 决策门槛(go / no-go)

  • 第 5 周末(关键门):本机必须能加载 MACE-OFF23 权重并在 ≤ 2 秒/帧完成 30 原子体系推理,内存占用在可承受范围。若不达标,立即降级:其一,只做 ANI-2x(torchani 更轻、CPU 推理更快),把研究对象从"两模型对比"改为"单模型的域外审计 + 不确定度预警能力",主结论框架完全保留;其二,把体系规模压到 ≤ 20 原子。
  • 第 4 周前必须查清(不要边做边发现):MACE-OFF23 权重的许可条款是否允许本项目的使用与结果发布。若不允许,全部改用 ANI-2x(MIT 许可)与其他明确开源的 MLIP。
  • 第 10 周末:方法学校验硬门槛必须通过。若原文算例复现不了(偏差 > 0.5 kcal/mol),最可能是单位或模型 size 变体选错——降级为放弃与原文数值对齐,改以 S22/S66 公开参考值作为唯一校验基准(该集参考值权威且无歧义),主结论框架不变。
  • 第 14 周末:核实域外基元清单能否凑齐 5 类 × 8 分子且参考计算成本可控(≤ 12 重原子)。若不能,降级:其一,把域外/域内的划分从"基元类别"改为"SPICE 频次连续变量",改做回归而非分组对比;其二,把探针从扭转能垒换成成本更低的"平衡键长/键角偏差"(只需单点优化对比,参考计算量下降一个数量级)。两条路径都保留"误差放大 + 预警能力"的主结论框架。
  • 预算裁剪顺序:先砍第二个模型,再砍非共价二聚体部分(只做扭转),再砍第二类不确定度指标,最后把每类基元的分子数从 8 降到 5。砍到只剩"ANI-2x + 3 类域外基元 × 5 分子 + 单一不确定度指标"时主结论仍成立。
  • 选择前提:仅在学生已完成过一次 PyTorch 环境配置、且机器内存 ≥ 16 GB 时启动。这条路线的失败模式主要在工程环境而非科学内容,第 5 周的环境门必须严格执行,不得拖延