Yau Awards Archive 2020 — 2025

C09

小数据 Δ-机器学习把 GFN2-xTB 校正到 DFT 的可用性边界:以化学相似度分层的增益消失阈值为判据

推荐优先级 中低分族 机器学习 + 半经验量子化学资源需求 纯 CPU,xtb 批量数小时技能取向 量子化学 + 机器学习 + 学习曲线分析失败风险 高

1 · 研究问题

在只有 10²–10³ 个训练分子的小数据条件下(这是一台笔记本 + 一学年真实能达到的规模),把 GFN2-xTB 能量校正到 DFT 水平的 Δ-机器学习(Δ-machine learning)模型,其相对于未校正 xTB 的增益,在测试分子与训练集的化学相似度低到什么程度时完全消失?该"增益消失阈值"是否随训练集规模系统性外移?

2 · 研究背景与空白

Δ-机器学习(Ramakrishnan 等, JCTC 2015)不直接学高精度能量,而是学"低精度与高精度方法之差";这个差比能量本身平滑得多,同样的数据能换来大得多的增益。以 GFN2-xTB 为基线、DFT 为目标是最实用的搭配:xTB 单点亚秒级、DFT 单点分钟级。

已有工作走到哪一步:Zhao 与 Savoie 的 Δ² 模型(Chem. Sci. 2023, 14, 13392;代码见 GitHub zhaoqy1996/Delta2ML)以 GFN2-xTB 几何与能量为低阶输入、B3LYP-D3/TZVP 为高阶目标,训练在约 167,000 个反应上,并在多个外部集上验证近化学精度的可迁移性。相关方向还有用核岭回归(kernel ridge regression, KRR)做 PBE→耦合簇校正,以及 2026 年用基础 MLIP 隐特征做 Δ 学习校正 DFT 生成能。

空白在:这些工作全部处在大数据 + 集群的体制里(十万量级训练样本),其结论"Δ 学习可迁移"对一个只能拿到几百个 DFT 参考点的使用者没有直接指导意义。小数据体制下的真问题不是"能否达到化学精度",而是"离训练集多远时这个校正还比不做校正强"——超过那个距离,Δ 模型可能反而把 xTB 本来合理的能量拉偏。这属于换问题方向 + 参数维度扫描。风险在于结论可能是"小数据下增益本来就很小",故本课题必须从设计上保证该负结论也是完整可交付的成果。

3 · 可检验假设

H1 以 Tanimoto 相似度(Morgan 指纹)度量测试分子到训练集的最近邻距离,Δ 模型相对未校正 xTB 的 MAE 增益随相似度单调下降,并在某个阈值 T* 处降为零(增益的自助 95% 置信区间跨零);在 1,000 分子训练规模下 T* ≤ 0.4。

H2 T* 随训练集规模(100 / 300 / 1,000)系统性外移,且外移速率呈对数标度;即扩大训练集主要买到的是"适用范围"而非"分布内精度"。若 H2 被否证(T* 对训练规模不敏感),则说明小数据 Δ 学习的适用范围由化学表征而非样本量决定,这是一条更强、更有用的结论。

4 · 量化验收标准

  1. 方法学校验(硬门槛):用自建管线在 QM9 数据集的一个标准子集上重算 GFN2-xTB 原子化能,并复现文献中报告的"直接用 KRR/GBDT 学 QM9 原子化能"的基线学习曲线,在 1,000 训练样本处的 MAE 与已发表数值偏差 ≤ 1.0 kcal/mol;同时验证自建的原子化能定义(DFT 与 xTB 各自的孤立原子参考能)在 20 个分子上自洽(残差无系统漂移)。此条不过关意味着能量参考基准或单位换算有误,后续全部增益结论无效——这是本课题最容易出错的地方。
  2. 统计口径预先写死:误差报 MAE 与 RMSE(kcal/mol);划分必须用骨架划分与相似度分层双重口径,并额外做一次随机划分对照以量化其乐观高估幅度。学习曲线在每个训练规模上跑 ≥ 10 次重抽样,报中位数与四分位区间。"增益"定义为 MAE(xTB 原始) − MAE(Δ 模型),其置信区间由 1,000 次自助(自助单位为测试分子)给出。相似度分箱至少 5 档,每档测试分子 ≥ 50。
  3. 训练规模至少 4 档(100 / 300 / 1,000 / 3,000,最后一档视算力);模型至少 2 种(核岭回归 + 梯度提升),确认 T* 不是单一模型的产物。
  4. 明确报告"DFT 参考值取自 QM9(B3LYP/6-31G(2df,p)),本项目不自算 DFT 参考",以及由此带来的适用范围限制(QM9 仅含 ≤ 9 个重原子的 C/H/O/N/F 分子)。
  5. 交付一张"增益 vs 相似度 × 训练规模"的二维热图与 T* 的置信区间表。
  6. 全部 xtb 批处理脚本、特征生成、学习曲线代码与原始能量数据开源,一条命令可重跑。

5 · 数据与工具

用途 来源 / 工具
DFT 参考与几何 QM9 数据集(134k 个 ≤ 9 重原子的有机分子,含 B3LYP/6-31G(2df,p) 优化几何与内能)。公开下载(Figshare / MoleculeNet / DeepChem 镜像),体积数百 MB。仅用于校验与对比,不计入本项目的数据贡献——DFT 参考值全部来自该数据集,本项目不自算
低阶方法 xtb(GFN2-xTB 单点,直接在 QM9 提供的几何上算,不重新优化,以保证 Δ 定义为纯粹的方法差而非几何差)
特征 RDKit(Morgan 指纹用于相似度与骨架划分);能量学习特征用组成计数 + 键类型计数 + 简单几何描述符(如 Coulomb 矩本征值或 BoB 的轻量实现,须自行实现并用小算例验证
模型 scikit-learn(核岭回归,高斯/拉普拉斯核)、LightGBM(CPU)
对照文献 Ramakrishnan 等(JCTC 2015)的 Δ-ML 原始工作;Zhao 与 Savoie(Chem. Sci. 2023)的 Δ² 模型;QM9 上公开的学习曲线基线。仅用于校验与对比,不计入本项目的数据贡献
算力 纯 CPU。xtb 单点在 QM9 分子(≤ 9 重原子)上约 0.05–0.3 秒;20,000 个分子约 20 分钟–2 小时(可 multiprocessing 并行)。KRR 在 3,000×3,000 核矩阵上训练秒级,10 次重抽样 × 4 规模 × 2 模型 × 5 相似度分箱仍在小时级。这条路线的算力完全可控——真正的风险是科学结论而非算力超出范围的方案(明确列出):自算任何 DFT 参考值、训练规模 > 20,000、深度神经网络势的训练——一律不做

6 · 方法路径

  1. 下载 QM9,装 xtb + RDKit,在 QM9 提供的几何上批量跑 GFN2-xTB 单点,构建 Δ = E_DFT^atomization − E_xTB^atomization 的配对表(第 1–6 周)。
  2. 核实关键定义(第 8 周前必须查清,不要边做边发现):QM9 内能的单位与参考态、孤立原子的 xTB 参考能取法、是否有已知的 QM9 "不可靠条目"清单(QM9 有一批未通过几何一致性检查的分子,须剔除,剔除清单的来源须注明)。
  3. 通过方法学校验硬门槛:复现 QM9 直接学习的基线学习曲线。
  4. 实现特征与相似度度量,构建骨架划分 + 相似度分层的评估协议,协议一旦冻结不得事后调整。
  5. 跑学习曲线:4 个训练规模 × 2 个模型 × 10 次重抽样,同时记录 xTB 原始误差作为无校正基线。
  6. 按相似度分箱计算增益与置信区间,定位每个训练规模下的 T*;画二维热图;检验 H2 的对数标度关系。
  7. 独立交叉校验:换一种完全不同的特征(Morgan 指纹计数向量替代几何描述符)重算 T*,确认阈值的存在与量级不依赖特征选择。

7 · 新颖性边界

  • 本课题声称提出新的 Δ-学习架构或新特征,声称达到化学精度,自算 DFT 参考值,把 QM9 数据计入学生的数据贡献。
  • 已有工作具体完成了什么:Ramakrishnan 等(JCTC 2015)确立 Δ-ML 范式;Zhao 与 Savoie(Chem. Sci. 2023)以 GFN2-xTB 为基线、约 167,000 个反应为训练集构建 Δ² 模型,并在多个外部集上验证近化学精度的可迁移性;相关工作用 KRR 做 PBE→耦合簇的 Δ-XC 校正。这些工作的共同前提是大训练集,且报告的是聚合精度而非适用范围。
  • 本项目的贡献是换问题方向且为主结论:在 10²–10³ 的小数据体制下,把研究对象从"精度能到多少"换成"适用范围有多大",给出一条以化学相似度为坐标的增益消失阈值 T*,以及它随训练规模的标度关系。
  • 为什么有价值:任何一个资源受限的使用者在决定"要不要花时间做 Δ 校正"时,需要的正是"我的目标分子离我能拿到的参考数据有多远"这个判断,而现有文献只回答"数据足够多时它管用"。
  • "增益本来就很小"同样是有效结论,且必须诚实报告:若小数据下 Δ 模型在所有相似度区间上的增益置信区间都跨零,则本项目的结论是"小数据 Δ 学习在 QM9 化学空间上不具备实用价值"——这是一条明确的、可被后续工作引用的负结论,但必须用学习曲线与自助区间证明这不是因为模型没调好(这正是要求 2 种模型 + 10 次重抽样的原因)。

8 · 决策门槛(go / no-go)

  • 第 8 周末(关键门):原子化能定义必须自洽、方法学校验硬门槛必须通过。若 QM9 内能与 xTB 能量的参考基准无法对齐(残差有系统漂移),立即降级:其一,把学习目标从原子化能改为 HOMO-LUMO 能隙(QM9 提供,xTB 也直接输出,无参考态问题,Δ 定义干净得多);其二,改为学习"偶极矩"的 Δ(同样两端都有)。两条降级路径都完整保留"小数据增益 vs 相似度阈值"的主结论框架,只是物理量换了。
  • 第 14 周末:确认在最大训练规模下 Δ 模型相对原始 xTB 的分布内增益是否 ≥ 1.0 kcal/mol。若连分布内都没有可分辨的增益,说明特征或目标量选择有问题——降级为上述 HOMO-LUMO 能隙路径;若换目标量后仍无增益,则如实把"小数据 Δ 学习无增益"作为主结论交付,并把学习曲线、模型对照、特征对照作为"这不是调参失败"的证据链。此时研究问题改写为"小数据 Δ 学习的增益下限在哪",八块结构其余部分不变。
  • 第 20 周末:确认相似度分箱后每箱测试分子 ≥ 50。若不足,把分箱从 5 档减到 3 档,或把相似度处理为连续变量做回归而非分箱。
  • 已知困难即研究内容:Δ 学习在小数据下失效是一个很可能发生的结果。本课题从第一天起就把这种可能性写进设计(两个目标量、两个模型、完整学习曲线),因此"失效"是被度量的对象而非事故。
  • 预算裁剪顺序:先砍最大训练规模档(3,000 → 1,000),再砍第二个模型,再砍特征交叉校验,最后把重抽样次数从 10 降到 5。砍到只剩"3 个训练规模 × KRR × 3 个相似度分箱"时主结论仍成立。
  • 选择前提:仅在学生兼具 C05 级量子化学理解与 C01 级机器学习经验、且明确接受结论可能为负时启动;建议与 C01/C02 并行,不作为唯一课题。