T672–90中
物理约束神经网络在轨道预测中的等算力对照:把物理放进模型真的划算吗?
推荐优先级:中(押注一个 8 月底必须闭合的未知项) · 族 A(公开档案数据) · 参赛子类:Physics — Astronomy / Computational · 资源需求:纯 CPU 笔记本,零器材成本 · 技能取向:机器学习 / 数值方法 / 实验设计
本条有一个获奖同题前作:ISEF 2025 的 PHYS069T(Grand Award, "An ML Framework for Space Debris Surveillance")已经用了 PINN。 学生必须主动区分——本课题的对照轴是算力,不是精度。
1 · 研究问题
在严格控制计算成本(等 FLOPs 或等墙钟时间)的前提下,把物理约束加入神经网络对轨道预测精度的增益还剩多少?这个增益随算力预算如何变化?
2 · 研究背景与空白
背景。 物理约束神经网络(PINN, Raissi et al. 2019, J. Comput. Phys. 378:686–707)把控制方程的残差作为损失项加入训练,宣称能在小样本下取得更好的泛化。这个思路已被大量应用到轨道预测上。
已有工作到哪一步。
| 命题 | 状态 |
|---|---|
| PINN 用于轨道预测 | ✅ 已做(2023–2026 多篇) |
| PINN vs LSTM 在 TLE 数据上比较 | ✅ 已做(Mahmud et al. 2026) |
| PINN vs 经典求解器的算力—精度双轴比较 | ✅ 已做(Grossmann et al. 2023,PDE 领域,结论对 PINN 不利) |
| PINN vs 多个数据驱动基线(GRU/Transformer/GP) | ❓ 未找到 |
| 天体动力学中严格的等 FLOPs / 等墙钟协议 | ❌ 未找到——这是唯一空隙 |
Mahmud et al. 2026(Advances in Space Research, DOI 10.1016/j.asr.2026.01.017)用 PINN-LSTM 对比纯 LSTM,报告 IRIDIUM 7 位置改善 87%、速度 70%,ORBCOMM FM26 位置 50%、速度 72%。但它只对 1 个基线、只测 2 颗卫星,且记录页未见任何算力控制。
Grossmann et al. 2023(arXiv:2302.04107 / IMA J. Appl. Math. 89(1):143–174)在偏微分方程领域做完了算力受控比较,结论很不客气:有限元法在多数问题上比 PINN 快 1–6 个数量级,原文结论是 PINN "have not been able to outperform the finite element method"。PINN 唯一占优的是训练完成后的求值速度(快 2–3 个数量级)。
空白在于:没有人在天体动力学里做过严格的等算力对照。 现有工作报告"加了物理更准",但没有回答"如果把省下来的物理建模时间用于把基线模型训得更久,还准不准"。
这个空白适合一年期学生课题:轨道 PINN 是低维 ODE 问题而非高维 PDE 场问题,网络极小——Harsha et al. 2024 的实测配置是 8 核 CPU 无 GPU、隐藏层 2–8 层每层仅 5 节点、5 折交叉验证每折约 25 秒。纯 CPU 笔记本绰绰有余。
3 · 可检验假设
H1 在等墙钟时间口径下,PINN 相对纯数据驱动基线的精度增益比不控制算力时报告的增益缩小至少一半。即:若不控算力时增益为 X%,等算力下增益 ≤ X/2。
H2(机制假设)该增益随算力预算单调衰减——预算越大,物理约束的相对价值越小,因为数据驱动模型有足够算力自己学到近似的物理。存在一个交叉点,超过该预算后 PINN 不再占优。
4 · 量化验收标准
- 方法学校验(硬门槛)。 用自建管线复现 Harsha et al. 2024 的 CPU 训练配置(2 隐藏层、5 节点/层、50 epochs、batch 32、Adam lr=1e-3),单折训练时间应在数十秒量级。若显著偏离,说明实现有问题。
- 等算力协议必须预先定义并写死。 明确采用等墙钟时间还是等 FLOPs(建议两种都报),并说明如何计量。这是本课题的核心方法学,不能边做边定。
- 多种子重复。 每个(模型 × 预算点)组合至少 5 个随机种子,报告中位数与四分位距,不报单次运行结果。
- 基线不止一个。 至少 3 个数据驱动基线(如 LSTM、GRU、Gaussian Process),避免重复 Mahmud et al. 只对 1 个基线的局限。
- 真值来源必须有精密轨道。 不得用 TLE 自身作为真值(见 §5 的效度威胁)。使用 ILRS/SLR 精密星历(LAGEOS、LAGEOS-2、LARES-2)或 Starlink 运营商公开星历。
- 统计口径预先写死。 主结果是「精度 vs 算力预算」的曲线族(每个模型一条),而非单点比较。报告交叉点位置及其置信区间。
- 可复现性。 全部脚本开源,含算力计量代码与随机种子。训练脚本中不得有任何网络请求(见 §5 的 CelesTrak 封禁风险)。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 精密轨道真值(首选) | ILRS/SLR 精密星历,CDDIS 周解(延迟约 3 天),覆盖 LAGEOS、LAGEOS-2、LARES-2 等激光合作目标。ilrs.gsfc.nasa.gov/data_and_products/ |
| 精密轨道真值(备选) | Starlink 运营商公开星历 |
| TLE(仅作输入或对照,不作真值) | Space-Track 或 CelesTrak |
| 传播器基线 | python-sgp4、Skyfield、hapsira(poliastro 2023-10 归档后的 MIT 分支)、Orekit |
| PINN 实现 | DeepXDE 或自写。低维 ODE,不需要 NVIDIA PhysicsNeMo 这类重型框架 |
| 算力 | 纯 CPU 笔记本。参照 Harsha et al. 2024:8 核无 GPU、25 秒/折。⚠️ 真正的瓶颈不是单次训练,而是「总实验次数 × 单次时间」——等算力协议要求多种子 × 多预算点 × 多模型的大量重复 |
🔴 致命方法学陷阱:TLE 是 Brouwer 平均根数,不是密切根数。 Vallado & Crawford, "Revisiting Spacetrack Report #3", AIAA 2006-6753 原文:"Using TLE data in another general perturbations propagator will result in completely erroneous results. Simply converting the orbital elements to an osculating state vector and propagating with other methods is not appropriate." → 若学生把 TLE 转成 (r, v) 再用真实的二体+J2 微分方程做物理残差约束,物理残差项与数据项在数学上不自洽,整个 PINN 的物理项是错的。 这个陷阱不会报错,只会给出看似合理的结果。必须在方法学中显式处理:要么用 SGP4 自身的动力学作残差,要么改用有密切根数真值的 SLR 数据。
🔴 反直觉的强警示:在 TLE 数据体系内,"更多物理"不等于"更准"。 Jankovic 2026(arXiv:2605.19850)用 Starlink 运营商更新的 TLE 作真值,24,641 个 TLE 对、501 颗卫星:SGP4 在约 65–75% 的卫星对上打赢了高保真传播(GMAT + EGM2008 + 大气阻力 + 太阳辐射压)。7 天中位误差 SGP4 约 38 km、高保真约 76 km。这个事实必须写进讨论——它正是本课题问题的现实版本。
🔴 数据获取的封禁风险(会静默毁掉整个赛季): - CelesTrak 自 2026 年 3 月 26 日起强制执行"每次更新只许下载一次"策略:第一次请求正常,第二次返回 HTTP 403;反复违反会把 IP 送进防火墙(最长 24 小时)。 - Space-Track:限 30 请求/分钟、300 请求/小时;GP(TLE)限 1 次/小时;账号可能被停用,且不得共享。 → 必须实现本地缓存加 mtime 检查,训练脚本中绝不能有网络请求。 在一个 3–4 个月的窗口里被封 IP 或停号,代价是无法承受的。
数据再分发的合规张力: Space-Track 的条款一处写 USSPACECOM 已给出 "express blanket approval" 允许转发基本 SSA 数据(须适当引用),另一处又写用户同意"未经事先明确批准不得转让任何数据"。实操建议:只公开派生指标与复现脚本,不公开原始 elsets 全量副本。
6 · 方法路径
- 装环境 + 跑通校验。 复现 Harsha et al. 2024 的 CPU 配置,确认单折训练在数十秒量级(§4 第 1 条硬门槛)。
- 建立本地数据缓存层,含 mtime 检查与"绝不重复下载"断言。这一步必须在任何批量实验之前完成——否则可能在实验中途被封。
- 定死等算力协议并实现算力计量(墙钟与 FLOPs 两种)。
- 处理 TLE 平均根数陷阱:明确选择残差形式(SGP4 动力学 vs 真实 ODE + SLR 密切根数真值),并在方法学中论证自洽性。
- 跑满(4 模型 × 多预算点 × ≥5 种子)的实验矩阵,记录每次运行的算力与精度。
- 绘制精度—算力曲线族,定位交叉点。
- 独立交叉校验。 用另一种算力口径(若主口径是墙钟则用 FLOPs)重跑关键点,验证结论不依赖口径选择。
7 · 新颖性边界
本课题不声称: - 不声称首次把 PINN 用于轨道预测。2023–2026 已有多篇,且 ISEF 2025 的 PHYS069T(Grand Award)已经做过。 - 不声称首次比较 PINN 与 LSTM。Mahmud et al. 2026 已做。 - 不声称首次做 PINN 的算力受控比较。Grossmann et al. 2023 已在 PDE 领域做完,且结论对 PINN 不利。 - 不声称对 PINN 方法本身提出改进。 - 不引用 PINN-GM(Martin & Schaub 2022)作为"PINN 已用于轨道预测"的证据——那做的是引力场表示 U(r)/a(r),不是轨道传播。这是一个容易误引的陷阱。
与 PHYS069T(Grand Award)的区分——必须主动说明: PHYS069T 用 PINN 做碎片轨迹预测并报告 97% 精度,对照轴是精度;本课题的对照轴是算力,问的是"这个精度增益在等算力下还剩多少"。这是评价维度的转换,不是精度的竞赛。
本项目的贡献(属「评价维度转换」型): 已有工作评估的是"加了物理准不准";本项目评估的是"在同样的计算预算下,把预算花在物理约束上还是花在多训练数据驱动模型上更划算"。这是主结论,不是附加内容。
为什么有价值: 等算力口径是通用机器学习的成熟范式(iso-FLOP / compute-matched),但天体动力学领域尚未采用。而 Jankovic 2026 的结果(SGP4 在 65–75% 情况下打赢高保真传播)说明"更多物理更好"这个直觉在这个领域确实会失效——本课题正是这个直觉的受控检验。
若结论不显著: 若等算力下增益未缩小,H1 被否证——这同样是有效结论(说明物理约束的价值是真实的而非算力假象),但必须给出多种子的误差棒证明有能力分辨这个差异。
8 · 决策门槛(go / no-go)
🔴 条件 1(2026 年 8 月底,不可推迟):必须拿到 Mahmud et al. 2026 全文,确认它是否报告了算力控制。 ScienceDirect 原文在核查时返回 403,只能看到记录页。若全文其实做了等算力对照,本课题的核心空隙消失,必须放弃或重新定位。 获取途径:机构订阅、作者主页、通过 research.polyu.edu.hk 的机构库、或直接向作者索取。
若 8 月底仍拿不到全文: 不要押注。降级路径:把课题重新定位为"PINN vs 多个数据驱动基线(GRU / Transformer / GP)的等算力对照"——即使 Mahmud 做了等算力,它也只对了 1 个基线、2 颗卫星,多基线对照仍然是新的。主结论框架(等算力下增益还剩多少)完全保留。
🟡 条件 2(第 4 周末):本地缓存层完成并通过"零网络请求"断言。 在训练脚本中加断言,确保运行期间不发起任何 HTTP 请求。被 CelesTrak 封 IP 或被 Space-Track 停号,在 3–4 个月窗口里是不可恢复的损失。
🟡 条件 3(第 6 周末):确定真值来源并验证可得。 若 ILRS 精密星历的覆盖对象或时间范围不足,降级路径:改用 Starlink 运营商公开星历(Jankovic 2026 已验证该路径可行)。
⚠️ 与「附属赛后不得修改」的冲突点: 等算力协议的定义(墙钟还是 FLOPs、如何计量)一旦在附属赛后想改就不被允许。必须在 11 月底前定死,并报告两种口径下结论是否一致。
须提前核实而非边做边发现的事项: - TLE 平均根数陷阱。这个错误不会报错,只会给出看似合理的结果。必须在写第一行残差代码之前想清楚。 - CelesTrak 的一次性下载策略(2026-03-26 起)。第二次请求就是 403。 - Peng & Bai 2018 的卷期号存在冲突(arXiv 页写 Issue 9,检索结果写 Issue 10),引用时以出版商页面为准。
已知困难及其定位: 等算力协议要求"总实验次数 × 单次时间"的大量重复,这是真正的瓶颈——单次训练只要几十秒,但矩阵可能有数百次运行。这个困难本身就是研究内容——严格的算力控制正是这个课题的方法学贡献所在。
选择前提: 适合有 Python 与机器学习基础、且能接受主结论可能是"物理约束没那么值钱"这种反直觉结果的学生。不适合把 PINN 当作先进技术展示的学生。
预算裁剪顺序: 无预算可裁(零成本)。时间不足时:先砍第二种算力口径(步骤 7),再把基线从 3 个减到 2 个,最后减少预算点数量。保留多种子重复——那是结论可信度的来源,不可砍。
已淘汰方向(记录在此,避免重复调研)
深调研中被否决的方向及其否决依据。列出它们比隐藏它们有价值——学生若自行想到同样的点子,可以直接看到为什么不行。
| 方向 | 否决依据 |
|---|---|
| 系外行星凌星深度的 TESS/Kepler 绝对仪器偏差 | Han et al. 2025 (ApJL 988, L4) 已测得 f_p,Kepler = 1.47% ± 1.43%,1σ 内与零一致——不存在显著的跨仪器偏差;且满足筛选条件的 Kepler 行星总共只有 53 颗,样本量天花板锁死,学生无法把误差棒压得更小。「用更好的恒星半径重算行星半径」路径亦已被 Berger 2018/2020、Fulton & Petigura 2018 饱和。注意:被否决的是"绝对偏差"这个命题,不是整个方向——重定向后的「流水线差分」版本见 T2 |
| 仿生涡流发生器的雷诺数依赖 | von Deyn et al. 2022 (JFM, doi:10.1017/jfm.2022.796) 已用 8 种沟槽扫过整个 Re 区间;Gatti & Quadrio 2016 已给出衰减律;Domel et al. 2018 已做盾鳞"尺寸×速度"交互。改造为"制造保真度→性能退化"尚可防守 |
| 自扶正三阶段机制的摩擦相图 | 双重否决:Bien et al. 2024 (ICB 64(3):776) 已用三档实测摩擦系数(0.36 / 0.55 / ≥1.2)做过,结论是摩擦无显著影响;且 ISEF 2025 的 PHYS065T 本身已做过 3D 打印刚体替代模型,"重构为刚体版"这条退路也被占 |
| Type-1 SPDC 保真度与泵浦功率的非单调关系 | 物理上不成立:该关系有闭式解且单调递减。另加成本否决:自建极限约 ¥85,000,超预算 17–42 倍 |
| 颗粒流 Beverloo 标度在 3D 打印孔口的失效 | Janda et al. PRL 108:248001 (2012) 表明 (D−kd) 可由自相似剖面导出,k 可能不是真实物理量,则"检验 k 随粗糙度漂移"命题本身不成立;且 3D 打印孔口板做颗粒流 2018 年已有人发表(Powder Technol) |
| 环境本底辐射与气象变量的相关性符号翻转 | 气压泵吸有完整传递函数(Perrier & Girault 2013, GJI);土壤湿度封闭效应有定量阈值;LightGBM/LSTM 对比已完成;arXiv:2511.17542 已用 NMF 做过降水—氡子体分离。且 3 个月窗口仅覆盖 3 个单向月度周期,原命题在统计上不可回答 |
附:本方案的数据基础与其局限
| 项 | 内容 |
|---|---|
| 获奖模式分析语料 | ISEF 2025 全类目 1294 项(427 获奖)+ ISEF 2026 全类目 1261 项(465 获奖);PHYS 两届合计 143 项(43 获奖) |
| 类别覆盖 | 2025 为 22 个类目;2026 只有 21 个——软件类目在 isef.net 的 2026 board 上完全没有发布(SOFT 与 SFTD 两个代码均返回 0,且 1286 个项目中无 soft*/sftd* 前缀 slug)。该类目因此无法做跨年复现检验 |
| 剔除记录 | 页面未渲染完成的记录(2025 有 25 条,2026 有约 19 条)奖项字段一律为空,其真实奖项状态未知。两个语料独立测得这类记录获奖率均为 0%(对照正常记录 33%–38%,z≈+3.5),确认为漏抓假阴性,已整体剔除而非计入未获奖组。依据见 ../analysis/corpus-provenance.md |
| 判定规则 | 任何效应必须在 2025 与 2026 两届独立数据中同号才予采信。单届显著但另一届反号的一律视为噪声——本方案已因此撤回一条初稿结论(详见「先说实话」第一节的方法学说明) |
| 做不到的事 | 多年趋势分析。isef.net 已下线 2022–2024 历史 board,本地语料只有 2025、2026 两届真数据,谈不了"近五年热点迁移" |
| 复现方式 | python3 analysis/award_patterns.py <2025语料目录> <2026语料目录>(传入两个目录即自动输出复现检验表) |
评分: O=8, W=8, F=9, S=7, Fit=9 → base=81.4,h=9 → [72, 90],置信度:中