Yau Awards Archive 2020 — 2025

P02

二维稀释伊辛模型临界行为的 Wolff 集团蒙特卡洛检验:弱普适性与对数修正两种图像的定量区分

推荐优先级 ★★★★★统计物理 / 蒙特卡洛纯 CPU(需 numba 加速)有限尺寸标度分析无数据下载风险

1 · 研究问题

位稀释(site-diluted)二维伊辛模型的表观临界指数随稀释度漂移,应解读为"弱普适性"(ν 连续变化、γ/ν 不变)还是"纯伊辛指数 + 对数修正"?在笔记本可达的系统尺寸 L ≤ 256 上,有限尺寸标度(finite-size scaling)能否定量区分这两种图像,若不能,区分所需的最小 L 是多少?

2 · 研究背景与空白

二维伊辛模型有 Onsager 精确解(Tc = 2/ln(1+√2),ν = 1,γ/ν = 7/4),是检验一切自旋模拟管线的黄金标尺。加入无序(随机置空格点)后,Harris 判据在 α = 0 处处于边界情形,理论预言临界行为极其微妙:比热从 ln L 变为 ln ln L 发散。

已有工作分成两派:Ballesteros et al.(cond-mat/9707179)的大规模蒙特卡洛支持"纯伊辛指数 + 对数修正";而基于 Wang–Landau 算法的研究(arXiv:0807.0075, Physica A 2008)报告 ν > 1、γ/ν 保持 7/4,支持"弱普适性"解读。两派使用的系统尺寸多在 L ≤ 128 量级,无序样本数 10²–10³。

空白在问题方向:争论的焦点其实是"同一批数据用两种模型都能拟合"——很少有工作在同一套现代统计口径(bootstrap 置信区间、预注册拟合区间、无序涨落显式报告)下对两种图像做正面模型比较。这正适合学生:物理答案已知候选、模拟代码百行量级、算力标尺文献明确、"区分不了"本身也是定量结论。

3 · 可检验假设

  • H1:对稀释度 p ∈ {1.0, 0.9, 0.8, 0.7}(p 为格点保留率),磁化率比值 γ/ν 与纯伊辛值 7/4 在 95% 置信区间内一致(弱普适性与对数修正两派在此点预测相同,作为管线一致性检验)。
  • H2:若把关联长度数据强行按纯幂律拟合,得到的有效 ν(p) 随稀释单调上漂;该漂移的幅度与形状可被"ν = 1 + 对数修正"模型在等自由度下拟合得不差于"ν 连续变化"模型(用 AIC/交叉验证判定)。

4 · 量化验收标准

  1. 方法学校验(硬门槛):纯二维伊辛(p = 1)、L = 32–256:Binder 累积量交叉定出的 Tc 与精确值偏差 ≤ 0.1%,ν、γ、β 与精确值偏差 ≤ 2%。此步不过关,后续全部结论无效。
  2. 每个 (p, L) 点无序平均 ≥ 500 个独立样本,显式报告样本间涨落与热化判据(热化步数 ≥ 20 倍积分自相关时间)。
  3. 拟合口径预先写死:双对数最小二乘之外,加非线性最小二乘与含修正标度项拟合交叉验证;全部指数误差用自助抽样给置信区间。
  4. Wolff 集团算法与 Metropolis 在 L = 16 小系统上互检:能量、磁化统计量一致性 ≤ 0.5 个合并标准差。
  5. 模型比较用双成本口径:等自由度与等参数个数下的 AIC/BIC 都报告。
  6. 全部代码与原始测量数据开源,第三方可一键重跑。

5 · 数据与工具

用途 来源 / 工具
模拟引擎 自写 Python + numba(Wolff 集团翻转与 Metropolis 均需自行实现,约 200 行;无现成框架依赖是本题优点)
精确解对照 Onsager 解析结果(教科书级)——仅作校验,不计入贡献
文献基准 cond-mat/9707179 与 arXiv:0807.0075 的表列指数——仅作对照,不计入贡献
分析 numpy/scipy/matplotlib;bootstrap 自写(约 30 行)

算力(基于文献标尺):1997 年 Ballesteros 等在当年硬件上完成 L ≤ 128、10³ 无序样本的研究;现代单核 Wolff 实现典型速度 ~10⁷ 自旋更新/秒(numba 实测速度需第 5 周核实)。估算:L = 128、每样本 10⁴ 测量扫略、500 样本 ≈ 8×10¹³ 自旋更新 ≈ 单核 2–3 天后台;4 个 p 值 × 5 个 L 值总计约 3–4 周后台运行,可行。降规模版本:L ≤ 96、样本 300 → H1(γ/ν 检验)完整保留;损失的是对数修正与弱普适性的区分能力,此时主结论转为"给出区分两图像所需最小 L 的定量判据"。

6 · 方法路径

  1. 实现 Metropolis 单自旋翻转,在 L = 16 纯伊辛上跑通并对照精确内能曲线。
  2. 实现 Wolff 集团算法,完成两算法互检与第 4 块硬门槛校验。
  3. 核实 numba 加速后的更新速度(阈值见第 8 块),据此冻结 (p, L) 网格。
  4. 对每个 (p, L) 采集能量、磁化、磁化率、Binder 累积量,无序平均并记录涨落。
  5. 做有限尺寸标度:Binder 交叉定 Tc(p),数据塌缩(data collapse)与幂律拟合并行。
  6. 对"ν 漂移"与"对数修正"两模型做预注册的正面比较(AIC/BIC + 交叉验证)。
  7. 独立交叉校验:用比热的 ln L vs ln ln L 发散形状做与指数拟合无关的第二判据。

7 · 新颖性边界

  • 本课题声称发现新普适类,也不声称解决弱普适性争论——该争论已有 25 年文献史(点名上述两派)。
  • 已有工作:两派各自给出了指数数值与解读,但采用的误差口径、拟合区间选择互不相同,直接比较困难。
  • 本项目贡献(主结论):同一管线、同一套预注册统计口径下对两种图像的正面定量比较与独立复现,并给出笔记本尺度下"可区分/不可区分"的明确边界。这属于方法层面的可复现性贡献 + 独立检验,在计算物理中是被承认的贡献类型,但定位必须在论文中讲清楚,否则会被误读为重复工作。
  • "在 L ≤ 256 内两模型不可区分"同样是有效结论,但必须给出误差棒证明有能力分辨设定的差异幅度。
  • 历届获奖图谱中无自旋模型蒙特卡洛先例,题材上避开了实验流体类的拥挤赛道。

8 · 决策门槛(go / no-go)

  • 第 4 周末:硬门槛校验(纯伊辛指数 ≤ 2%)通过;不过关 → 排查实现而非继续加规模。
  • 第 5 周末:核实 numba 实现速度。若 < 5×10⁶ 自旋更新/秒 → 具名降级:其一,改用 C 扩展重写核心循环(一周预算);其二,直接采用降规模版本(L ≤ 96),主结论框架(两模型比较)不变。
  • 第 20 周末:若在已达尺寸内两模型 AIC 差 < 2(不可区分)→ 把主结论正式切换为"最小可区分 L 的外推判据",补充一组 L = 320 的单点长跑(后台 1–2 周)作为外推锚点。
  • 预算裁剪顺序:p 值个数(4→3)→ 交叉校验判据数 → L 网格密度;硬门槛与无序样本下限不可裁。
  • 适合学生:对编程与统计有耐心、能接受"负结果也要写清楚"的队伍;无任何外部数据依赖,是十题中不可抗力风险最低的一条。