Yau Awards Archive 2020 — 2025

E03

波动率预测模型赛马:GARCH(1,1) 对 HAR 与极差估计量在中美指数 2005–2026 上的 QLIKE/DM 检验

优先级:高族:波动率建模数据:yfinance+akshare(免费)算力:低(CPU 小时级)技能:时间序列计量

1 · 研究问题

在只用免费日频 OHLC 数据的约束下,HAR 类模型对 GARCH(1,1) 的样本外波动率预测优势(以 QLIKE 损失与 Diebold–Mariano 检验衡量)在沪深 300、标普 500、恒生指数三个市场、1/5/22 日三个预测期上是否稳健存在?该优势在 2015 股灾、2020 疫情、2024-09 政策行情等高波动区间是否放大?

2 · 研究背景与空白

波动率不可直接观测,评估预测模型需要代理:学术标准是 5 分钟已实现波动率(realized volatility),但免费渠道拿不到长历史高频数据;基于日内最高/最低价的极差估计量(Parkinson 1980、Garman–Klass 1980)效率约为日收益平方的 5–7 倍,且只需 OHLC——这是本课题绕开数据墙的关键。

Hansen & Lunde (2005) 比较 330 个模型后发现汇率上没有模型显著击败 GARCH(1,1),个股上含杠杆效应的模型更优。Corsi (2009) 的 HAR 模型以日/周/月三尺度已实现量做线性回归,成为 RV 预测基准。中国市场已有大量用 5 分钟 RV 的比较研究(如 Realized GARCH 类,样本多止于 2020 年前后),结论普遍是含已实现量的模型更优。

空白在评价维度与时间覆盖:已有中国研究几乎全部以高频 RV 为信息集与代理;"仅用免费 OHLC 极差信息还能保留多少 HAR 优势"这一对学生和散户真实可得的信息集问题未见系统回答,且 2021–2026(含 2024 年极端行情)样本未被覆盖。预测优势不显著同样是有效结论。

3 · 可检验假设

  • H1:以 Garman–Klass 极差方差为目标与回归元的 HAR-RG 模型,在 1 日预测期上对 GARCH(1,1) 的 QLIKE 损失改进 ≥ 10%,DM 检验 p < 0.05(三个市场中至少两个成立)。
  • H2:预测期拉长到 22 日后,HAR-RG 对 GARCH(1,1) 的优势缩小到 QLIKE 改进 < 5% 或不显著——即极差信息的优势主要在短期。若 H1 本身不成立(GARCH(1,1) 未被击败),呼应 Hansen–Lunde 的"难以击败"结论,同为有效结果。

4 · 量化验收标准

  1. 方法学校验(硬门槛):(a) 自写 GARCH(1,1) 极大似然估计,在同一数据上与成熟库 arch 的参数估计偏差 ≤ 1%、对数似然偏差 ≤ 0.1%;(b) 在模拟 GBM 路径上验证 Parkinson/Garman–Klass 估计量的无偏性(10^4 条路径,偏差 ≤ 2%,自助法 CI 覆盖)。此步不过关,后续全部结论无效。
  2. 统计口径:训练/测试严格按时间划分(滚动 1000 交易日窗口,逐日或每 5 日重估);绝不随机划分,并附一次"随机划分对照"量化高估幅度。损失函数只用 QLIKE 与 MSE(Patton 2011 证明对噪声代理稳健的两类),不用 MAE/MAPE 并说明原因
  3. 模型比较:两两用 Diebold–Mariano(HAC 方差,滞后阶 = 预测期-1 起报并做敏感性);全体模型用 Model Confidence Set (Hansen–Lunde–Nason 2011) 控制多重比较,α = 0.10。
  4. 报告效应量:QLIKE 改进百分比 + 自助法 95% CI;分高/低波动子样本(以 VIX/中国波指或滚动波动率中位数划分)报告。
  5. 每市场样本外预测点 ≥ 2500 个交易日。
  6. 可复现性:脚本开源,全流程 CPU 重跑 ≤ 2 小时(约 6 模型 × 3 市场 × 5000 次滚动重估,GARCH 单次拟合亚秒级)。

5 · 数据与工具

用途 来源 / 工具
标普 500(^GSPC,1950 至今)、恒生(^HSI,1987 至今)日频 OHLC yfinance,免费;缺失率与拆分调整须自检
沪深 300 日频 OHLC(2005-04 指数发布至今) akshare 指数接口(免费);与 yfinance 000300.SS 交叉核对,二者不一致处以交易所公开数据为准
高波动区间划分参考 CBOE VIX(FRED 免费);中国波指已停发,用滚动实现波动率替代并注明
5 分钟 RV 小样本旁证(可选,近 1–2 年) akshare 分钟数据(历史深度有限,需核实;仅作附录旁证,不进主结论)
分析环境 Python: arch、statsmodels、numpy;MCS 自写或用现成实现(需核实维护状态);纯 CPU
对照基准(仅校验对比,不计入贡献 Hansen–Lunde (2005)、Corsi (2009) 原文结果;中国市场 Realized GARCH 文献结论

6 · 方法路径

  1. 搭环境,完成第 4.1 条两项硬门槛校验。
  2. 下载三市场 OHLC,清洗(停牌、涨跌停日的极差退化处理规则须预先写死并可复现)。
  3. 实现模型族:GARCH(1,1)、GJR-GARCH、EWMA(RiskMetrics)、HAR-RG(极差版 HAR)、AR(1)-RG、混合 GARCH-X(极差作外生量)。
  4. 滚动样本外预测 1/5/22 日波动率,计算 QLIKE/MSE。
  5. 做 DM 两两检验与 MCS,输出主结果表。
  6. 分高/低波动子样本与三大危机窗口做异质性分析,检验 H2。
  7. 交叉校验:用近 1–2 年分钟数据算 5 分钟 RV,检验极差代理与 RV 的相关性(预期 ≥ 0.9),为主结论的代理有效性提供旁证。

7 · 新颖性边界

  • 本课题提出新模型;GARCH/HAR/极差估计量与 QLIKE/DM/MCS 全部方法归原作者。中国市场"含已实现量模型更优"的结论已被高频 RV 文献反复得到,不得声称为本项目发现。
  • 本项目贡献(主结论):在"免费 OHLC 信息集"这一明确约束下的跨市场、跨预测期系统赛马,与 2021–2026 新样本(含 2024 极端行情)的覆盖。若 HAR 优势在此信息集下消失,是对高频文献结论适用边界的有效刻画。
  • 历届丘奖对照:2022 铜奖 "LASSO-BiLSTM ensemble for exchange rate forecasting" 属预测建模但无严格损失函数比较与 DM/MCS 推断;本课题反其道而行——模型简单、推断从严,差异化清晰。

8 · 决策门槛(go / no-go)

  • 第 4 周末:三市场 OHLC 数据质量核查完成(缺失率 < 1%、极差为零的涨跌停日占比统计)。若沪深 300 的 OHLC 在早期年份质量不达标,降级:样本起点后移至 2010,或以上证综指(1990 至今)替换,主结论框架不变。
  • 第 8 周末:硬门槛与基线两模型(GARCH(1,1)、HAR-RG)滚动预测跑通。若滚动重估耗时超预算 10 倍,降级为每 20 日重估一次(文献常规做法之一),并报告重估频率敏感性。
  • 第 16 周末:主结果表若显示所有差异均不显著且 CI 极宽(无法分辨 10% 的 QLIKE 改进),把功效分析写成研究内容:用模拟标定"该样本量下可分辨的最小改进",结论改述为适用边界刻画。
  • 适配前提:适合喜欢时间序列与编程、能接受"没有交易策略、只有预测精度"叙事的学生;全程无须任何付费数据。