Yau Awards Archive 2020 — 2025

E04

尾部风险模型回测:GARCH-EVT、GARCH-t 与历史模拟在 A 股与美股指数上的 VaR/ES 违约检验

优先级:高族:风险度量与极值理论数据:yfinance+akshare(免费)算力:低(CPU 小时级)技能:统计+极值理论

1 · 研究问题

McNeil–Frey (2000) 的 GARCH-EVT 两步法在沪深 300、创业板指与标普 500 的 2010–2026 滚动样本外回测中,其 99% VaR 与 97.5% ES(expected shortfall,预期损失)的违约表现是否仍系统优于 GARCH-t 与历史模拟?A 股涨跌停制度截断的收益分布是否改变 EVT 尾部拟合的相对优势?

2 · 研究背景与空白

VaR(value at risk)与 ES 是监管与风控的标准尾部风险度量;巴塞尔协议 IV 已把市场风险标准度量从 99% VaR 转向 97.5% ES。模型好坏由回测(backtesting)判定:VaR 看违约次数与独立性(Kupiec 1995 的 POF 检验、Christoffersen 1998 的独立性检验),ES 用 Acerbi–Szekely (2014) 类检验。

McNeil & Frey (2000, J. Empirical Finance) 提出两步法:先用 GARCH 过滤收益得到近似 i.i.d. 的标准化残差,再用广义帕累托分布(GPD)的超阈值方法(POT)拟合残差尾部;在 1990 年代美欧数据上显著优于正态与无条件方法。后续文献(如 Novales & Garcia-Jorcano 2019)在多市场确认条件 EVT 类模型的 ES 预测更准。中国市场亦有近作以 e-backtesting 框架在巴塞尔 IV 口径下评估 ES 方法(Risks, 2026),但其关注监管审慎性而非涨跌停制度对 EVT 拟合的影响。

空白在评价维度与样本:A 股 ±10%/±20% 涨跌停对收益分布形成硬截断,理论上压缩单日尾部并把极端风险转移为连续跌停——这对 GPD 尾部拟合是结构性挑战,未见以 2010–2026 样本、跨涨跌停宽度(主板 10% vs 创业板 2020 后 20%)系统检验。"EVT 在截断分布上无优势"同样是有效结论。

3 · 可检验假设

  • H1:在标普 500 上,GARCH-EVT 的 99% VaR 违约率落入 Kupiec 95% 接受域且 ES 检验不拒绝,而历史模拟至少在一个口径被拒绝——复现经典结论。
  • H2:在主板指数(沪深 300)上,GARCH-EVT 相对 GARCH-t 的优势小于其在标普 500 上的优势(用违约率偏离与 ES 检验统计量差值衡量);在涨跌停放宽后的创业板(2020-08 后)该优势部分恢复。方向相反则说明截断主要由过滤步骤吸收,同为有效结论。

4 · 量化验收标准

  1. 方法学校验(硬门槛):(a) 自写 GPD 极大似然拟合,在形状参数 ξ 已知的模拟数据(学生 t、Fréchet 域,n=250 超阈值样本,10^3 次重复)上偏差 ≤ 5%,自助法 CI 覆盖率 90–98%;(b) 用教科书公开算例复算 Kupiec 与 Christoffersen 检验统计量,逐位吻合;(c) 在标普 500 上定性复现 McNeil–Frey 的结论排序(条件 EVT ≥ 条件 t > 无条件)。此步不过关,后续全部结论无效。
  2. 统计口径:滚动窗口 1000 交易日,每 10 日重估,严格时间序;阈值选取写死为残差的 90% 分位并报 85%/95% 敏感性;每指数样本外 ≥ 2500 日、99% VaR 期望违约 ≥ 25 次。
  3. 多模型 × 多指数 × 多口径的检验族做 FDR(Benjamini–Hochberg,q=0.10)校正,并同时报未校正结果。
  4. 报效应量:违约率点估计 + Clopper–Pearson 95% CI,ES 检验统计量 + 模拟 p 值,不只报"拒绝/不拒绝"。
  5. 连续跌停的处理规则(视为单日观测还是合并事件)预先写死,作为稳健性的两套口径都报。
  6. 可复现性:脚本开源,全流程 CPU ≤ 3 小时(约 4 模型 × 4 指数 × 900 次滚动重估)。

5 · 数据与工具

用途 来源 / 工具
标普 500(1950 至今)、沪深 300(2005 至今)、中证 500、创业板指(2010 至今)日收盘 yfinance + akshare 交叉核对,免费;指数无个股幸存者偏差问题
涨跌停制度时间表(2020-08-24 创业板 10%→20% 等) 交易所公告(深交所官网),一级来源
分析环境 Python: arch(GARCH)、scipy(GPD MLE 自写为主、genpareto 对照)、statsmodels;纯 CPU
对照基准(仅校验对比,不计入贡献 McNeil–Frey (2000) 原文表;Novales & Garcia-Jorcano (2019) 结论

6 · 方法路径

  1. 搭环境,完成第 4.1 条三项硬门槛校验(模拟校验 → 检验统计量复算 → 经典结论复现)。
  2. 下载四指数收益,清洗并标注涨跌停制度区间与连续跌停事件。
  3. 实现四模型:历史模拟、GARCH-正态、GARCH-t、GARCH-EVT(POT)。
  4. 滚动样本外预测 99%/95% VaR 与 97.5% ES,记录违约序列。
  5. 做 Kupiec/Christoffersen/ES 检验与 FDR 校正,输出主结果矩阵。
  6. 分制度子样本(创业板 2020-08 前后)检验 H2,附残差尾部 QQ 图与 ξ 估计的时变图。
  7. 交叉校验:用 Hill 估计量独立估计尾指数,与 GPD 的 ξ 比对(预期同数量级),并做阈值敏感性图。

7 · 新颖性边界

  • 本课题提出新风险模型;两步法归 McNeil–Frey (2000),回测检验归 Kupiec/Christoffersen/Acerbi–Szekely。条件 EVT 更优的一般结论已被多市场文献确立。
  • 本项目贡献(主结论):涨跌停截断这一制度特征对 EVT 相对优势的影响估计——利用创业板 2020 年放宽这一制度变化做同一市场内的前后对照,这一评价维度未见系统处理;以及 2010–2026(含 2015 股灾、2024-02 微盘股流动性危机)的新样本回测记录。
  • 历届丘奖对照:该赛道历届无 VaR/ES 回测类获奖论文,风险度量方向整体空缺;与 2020 提名奖 G20 股市关联网络论文(相关结构)无方法重叠。

8 · 决策门槛(go / no-go)

  • 第 6 周末:硬门槛 (a)(b) 必须通过;(c) 若标普 500 上无法复现经典排序,先查过滤残差的自相关(Ljung–Box),第 8 周仍失败则降级:放弃"复现经典"表述,改为"在现代样本上的全新回测记录",方法学校验以 (a)(b) 模拟与算例校验为准,主结论框架(制度截断 × 模型比较)不变。
  • 第 12 周末:确认样本外违约次数达到第 4.2 条下限。若创业板 2020 后子样本违约数 < 15 次(功效不足),降级为 95% VaR 口径为主、99% 为辅,并报功效模拟。
  • 已知困难即研究内容:连续跌停使"单日损失"定义模糊——两套口径的差异本身就是涨跌停如何扭曲风险度量的证据,写入正文而非附录。
  • 适配前提:需要一定的概率论兴趣(GPD、尾指数);数学强、编程中等的学生最适配。