M38
羽毛球每球得分制下冒险程度的 Markov 决策过程:最优策略的阈值结构定理
来源说明:本则出自独立撰写的第二批方案。它与前 20 则同样遵循八块结构与硬门槛要求,但撰写时未做英文文献检索,新颖性边界依据的是历届获奖图谱与既有知识,而非当轮查新。因此其「需核实」条目更多,启动前须自行补一轮英文检索。
1 · 研究问题
把羽毛球 21 分每球得分制(含 20 平后净胜 2 分、30 分封顶规则)建为 Markov 决策过程——每球运动员在"激进/保守"打法间选择(激进:得分概率高但失误概率也高)——最优策略是否关于比分差呈阈值(threshold)结构,即存在单调切换边界?该结构能否在明确的参数假设下严格证明,而非仅由数值表观察?
2 · 研究背景与空白
比分制运动的 Markov 分析是经典题材:i.i.d. 每球胜率 p 下整局获胜概率有封闭公式(网球/排球/羽毛球情形均为标准练习)。引入决策后问题升级为有限状态 MDP:状态 = (我方分, 对方分, 发球权),动作 = 打法风格,价值函数由逆向归纳精确解出(状态数 < 10³,笔记本毫秒级)。数学内核在结构定理:MDP 理论中"最优策略单调性"有成熟的充分条件框架(superadditivity / 单调价值差分论证,Puterman 教材第 4/6 章型技术),把它落到具体计分规则上需要真正的证明工作(deuce 规则破坏简单单调性,是本题的实质难点与亮点)。
已有工作:固定策略下的胜率公式(教材级);网球发球策略博弈、排球轮转等运筹文献存在(第 3 周核实清单:搜索关键词 badminton scoring Markov decision risk strategy;关键词 monotone optimal policy sports MDP)。丘奖相邻获奖论文:2024 金奖《Optimizing Dart Throwing Strategies for the Elderly Based on Markov Decision Process》(MDP + 运动策略,数值最优化为主)、2025 入围《A Mathematical Model for Measuring Sprinting Styles of 100-Meter Sprinters and Its Application》(运动风格量化)。
空白在:羽毛球现行计分制下"冒险度选择"的 MDP 建模 + 最优策略阈值结构的严格证明未见发表;相对 2024 金奖,本题把交付重心从数值最优解转移到结构定理(评价维度转换),这既是差异化也是数学含量的保证。
3 · 可检验假设
- H1:参数满足"激进打法的得分概率增益与失误概率代价可交换排序"(论文中精确形式化)时,最优策略关于分差单调:落后越多越应激进,且切换边界是分差的阶梯函数(对全部发球权状态成立)。
- H2:deuce 段(20 平后)的最优策略与常规段在同一参数下可以不同(存在参数区域使切换边界在 deuce 处跳变)——该现象可构造性证明(给出显式参数点)并刻画其参数区域。
4 · 量化验收标准
- 方法学校验(硬门槛):动态规划求解器先复现无决策退化情形——固定 p 下的整局胜率与封闭公式(含 deuce 几何级数项)在 p ∈ {0.4, 0.45, …, 0.6} 上零偏差(≤ 10⁻¹²,精确有理算术可做到严格相等);并复现 10⁶ 局 Monte Carlo 模拟与理论值的一致性(偏差在 3σ 内)。不过关则全线无效。
- 定理交付:H1 阈值定理的完整证明(明确假设、单调性引理链);H2 的构造性证明 + 参数区域数值刻画。
- 数值交付:参数网格(≥ 10⁴ 组)上最优策略全解,机器验证阈值结构在定理假设域内零反例、假设域外给出反例清单(反例本身是定理假设必要性的证据)。
- 稳健性:参数来自公开文献的羽毛球技术统计(多拍回合得失分率区间;第 4 周核实可得性,不可得则参数区间由敏感性分析覆盖并如实声明),主结论(结构定理)不依赖任何单一参数点。
- 统计口径:模拟对照报 95% 置信区间;不用任何拟合优度伪指标粉饰。
- 代码开源,一键复跑(全套 < 1 小时)。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| MDP 求解 | 自写逆向归纳(Python Fraction 精确算术版 + NumPy 浮点版互证) |
| 模拟对照 | 自写 Monte Carlo(仅校验,不计入贡献) |
| 参数区间 | 公开体育科学文献中的羽毛球回合统计(第 4 周核实:搜索关键词 badminton rally outcome statistics error rate;不可得则用敏感性区间) |
| 结构定理技术 | Puterman《Markov Decision Processes》单调策略章节(图书馆/公开讲义) |
| 算力量级 | 状态数约 24×24×2,逆向归纳毫秒级;参数网格全解笔记本分钟级,纯 CPU |
6 · 方法路径
- 写精确算术逆向归纳求解器,完成第 4 块第 1 条封闭公式复现。
- 形式化动作模型与参数假设(须给出明确、可复现的"激进/保守"参数化判据)。
- 参数网格全解,观察阈值结构与 deuce 跳变现象,圈定定理假设的候选形式。
- 证明单调性引理链(价值差分沿分差的符号传播),闭合 H1 定理;构造 H2 参数点。
- 文献参数标定 + 敏感性分析,检验结构在现实参数域内的稳健性。
- 独立交叉校验:Fraction 版与 NumPy 版全网格互证;Monte Carlo 抽检 100 参数点。
7 · 新颖性边界
- 本课题不声称固定策略胜率公式(教材级)与 MDP 单调性一般理论(Puterman 框架)为本项目结果;不声称对真实比赛做因果断言(模型结论限定在假设内,论文明确写出)。
- 已有工作:计分制 Markov 分析(教材级);体育决策 MDP 文献(第 3 周核实清单)。丘奖相邻获奖论文:2024 金奖《Optimizing Dart Throwing Strategies for the Elderly Based on Markov Decision Process》——本题差异:运动不同(羽毛球对抗性计分 vs 飞镖非对抗)、状态结构不同(对抗比分 + deuce 规则)、交付重心不同(结构定理及其证明 vs 数值最优策略);2025 入围短跑模型为回归型风格量化,与本题 MDP 决策框架不同。
- 本项目贡献(主结论):羽毛球计分 MDP 的阈值结构定理(含 deuce 跳变现象的构造性刻画)+ 全参数域数值验证。
- 价值:把一条"人人可感"的竞技直觉(落后就该搏)变成带精确假设的定理;deuce 跳变是模型独有的可检验预言,英文答辩故事线完整。
8 · 决策门槛(go / no-go)
- 第 4 周末:硬门槛复现 + 动作模型冻结。
- 第 10 周末:网格全解完成。若阈值结构在大片合理参数域内不成立 → 这本身是结果:降级路径 A:主结论转为"阈值结构成立/失效的参数相图 + 失效机制分析"(保留 MDP 框架与定理目标,定理改为刻画失效边界)。
- 第 22 周末:H1 证明若卡在 deuce 段,降级路径 B:定理范围收缩到常规段(0–20 分)严格证明 + deuce 段的穷尽数值验证(有限状态可全验,构成有限情形的机器证明)——主结论框架不变。
- 第 4 周核实项:公开羽毛球统计的可得性;不可得不阻塞主线(定理不依赖数据)。
- 预算裁剪顺序:真实数据标定章节 → H2 参数区域精细化;H1 定理与全网格验证不砍。