Yau Awards Archive 2020 — 2025

Candidate Topics候选课题

计算机奖赛道 · 候选课题 20 则

Computer Science — 20 scoped research proposals for the 2027 season.

20

Candidate topics候选课题

64

Past winners studied历届获奖论文对照

2

Sub-families分族

52

Weeks planned周倒排时间表

Download PDF下载完整 PDF 共用附录:时间表与红线清单

本方案面向 2027 赛季(2026 赛季提交截止为 2026 年 9 月 15 日,从零启动已来不及)。倒排时间表以 2026 年 9 月为第 0 周、2027 年 9 月 15 日提交为终点,共约 52 周。

学生画像与资源假设:普通重点高中生,有一定编程与数学基础;计算资源为个人笔记本、纯 CPU、无 GPU 无集群;实验资源不超过中学常规实验室;全部使用公开数据;由中学教师即可指导。凡超出这一假设的路线,都在标签里标明了资源门槛。

四条必须先知道的赛制事实(取自官方公告,2020–2026 全部公示文章):指导老师不得来自培训机构或任何谋利机构,违者取消资格;总决赛全程英文(研究报告、PPT、答辩);入围总决赛的研究报告会在 11 月全网公示;提交材料含论文查重报告与实验视频。规则每年会改,报名开放后须重新核对当年《参赛规则》与本学科《参赛指南》。

这个赛道的评委在奖励什么

统计 2020–2025 共 64 项计算机奖获奖论文,这个赛道的供需失衡最明显,也因此存在最清晰的套利空间。

深度学习应用占了压倒性多数,但回报正在递减。 医学影像诊断、人脸识别、语义分割、视觉辅助系统、音乐风格迁移、甲骨文识别——这一族占了全部获奖的六成以上,且绝大多数停在铜奖与优胜奖。评委每年要看几百份"我拿一个模型跑了一个数据集"的报告。做同类课题,你的对手不是问题本身,而是三百份长得差不多的报告。

纯算法与理论稀缺,但命中率极高。 六年里这一族只有寥寥数篇:并行 bi-core 分解(2021 金奖)、并行密度峰值聚类(2022 银奖)、Max-Cut SDP 的最优解与秩(2020 优胜)、神经直觉与逻辑推理结合的几何定理证明、LLM 数学推理的形式化验证(2024 金奖)。投稿密度低而获奖层级高,这是本赛道最值得注意的结构性事实。而且算法与理论类课题天然只需 CPU,与本方案的资源约束完美契合。本方案 K01–K10 有意重仓这一族。

LLM 相关是新兴且 CPU 友好的窗口。 2024–2025 出现了:LLM 数学推理的形式化验证(金奖)、历史推理 benchmark、基于 LLM 的多智能体重复博弈中"未来的阴影"对合作策略演化的影响(铜奖)、多模态机器心智理论。注意这几篇的共同点:交付物是测量与结论,不是训练出来的模型。评测型、探针型、行为分析型课题只需 API 调用或小模型 CPU 推理,是资源受限学生的最佳杠杆——本方案 K11–K20 按这个思路设计。

这个赛道的头号死法是"工程演示"。 丘奖要的是研究报告,不是产品。一个能跑的系统 + 一张性能对比表,缺少可否证的科学假设,在分赛区就会被筛掉。本方案每条路线都强制要求 H1/H2 假设含数值或方向,且验收标准第一条是能否重现已发表基准。

算力是硬现实。 纯 CPU 笔记本意味着:ResNet 级别的从头训练勉强可行但耗时以天计,Transformer 预训练完全不可能,LoRA 微调只能用到很小的模型,量子态矢量模拟约 26–30 比特就吃满 16 GB 内存。每条路线都写明了具体上限与降规模版本——把算力约束写成课题设计的输入,而不是做到一半才发现。

本赛道 20 条路线的分族逻辑

  • K01–K10 算法、系统与理论族:结构性绕开算力墙——交付物是复杂度分析、收敛性、正确性证明与基准测量,不是模型规模。风险在于必须核实该问题的已知最好界,不能去撞已知难题。每条路线都做了这项核实。
  • K11–K20 机器学习与应用族:以评测、可解释性、鲁棒性分析为主,训练型课题一律限定在 CPU 可完成的规模并配降规模版本。涉及 LLM API 的路线写明了预算上限与可复现性要求(固定模型版本号与调用日期——模型会静默更新,不记录版本的实验一年后无法复现)。

两族独立排序:K01/K11 最稳,K10/K20 风险与上限最高。



All topics课题索引

20 则

按可行性排序,编号越小越稳。点开任一则可看完整的八块方案:研究问题、可检验假设、量化验收标准、数据与工具、方法路径、新颖性边界与 go/no-go 决策门槛。

K01

学习型索引在查询分布偏移下的鲁棒性

在 SOSD(Search On Sorted Data)标准数据集上,学习型索引(learned index:RMI、RadixSpline、PGM-Index)相对传统索引(ART、STX B+ 树、二分查找)的查找…

推荐优先级:最高分族:数据结构工程化参赛子类:计算机-系统与数据结构

K02

图重排序收益的结构归因

对 20 个以上公开真实图,四种顶点重排序(graph reordering)方法——Gorder、Rabbit Order、按度排序(DegSort)、逆 Cuthill–McKee(RCM)——给 PageRank …

推荐优先级:高分族:图算法与网络分析参赛子类:计算机-算法与性能

K03

基数约束 CNF 编码的求解成本敏感性

把组合问题编码为命题可满足性(SAT)实例时,"至多一个"(at-most-one, AMO)与基数约束(cardinality constraint)的六种经典 CNF 编码(pairwise、sequential/S…

推荐优先级:高分族:算法设计与复杂度参赛子类:计算机-算法与形式方法

K04

开源 C 静态分析器的误报–漏报前沿

已发表评测报告的开源 C/C++ 静态分析工具(Clang Static Analyzer、cppcheck、Infer、CodeChecker)在 Juliet 测试集上的精确率与召回率数字,对"工具告警与基准 man…

推荐优先级:高分族:编译与程序分析参赛子类:计算机-软件工程与安全

K05

无锁并发队列的尾延迟归因

在现代**异构多核**(heterogeneous / hybrid core,如性能核 P-core 与能效核 E-core 混合)笔记本 CPU 上,若干开源无锁(lock-free)并发队列实现的入队–出队延迟尾部…

推荐优先级:中高分族:并发与系统性能测量参赛子类:计算机-系统与性能

K06

近似中介中心性算法的误差–成本前沿

近似中介中心性(betweenness centrality, BC)算法 KADABRA、RK(Riondato–Kornaropoulos)与 ABRA 所提供的理论保证是"所有顶点的 BC 值绝对误差 ≤ ε(置信…

推荐优先级:中高分族:图算法与网络分析参赛子类:计算机-算法与网络科学

K07

顶点覆盖数据规约规则的边际效力

在最小顶点覆盖(minimum vertex cover)的参数化预处理中,六条经典数据规约规则(度-1 规则、度-2 折叠、支配规则、线性规划/Nemhauser–Trotter 约简、皇冠约简 crown reduc…

推荐优先级:中分族:算法设计与复杂度参赛子类:计算机-算法与组合优化

K08

常数时间性质统计检验的功效标定

以时序泄漏检测工具 dudect 为代表的"黑盒统计检验"方法,在噪声远高于服务器的**消费级笔记本 CPU** 上,对**可控幅度的人工植入泄漏**的检出功效(statistical power)随测量样本量如何变化?…

推荐优先级:中分族:密码学(防御向)参赛子类:计算机-信息安全与测量

K09

纯 CPU 量子线路模拟的可行边界

在一台 16 GB 内存的纯 CPU 笔记本上,态矢量(statevector)模拟与矩阵乘积态(matrix product state, MPS)模拟在量子近似优化算法(QAOA)求解 MaxCut 的线路上,墙钟成…

推荐优先级:中低(风险偏高)分族:量子计算模拟参赛子类:计算机-量子计算与数值方法

K10

图算法正确性的 Lean 4 机器检验

在 Lean 4 与 mathlib 生态中,一名高中生能否在 12 个月内完成有限有向图上**最大流–最小割定理**(max-flow min-cut theorem)及 Ford–Fulkerson 方法在整数容量下…

推荐优先级:最低(风险最高,需最强学生)分族:形式化验证与定理证明助手参赛子类:计算机-形式方法与逻辑

K11

长时序预测中「线性基线 vs Transformer」争议在中国气象与电力新样本上的独立仲裁——兼量化随机划分导致的性能高估

Zeng 等(2023)「单层线性模型 DLinear 在长时序预测(long-term time series forecasting, LTSF)上普遍优于 Transformer 类模型」的结论,在中国气象站点与电…

优先级:最高分族:时间序列预测资源:纯 CPU / 零预算

K12

SMOTE 类重采样在梯度提升分类器与阈值调优对照下的真实收益——PR-AUC 与概率校准双口径的独立复检

Elor 等(2022)「对强分类器而言 SMOTE 类重采样基本无益」的结论,在极端不平衡(正类 <0.5%)的公开数据集与概率校准(calibration)这一新评价维度上是否仍然成立?重采样带来的排序指标变化与校准…

优先级:高分族:评测审计 / 不平衡学习资源:纯 CPU / 零预算

K13

神经推荐是否真的在进步——MovieLens 与 Amazon 2023 新类目切片上的等墙钟基线审计,加测长尾覆盖与新颖度

Ferrari Dacrema 等(2019)「多数神经推荐模型可被近邻/线性基线打败」的结论,在 Amazon Reviews 2023 新类目切片上、以纯 CPU 等墙钟成本口径衡量时是否仍成立?把评价维度从准确类指…

优先级:高分族:推荐与信息检索资源:纯 CPU / 零预算

K14

深度知识追踪的增益边界——DKT 相对最优逻辑回归在 ASSISTments 与 EdNet 冷启动切片上的等成本复检

Gervet 等(2020)「精心构造特征的逻辑回归(Best-LR)在多数数据集上与深度知识追踪(Deep Knowledge Tracing, DKT)打平」的结论,在学生冷启动切片(每个学生的前 10/25/50 …

优先级:高分族:教育技术 / 人机交互资源:纯 CPU / 零预算

K15

小参数量 CNN 从零训练 vs 预训练特征线性探针——CIFAR-10-C 腐蚀鲁棒性与校准的等墙钟对比

在消费级纯 CPU 的固定墙钟预算(8 小时)内,「从零训练小 CNN」与「冻结预训练骨干 + 线性探针(linear probe)」两条路线,谁能在 CIFAR-10-C 腐蚀鲁棒性与概率校准上取得更好的前沿?精度、鲁…

优先级:中高分族:轻量计算机视觉 / 鲁棒性资源:纯 CPU / 零预算

K16

SHAP 与 LIME 特征归因分歧的决定因素——模型类别、特征相关性与维度的受控扫描及可操作判据

Krishna 等(2022)记录了 SHAP 与 LIME 等归因方法的「分歧问题」(disagreement problem),但未回答:分歧度能否由数据与模型的可测性质(特征相关性结构、维度、模型非线性度)系统预测…

优先级:中高分族:可解释性资源:纯 CPU / 零预算

K17

LLM 评改中文议论文的偏差探针——长度、辞藻与错别字的受控扰动因果实验

大语言模型作为作文评分者(LLM-as-a-judge)时,对与内容质量无关的表面特征——篇幅、成语/辞藻密度、模板化开头、错别字——存在多大的因果性评分偏差?这些偏差在中文议论文场景下的效应量与方向,与已发表的英文对话…

优先级:中分族:LLM 评测与探针 / 教育技术资源:API 预算 ≤200 元

K18

中文数学应用题的模板化扰动评测——数字替换、无关条件与叙述改写下大模型退化谱的测绘

Apple GSM-Symbolic(2024)在英文 GSM8K 上证明:仅替换数字或加入无关条件即可使 LLM 数学准确率大幅下降。该退化谱在**中文**小学/初中应用题上形状如何?本地可跑的 1.5B 小模型与 A…

优先级:中分族:LLM 评测与探针资源:API ≤100 元 + 本地 CPU 推理

K19

中国文化物象零样本识别差距的测绘——CLIP 与 Chinese-CLIP 在自建评测切片上的对比与提示语言消融

英文语料训练的 CLIP 在中国文化特定物象(节令食品、传统器物、戏曲行当、非遗工艺)上的零样本识别相对其通用类目基线退化多少?该差距中有多大比例可仅靠提示工程(英文加 "Chinese" 限定、改用中文提示 + Chi…

优先级:中低分族:多模态定量分析资源:纯 CPU / 零预算(图片收集工作量大)

K20

0.5B–3B 开源模型 GGUF 量化退化的中英不对称性——困惑度与下游任务联动的全档位测绘

Marchisio 等(2024)在 8B–103B 模型上证明量化对非拉丁文字语言伤害更大。在消费级 CPU 唯一可部署的 0.5B–3B 小模型区间、GGUF Q2–Q8 全档位上,中文相对英文的退化不对称性是否仍成…

优先级:探索(风险最高)分族:LLM 评测 / 鲁棒性资源:纯 CPU(墙钟重)/ 零 API 预算