ISEF Topic Scoping 2027

R1369–87

8 个人的数据,训练集和测试集里是不是同一批人

推荐优先级:较高 · 族 A(公开数据集重评测)/ 参赛子类:ROBO — 机器学习方向(官方 2027 子类名称需核实) · 资源需求:一台笔记本,零器材成本,无采购周期 · 技能取向:实验设计 / 评测口径管理 / 统计推理

1 · 研究问题

在人体活动与跌倒识别任务上,随机帧划分、随机片段划分、受试者独立划分这三种数据划分方式之下,同一个模型的 F1 相差多少?这个差能否写成一个按受试者数与模型容量分格、可直接查用的修正系数表?

2 · 研究背景与空白

背景。 可穿戴 IMU(惯性测量单元)与雷达采集的人体动作数据有一个决定性的性质:个体内相关性极强。同一个人的步态在几十毫秒尺度上几乎不变,采样率 O(10–100 Hz) 意味着相邻帧之间的姿态差异远小于人与人之间的差异。此时如果按"帧"随机划分训练与测试集,几乎每一个测试帧都能在训练集中找到一个时间上紧邻的孪生帧——分类任务从"识别动作"退化成了"最近邻检索",模型只需记忆而不需泛化。同样的机制也存在于按片段随机划分:片段之间若有重叠,或来自同一次动作,相关性依然存在。只有按受试者划分(测试受试者从未出现在训练集里),报告的成绩才对应"这个模型能否用在一个新的人身上"这句话。

已有工作到哪一步。 2025 ROBO021(Grand Award)"Fall Detection With 4D Radar and Deep Learning"——8 人 8 场景 80,000 帧、23 种非跌倒动作 + 16 种跌倒动作,摘要报告 precision of 0.931, recall of 0.9, and F1 of 0.915, suggesting its ability to generalize well,数据来自 8 individuals in 8 locations但没有说明划分方式。同届 2025 ROBO011T(Grand Award)"ML IMU Processing and Visual Monitoring for PD"(GaitGuardian) 的表述是 Fall detection runs an ML ensemble on IMU data, nearing perfect accuracy,形态相同。mine_isef "leakage cross-validation subject" 五届零命中fall detection 五届 12 项,是高密度词——在这个词上做"更好的系统"必输,做"你那个数对不对"仍是空地。词频侧的旁证:48 篇 ROBO 获奖摘要里 reproducib 唯一 1 次命中是 ROBO043T 的形容词用法,standard deviation 0 次。

空白在于:这个子领域最著名的翻车方式在本类目连续两届无人提及,也没有人给出"在你这个规模下,随机划分会让 F1 虚高多少"这个可查的数。这个空白适合一年期学生课题:数据公开、CPU 可算、全程无人类受试者因而无需 IRB、实验时间完全可压缩(多跑几次重复就是多几个样本),而且结论正负都成立——虚高幅度大是结果,虚高幅度小说明该任务的类间差异大于个体间差异,同样是可发表的结论。

3 · 可检验假设

H1 在受试者独立划分下,同一模型的 F1 比随机帧划分低 ≥ 0.10(绝对值),即随机帧划分带来的虚高至少 10 个百分点。

依据的推算过程:以 ROBO021 的规模为参照,8 人 80,000 帧意味着人均约 10,000 帧;在 O(10–100 Hz) 采样率下,相邻帧间隔 10–100 ms,人体姿态在这个尺度上几乎不变。随机帧划分下,任一测试帧在训练集中存在时间紧邻孪生帧的概率接近 1,任务退化为检索。0.10 是待否证的下限门槛而非已知量,具体值由实验测定;之所以敢把门槛放在这里,是因为退化后的成绩上界由数据本身的标注一致性决定,而非由模型泛化能力决定。

H2(机制假设,H1 被否证时仍有内容)若 F1 差距 < 0.10,则该任务的类间差异大于个体间差异(例如跌倒的加速度特征在所有人身上都相似)。此时虚高应主要来自片段重叠而非受试者身份,判据是:「随机片段划分 → 受试者独立划分」之差显著小于「随机帧划分 → 随机片段划分」之差。这两条差值可以在同一批实验里同时得到,因此 H2 不需要额外实验。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 两条自检必须同时通过:① 用自建管线在所选公开数据集的官方基准划分上复现其已发表的基准 F1,偏差 ≤ 3 个百分点;② 随机标签对照——把标签整体打乱后重训,在受试者独立划分下的 F1 必须落在多数类基线的置信区间内。若打乱标签仍得到显著高于基线的成绩,说明管线自身有泄漏,后续全部结论无效。(若数据集无官方划分或无已发表基准,则第 ① 条以合成对照替代,但必须在正文中声明这一替换。)
  2. 统计口径预先写死——两个 n 必须分开。 三种划分的比较必须在同一模型、同一超参、同一随机种子集合下进行;重复次数 ≥ 20 次。必须明确区分「同一受试者集合的不同随机划分」与「不同受试者留出组合」——前者是划分噪声,后者是个体异质性,这两个 n 不是一回事,不得混算,须分别报告标准差。
  3. 必须报告同口径的前后对比。 同一模型在「未做泄漏控制」与「做了泄漏控制」两种口径下的成绩必须成对给出;主表至少覆盖 3 种划分 × 2 个独立数据集 × 2 类模型。
  4. 修正系数的量化形式。 交付"随机划分 F1 → 受试者独立 F1"的换算表,按数据集、受试者数、模型容量分格,每格给出自助抽样置信区间,重抽样单元为受试者而非帧
  5. 阴性结果预案(开题时即写好)。 若虚高幅度不显著,交付物改为"各任务上个体异质性上限表",说明在何种任务上随机划分是可接受的。这仍是完整结论。
  6. 可复现性。 划分脚本、特征脚本、训练脚本、每一次划分的受试者 ID 清单全部开源,第三方一键重跑。

5 · 数据与工具

用途 来源 / 工具
人体活动/跌倒识别数据(主) 公开的、带受试者 ID 标注的 IMU 活动识别数据集。源文件记载"IMU 类的公开数据集有多个,含受试者标注"。具体数据集名称、受试者数、采样率、许可条款需核实。选数据集的硬判据:每条记录必须能追溯到受试者 ID,无受试者 ID 的数据集这条课题做不了
第二数据集(外部验证) 同上,须在传感器佩戴位置或人群构成上与第一个不同。需核实
对照基准 该数据集已发表的基准成绩(仅用于校验与对比,不计入本项目的数据贡献)。其评测口径需核实
模型 轻量时序模型两档(例如一个树模型 + 一个小型 1D 卷积网络),CPU 可训。具体实现库与版本需核实并在第 1 周锁定
计算环境 笔记本 CPU,零采购,无到货周期
明确不采集的东西 不自采任何人体数据:不贴传感器、不招募受试者、不拍摄视频、不做任何人身上的测量

须核实而非引用的量:受试者 ID 是否在公开发布版本中保留——有些数据集出于隐私把 ID 去掉或重编号,这会让这条课题直接死,必须在第 1 周下载后逐个核实字段,不能只看论文描述。② 数据集许可是否允许再分发划分索引(可复现性交付物依赖此项)。③ 已发表基准成绩的评测口径(F1 是 macro 还是 micro、是否含背景类)。

合规红线(必须写进研究计划,否则会被合规审查卡住): 本课题全程离线、无人类受试者、无需 IRB——只使用已公开发布的去标识数据集。这一点不是可写可不写:IRB 必须在招募动作之前批准,而本课题没有任何招募动作;同时 2027 版删除了"在医学专业人员监督下可以"的豁免口子,学生一律不得向受试者反馈研究数据或提供任何建议、诊断、医学信息——本课题不与任何人接触,因此不触发该条。但研究计划里必须显式声明"使用已公开发布的去标识数据集,无新的人类受试者参与",否则审查方会按人体研究处理并要求补 IRB,光是这一轮往返(2–6 周)就会吃掉 3–4 个月净窗口的一大块。

6 · 方法路径

  1. 建管线 + 跑通两条自检(官方划分复现 + 随机标签对照,§4 第 1 条)。这一步不过不许继续。
  2. 核实数据能力边界。 本方向已知的静默失败点(不报错但给错结果),逐一排查: - 受试者 ID 在公开版本中被去除或重编号,导致"受试者独立划分"实际上并不独立——管线照跑不误; - 滑窗特征在划分之前计算,窗口跨越训练/测试边界,泄漏发生在特征工程阶段而不是划分阶段; - 特征标准化用全数据集的均值方差,测试集统计量泄漏进训练; - F1 的平均方式(micro / macro / weighted)未写死,三种口径在类别不平衡下能差出好几个点,且不报错; - 同一受试者在不同 session 中被当作不同 ID(或反之),使"受试者划分"名不副实。
  3. 冻结三种划分的实现细节与评测口径,写入研究计划。此后不得更改 F1 平均方式。
  4. 跑 3 种划分 × 2 数据集 × 2 类模型 × ≥ 20 次重复,全部记录受试者 ID 清单。
  5. 构造修正系数表与泄漏检查清单(本课题的主产物),并按 H2 的判据判断虚高的主导来源。
  6. 独立交叉校验。 用另一种原理测同一个量:① 用"留一受试者"(leave-one-subject-out)与"按 session/日期划分"两条独立路径分别估计虚高幅度,若两者给出的修正系数一致,结论稳健;② 设一个故意注入泄漏的阳性对照——把同一受试者的数据人为复制到训练与测试两侧,验证管线确实能把泄漏检出,且检出幅度与理论预期一致。

7 · 新颖性边界

本课题不声称: - 不声称首次发现受试者泄漏。 该问题在人体活动识别文献中是已知的,这正是本条 h 取 9 的原因。任何"我发现了泄漏"的表述都会被文献立刻击倒。 - 不声称提出新的划分方法或新的泄漏检测算法。 - 不声称 ROBO021 或 ROBO011T 存在泄漏。 两篇摘要都没有说明划分方式,据此断言其有泄漏是不成立的——本课题只能说"无法排除",并把这一点当作"摘要应当报告划分方式"这一规程建议的依据。这条边界在答辩时必须主动讲。 - 不声称首次做跌倒识别。fall detection 五届 12 项,是本类目的高密度词,在这个词上做"更好的系统"必输

已有工作做到哪: ROBO021 报告 precision of 0.931, recall of 0.9, and F1 of 0.915, suggesting its ability to generalize well,数据来自 8 individuals in 8 locations,划分方式未说明;ROBO011T 报告 nearing perfect accuracymine_isef "leakage cross-validation subject" 五届零命中。

本项目的贡献(属「方法可复现性贡献」型): 不是发现泄漏,而是给机器人与可穿戴类竞赛项目提供一份可直接套用的修正系数与检查清单——文献知道泄漏存在,但没有人给出"在 8 人、80,000 帧这个具体规模下,随机划分会让你的 F1 虚高多少"这个可查的数。这是主结论,不是附加内容。

为什么有价值: 本类目连续两届的获奖摘要都在这个形态上,而 suggesting its ability to generalize well 这句推论的成立条件恰恰是摘要里没写的那一行。一份带误差棒的修正表,能让后来者在写摘要之前就知道自己那个 0.915 该怎么解释。

若结论不显著: 若虚高幅度小于预期,说明该任务的类间差异大于个体间差异——这同样是有效结论,但必须给出误差棒(以受试者为重抽样单元)证明你有能力分辨 0.10 量级的差异,否则等于没做。

8 · 决策门槛(go / no-go)

🔴 条件 1(第 3 周末,2026-08-25):至少两个带受试者 ID 的公开数据集下载并解析成功,且 ID 字段确认存在。 这是本课题最硬的 go/no-go 项——受试者 ID 被去除,课题即不成立。核实动作必须是"下载数据、打印字段表",不是"读论文描述"。 降级路径: 改用带 session/日期标注的数据集,用"跨 session 划分"替代"跨受试者划分",主结论框架从"个体泄漏虚高多少"变为"时间相关性泄漏虚高多少"——修正系数表的形式、检查清单、贡献类型全部保留,只是分格轴换一个。

🟢 2026-09-05:研究计划定稿并提交。 显式声明"无人类受试者、使用已公开发布的去标识数据集"。本方向审批负担极轻,具体表单组合(Form 1 / 1A / 3 及 2027 新增的 Form 2A 学生支持披露表)需核实 2027 版官方要求,不要凭印象填。

🟡 条件 2(第 10 周末,2026-10-12):≥ 20 次重复全部跑完。 未完成则按预算裁剪顺序砍模型档位或数据集数,不得延后。

2026-12-15:数据采集截止,留 3 周分析与展板。

⚠️ 与「附属赛后不得修改」的冲突点: 三种划分的实现细节、F1 的平均方式(macro / micro / weighted)、重复次数一旦在附属赛后想改就不被允许。必须在 11 月底前定死。 其中平均方式最敏感——在类别不平衡的跌倒数据上换一种平均方式,全部结论的数值都会变。

须提前核实而非边做边发现的事项: - 受试者 ID 可得性(见条件 1)与数据集许可。 - 本文件证据级别为"基于本地五届语料,未做外部文献核查",2022–2024 三届只有标题。本条是五条里撞车风险最高的一条(h=9):学生必须在开题前自己补一轮独立文献检索,重点查人体活动识别领域已有的 subject-wise cross-validation 工作,并据此把自己的贡献表述精确锚定在"给竞赛项目的可查修正系数"上。

已知困难及其定位: 原创性有天花板,这是本课题最大的风险。这个困难本身就是选题定位问题而不是技术问题——课题的价值必须锚定在"提供一个此前无人给出的、按规模分格的可查数字",一旦表述成"我发现了泄漏"就立刻失去可辩护性。这一点必须在展板首屏就写清楚。

选择前提: 适合能忍受大量重复实验、并且愿意在评测口径上做严格记录的学生。不适合想做硬件或需要视觉冲击力展板的学生——本课题的展板全是图表。

预算裁剪顺序: 零成本,无预算可裁。时间不足时:先砍第二类模型,再砍第二个数据集(保留单数据集三划分对比),最后把重复次数从 20 降到 10。砍到最后主结论仍成立,只是置信区间变宽、修正系数表的分格变粗。

🔴 展台能否展示实物: 无实物,纯图表——三种划分的成绩对比图、修正系数表、泄漏检查清单。不涉及液体、锐器、化学品、电池组、通电无人机,也不涉及任何人体、传感器或受试者材料展台限制对本课题为零。

评分: O=6, W=9, F=9, S=8, Fit=8 → base=78.0,h=9 → [69, 87],置信度:中