ISEF Topic Scoping 2027

R874–84

自训练模型赢了 9 个百分点,其中有几个点是架构挣的

推荐优先级:较高 · 族 A(公开数据与开源模型) · 参赛子类:Robotics and Intelligent Machines — 感知与评测方法 · 资源需求:零实物采购,笔记本 CPU 可行;若需云 GPU,按几十机时约 ¥300–800 量级,平台与计费需核实 · 技能取向:实验设计 / 评测口径 / 统计分解

1 · 研究问题

"自训练模型 vs 现成模型"的性能差可以被拆成几个部分:多少来自训练数据域匹配,多少来自架构与超参,多少只是测试集太小造成的抽样波动?把基线也放到同一数据域上重训之后,那 9 个百分点还剩多少?

2 · 研究背景与空白

背景。 目标检测模型的"现成权重"(stock weights)通常在 COCO 这类地面视角、日常物体的通用数据集上预训练。把它直接拿去测航拍视角、特定作物或特定缺陷,属于典型的域偏移(domain shift)——视角、尺度、类别词表、光照统计全都变了。此时"我的模型比现成模型强"这句话里,至少混着三件不同的事:我用了目标域的数据(域匹配)、我换了架构或调了超参(架构分量)、以及我的测试集只有几十张图(抽样波动)。这三者不分开,"贡献"就无从谈起:一个连目标类别都不在其预训练词表里的基线,从一开始就不该赢。

已有工作到哪一步。 2025 ROBO014T(Grand Award)"Coordinated Drones for Object Detection" 的核心证据是 the custom-trained model achieved an F1 score of 0.96, while the stock model achieved an F1 score of 0.87;同一摘要还写了多机野外测试 achieving a perfect F1 score of 1.00, meaning no detections were missed or incorrect——满分 F1 是测试集过小的直接证据。同类形态还有 2025 ROBO054(Special) 的 YOLOv8 92.5% vs RT-DETR 87.07%,此项做了五折交叉验证与消融(ablation),是本类目里少见的规范对照,可作为本课题的正面样板;而 ablation 在 ROBO 48 篇里也仅此 1 次命中。同一批统计中,standard deviation 0 次、error bar 0 次、sensitivity analys 0 次、repeatab 0 次。

空白在于:把"我的模型 vs 未经领域适配的现成模型"当作贡献证据,是本类目的系统性问题而非个别失误,但从未有人量化过这种不公平基线平均高估了多少个百分点。这个空白适合一年期学生课题:属于"方法可复现性贡献"型;数据集公开可下载、零实物采购;算力可以通过挑选规模压进笔记本 CPU;而且结论正负都成立——高估幅度大或小,那个数字本身就是可引用的结论。

3 · 可检验假设

H1 在 ≥ 3 个公开数据集上,把现成基线放到与自训练模型完全相同的数据域上重训(只改数据域,架构与超参保持基线默认)之后,"自训练 vs 现成"的表观优势平均缩小 ≥ 60%;即 ROBO014T 报出的 9 个百分点(0.96 − 0.87)中,≥ 5.4 个百分点由域匹配解释,架构与超参分量 ≤ 2 个百分点,其余归入测试集抽样波动。

数值依据:表观优势的分解在数量级上由一个可直接检验的事实主导——目标类别是否出现在基线预训练的类别词表中。若不在,基线在该类上的召回近乎结构性为零,表观差几乎全部来自域匹配;若在,则差值主要由数据分布差异贡献。H1 因此附带一个可否证的相关性判据:缩小幅度与"目标类别是否在基线词表中"强相关(按此二分的两组,缩小幅度的差异须显著)。

H2(备择假设,H1 被否证时仍有内容)若同域重训后表观优势并未显著缩小,则主导因素不是域匹配而是测试集规模:表现为在 n < 100 张的测试集上,表观优势的自助法 95% 置信区间宽度 ≥ 优势本身(即那个差在统计上根本不可分辨)。此时结论指向 R9 所建的最小样本量表,两条课题互为佐证。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 用自建评估管线在一个已公开发布评测数值的算例上重算,偏差 ≤ 1 个百分点(具体算例与其官方数值须自行核实后写入研究计划,不得引用未经核对的数字)。设立此门槛的原因是:mAP 与 F1 的实现差异——IoU 阈值、置信度截断、非极大值抑制(NMS)参数、类别映射——本身就能造成几个百分点,而本课题要测的差正是这个量级这一步不过关,后续所有分解都是在测自己的评估脚本。
  2. 统计口径预先写死,两个 n 必须分开报。同一份权重在不同测试子集上重评估」反映的只是测试集抽样;「不同随机种子重训出的独立模型」才包含训练随机性。这两个 n 不是一回事,混用是本类目最常见的错误。规定:每个"训练配置 × 数据集"用 ≥ 5 个随机种子独立重训(算力不足时见 §8 降级),所有差值报自助法 95% 置信区间。
  3. 必须报告优化前后的同口径对比。 给基线做域适配本身就是一次优化,须给出三档同口径结果:现成权重直接评测 → 同域重训(基线默认超参)→ 同域重训 + 同等预算的超参搜索。三档必须用同一测试划分、同一 IoU 阈值、同一置信度阈值、同一 NMS 参数
  4. 参数点。 ≥ 3 个公开数据集,其中至少 1 个为航拍或机器人视角(VisDrone 一类);每个数据集 ≥ 2 个模型规模档。
  5. 结论必须落回机器人任务。 把高估的百分点换算成机器人任务指标——例如"高估的 9 个百分点对应到搜救任务的覆盖率与漏检目标数意味着什么",并给出换算所依据的任务模型与假设。没有这一步,本课题会被判为机器学习方法学而非 ROBO。
  6. 可复现性。 训练与评估脚本、全部配置文件、随机种子表、训练日志、逐次评测结果与预测文件开源;AI 生成的代码须显式引用并保留提示词日志。

5 · 数据与工具

用途 来源 / 工具
主数据集 VisDrone 等公开检测数据集,公开可下载,无采购周期;但注册、条款确认与格式转换会花时间,预留 2 周
模型 YOLO 的 nano 档等轻量检测器;现成权重与从头/同域重训权重各一套
评估 标准检测评测实现(COCO 风格 mAP),须固定版本并在 §4 第 1 条中复现官方数值
备用路径(算力不足时) 直接使用公开的检测结果文件做纯重评估,跳过重训;此路径下只能分解"评估口径"与"测试集规模"两个分量
对照基准(仅用于校验与对比,不计入本项目的数据贡献 ROBO014T 的 F1 score of 0.96 vs 0.87perfect F1 score of 1.00;2025 ROBO054 的 YOLOv8 92.5% vs RT-DETR 87.07%
算力 笔记本 CPU 可行,但必须挑选算得动的规模——nano 档模型 + 子采样数据集 + 缩小输入分辨率。若上云 GPU,按几十机时约 ¥300–800 的量级估算,具体平台、单价与学生账号可用性需核实;上云前必须先在本地把单次训练压到可预算的时长

能力边界须核实项: 各数据集的许可证是否允许竞赛使用与结果再分发(这决定开源交付物的边界);§4 第 1 条所用算例的官方评测数值;云 GPU 平台的计费口径与实名/支付可用性;所选现成权重的预训练语料是否可能已包含测试数据(若数据集被并入某些大规模预训练语料,结论会被静默污染,此项需核实且多半只能给出"无法排除"的诚实声明)。

6 · 方法路径

  1. 搭评估管线 + 在已发布算例上复现官方数值(§4 第 1 条硬门槛)。这一步不过不许继续。
  2. 核实工具能力边界。 逐条排查以下静默失败点(不报错但给错结果): - mAP 实现差异:COCO 风格累计 PR 曲线、VOC 11 点插值、各类第三方实现,在同一份预测文件上能差出几个百分点,全都正常返回结果。 - 类别映射错位:现成模型的 80 类词表与目标数据集类名对不上时,脚本会把未匹配类静默计为全部漏检——这正是"不公平基线"的机器实现形式,也是本课题必须亲手拆开的那个环节。 - 置信度阈值不统一:F1 是阈值相关量,两个模型各用各的最优阈值 vs 用统一阈值,结论可以反号,且两种做法都不会报错。 - 划分泄漏:VisDrone 这类数据集的相邻帧来自同一段视频,随机划分会让训练集与测试集共享场景(与 R13 是同一病灶);五届检索 leakage cross-validation subject 零命中。 - 预处理不一致:输入尺寸与 letterbox 填充方式不同,小目标的 mAP 会系统性变化,而两条管线都能跑完。
  3. 冻结数据集、划分方式与全部评估参数(IoU 阈值、置信度阈值、NMS 参数),写入研究计划。划分必须按场景/视频整块划分而非按帧随机。
  4. 跑满三档配置 × ≥ 3 数据集 × ≥ 5 种子,产出逐配置的评测表与预测文件。
  5. 做三分量分解:域匹配分量、架构与超参分量、抽样波动分量,各给自助法 95% 区间;并按"目标类别是否在基线词表中"分组检验 H1 的相关性判据。
  6. 落回机器人任务,按 §4 第 5 条给出换算。
  7. 独立交叉校验。 用另一套第三方评估实现(不同代码库)在同一份预测文件上重算全部结论,并同时用一组独立口径(PR 曲线下面积、逐图检出率)复核分解结论。若结论随实现改变,说明分解被评估口径污染,须先解决再下结论。

7 · 新颖性边界

本课题不声称: - 不声称首次指出域偏移的存在。域适配是成熟研究领域,本课题只把"不公平基线的高估幅度"量化到机器人视觉这个具体语境。 - 不声称 ROBO014T 的结论是错的。 它的模型在它的任务上很可能确实更好——本课题质疑的是归因,不是性能。这个区分必须写进摘要,否则答辩时会被正确地反驳。 - 不声称 perfect F1 score of 1.00 是造假。满分 F1 只说明测试集太小,这是样本量问题不是诚信问题。 - 不声称提出新的检测架构或新的域适配方法。

已有工作做到哪: ROBO014T 报 0.96 vs 0.87 并在多机测试上报 1.00;2025 ROBO054 做了五折交叉验证与消融,是本类目里少见的规范对照;ROBO 48 篇里 ablation 仅 1 次命中、standard deviationerror bar 各 0 次。

本项目的贡献(属「方法可复现性贡献」型): 已有工作给出的是"我的模型比现成模型高多少";本项目给出的是"公平基线的构造规程,以及不公平基线在机器人视觉任务上平均高估了多少个百分点"。这个规程与这个数字是主结论,不是附加内容。

为什么有价值: 这是一个可以被后来者直接套用的方法学纠正——任何要写"我的模型 vs 现成模型"的项目,都能照着规程把基线摆正,并用高估幅度反推自己的结论还剩多少。它同时给评审提供了一把可量化的尺子。

若结论不显著: 若同域重训后表观优势并未显著缩小,这同样是有效结论——它说明架构分量确实存在,自训练模型的优势是真的。但必须给出误差棒证明有能力分辨预期量级(数个百分点)的差异,否则等于没做。

8 · 决策门槛(go / no-go)

🟢 2026-08-25(第 3 周末):评估管线复现官方算例通过,全部数据集下载与格式转换完成。 数据集注册与格式转换须预留 2 周,从第 1 周就开始,不许拖到九月

🟡 2026-09-14(第 6 周末):完成一次完整的小规模跑通(1 数据集 × 3 配置 × 2 种子)并据此做出机时预算表。 若笔记本 CPU 上单次训练超过 4 小时,则 3 数据集 × 3 配置 × 5 种子 = 45 次训练在净窗口内不成立,降级路径分两级:其一,数据集子采样 + 输入分辨率下调 + 种子数降到 3,并显式声明结论限定于该规模;其二(更彻底),改用公开的检测结果文件做纯重评估,此时域匹配分量退为文献讨论,只分解"评估口径"与"测试集规模"两个分量。主结论框架(表观优势的分解与公平基线规程)在两级降级下都保留,只是分解粒度下降。这一点必须提前写进方案,而不是十月才发现。

🔴 2026-11-30:数据集、划分方式、评估参数、种子数定死。 2026-12-15:数据采集截止,留 3 周分析与展板。

⚠️ 与「附属赛后不得修改」的冲突点: 数据集选择、划分方式、IoU 阈值、置信度阈值、NMS 参数、种子数,一旦在附属赛后想改就不被允许。事后调阈值可以让分解结论反号,这是评审最敏感的问题之一。必须在 11 月底前一次定死并写入研究计划,同时预先声明"若某数据集不可用,替补数据集是哪一个"。

须提前核实而非边做边发现的事项: 数据集许可证与再分发条款;§4 第 1 条算例的官方数值;云 GPU 计费与学生账号可用性;现成权重的预训练语料是否可能包含测试数据。另外,本文件顶部已声明"基于本地五届语料,未做外部文献核查",学生必须在开题前自行补一轮外部文献检索,重点查域适配基准与公平比较规程的既有工作。

已知困难及其定位: "什么算公平基线"本身是有争议的——给基线多少调参预算才算公平?这个争议就是研究内容:本课题的三档设计(直接评测 / 同域重训 / 同域重训+超参搜索)正是把这个争议摆成一条可测的连续谱,而不是替读者拍一个答案。

选择前提: 适合能设计受控实验、愿意反复核对评估口径的学生。学科契合是本条最大的非技术风险:必须把结论落回机器人任务(§4 第 5 条),否则会被判为机器学习方法学而非 ROBO。不适合把"跑通别人的训练脚本"当作研究的学生——本课题的全部价值在分解设计,代码本身是现成的。

预算裁剪顺序: 无实物预算可裁(零采购)。算力/时间不足时的裁剪顺序:先砍第 7 步的第三方实现交叉校验,再砍第三个数据集(保留 2 个,其中必须保留航拍视角那个),再把种子数从 5 降到 3,最后退到纯重评估路径。砍到最后,"公平基线规程 + 至少一个数据集上的分解结果"这一主结论框架仍成立。

🔴 展台能否展示实物: 全部是图表,无任何实物展示需求,展台限制对本条的影响为零。无液体、无电池、无锐器、无干燥粉末。禁网址与二维码——数据集主页与代码仓库地址均不得以网址或二维码形式出现在展板上。

评分: O=7, W=9, F=8, S=7, Fit=9 → base=79.0,h=5 → [74, 84],置信度:高