A361–79
深度学习行为评分器的一致性与退化边界:准确率 92% 到底是什么意思
推荐优先级:备选 · 参赛子类:Animal Sciences — Animal Behavior · 资源需求:手机/摄像头 + 一台能跑 YOLO 的笔记本或免费云 GPU;无脊椎动物(面包虫/果蝇/水蚤)成本极低 · 技能取向:计算机视觉 / 分类评价指标 / 评分者一致性
1 · 研究问题
一个 YOLO 行为分类器报告的"92% 准确率",换算成与人工评分者的 Cohen's kappa 之后还剩多少?当浊度、光照与每视野个体数系统性变化时,它从哪一个具体阈值开始失效?
2 · 研究背景与空白
背景。 用目标检测网络(YOLO 系列)自动给动物行为打标签,正在成为学生项目里最常见的一条技术路线:录像 → 逐帧检测 → 把检测结果聚合成"攻击次数""存活个体数"这类行为学指标。问题在于评价指标。 "准确率"(accuracy)是全部预测中正确的比例,它在类别不平衡时几乎不携带信息——若"攻击行为"只占全部帧的 3%,一个把所有帧都判为"非攻击"的模型准确率就有 97%,而它一次攻击都没检测出来。行为学关心的是稀有事件,因此正确的报告口径是 PR-AUC、逐类召回与精确率,以及与人工评分者的一致性(Cohen's kappa,扣除了"碰巧一致"的部分)。此外,任何视觉模型都有能力边界:训练时没见过的浊度、光照、个体密度会让它悄悄退化——不报错,只是给出错的数。
已有工作到哪一步。 ANIM021(2025,Grand Award,蟹苗防自相残食)摘要原文:"Aggression levels and survival rates were analyzed using the Deep Learning YOLO algorithm with 3,000+ images, achieving 92% accuracy"。这个 92% 是摘要中关于模型性能的唯一数字:没有混淆矩阵、没有逐类召回、没有与人工评分者的一致性、没有说明测试集如何划分、也没有任何条件依赖分析。同类问题同时出现在 ANIM047T(2026,Grand Award,CrabTech)报告的 99.4% accuracy,以及 ANIM013T(2025,Grand Award,"Giant Water Bug Boost")——后者摘要写明"AI-assisted morphological analysis was constructed to enhance sex differentiation",同样未给出任何分类性能的细分指标。
空白在于:三个不同年份、不同国家、不同物种的获奖项目共用同一个未被质疑的指标,而没有任何人做过"这个数字在什么条件下还成立"的检验。 这个空白适合一年期学生课题的理由是:它完全不需要复制原作的物种或养殖系统——退化边界这个问题与物种无关,任何能拍到的密集无脊椎动物都成立;训练与推理可在免费云 GPU 上完成;而且结论正负都成立——退化曲线陡说明这类报告必须附带条件说明,退化曲线平说明模型比想象的稳健,两者都是对使用者有直接后果的结论。
3 · 可检验假设
H1 同一个 YOLO 行为分类器,在其训练条件下报告的总体准确率与它同一批数据上的 Cohen's kappa 之差 ≥ 0.25(例如 accuracy 0.92 对应 kappa ≤ 0.67),且稀有行为类别的召回率 ≤ 0.60——即准确率主要由多数类撑起。判据明确:kappa 与逐类召回都从同一份混淆矩阵直接算出。
H2(机制假设,H1 被否证时仍有内容)无论 kappa 高低,模型性能对拍摄条件存在一个可定位的断点:在浊度、光照或个体密度三个变量中至少有一个,存在一个阈值,跨过它之后稀有类召回率相对基线下降 ≥ 50%;且该断点在退化曲线上足够陡,可用分段回归定位并给出置信区间。
4 · 量化验收标准
- 方法学校验(硬门槛,不过关不许往下做,后续全部结论无效)。 用已知答案的正对照验证整条评价管线:人工构造一批标签完全已知的合成测试集(把已标注的目标以已知数量、已知位置贴到背景上,或用已知总数的静态照片),跑通"检测 → 聚合 → 混淆矩阵 → kappa/PR-AUC"全流程,要求管线报出的计数与已知真值偏差 ≤ 2%,且在故意构造的极端不平衡样例上,管线报出的 accuracy 与 kappa 呈现预期的巨大分离。这一步不过不许继续——若评价代码本身算错,后面所有退化曲线都是在测你的 bug。
- 统计口径预先写死——极不平衡分类一律报 PR-AUC + 逐类召回 + 逐类精确率,明确写"不报 accuracy"。 原因写进正文:稀有行为占比低时 accuracy 由多数类主导,与模型能否检出目标行为几乎无关。唯一保留 accuracy 的地方是与前作数字的对照表,且必须在同一张表里并列 kappa 与召回,让读者直接看到差距。
- 统计口径预先写死——人工评分是唯一真值来源,其自身信度必须先测。 ≥ 3 位标注者独立盲标同一批 ≥ 500 帧(互不可见、随机顺序),报告 Fleiss' kappa;标注者间 kappa < 0.6 的行为类别一律从主分析中剔除,剔除规则在开标前定死。理由:模型不可能比它的真值更准,真值本身不可靠时"模型准确率"没有意义。
- 数据划分口径预先写死——按录像段(或按个体/按容器)分组划分训练与测试,绝不随机划分帧。 同一段录像的相邻帧几乎完全相同,随机划分会把近乎相同的帧同时放进训练集和测试集,制造虚高性能。必须额外报告一次"随机划分 vs 按段划分"的对照,量化这个高估幅度——这个数本身就是一个有价值的交付物。
- 退化曲线的具体设计。 三个变量各取 ≥ 5 个水平(浊度、光照强度、每视野个体数),每个水平 ≥ 200 帧已标注真值,报告各水平下的稀有类召回与 PR-AUC,用分段回归定位断点并给出自助抽样置信区间。变量水平序列必须在开测前一次定死。
- 可复现性。 训练/推理/评价脚本、逐帧标注文件、数据划分表、随机种子全部开源存档;原始视频按可行范围存档(体量过大时至少公开抽帧后的图像集与标注)。第三方可一键重跑得到同样的 kappa 与退化曲线。AI 生成的代码须显式标注并保留提示词日志。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 拍摄对象 | 任意易得的密集无脊椎动物:黄粉虫(面包虫)、果蝇、水蚤。均为无脊椎动物,不受脊椎动物规则约束,宠物市场/饲料店可购 |
| 录像 | 手机或 USB 摄像头固定俯拍,帧率与分辨率须核实是否足以分辨目标行为的时长(见 §6 第 2 步) |
| 检测模型 | YOLO 系列开源实现。须核实所用版本、许可证与预训练权重来源,并在展板与研究计划中引用——用了别人的预训练权重就必须写清楚 |
| 训练算力 | 免费云 GPU(Colab 等)或本地显卡。须核实免费额度是否够跑完预定的训练与全部退化条件推理;不够则减小模型尺寸而非减少退化条件 |
| 标注 | 开源标注工具(LabelImg/CVAT 一类)。需核实所选工具的导出格式与评价脚本是否对齐 |
| 一致性统计 | Python(scikit-learn 的混淆矩阵与 PR 曲线、statsmodels 的 kappa)。纯 CPU 即可 |
| 对照基准(仅用于校验与对比,不计入本项目的数据贡献) | ANIM021(2025)的 92% accuracy / 3,000+ images、ANIM047T(2026)的 99.4% accuracy;用作"同类报告口径长什么样"的对照,其任何数字不得写成本项目结果 |
| 须核实项 | ① 免费云 GPU 的实际可用时长与是否会中断;② 目标行为的持续时长(决定所需帧率);③ 能否稳定招募到 3 位愿意各标 500 帧的同学——标注是本课题最大的人力成本,必须在开题前谈妥;④ 加噪/降光的后期模拟是否能代表真实的浊度与光照变化——这一项存疑,必须至少用一组真实拍摄条件做交叉验证,不得全靠后期合成 |
| 不可用路径(已排除) | 复制原作的蟹苗养殖系统——需长期养殖场准入与跨月周期,净窗口覆盖不了。用脊椎动物(鱼类)做密集群体拍摄——改变水体浊度与光照即构成操纵动物环境,失去观察豁免,须 Form 5A + SRC 事前批准,且浊度操纵存在被判定为逆境刺激的风险 |
6 · 方法路径
- 建体系并完成 §4 第 1 条校验。 搭好训练与推理环境,实现混淆矩阵/kappa/PR-AUC/召回的评价代码,在标签已知的合成测试集上跑通并达到计数偏差 ≤ 2%。这一步不过不许继续。
- 核实工具与生物材料的能力边界,逐条实测下列静默失败点: ① 数据泄漏——随机划分帧会把同一秒的相邻帧分到训练与测试两侧,模型只需"记住这一帧长什么样"就能得高分,不报错,只是分数虚高,因此划分必须按录像段分组;② 极不平衡下 accuracy 的假象——稀有行为占比低时 accuracy 逼近多数类占比,模型什么都没学到也能有高分;③ 检测限以下的删失被当成 0——置信度低于阈值的目标被丢弃后,"未检出"与"确实没有"被混为一谈,必须把置信度阈值当作一个显式变量报告,而不是用默认值悄悄决定结果;④ 观察者预期偏差——人工标注者若知道这段视频属于哪个条件,标注会向预期漂移,必须随机码 + 盲标;⑤ 群体饲养导致的伪重复——同一容器里的个体不是独立样本,若按"个体数"报 n 会严重高估样本量,n 应以容器/录像段计。
- 录制并标注基线数据集。 在一组固定条件下录 2–3 小时视频,抽帧标注,建立训练集与按段划分的测试集。≥ 3 位标注者盲标同一批 ≥ 500 帧,先算 Fleiss' kappa,按预定规则剔除不达标类别——真值不合格的类别不许进入后续任何分析。
- 训练模型并做基线评价,同时报告"按段划分"与"随机划分"两套结果,量化泄漏带来的高估幅度。这一步产出的对照数字是本课题最稳的交付物之一,不依赖退化实验。
- 系统性改变三个变量,跑退化曲线。 浊度、光照、个体密度各 ≥ 5 个水平、每水平 ≥ 200 帧真值。优先用真实拍摄条件而非后期合成;若时间不足只能合成,须至少保留一个变量做真实拍摄,并显式对照真实与合成两条曲线的差异——这个对照本身就是结论的一部分,不做就等于把合成当真实。
- 用分段回归定位断点,给出各变量的失效阈值与置信区间;把断点表述成使用者能用的形式(例如"每视野超过 N 只时稀有类召回跌破 0.5")。涉及主观判断的环节(断点模型的选择、异常点剔除)须给出明确、可复现的判据并在开测前写死。
- 独立交叉校验:用另一种方法算同一个量。 对同一批视频用一条完全不依赖深度学习的路径估计同一个行为指标——例如基于帧差分/光流的运动强度阈值法,或人工全量计数一小段视频——与 YOLO 管线的输出对照。两条独立路径若在某个条件下开始分歧,那个分歧点应与退化曲线的断点吻合;若不吻合,说明至少有一条路径的假设被违反。
7 · 新颖性边界
本课题不声称: - 不声称首次用 YOLO 做动物行为分类。这是成熟做法,ANIM021(2025,Grand Award)、ANIM047T(2026,Grand Award)、ANIM013T(2025,Grand Award)三个获奖项目都已在用。 - 不声称蟹苗庇护所能提高存活率。 那是 ANIM021(2025,Grand Award)的结论(其摘要报告在蟹银行中存活率提升至 35.9%,为对照的 1.5 倍),本项目不做该实验,也不得把它写成本项目发现。 - 不声称 CrabTech 的 99.4% 是错的。 本课题不接触该系统、不复现其数据,无法对它的具体数字下判断;本课题给出的是"这一类报告口径在什么条件下会误导"的一般性证据。这个区分必须在展板上写清楚,否则会被读成越权指控。 - 不声称提出了新的模型架构或新的评价指标。PR-AUC、Cohen's kappa、分组交叉验证都是既有工具,本课题的贡献在于把它们用在一个从未被这样检验过的地方。
已有工作做到哪: ANIM021(2025,Grand Award)用 3,000+ 张图像训练 YOLO 分析攻击水平与存活率,报告 92% accuracy;ANIM047T(2026,Grand Award)的 CrabTech 报告 99.4% accuracy;ANIM013T(2025,Grand Award)用 AI 辅助形态分析做性别判别。三者均未公开混淆矩阵、逐类召回、评分者一致性或数据划分方式。
本项目的贡献(属「评价维度转换」型): 已有工作评估的是模型在其自身条件下能达到多高的准确率;本项目评估的是这个数字换成不平衡分类下的正确口径后还剩多少,以及它在什么条件下失效。这是主结论,交付物就是那张 accuracy–kappa 对照表与三条退化曲线。
为什么有价值: 这条技术路线在学生项目里正在快速普及,而"92%"这样的单一数字会被下一批学生原样继承;给出一条可操作的报告清单与一组失效阈值,比再训一个模型有用得多。
若结论不显著: 若 kappa 与 accuracy 差距很小、退化曲线很平,H1/H2 均被否证——"这类模型比想象的稳健"同样是有效结论,且对使用者同样有用。但必须给出误差棒证明有能力分辨这个差异:每个退化水平只有 200 帧时召回率的置信区间可能宽达十几个百分点,没有误差棒的"曲线很平"等于没做。
8 · 决策门槛(go / no-go)
🟡 条件 1(第 6 周末,即 2026 年 9 月中旬):完成评价管线校验(合成集计数偏差 ≤ 2%)+ 落实 3 位标注者。 若招不到 3 位标注者,立即降级: 降级路径是改为 2 位标注者 + 同一位标注者的跨时重标(intra-rater 重测),报告 Cohen's kappa 与自我一致性两个数。主结论框架(模型性能相对于人工真值的真实水平)完全保留,只是一致性估计的稳健性下降,须在局限性中显式声明。
🟡 条件 2(第 10 周末,即 2026 年 10 月中旬):基线模型训练完成且按段划分的测试结果已出。 若免费 GPU 额度不足或训练不收敛,立即降级: 改用更小的模型或更少的类别(只保留一个稀有行为类 + 一个背景类)。主结论框架保留——单类别同样能算 kappa、PR-AUC 与退化曲线;若连训练都完全跑不通,最后的兜底是把课题收缩为"人工标注者之间的一致性有多高、它给模型性能设定了什么上限",这一条纯靠标注数据即可完成,不需要任何 GPU。
⚠️ 与「附属赛后不得修改」的冲突点: 四件事一旦在附属赛后想改就不被允许——① 数据划分方式(按段分组的具体规则);② 检测置信度阈值;③ 标注者 kappa < 0.6 剔除类别这条规则;④ 三个退化变量的水平序列。必须在 11 月底前定死并写入研究计划,因为每一项都能大幅改变最终报出的数字。
须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,"未找到前作"不等于"不存在前作"。 计算机视觉领域关于分组交叉验证与不平衡分类评价的方法学文献很多,学生必须在开题前自行补检索,并在研究计划中说明本课题相对这些方法学文献的定位:本课题不是提出方法,而是把既有方法用在一个具体的、被反复重复的报告习惯上。 - 后期加噪/降光能否代表真实的浊度与光照变化。必须至少用一组真实拍摄条件实测验证,不能全靠合成。 这是本课题最容易被评委问倒的地方。 - 免费云 GPU 的实际可用额度。必须先跑一次完整训练确认,不能边做边发现额度耗尽。
已知困难及其定位: 人工标注量大且枯燥(≥ 500 帧 × 3 人,加上退化条件的每水平 200 帧真值)。这个困难本身就是研究内容——课题问的正是"人工真值有多可靠、它给模型性能设了什么上限",所以标注不是前置苦工,而是产生主结论的那一步。
选择前提: 适合有一定 Python 基础、能接受"主结论是一组否定性的方法学证据"的学生。不适合想做出一个更好的模型的学生——本课题不追求性能,追求的是把性能数字说清楚;也不适合无法组织同学参与标注的学生。
预算裁剪顺序: 器材成本近零,无预算可裁。时间不足时的裁剪顺序为:先砍第 7 步(非深度学习路径的交叉校验),再把退化变量从 3 个减到 2 个(优先保留个体密度,因为它与伪重复问题直接相关),再把每变量水平从 5 个减到 4 个(不得少于 4,3 点定位不了断点)。砍到只剩第 1–4 步时主结论变为"accuracy 与 kappa 的差距 + 随机划分的高估幅度",仍完整成立。
合规与表格: - 不触发脊椎动物规则。 拍摄对象限定为无脊椎动物(面包虫/果蝇/水蚤),这是刻意选择:若改用鱼类,则改变浊度与光照即构成"操纵动物环境",立即失去观察豁免,须 Form 5A + SRC 事前批准,且浊度操纵有被判定为逆境刺激的风险。斑马鱼受精后 7 天(7 dpf)起即算脊椎动物,头足类按脊椎动物对待——两者都不得用于本课题的浊度实验。 - 不触发 PHBA。 无微生物培养、无 rDNA、无组织。果蝇培养基会长霉;规则要求食品霉菌研究在首次出现霉菌时终止实验,用标准培养基并按常规换瓶即可规避。因此不需要在时间线里扣除 PHBA 的 2–6 周 SRC 事前审批。 - 家中禁止培养任何潜在危险生物制剂(规则点名连 BSL-1 与 C. elegans 都不行)——本课题不培养任何微生物,饲养面包虫/果蝇不属于此列,但若有人建议"顺便测测水体细菌",立即出局。 - 抗生素耐药性研究基本封死、朊病毒样蛋白全面禁止——本课题均不涉及。 - 须填表格: Form 1、Form 1A(含研究计划)、Form 1B、Form 2A(2027 新增,所有项目必填)、Form 3(风险评估:无脊椎动物饲养、电气设备)、Abstract(实验后)。若在大学实验室使用 GPU 集群或接受远程指导,追加 Form 2C(原 RRI 表,须在展台竖立展示);若有导师实质参与建模,追加 Form 2B(Qualified Scientist)。注意 Form 2A/2B/2C 新增了"支持时长"提问,导师参与程度会被显式披露,设计上应确保学生本人完成主体工作。 - 展台: 禁活体、液体(含水)、土壤、玻璃,并且禁止活跃网络连接——这条对本课题特别重要:不得在展台做在线推理演示。展台靠退化曲线图、混淆矩阵、accuracy–kappa 对照表、标注一致性矩阵与录像截图/视频撑起。 - AI 政策: 不得用生成式 AI 撰写研究计划、摘要、展板或生成引文;训练与评价代码若由 AI 生成,须显式引用并保留提示词日志——本课题代码量大,这一条务必从第一天就开始记。
评分: O=7, W=7, F=7, S=6, Fit=8 → base=69.6,h=9 → [61, 79],置信度:中