ISEF Topic Scoping 2027

A672–82

三个站点、三个污染水平:内分泌干扰物效应与站点身份能否分开

推荐优先级:高 · 参赛子类:Animal Sciences — Ecology · 资源需求:一台笔记本,零器材成本,全部使用公开声学档案 · 技能取向:混合效应模型 / 方差分解 / 标注信度

1 · 研究问题

当每一个污染等级只对应一个地理站点时,"高 EDC 水平与攻击性叫声下降 28.62% 相关"这句话里有多少可能只是站点本身的差异?在同一污染等级内取多个站点、把站点作为随机效应之后,处理变量的固定效应还剩多少;而叫声类型的标注者间一致性(Fleiss' kappa)又是多少?

2 · 研究背景与空白

背景。 声学监测把动物的叫声当作行为状态的非侵入代理:录音 → 生成声谱图 → 把每一段叫声归到某个类型 → 用各类型的比例推断行为(例如攻击性叫声比例下降 = 攻击行为下降)。这条链路有两个几乎从不被检验的环节。第一是伪重复(pseudoreplication)。 生态学里最经典的统计陷阱:当"处理水平"与"地点"完全一一对应时,处理效应与地点效应在数学上不可分离——你无法知道两地的差异是因为处理变量不同,还是因为纬度、猎物组成、人类干扰、录音设备位置、甚至录音机型号不同。正确的做法是在同一处理水平内取多个独立地点,把地点作为随机效应,看固定效应还剩多少;若做不到,至少要显式给出方差分解,说明地点层面的方差有多大。第二是标注信度。 叫声类型的归类由人主观完成,若不同标注者对同一段声谱图给出不同类型,那么"攻击性叫声比例"这个量本身就带着一个未知大小的噪声,任何基于它的百分比变化都必须先扣掉这个噪声。

已有工作到哪一步。 ANIM040(2025,Special Award,"The Effect of Chemicals on Otter Social Behaviors")用北美河獭的叫声作为行为代理,检验内分泌干扰物(EDCs)的影响。摘要原文:"Camera trap footage was obtained at three sites across America containing varying EDC levels–Alaska, California, and New York",用软件生成声谱图并归类为对应行为状态的叫声类型,结果为高 EDC 水平"associated with a 28.62% decrease in aggressive calls (**p≤0.01)",并报告某些与交配行为相关的叫声类型完全消失。

空白在于三个站点同时就是全部三个处理水平,n = 3 且完全混杂——阿拉斯加、加州、纽约之间不同的绝不只是 EDC 水平;而摘要里没有任何标注一致性数据。 这个空白适合一年期学生课题的理由极其硬:它的核心问题(伪重复 + 标注信度)与物种无关,可以整体搬到任何有公开多站点声学档案的类群——鸟鸣、蝙蝠、蛙鸣都有成熟的公开数据库;用公开数据即触发规则的明文豁免("仅使用来自同行评审出版物或公共数据库的数据/图像"无需 SRC 事前批准),因此零合规、零器材、零时间风险;而且结论正负都成立——方差分解显示站点方差占大头,说明这一整类单站点对应单处理水平的设计不可信;占小头,则说明处理效应稳健。这是本类目性价比最高的一条。

3 · 可检验假设

H1 在同一处理水平内取 ≥ 3 个独立站点并把站点作为随机效应后,站点层面的方差占总方差的比例 ≥ 40%,且处理变量的固定效应显著性相对"把站点当处理水平"的朴素模型下降至少一个数量级(例如从 p ≤ 0.01 退到 p > 0.05)。判据明确:同一份数据分别跑朴素模型与混合效应模型,两套结果直接并列。

H2(机制假设,H1 被否证时仍有内容)叫声类型标注的 Fleiss' kappa < 0.6;据此,把标注噪声代入蒙特卡洛模拟后,能被可靠检出的最小"某类型叫声比例变化"大于 28.62 个百分点的一半——也就是说,即便处理效应真实存在,现有标注精度也支撑不了这个量级的定量声称。这一条只依赖标注实验,与站点结构无关。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关不许往下做,后续全部结论无效)。已知答案的正对照验证整条统计管线:生成一批模拟数据集,其中真实的处理效应被设为已知值(含"真实效应为零但站点间存在差异"这一关键情形),把这些数据喂进本课题的朴素模型与混合效应模型,要求:① 混合效应模型在"真实效应为零"的模拟上,假阳性率 ≤ 0.10;② 朴素模型在同一批模拟上表现出明显更高的假阳性率——这一对照本身就是本课题最核心的证据这一步不过不许继续——若你的模型代码在已知答案的数据上就给错结果,后面所有真实数据的结论都是在测你的 bug。
  2. 统计口径预先写死——录音片段是技术重复、站点是生物学/空间重复,只有站点进随机效应的 n。 同一站点、同一夜的多段录音不是独立观测(同一批个体、同一天气、同一设备),n 必须以站点计,片段作为嵌套层。报告必须写全三个数:"n = X 个站点 / 每站点 Y 段录音 / 共 Z 次叫声事件"。同时必须显式报告设备型号与录音参数在站点间是否一致——不一致本身就是一个混杂项。
  3. 统计口径预先写死——标注必须盲法且预先定死一致性指标。 ≥ 3 位标注者对同一批 ≥ 300 段声谱图独立分类,文件名随机码化、顺序随机、标注者不知该段来自哪个站点或哪个处理水平;报告 Fleiss' kappa(多标注者)与逐类别的 Cohen's kappa;kappa < 0.6 的叫声类别一律从主分析中剔除,剔除规则开测前写死。
  4. 模型与比较口径预先写死。 混合效应模型的固定效应项、随机效应结构(站点截距 or 站点截距 + 斜率)、是否纳入协变量(纬度、季节、设备)在开始分析前一次定死并写入研究计划;必须同时报告"朴素模型 vs 混合效应模型"的完整对照表,量化朴素做法的偏差幅度——这张表是主结论的载体。
  5. 数据量下限。 处理水平 ≥ 2 级,每级 ≥ 3 个独立站点(这是 H1 能被检验的最低配置,少于 3 个站点就复制了前作的缺陷);每站点 ≥ 100 段可用录音;标注实验 ≥ 300 段 × 3 人
  6. 可复现性。 全部数据获取脚本(含数据集版本号与下载日期)、随机码对照表、逐段标注记录、模拟数据生成脚本、混合效应模型脚本一律开源存档,第三方可一键重跑。公开数据库是活数据,必须记录下载日期并冻结快照,否则数字随数据库更新而变,前后分析对不上。

5 · 数据与工具

用途 来源 / 工具
声学档案 公开的多站点生物声学数据库(鸟鸣、蝙蝠、蛙鸣等类群均有成熟的公开档案)。须核实:所选库是否提供站点标识、录音设备信息与足以定义"处理水平"的环境协变量;许可证是否允许再分发派生数据;是否可批量下载
处理变量(环境协变量) 公开环境数据(水质/污染物监测、土地利用、城市化指数等)按站点坐标匹配。须核实空间与时间分辨率是否足以与录音站点对齐——这是本课题最关键的一项核实,若匹配精度太粗,处理水平的划分本身就不成立
声谱图生成 开源音频处理库(librosa 一类)。须核实所用窗长、跳步与频率范围,并在脚本中写死——参数不同声谱图外观差别很大,会直接影响标注
标注 3 位同学独立盲标;用随机码重命名的图片集 + 简单表单即可
统计 R(lme4/glmmTMB 做混合效应模型,irr 做 Fleiss' kappa)或 Python(statsmodelspingouin)。混合效应模型的收敛失败是静默陷阱,须逐个检查收敛诊断
计算环境 纯 CPU 笔记本。音频数据可能达 GB 级,须核实存储与带宽是否够,并优先下载已提取的特征或低采样率版本
对照基准(仅用于校验与对比,不计入本项目的数据贡献 ANIM040(2025,Special Award)摘要中的三站点设计(Alaska / California / New York)与 28.62% 攻击性叫声下降(**p≤0.01);用作"这类设计长什么样"的对照靶,其任何数字不得写成本项目结果
须核实项 ① 所选数据库能否满足"同一处理水平 ≥ 3 个独立站点"——这是全课题的先决条件,必须在开题前确认,不能边做边发现;② 环境协变量与录音站点的空间匹配精度;③ 数据库许可证;④ 能否招募到 3 位愿意各标 300 段的同学
不可用路径(已排除) 自己去野外布设录音设备——净窗口 3–4 个月覆盖不了多站点长期录音,且野外作业涉及场地与法规。复制水獭这一物种——公开的多站点水獭声学档案很可能不存在,且相机陷阱录音的获取依赖特定项目准入;本课题的核心问题与物种无关,不必执着

6 · 方法路径

  1. 建体系并完成 §4 第 1 条校验。 搭好数据获取、声谱图生成、混合效应建模、kappa 计算的全套脚本;用已知真值的模拟数据跑通并达到假阳性率要求,同时确认朴素模型在同一批模拟上确实表现更差。这一步不过不许继续——而且它可以在真实数据到手之前就完成,是最该提前做的一步。
  2. 核实工具与数据的能力边界,逐条实测下列静默失败点:伪重复——同一站点的多段录音不独立,若当作独立观测会把有效样本量高估几十倍,模型不报错只是给出极小的 p 值,这正是本课题要量化的对象;② 观察者预期偏差——标注者若知道某段来自"高污染站点",归类会向预期漂移,必须随机码 + 顺序随机 + 盲标;③ 设备与录音参数的批次效应——不同站点若用不同录音机或不同增益,声谱图的外观系统性不同,标注者会无意中"认出站点",这是最隐蔽的一条,必须实测检验标注者能否仅凭声谱图猜出站点;④ 检测限以下的删失被当成 0——弱信号叫声在噪声大的站点检不出,记为"该类型 0 次"会把站点差异读成行为差异,必须显式区分"未检出"与"确实没有",并报告各站点的背景噪声水平;⑤ 混合效应模型的静默不收敛——lme4 一类工具在随机效应结构过于复杂时会给出收敛警告甚至无声地退化,必须逐个检查收敛诊断与随机效应方差是否被估到边界(0)
  3. 选定数据库并冻结快照。 一次性下载全部所需数据并记录下载日期与数据集版本;这是最该尽早完成的一步——它把"数据拿不到"这一类中途崩盘风险彻底消除。
  4. 构建站点—处理水平映射并做设计核查。 确认每个处理水平确实有 ≥ 3 个独立站点,并逐一检查站点之间是否存在其他系统性差异(纬度、季节覆盖、设备)。若发现某处理水平只剩 1–2 个站点,必须在此处停下来调整数据集或处理水平的划分,而不是硬着头皮往下跑。
  5. 完成盲法标注实验并算 kappa。 ≥ 300 段 × ≥ 3 人,按预定规则剔除不达标类别。涉及主观判断的每一处(类别定义、边界情形、无法判定时的处理)须给出明确、可复现的判据并写入标注手册,手册随数据公开。
  6. 跑朴素模型与混合效应模型,出方差分解与对照表。 报告站点层面方差占比、固定效应的两套估计与显著性、以及朴素做法的高估幅度。
  7. 独立交叉校验:用另一种方法算同一个量。 用完全不同的统计路径重估同一结论——例如站点层面的置换检验(把处理标签在站点之间随机重排若干次,看观测到的效应在零分布中的位置)。置换检验不依赖混合效应模型的分布假设,两条路径若一致,H1 的结论才站得住;若不一致,说明模型假设被违反,须查清再下结论。

7 · 新颖性边界

本课题不声称: - 不声称首次用声学监测研究污染物对动物行为的影响。ANIM040(2025,Special Award)已在河獭上做过并获奖。 - 不声称发现"高 EDC 水平与攻击性叫声下降相关"。 这是 ANIM040 的结论(28.62% 下降,**p≤0.01),本项目不研究水獭、不接触其数据,不得写成自己的发现。 - 不声称 ANIM040 的结论是错的。 本课题不复现它的数据,无法对它的具体结果下判断;本课题给出的是"当处理水平与站点一一对应时,这类推断会被高估多少"的一般性证据。这个区分必须在展板上写清楚,否则会被读成越权指控。 - 不对内分泌干扰物的生态风险或人类健康做任何声称。 - 不提出新的统计方法。混合效应模型、方差分解、Fleiss' kappa、置换检验全部是既有工具。

已有工作做到哪: ANIM040(2025,Special Award)在三个美国站点(Alaska、California、New York)获取相机陷阱素材,用软件生成声谱图并按叫声类型分类,报告高 EDC 水平与攻击性叫声下降 28.62% 相关(**p≤0.01),并观察到部分与交配行为相关的叫声完全消失。它未报告标注者间一致性,也未处理"三个站点即三个处理水平"的混杂结构。

本项目的贡献(属「评价维度转换」型): 已有工作评估的是处理变量与行为代理量之间是否存在相关;本项目评估的是在这类设计下,观测到的相关里有多少可以被空间/站点差异解释,以及标注噪声给定量声称设定了什么精度上限。这是主结论,交付物就是那张朴素/混合效应对照表、那个站点方差占比与那个 Fleiss' kappa。

为什么有价值: 公开声学档案 + 环境协变量这条路线正在快速普及,而"每个处理水平一个站点"是其中最常见的设计;给出一个具体的高估幅度与一条可操作的最低站点数判据,比再做一次单站点研究有用得多。

为什么它同时是低风险的: 全部使用公开数据库数据,触发规则的明文豁免,无需任何生物学审批,也不存在动物、季节或场地风险。

若结论不显著: 若站点方差占比小、两套模型给出一致结论,H1 被否证——"这类设计比想象的稳健"同样是有效结论,它给出的是这条路线的可用性证据。但必须给出误差棒证明有能力分辨这个差异:站点方差占比的置信区间若宽到跨越 10% 与 60%,那叫站点数不足,不叫"站点效应小"。

8 · 决策门槛(go / no-go)

🔴 条件 1(第 4 周末,即 2026 年 9 月初):确认所选公开数据库能提供"每个处理水平 ≥ 3 个独立站点"。 这是全课题的先决条件。若做不到,立即降级: 降级路径是把处理水平的定义换成一个数据更充足的环境梯度(例如城市化程度、道路距离、土地覆盖类型——这些协变量在公开数据里几乎总能凑到足够站点),主结论框架(处理效应里有多少是站点差异)完全保留,只是换了处理变量。若连这也不行,最后的兜底是把课题收缩为纯粹的 H2 路线——标注信度与它给定量声称设定的精度上限,这条只需要一批公开声谱图与 3 位标注者,不依赖任何站点结构。这两级降级都不是换课题。

🟡 条件 2(第 8 周末,即 2026 年 9 月底):标注实验完成,Fleiss' kappa 已出。 若 kappa 低到大部分类别都被剔除,立即降级: 把叫声类别合并到更粗的层级(例如只分"攻击性 / 非攻击性"两类),并把"类别粒度与一致性的权衡曲线"提升为主要交付物之一——这本身就是对这类研究极有用的结论:越细的分类越不可靠,那么细分类支撑的百分比声称就越可疑。主结论框架保留。

⚠️ 与「附属赛后不得修改」的冲突点: 五件事一旦在附属赛后想改就不被允许——① 处理水平的划分规则(阈值取在哪);② 混合效应模型的随机效应结构;③ 协变量清单;④ kappa < 0.6 剔除类别这条阈值;⑤ 叫声类别的定义与合并规则。必须在 11 月底前定死并写入研究计划,因为每一项都能改变站点方差占比这个主结论数字。尤其注意:本课题是纯数据分析,重跑成本几乎为零,因此"想改口径"的诱惑最大,必须靠预先写死来防住自己。

须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,"未找到前作"不等于"不存在前作"。 伪重复是生态学中被讨论了几十年的经典问题(Hurlbert 之后有大量文献),几乎可以肯定存在方法学前作。学生必须在开题前自行补检索,并在研究计划与展板上主动列出:本课题不是提出"伪重复是个问题"这一认识,而是在一个具体的、正在被学生反复重复的设计上量化它的幅度。 这个定位必须写清楚——评委自己发现而学生没提,项目直接出局。 - 公开数据库的许可证与再分发条款。必须在下载前确认,否则开源存档派生数据可能违约。 - 环境协变量与录音站点的匹配精度。必须实测检查,不能假定坐标对得上。

已知困难及其定位: 最大的困难是"找到一个同时具备多站点、有站点标识、且能匹配到环境协变量的公开声学档案"。这个困难本身就是研究内容的一部分——数据可得性正是前作只能用三个站点的原因;本课题把"要多少个站点才够"当作要回答的问题,而不是绕开的障碍。

选择前提: 适合统计基础扎实、能接受"主结论是一个方法学否定结果"、且不需要动手实验的学生。不适合想做实验装置或接触活体动物的学生——本课题从头到尾只有一台笔记本;也不适合无法组织同学参与标注的学生。但它的另一面是:零成本、零合规、数据几天就能全部落盘,是本类目里中途崩盘风险最低的一条。

预算裁剪顺序: 零预算,无可裁。时间不足时的裁剪顺序为:先砍第 7 步(置换检验交叉校验),再把标注段数从 300 减到 200(不得少于 150,否则 kappa 的置信区间无法解读),再把站点数从每水平 ≥ 3 降到 ≥ 3 但减少每站点录音量。不可砍的是"每处理水平 ≥ 3 个站点"这条——砍掉它就复制了前作的缺陷,整条课题失去意义。

合规与表格: - 本课题的最大优势是合规成本近乎为零。 规则明文豁免"仅使用来自同行评审出版物或公共数据库的数据/图像",无需 SRC 事前批准;人类受试者豁免第 2 类同样覆盖"数据/档案回顾研究,数据来自公开可得和/或已发表的既有数据集,且不涉及与人的任何互动"。因此不触发 IRB。 - 不触发脊椎动物规则。 本课题不接触任何活体动物、不操纵任何动物环境、不采集任何新数据。规则中"不得死亡、不得超过瞬时或轻微疼痛、毒性研究全面禁止、体重下降上限 15%、斑马鱼 7 dpf 起即算脊椎动物、头足类按脊椎动物对待"这一整套限制全部与本课题无关——这正是选择公开数据路线的核心理由。需要提醒的是:脊椎动物的观察豁免要求"与动物无互动、不以任何方式操纵动物环境",给动物食物就已经算互动;本课题连观察都不亲自做,因此连这条豁免都用不上,直接落在公开数据豁免里。 - 不触发 PHBA。 无微生物、无 rDNA、无组织、无体液。家中禁止培养任何潜在危险生物制剂(规则点名连 BSL-1 与 C. elegans 都不行)与本课题无关。因此不需要在时间线里扣除 PHBA 的 2–6 周 SRC 事前审批——这是本条净窗口最完整的原因,3–4 个月可以全部用于分析。 - 抗生素耐药性研究基本封死、朊病毒样蛋白全面禁止——本课题均不涉及。 - 人类受试者: 只要不向任何人采集数据,就不触发。注意标注者(3 位同学)是研究协作者而非受试者——你分析的是声谱图的属性,不是同学的属性;但若把"标注者之间的分歧模式"本身当作研究对象去分析同学的认知特征,就会滑向人类受试者研究,须避免这种表述。若确有必要,则 IRB 必须在招募动作之前批准,且 2027 版一律禁止向受试者反馈数据或给出建议。 - 须填表格: Form 1、Form 1A(含研究计划,第 10 题的 Source of Data 须如实选择 "publicly available")、Form 1B、Form 2A(2027 新增,所有项目必填)、Abstract(实验后)。通常不需要 Form 3(无危险化学品、活动或装置),但若附属赛 SRC 另有要求则以其为准。若在大学场所或接受远程指导,追加 Form 2C(须在展台竖立展示);若有导师实质参与建模,追加 Form 2B(Qualified Scientist,注意新增的"支持时长"提问)。 - 展台: 禁活体、液体(含水)、土壤、玻璃、活跃网络连接。本课题展台全是图表:方差分解图、朴素/混合效应对照表、Fleiss' kappa 矩阵、置换检验的零分布图、站点地图与声谱图样例。选这条就要接受展板没有任何实物。 - AI 政策: 不得用生成式 AI 撰写研究计划、摘要、展板或生成引文;数据获取与统计脚本若由 AI 生成,须显式引用并保留提示词日志。本课题几乎全是代码,这一条务必从第一天就开始记。

评分: O=8, W=8, F=8, S=6, Fit=8 → base=77.2,h=5 → [72, 82],置信度:高