ISEF Topic Scoping 2027

P769–87

5 重复 × 10 粒的标准设计能查出多大的效应:种子批次异质性的方差分解

推荐优先级:中 · 参赛子类:Plant Sciences — Growth and Development · 资源需求:培养皿 + 温湿度记录仪阵列 + 种子,百元级;几乎零合规 · 技能取向:嵌套方差分解 / 功效分析 / 实验设计

1 · 研究问题

在一个典型的"5 个重复 × 每皿 10 粒"萌发实验里,观测到的变异有多少来自处理、多少来自种子批次、多少来自培养皿在培养箱里的位置?这个被整个类目默认使用的标准设计,其最小可检出效应(MDE)究竟是多大?

2 · 研究背景与空白

背景。 "5 个重复、每皿 10 粒"是萌发实验里近乎默认的设计,但它包含一个从未被言明的统计假设:5 个培养皿之间的差异,全部来自处理与随机误差。 现实中至少还有两个方差来源被折叠进了"随机误差"里。第一是种子批次异质性:同一物种不同批号的基础萌发率可以差 30 个百分点,且部分批次带有二次休眠,表现为整批延迟;即使同一批号,不同种子的成熟度与储藏历史也不一致。第二是培养箱内的位置效应:培养箱不是等温箱,靠近门、靠近加热元件、靠近风扇的位置可以与中心相差 1–2 °C,湿度差异更大;萌发速率对温度高度敏感,1 °C 足以改变第 5 天的萌发率数个百分点。这两个方差来源与处理效应在统计上是竞争关系——它们越大,同样的 n 能检出的处理效应就越大。 而没有做过方差分解的实验,无法知道自己的 MDE 是多少,因此也无法解释一个不显著的结果到底意味着"没有效应"还是"没有能力看到效应"。

已有工作到哪一步。 PLNT051(2026,Special Award,"Priming for Success") 摘要原文:"Each hormonal treatment group had 5 replicates under 3 saline conditions... In each replicate, ten primed seeds were placed in a petri"、"each of the 900 seedlings were measured for hypocotyl length"、"Priming seeds with some hormones did enhance percent germination early on while other hormone treatments did not"。"有些激素有效、有些无效"这种结论,在没有报告功效的前提下,与"全部无效但有随机波动"在数据上是分不开的——这正是需要 MDE 的场合。 该项目规模不小(900 株幼苗、5 种激素 × 3 个盐度),也给出了具体结论("The seeds in the ascorbic acid treatment group had the best percent germination rates under low saline conditions"),但没有任何方差分解或功效报告。同类设计也见于 PLNT038T(2025,Grand Award)PLNT055(2025,Special Award)——后者虽然用了 GLM 与 ANOVA 并逐项给出 p 值(如 "germination proportion (p = 1.02e-7)"、"no significant difference was found between leachate types... with all p-values exceeding 0.15"),但那个"无显著差异"的结论同样没有配套的功效说明

空白在于整个 PLNT 语料里没有任何一个项目报告过萌发实验的方差分量或最小可检出效应,因此该类目全部"无显著差异"的结论,其可解释性都是未知的。这个空白适合一年期学生课题的理由:它只需要培养皿、种子与温湿度记录仪,成本百元级;纯对照实验 10 天一轮,可跑三到四轮;而且结论正负都成立——方差分量大则说明标准设计功效不足(一个能改变整类课题设计的结论),方差分量小则为标准设计提供辩护。

3 · 可检验假设

H1 在完全同处理的纯对照实验中,批次层与培养箱位置层的方差分量之和占总方差的比例 ≥ 30%;据此计算的"5 重复 × 10 粒"设计在 α = 0.05、功效 0.8 下的最小可检出萌发率差异 ≥ 15 个百分点。判据来源:若位置层温差达 1–2 °C,而萌发率对温度的响应在适温区约为每 °C 数个百分点,仅此一项就可贡献可观的皿间方差;再叠加批次异质性,30% 是一个保守下界。

H2(机制假设,H1 被否证时仍有内容)位置效应的空间结构不是随机的而是有梯度的:培养箱内的萌发率与实测温度呈显著正相关(回归斜率置信区间不含零),且该梯度可用一个简单的空间协变量(到箱门距离或到风扇距离)解释 ≥ 50% 的位置层方差。若 H2 成立,本课题就同时给出了补救方案——不必增加重复数,只需随机化皿位或把位置作为区组因子,即可回收大部分功效损失。这比单纯指出问题有用得多。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 温湿度记录仪阵列必须先互相校验:把全部记录仪(≥ 8 支)在同一位置、同一环境下同步记录 ≥ 2 小时,两两读数差的绝对值须 ≤ 0.3 °C,超出者剔除或做逐支偏差校正;同时用冰水混合物(0 °C)与室温标准温度计做单点校验,偏差 ≤ 0.5 °C。这一步不过关不许往下做,后续全部结论无效——本课题的核心主张之一是"位置温差有多大",记录仪之间本身就差 1 °C 的话,测到的"位置效应"全是仪器噪声。
  2. 统计口径预先写死——三层嵌套必须显式分开,生物学重复与技术重复分开计数。 方差分解模型为 萌发结局 ~ 1 + (1|批次) + (1|培养箱位置) + (1|皿)种子嵌套于皿、皿嵌套于位置与批次实验单元是培养皿,皿内 10 粒种子是技术重复,n 只计皿数;但本课题罕见地也需要逐粒数据,因为皿内方差是要估计的对象之一,因此原始记录必须逐粒而非逐皿汇总。论文正文必须显式写出"n(批次)= A,n(位置)= B,n(皿)= C,n(种子)= D"四个数。
  3. 统计口径预先写死——萌发数据用 GLMM,绝不用 t 检验或直接 ANOVA。 萌发是二项结局(萌发/未萌发),用二项族广义线性混合模型(logit 链接)估计方差分量;萌发时间是删失数据(未萌发种子在观测终点右删失),用生存分析(Cox 混合效应模型或 Kaplan-Meier + frailty)而非直接比较均值。明确写明不用 t 检验及其原因:t 检验假设正态与等方差,对比例数据在接近边界时严重失效,且完全无法给出方差分量。 方差分量的置信区间用参数化自助抽样(≥ 1000 次)。
  4. 纯对照的规模下限。 批次 ≥ 3 个(不同批号或不同购买日期),培养箱位置 ≥ 8 个(覆盖上/中/下层 × 前/后/左/右),每位置每批次 ≥ 2 皿,每皿 ≥ 10 粒。总皿数 ≥ 48。 每个位置必须有一支同步记录的温湿度记录仪。
  5. 交付一张可复用的功效查表与一张位置效应热图。 查表:给定期望效应量(5 / 10 / 15 / 20 / 30 个百分点)→ 在 α = 0.05、功效 0.8 下所需的皿数,分"位置随机化"与"位置不随机化"两栏。热图:培养箱各位置的实测温度与实测萌发率并排。这两张图是本课题的主交付物,必须在开题时就写死其形式。
  6. 可复现性。 逐粒逐日萌发记录、逐位置温湿度时序、批次与位置的编码表、GLMM 与功效计算脚本全部开源存档,第三方可一键重跑得到相同的方差分量与查表。

5 · 数据与工具

用途 来源 / 工具
温湿度记录 独立记录仪 ≥ 8 支(每个培养箱位置一支)。须核实:所选记录仪的标称精度、分辨率与采样间隔;廉价 DHT22 类模块的温度精度约 ±0.5 °C,可能不足以分辨 1 °C 的位置差,须核实是否需要换用更高精度型号。原文无型号与价格,一律写"需核实"
受试种子 生菜、黑麦草或萝卜等快萌发物种,须准备 ≥ 3 个不同批号须核实:能否买到 3 个可区分批号的同物种种子——这是本课题的前提,若只能买到同一批号则批次层无法估计,见 §8 条件 2
培养容器 标准培养皿 + 滤纸,≥ 48 套
培养箱 学校生物实验室的恒温培养箱,或自建(保温箱 + 加热片 + 温控器)。自建培养箱反而更好——它的位置效应更大更容易测到,且完全自主可控
图像记录 平板扫描仪或固定支架相机(光照一致性优先选扫描仪),每张照片含标尺与皿号
对照基准(仅用于校验与对比,不计入本项目的数据贡献 PLNT051(2026)的 5 重复 × 10 粒 × 3 盐度设计;PLNT038T(2025)与 PLNT055(2025)的同类设计
统计 R + lme4/glmmTMB(GLMM 与方差分量)、simr(基于模拟的功效分析)、coxme(生存分析)。纯 CPU
须核实项 培养箱的可得性与独占性——本课题需要培养箱在整个实验期内被本项目独占(其他人开门取物会破坏温度场)。须在开题前与实验室确认;若无法独占,自建保温箱是更稳妥的选择

6 · 方法路径

  1. 建体系 + 跑通已知对照 + 完成 §4 第 1 条的校验。 完成记录仪的两两一致性校验(≤ 0.3 °C)与冰点单点校验;同时跑一轮预实验,确认所用种子在标准条件下的萌发率落在 70%–95% 区间。萌发率不得太高或太低——接近 100% 或接近 0% 时二项方差被压缩,方差分量估计不可靠。这一步不过不许继续。
  2. 核实工具与生物材料的能力边界。 这个方向有四个不报错但给错结果的静默失败点,必须逐一实测排除:(a)培养皿位置效应与培养箱内温度梯度——这是本课题的研究对象,但也意味着若记录仪精度不足,测到的梯度全是噪声;(b)种子批次异质性与休眠状态差异——某一批次若带二次休眠,其萌发曲线形状与其他批次不同,这会被方差分解错算成"批次方差大",必须同时报告各批次的萌发时间分布而非只报终点率;(c)真菌污染被当成萌发失败——霉变种子不萌发,若不逐粒记录污染状态,污染的空间聚集性(通常在湿度高的位置)会被错算成位置效应;(d)检测限以下的删失读数被记成 0——观测终点仍未萌发的种子是右删失而非"萌发时间 = ∞",直接按 0 或按终点值处理都会扭曲生存分析。
  3. 冻结设计矩阵并写入研究计划。 3 批次 × 8 位置 × 2 皿 × 10 粒的完整矩阵、位置编码方案、观测天数(10 天)一次定死。位置编码必须记录物理坐标(层、前后、左右)而非只记编号,否则 H2 的空间协变量无法构造。
  4. 跑纯对照实验并同步记录温湿度。 全部 48+ 皿处理完全相同(同一浸润液、同一体积、同一物种),逐日扫描 + 逐粒判读,温湿度记录仪全程记录。"算不算萌发"须给出明确、可复现的判据:预先定义为胚根突破种皮且长度 ≥ 2 mm,与 P1 保持一致以便合并。
  5. 拟合 GLMM 并做方差分解。 报告三层方差分量及其自助抽样置信区间,以及各层占总方差的比例。
  6. 做基于模拟的功效分析并产出查表。 用估得的方差分量做参数化模拟(simr 或自写),在不同效应量与不同皿数下重复模拟 ≥ 1000 次,统计检出比例,产出功效查表。分"位置随机化"与"位置固定"两栏——这个对照直接量化了随机化能回收多少功效。
  7. 独立交叉校验。 用另一种方法算同一个量:把纯对照数据随机分成两组假处理组(实际处理完全相同),重复 ≥ 1000 次,统计"假阳性率"——理论上应等于 α = 0.05。若实测假阳性率显著高于 5%,那就直接证明了标准分析方法在存在未建模的位置/批次结构时会产生过多假阳性,这是本课题最有冲击力的一张图,且它完全不依赖方差分量估计的准确性。

7 · 新颖性边界

本课题不声称: - 不声称首次提出实验设计需要功效分析。这是统计学的基础常识,在临床试验与农业田间试验中功效分析是强制项,学生必须主动引用而非当作发现。 - 不声称 PLNT051(2026,Special Award)PLNT038T(2025,Grand Award)PLNT055(2025,Special Award) 的结论是错的。本课题没有它们的原始数据,也不复现其实验;本课题只在自己的纯对照实验上估计该类设计的方差结构与 MDE。这个区分必须在展板上明写,否则会被读成对具体项目的指控。 - 不声称提出新的实验设计方法。区组化与随机化是农业统计里的标准手段,本课题只是把它们的收益量化到这个具体场景。 - 不声称结果可外推到本课题未测试的物种、培养箱型号或培养条件。方差分量是设备与材料特异的,须在局限性中显式声明。

已有工作做到哪: PLNT051 用 5 重复 × 10 粒 × 3 盐度的设计测了 900 株幼苗并给出激素间的优劣结论;PLNT055 用 GLM + ANOVA 逐项报告 p 值,包括一个"三种浸出液来源无显著差异(p > 0.15)"的阴性结论。没有任何一个报告过方差分量、功效或最小可检出效应。

本项目的贡献(属「方法可复现性贡献」型): 已有工作评估的是某个处理是否有效;本项目评估的是这个类目通用的实验设计能看见多大的效应,以及看不见的部分被什么占据了,交付物是一张可直接查用的功效表与一张位置效应热图。这是主结论,不是附加内容。这类贡献在实验设计领域是被承认的,但定位必须讲清楚,否则会被误读为"什么都没做的空白实验"。

为什么有价值: 萌发实验是 PLNT 类目里出现频率最高的实验形态,而它的功效从未被标定。一个"无显著差异"的结论,在不知道 MDE 的情况下是无法解释的。若结论是"标准设计的 MDE ≥ 15 个百分点",那么此后所有报告小效应的萌发项目都必须先证明自己有能力看到它——这是一条能直接改变整类课题设计的操作要求。

若结论不显著: 若批次与位置方差分量之和不足 30%、H1 被否证——"标准设计的功效是够的"同样是有效结论(这是对整个类目通用做法的一次难得辩护),但必须给出误差棒证明有能力分辨这个差异:具体地,必须报告方差分量估计的置信区间宽度,并证明其上界确实低于 30%,否则"没测到大方差"只是因为批次数或位置数不足。

8 · 决策门槛(go / no-go)

🟡 条件 1(第 4 周末,即 2026 年 9 月初):温湿度记录仪两两一致性必须 ≤ 0.3 °C。 若达不到,立即降级:放弃"温度是位置效应的机制"这一主张(H2 的一半),改做「纯位置区组」路径——不再声称位置效应由温差驱动,只把位置作为一个无标签的区组因子估计其方差分量。主结论框架完全保留(仍是三层方差分解与 MDE 查表),只是失去 H2 的机制解释,须在局限性中声明"位置效应的物理成因未被确定"。

🟡 条件 2(第 6 周末,即 2026 年 9 月中旬):必须取得 ≥ 3 个可区分批号的同物种种子。 若只能买到同一批号,立即降级:把"批次"层替换为「储藏处理」层——把同一批号的种子人为分成 3 组,分别施加不同的储藏条件(室温 / 冷藏 / 短期高湿),人工制造批次异质性。主结论框架保留(仍是三层嵌套方差分解),且这条路径的额外好处是异质性来源已知、可控,反而更容易解释。须在结论中显式声明这是人工制造的批次效应,其量级不一定代表真实市售批次差异。

🟡 条件 3(第 8 周末,即 2026 年 10 月初):培养箱必须能被本项目独占。 若他人频繁开门破坏温度场,位置效应会混入不可控的时间噪声。立即降级:改用自建保温箱(泡沫箱 + 加热片 + 温控器 + 小风扇,成本百元内),完全自主可控且位置梯度更明显、更容易测到。主结论框架不变,但须在局限性中声明自建箱的梯度可能大于商用培养箱,MDE 查表的外推需谨慎。

⚠️ 与「附属赛后不得修改」的冲突点: 四件事必须在 2026 年 11 月底前定死:(1)萌发判据(胚根 ≥ 2 mm);(2)三层嵌套模型的结构(哪些是随机效应、嵌套关系如何);(3)位置编码方案与空间协变量的定义;(4)功效查表的效应量档位与 α、功效目标值。事后改模型结构等于事后改方差分量,附属赛后一律不被允许。

须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,「未找到前作」不等于「不存在前作」。 培养箱位置效应与种子批次异质性在种子科学与农业统计文献中很可能早有系统研究(重点查 Seed Science and TechnologyCrop Science 与 ISTA 规程)。学生必须在开题前查清并主动引用,新颖性主张须严格限定为"该分解未见于 ISEF 语料的学生项目实践"。 - 3 个可区分批号的种子必须在 9 月中旬前落实采购,这是本课题的前提。 - 温湿度记录仪的实际精度须在采购前核实——标称与实测常常不一致。 - 培养箱的独占性须在开题前与实验室书面确认。

已知困难及其定位: "纯对照实验听起来像什么都没做"是本课题最大的答辩风险。应对方式已写进设计:交付物不是实验本身,而是一张可复用的功效查表与一张位置效应热图(§4 第 5 条),加上 §6 第 7 步那张假阳性率图——那张图不依赖任何方差分量估计,它直接展示"完全相同的处理之间也能测出显著差异",视觉与逻辑冲击力都很强。 位置效应热图本身在展台上也很好看。另一个困难——方差分量的估计精度——本身就是研究内容,因为课题问的正是这些方差有多大。

选择前提: 适合能忍受"整个实验里没有任何一个处理组"这种反直觉设计、且愿意学会 GLMM 与基于模拟的功效分析的学生。不适合希望"发现某个处理有效"的学生——本课题从头到尾不设处理。

预算裁剪顺序: 总成本百元级。时间不足时的裁剪顺序:先砍批次从 3 个减到 2 个(2 是估计批次方差的绝对下限,且置信区间会很宽,须显式声明),再砍位置从 8 个减到 6 个,再砍重复轮次从 3 轮减到 2 轮。温湿度记录仪的数量永远不砍——每个位置必须有一支,否则 H2 完全无法检验。 砍到最后主结论框架仍完整保留。

合规与表格: 植物组织与种子豁免 SRC 事前审批,本课题合规负担极低。需 Form 1、Form 1A、Form 1BForm 2A(2027 新增学生支持披露表)为强制项。浸润液为纯水时无危险化学品问题,无需 Form 3;若自建保温箱涉及加热片与市电,须在 Form 3 中列明电气安全措施与成人监督。培养皿长时间保湿可能长出环境真菌——这属于意外污染而非有意培养,不构成 PHBA但学生绝不得有意接种或转接任何真菌/细菌,那会立即触发 PHBA:家中一律禁止,须实体实验室 + 受训监督人 + Form 6A + SRC 事前审批(额外 2–6 周)。本设计不接种任何微生物。 不涉及 rDNA、脊椎动物、人类受试者、非本地物种引入。AI 政策:研究计划、摘要、展板与引文不得由生成式 AI 撰写;GLMM 与功效模拟脚本若由 AI 生成须显式引用并保留提示词日志。展台:培养皿含液体与活体种子,全部不得上台。展位靠位置效应热图(温度 + 萌发率并排)、方差分量堆叠条形图、功效查表与假阳性率模拟图撑住;温湿度记录仪是干燥固体,可以上台。

生长周期时间轴: 2026-08 中旬提交 Form 1/1A/1B/2A(+ Form 3 若自建保温箱)→ 审批 2–4 周(无 PHBA,不需额外 2–6 周)→ 2026-09 初完成记录仪一致性校验与预实验 → 2026-09 中旬第一轮纯对照播种(第 0 天)→ 主结局(逐粒萌发状态与萌发时间)在播种后第 10 天全部到手 → 2026-10 与 2026-11 各跑一轮(换批次组合 / 重复验证)→ 2026-12-15 数据采集截止,留三周做 GLMM 拟合、功效模拟与展板。主结局落在播种后 10 天,距 60 天红线余量极大;三轮重复全部落在窗口内,抗风险能力在本文件中属上游。

评分: O=7, W=8, F=9, S=6, Fit=10 → base=77.8,h=9 → [69, 87],置信度:中