ISEF Topic Scoping 2027

G1471–81

从 p = 0.0906 到"相当":小型水轮机比较该用等效性检验而不是显著性检验

推荐优先级:较高 · 族 B(自建低成本装置 + 统计方法学) · 参赛子类:EGSD(Energy: Sustainable Materials and Design),官方子类划分需核实 · 资源需求:总器材 < ¥800,全部现货一周内,无长周期采购 · 技能取向:装置搭建 / 等效性检验 / 实验设计

1 · 研究问题

当一个比较实验得到 p > 0.05,把它解读成"性能相当"在统计上成立吗?换成等效性检验(two one-sided tests, TOST),需要设定多大的等效界、需要多少次重复,才能真正支持"新设计不劣于工业标准"这个结论?

2 · 研究背景与空白

背景。 常规的显著性检验(null hypothesis significance testing, NHST)把"两者无差异"放在零假设的位置上。它的结论只有两种:拒绝零假设(有差异),或不拒绝零假设。"不拒绝"不等于"接受"——p 大既可能因为真的没差异,也可能因为方差太大或样本太少,两种情形从 p 值上无法区分。等效性检验把逻辑倒过来:先由研究者预先设定一个等效界 ±δ("差多少以内算实用上相当"),然后做两次单侧检验,分别检验"差异 > +δ"和"差异 < −δ",两次都被拒绝才判定等效。关键在于两点:第一,δ 必须来自领域意义而不是数据——看到数据再定 δ 就是在为想要的结论量身定制标准;第二,NHST 与 TOST 对方差的要求方向相反:σ 大容易得到"不显著",σ 小才可能得到"等效"。因此在中等方差下必然存在一片区域,落在里面的实验既不显著、也不等效——它什么都没证明。一个被写成"相当"的 p = 0.0906,典型地就落在这片区域里。

已有工作到哪一步。 EGSD029(2025, Grand Award, "Micro Pumped Hydro-Power System Turbine Assessment") 建了两个约 1550 L 的水箱,比较 Pelton、Cross Flow 与自设计转轮,明确写出 "Although there was no statistically significant difference in Watt hours among the three turbines (p-value=0.0906)",然后紧接着把自设计转轮描述为 "a strong competitor to the other two turbines in terms of efficiency (novel mean=12.63% Peloton=14.39%, Cross Flow=13.64%)"这是教科书式的"把未拒绝零假设当成接受零假设",而且它自己把 p 值原样写了出来,无从辩驳。 更值得注意的是那三个效率数字本身:自设计 12.63% 对 Pelton 14.39%,相对差 12.2%——一个在任何合理等效界下都不小的差距,却被叙述成"相当"。 效率绝对值(12–14%)也偏低,说明测试台损耗占比很大,方差可能很可观。放到赛道层面:EGSD 两届 35 篇获奖摘要里 sensitivity analys 出现 0 次、error bar 0 次、standard deviation 0 次;作为横向参照,同两届四个工程赛道 173 个获奖项目里 error barsensitivity analys 合计 0 次推断方法这一侧,整个工程组都是空的。

空白在于:没有人在这个赛道上做过"同一组数据,NHST 与 TOST 给出什么不同结论"的对照,也没有人给过"小型能源装置比较实验该做多少次重复、等效界该怎么定"的可操作建议。这是一个评价维度转换型的空白——已有工作比的是哪个转轮好,本课题比的是"用什么推断方式才能说它们相当"。它适合一年期学生课题:器材总额不到 ¥800 且全部现货一周内,缩小版闭环测试台一周内可建成;实验时间可压缩(多加一路并行测试或缩短单次放水时长都能换时间);而且结论正负都成立——TOST 与 NHST 结论不一致是结果,一致同样是结果(后者意味着本测试台方差足够小,此时交付物换成 n(δ) 曲线,仍然完整)。

3 · 可检验假设

H1 在本课题自建测试台上,以 ±10%(相对)预先设定的等效界,三种转轮的两两比较(共 3 对)中至少有 1 对出现 TOST 与 NHST 结论不一致的情形——即 NHST 判"无显著差异"而 TOST 判"不能判定等效"。

依据的推算过程:NHST 不显著要求 |Δ| < t·SE;TOST 判等效要求 |Δ| + t·SE < δ。两个条件对 SE 的要求方向相反,因此当 SE 落在区间 [(δ−|Δ|)/t, |Δ|/t] 内时,两个条件同时成立——"既不显著也不等效"的区域是数学上必然存在的,不是罕见情形。 更进一步:若观测到的相对差本身就超过 δ(如 EGSD029 的 12.2% 差超过 ±10% 的界),则 δ − |Δ| < 0,无论重复多少次都不可能判定等效——这是一个不依赖任何数据的结论,本身就构成本课题最锋利的一段论证。H1 的可否证方式很直接:若三对比较的 TOST 与 NHST 结论全部一致,H1 被否证。

H2(备择假设,H1 被否证时仍有内容)若三对比较结论全部一致,说明本测试台的方差远小于 EGSD029 的水平;此时把交付物换成等效界宽度与所需样本量的关系曲线 n(δ):在 ±5%/±10%/±20% 三档等效界下,分别给出以本测试台实测方差判定等效所需的最小重复次数。主结论框架(小型能源装置的比较该用等效性检验,且等效界必须预先定死)完全不变,被牺牲的只是"两种方法结论会打架"这个演示性证据。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 两条并行:(a)电能计量链路——把发电机换成已知阻值的精密电阻,接已知电压的稳压源,验证 INA226 采集经时间积分后得到的 Wh 与解析值(V²/R × t)偏差 ≤ 2%;(b)流量/体积计量——用已知容积的量器在已知时间内放水,核对流量计读数偏差 ≤ 5%这两条不过关,则"效率 = 输出电能/输入水力能"这个分数的分子和分母都不可信,后续所有转轮比较都无意义。 这也是本课题相对 EGSD029 的第一处实质改进:那个项目报了 12–14% 的效率,但没有任何证据说明这个分数的两端是怎么标定的。
  2. 等效界 δ 必须在看到任何转轮数据之前定死,并写入研究计划。 定法(二者取大):(i)两台工业标准转轮(Pelton 与 Cross Flow)之间的实测差;(ii)工程上认为可互换的最小差。理由必须白纸黑字写出来。 看到数据之后再调 δ,是本课题最严重的自我背叛——一旦发生,全部结论作废,且这一条必须写进研究计划让评委看得见。
  3. 两个 n 严格分开,不得混用。 n_run = 同一只转轮在同一工况下的独立放水次数 ≥ 10n_part = 同一设计独立打印/装配的转轮件数 ≥ 3。打印公差引入的件间方差必须与放水重测方差分开报告——层高、打印方向、打印批次逐件记录(与 G6 同源:打印面上的层纹尺度可能与转轮流道特征同量级)。报告中每一根误差棒都必须标注它来自 n_run 还是 n_part。
  4. 同时报 NHST 与 TOST,并画出判定区域图。 以观测差 Δ 为横轴、标准误 SE 为纵轴,画出"显著""等效""既不显著也不等效"三个区域,把本课题的 3 对比较与 EGSD029 的公开数字都标上去。这张图就是本课题的主图,它把一个统计概念变成一眼能看懂的东西。
  5. 工况必须控制并作为协变量。 每次放水记录:初始水位、平均水头、水温、放水时长、环境温度。水箱水位在放水过程中下降会使水头漂移,若不控制,"重复"就不是重复——必须或者用溢流保持恒定水头,或者把每次的平均水头作为协变量纳入模型,两者选一并在开题时定死。
  6. 可复现性。 转轮 STL 与打印参数、测试台设计文件、采集脚本、统计脚本(NHST 与 TOST 两套)、每一次放水的原始时序数据全部开源。每次放水的原始时序是关键——只报均值的数据集无法被别人重做 TOST。

5 · 数据与工具

用途 来源 / 工具
循环水路 水泵约 ¥150、20–60 L 水箱两个约 ¥120,现货。闭环设计使单次放水可控在分钟量级,这是"实验时间可压缩"的来源
转轮 3D 打印 Pelton/冲击式/自设计转轮与壳体,校内打印。打印公差会引入额外方差,必须与 G6 一样记录层高与打印方向,且每种设计打印 ≥ 3 件(n_part)
发电 微型直流发电机约 ¥80,现货
流量测量 流量计约 ¥120。具体型号、量程、起始流量阈值与标称精度需核实——起始流量阈值是本条最重要的静默失败点(见 §6)
电能采集 INA226 + 数据记录,约 ¥100,现货
校验基准(仅用于校验与对比,不计入本项目的数据贡献 已知阻值的精密电阻 + 稳压源(电能链路标定);已知容积的量器(体积/流量标定)
文献对照(仅用于校验与对比,不计入本项目的数据贡献 EGSD029(2025)的 p-value=0.0906novel mean=12.63% Peloton=14.39% Cross Flow=13.64%,以及其约 1550 L 水箱规模

总额 < ¥800,全部现货一周内,无一项采购周期超过 4 周——本条在采购风险上是这五条里最干净的。

须核实而非引用的量:(a)流量计的起始流量阈值与标称精度——低于阈值时它会输出零而不报错;(b)微型直流发电机的负载特性(本课题不做最大功率点跟踪,但必须确认负载在各转轮间完全一致,否则测到的是负载而不是转轮);(c)3D 打印层高与流道特征尺度的比值——这个比值决定打印公差是否与被研究的几何差异同量级,必须在第 2 步实测;(d)水温对粘度与雷诺数的影响幅度,需核实是否在本装置尺度上可忽略。

6 · 方法路径

  1. 搭闭环测试台 + 完成 §4 第 1 条两条标定。 电能链路用精密电阻与稳压源标定到 ≤ 2%,流量/体积链路用已知容积量器标定到 ≤ 5%。这一步不过不许继续——效率分数的两端都不可信时,比三个转轮没有意义。
  2. 核实器材能力边界,逐一排查本方向的静默失败点(这些陷阱全都不报错,只是给错数): - 流量计在低流量下低于起始流量阈值时输出零脉冲——积分出来的输入能量偏低,效率被系统性抬高,且抬高幅度随转轮阻力不同而不同,正好与被比较的量共线; - 水箱水位下降导致水头在单次放水过程中漂移——每次放水的"平均水头"都不同,于是所谓的 10 次重复其实是 10 个不同工况,n_run 是假的; - 发电机负载不匹配使最大功率点漂移——三个转轮的最优转速不同,固定负载下测到的是"负载与转轮的匹配度"而不是转轮效率。必须要么统一负载并明确声明这是比较前提,要么对每个转轮扫负载取峰值,两者选一并写进研究计划; - INA226 采样率低于水流脉动频率——功率脉动被平均掉,输出电能被低估,且脉动越强的转轮被低估越多; - 打印件逐次放水后磨损、吸水膨胀——性能单调漂移,与测试顺序共线,会被完整地记成"设计差异"。必须随机化三种转轮的测试顺序,并把测试序号作为协变量检验。
  3. 在看到任何转轮数据之前定死等效界 δ、n_run、n_part,写入研究计划并请指导老师签字确认日期。 这一步的时间戳本身就是本课题诚信的证据,要在展板上写出来。
  4. 跑满 3 种转轮 × n_part ≥ 3 件 × n_run ≥ 10 次的放水矩阵(共 ≥ 90 次放水),测试顺序随机化,逐次记录全部工况协变量。
  5. 对同一组数据分别做 NHST 与 TOST,产出 §4 第 4 条的判定区域图,并把 EGSD029 的公开数字标进去。
  6. 做 n(δ) 曲线与功效分析。 以本测试台实测方差为输入,给出 ±5%/±10%/±20% 三档等效界下判定等效所需的最小 n_run,并给出通用建议。
  7. 独立交叉校验(用另一种原理测同一个量)。势能账独立估计输入能量:放掉的水的质量 × g × 实测平均水头,与"流量计读数 × 水头 × 时间积分"这条路径的结果对照。两者一致,说明输入端可信;不一致,直接指向第 2 步中的流量计阈值或水头漂移问题。这条校验几乎不花钱——只需要一台秤或一个量器——却能一次性覆盖本课题最大的两个系统误差来源。

7 · 新颖性边界

本课题不声称: - 不声称设计出更好的水轮机。本课题的三种转轮全部是已有构型或简单变体,转轮设计不是贡献所在。 - 不声称首次提出等效性检验。TOST 是一个成熟的、教科书里的方法,把它说成发明会立即失去可信度。本课题的贡献是把它用在这个赛道上,并给出这个赛道的方差数值与 n(δ) 建议。 - 不声称 EGSD029 的效率数字是错的。该项目自己把 p-value=0.0906 与三个效率均值原样写了出来;本课题不复现其 1550 L 规模的装置,也不对其效率数字做真伪判断。本课题针对的是从 p = 0.0906 到"strong competitor"这一步推理,而不是数据。 - 不把缩比结果外推到原尺度。 小水头小流量下雷诺数远低于原项目,效率绝对值不可比。课题严格限定为"在同一台测试装置上比较三种转轮的推断方法",绝对值不外推,缩比限制必须在局限性中明确声明。

已有工作做到哪: EGSD029(2025, Grand Award)在约 1550 L 双水箱系统上比较了三种转轮,报出 p-value=0.0906 与 12.63%/14.39%/13.64% 三个效率均值,并据此称自设计转轮为 "a strong competitor"它没有报告重复次数的两个 n、没有等效界、没有误差棒、没有测试台的能量账标定。 赛道层面,两届 35 篇获奖摘要 sensitivity analyserror barstandard deviation 均为 0 次。

本项目的贡献(属「评价维度转换」型): 已有工作评估的是"哪个转轮效率高";本项目评估的是"在给定方差下,什么样的推断方式才能支持'相当'这个结论,以及需要多少次重复",交付物是判定区域图、n(δ) 曲线和一个带完整原始时序的水轮机数据集。这是主结论,不是附加内容。

必须主动写进讨论的混淆源: 三种转轮的最优转速不同,固定负载下的比较对某一种可能天然有利。这是评委最爱问的问题,主动处理远好过被问出来——处理方式必须在开题时定死(统一负载并声明前提,或逐转轮扫负载取峰值),不能事后选择。

为什么有价值: "p > 0.05 所以两者相当"是学生研究里最普遍、也最少被纠正的一个推理错误,而它在能源装置比较中尤其常见——因为这类实验方差天然很大,不显著几乎是默认结果。本课题给出的不是一句批评,而是一套可直接照做的流程:δ 怎么定、n 怎么算、两个 n 怎么分、图怎么画。

若结论不显著: 若三对比较的 TOST 与 NHST 结论全部一致,H1 被否证——这同样是有效结论(说明本测试台方差小到两种方法不再打架),交付物转为 n(δ) 曲线。但必须给出误差棒证明有能力分辨这个差异,否则等于没做。

8 · 决策门槛(go / no-go)

🟢 2026-08-25(第 3 周末):闭环测试台建成,§4 第 1 条两条标定全部通过。 若电能积分偏差 > 2%,先查采样率与时间基准;若流量偏差 > 5%,先查起始流量阈值。不得带着未标定的能量账开始跑 90 次放水——那 90 次会全部作废。

🔴 2026-09-14(第 6 周末):等效界 δ、n_run、n_part 三项定死并写入研究计划,此后不得更改。 这是本课题唯一真正不可逆的时点。 δ 一旦在看过数据之后被调整,整个课题的立论基础就没了——它批评的正是这种事后适配。建议做法:把定稿版研究计划打印签字并注明日期,作为展板附件。

🟡 2026-10-12(第 10 周末):完成 3 转轮 × 3 件 × 10 次 = 90 次放水。 若做不完,降级路径:把 n_part 从 3 降到 1(放弃件间方差分解与打印公差这一条支线),保留 3 转轮 × n_run ≥ 10 的比较。主结论框架(TOST vs NHST 的对照、判定区域图、n(δ) 曲线)完全保留,被牺牲的只是"打印公差贡献了多少方差"这个次要结论。反过来绝不允许——砍 n_run 会直接摧毁 TOST 所需的功效。

2026-12-15:数据采集截止,留 3 周分析与展板。

⚠️ 与「附属赛后不得修改」的冲突点: 等效界 δ、两个 n 的取值、效率的定义(输出电能 ÷ 输入势能,还是 ÷ 输入水力功率)、以及负载策略(统一负载 vs 逐转轮扫负载)——这四项一旦在附属赛后想改就不被允许,必须在 2026 年 11 月底前定死。 其中 δ 与效率定义最致命:改任何一个,判定区域图上的点就会整体搬家。

须提前核实而非边做边发现的事项: - 流量计的起始流量阈值——它不报错,只输出零,是本课题最隐蔽的系统误差来源。 - 3D 打印层高与转轮流道特征尺度的比值——若两者同量级,"设计差异"里就混着打印噪声,必须在第 2 步量化后再决定是否需要后处理(打磨、涂层)以及后处理是否要作为受控变量。 - 水头控制策略(溢流恒定水头 vs 平均水头作协变量)——必须在建台时就决定,建完再改等于重建。

已知困难及其定位: 缩比带来的相似性问题——小水头小流量下雷诺数远低于工程尺度,效率绝对值不可外推。这个困难本身不是本课题的障碍,因为本课题比较的是推断方法而不是转轮性能:只要三种转轮在同一台装置上受同样的缩比影响,方法学结论就成立。但这一点必须在讨论中主动说清楚,不能等着被问。

选择前提: 适合能忍受重复劳动、对统计有真实兴趣、且愿意在看数据之前就把结论标准锁死的学生。90 次放水加上逐次记录协变量是一件很枯燥的事,而"先定 δ 再看数据"这条纪律在心理上比想象中难守——学生必须真的理解为什么不能事后调。不适合追求装置本身创新的学生。

预算裁剪顺序: 总额已不足 ¥800,可裁空间小。顺序为:先砍第 6 步的 n(δ) 曲线(保留单一 ±10% 等效界),再把 n_part 从 3 降到 1,再把转轮从 3 种降到 2 种(保留 Pelton 与自设计这一对差异最大的)。砍到 2 转轮 × 1 件 × 10 次放水时,NHST vs TOST 的对照与判定区域图仍然成立,主结论保留。第 7 步的势能账交叉校验不可砍——它成本几乎为零却覆盖两个最大误差源。

🔴 展台能否展示实物:不能,本课题在展台端是纯亏的。 水是液体,水箱、水泵、管路、整机一律不得上展台;玻璃量器不得带。3D 打印转轮本体是干燥固体塑料件,理论上不属于禁止清单,但是否允许单独展示需向赛务核实——按源文件对本条的判断,安全做法是按"完全不带实物"准备,展板只有照片、视频截图与统计图。这一点必须从第一天就接受:本课题的价值在数据与推断,判定区域图与 n(δ) 曲线本身就是很强的视觉主体,展示损失可接受,但如果学生的期待是"现场转一台水轮机给评委看",那这条课题不适合他。

采购周期: 全部器材现货一周内,无一项超过 4 周,本条不构成 go/no-go 风险——这是本条相对 G12、G13 的实质优势。

评分: O=7, W=9, F=7, S=7, Fit=8 → base=76.2,h=5 → [71, 81],置信度:高