ISEF Topic Scoping 2027

G1377–87

n=1 报出 90% 提升:手工装配电化学电池的单体间方差与最小可判样本量

推荐优先级:高 · 族 B(自建低成本装置 + 工艺方差实验) · 参赛子类:EGSD(Energy: Sustainable Materials and Design),官方子类划分需核实 · 资源需求:器材 < ¥1,200 现货;恒流充放电链路自制约 ¥200,若改用电化学工作站则货期 4–6 周(go/no-go 项) · 技能取向:装配工艺控制 / 方差分解 / 功效分析

1 · 研究问题

手工装配的实验室电池,单体之间的容量差异有多大?在这个方差水平下,要把一个"提升 90%"的结论支撑到 80% 统计功效,最少需要几个独立单体?如果只做 1 个,误判概率是多少?

2 · 研究背景与空白

背景。 一个实验室电池的容量不是材料的固有属性,它是"材料 + 装配工艺 + 测量链路"三者的联合产物。手工装配的每一步都会引入方差:涂布量决定活性物质载量,压实力决定颗粒接触与孔隙率,隔膜含液量决定离子通路,装夹压力决定接触电阻。这些方差最终以单体间变异系数(coefficient of variation, CV_dev = σ_dev/μ)的形式出现。而任何"A 比 B 好 Δ%"的结论,其可信度完全由 Δ 与 σ_dev 的比值——效应量 d = Δ/σ_dev——决定。两样本 t 检验在 α = 0.05(双侧)、power = 0.8 下,每组所需样本量近似为 n ≈ 16/d²(这是标准教科书结果,不是本课题的发明)。这个式子有一个致命性质:n 与 σ² 成正比。 用错了 σ,样本量的估计会以平方的速度错下去。

这里就是本课题的靶心。 在电池实验里,σ 有两个完全不同的来源:同一只电池重复测量的方差 σ_rep(测量链路的重复性),和不同电池个体之间的方差 σ_dev(装配 + 材料 + 测量的总和)。前者通常小得多。把 σ_rep 当成 σ_dev 来算样本量,就会得出"做一个就够了"的结论——而这正是语料里那个 n=1 报出 p 值的项目的算术来源。 这两个 n 不是一回事,混用是本类目最常见的方法学错误。

已有工作到哪一步。 EGSD027(2025, Grand Award, "Investigating Ultra-High Carboxyl Density Binders") 用 DFT 算相互作用能与 pKa,得到 "COOH density was strongly correlated with IE (r = .90)",然后写道 "Silicon anodes with standard (n=2) and ultra-high COOH (n=1) density binders were then physically synthesized and measured for true performance, confirming that ultra-high COOH density improves battery performance by 90% (p < .01)"——实验组 n=1,对照组 n=2,却报出了 p 值。这是语料里唯一一处把样本量写得如此明确的地方,也因此是最不可能被反驳的立论基础。 另需注意 EGSD008T(2025, Grand Award, 黑磷负极)"capacity retention of 1735 mAh/g after 600 cycles",同样未说明测了几个电池、做了几次独立合成;2024 EGSD002(非晶 ZnP₂ 负极,Fourth Award)属同一支脉络。放到整个赛道看:35 篇获奖摘要里明确报告过"独立重复合成/重复制样"的只有一篇——EGSD036(2025, Grand Award, 肼辅助海水制氢)写了 "was prepared at least five times to ensure the accuracy of the results"其余 34 篇一个字都没提reproducibrepeatabtriplicatstandard deviationbatch-to-batchinter-batch 的词频全部为 0

空白在于:没有人测过"手工装配电池的单体间方差到底是多少",因此也没有人能说清楚这个赛道里的百分比提升该配几个样本才算数。这是一个方法本身类型的空白,可靠性排位不高,但它有一个别处没有的补偿:判据完全客观——CV_dev 是一个可以直接测出来的数字,不依赖任何主观边界声称。它适合一年期学生课题的理由:器材总额不到 ¥1,200 且全部现货(避开锂系与有机电解液是这条课题可行的前提),装配 15 只水系电池是一件可以在两周内完成、且可以通过增加并行装配批次来压缩时间的工作;而且结论正负都成立——CV_dev 大是结果,CV_dev 小同样是结果(后者意味着这个赛道的小样本结论比想象中稳健,这是个更反直觉、也更值得报告的发现)。

3 · 可检验假设

H1 手工装配水系电池的单体间变异系数 CV_dev 至少是同一只电池重测变异系数 CV_rep 的 3 倍;因此,用 CV_rep 冒充 CV_dev 去做功效分析,会把所需最小样本量低估约 9 倍(因为 n ∝ σ²,σ 差 3 倍则 n 差 9 倍)。

依据的推算过程(这也是本课题主结论的形状):设实测 CV_dev = 15%。要检出 20% 的真实提升,d = 0.20/0.15 = 1.33,n ≈ 16/1.33² ≈ 9 只/组。而若误用 CV_rep = 5%,则算得 d = 0.20/0.05 = 4,n ≈ 16/16 = 1 只/组——"n=1 也够"的错觉就是这么产生的。这里 15% 与 5% 是用于演示推算逻辑的占位数值,真实数值必须由本课题实测给出,不得预设。 需要额外强调的是一个更基本的事实:当 n=1 时,组内方差根本无法从数据估计,任何 p 值都必须依赖一个从别处借来的 σ——而借来的那个 σ 是什么,正是本课题要回答的问题。

H2(备择假设,H1 被否证时仍有内容)若 CV_dev/CV_rep < 3,说明手工装配电池的主导方差来自测量链路(装夹接触电阻、夹具压力、温度)而非装配环节(涂布量、压实力、含液量)。此时方差分解的结论方向反转,交付物从"样本量查表"变为"重测次数查表"——即告诉别人同一只电池该测几次才能压住测量噪声。主结论框架(两个 n 必须分开,混用会导致样本量估计以平方速度出错)在两条假设下完全不变。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关则后续全部结论无效)。 用一组同型号同批次的市售商品电池 ≥ 10 只在同一测试链路上测容量,取得两个数字:(a)测试链路自身的重测变异系数——同一只商品电池重测 10 次,要求 CV ≤ 1%;(b)工业级单体间变异系数——10 只商品电池之间的 CV,作为手工装配方差的下界参照。要求(a)显著小于要测的装配方差(至少小一个数量级),否则测量噪声会把装配方差淹没,整个方差分解无从谈起。 另需用已知阻值的精密电阻验证恒流源实际电流与设定值偏差 ≤ 2%、时间基准偏差 ≤ 0.5%。这一条不过关,后续所有方差数字都无效。
  2. 两个 n 严格分开——这是本条课题的主结论所在,也是最高优先级的验收项。 - n_dev = 同一批材料、同一套工艺独立装配的不同单体数 ≥ 15。 - n_rep = 同一只单体在同一工况下的重复充放电次数 ≥ 5(须在相同 SOC 历史下,前 3 次化成循环不计入)。 - 报告中每一个数字、每一根误差棒、每一个统计检验,都必须显式标注它用的是 n_dev 还是 n_rep。 - 任何把 n_rep 当作 n_dev 用于统计检验的做法,在本课题中判为错误,并作为结论之一明确写出来。 这不是一条格式要求,这是被研究的对象本身。
  3. 方差分解。 把装配流程拆成三个可控环节——涂布量、压实力、隔膜含液量——每环节 ≥ 3 水平 × ≥ 3 单体,用嵌套方差分析或随机效应模型给出各环节的方差分量与残差分量,并报告每个环节的可控精度(刮刀间隙的读数分辨率、压片压力的读数分辨率、移液器的容量精度)。没有可控精度的方差分解站不住——评委会问"你怎么知道这个方差是压实力造成的而不是你压力读不准造成的"。
  4. 最小可判样本量推算(本条是主交付物)。 以实测 CV_dev 为输入,给出 n(Δ) 曲线:Δ 从 5% 扫到 100%,α = 0.05 双侧、power = 0.8。必须并列给出两个版本——解析版本(n ≈ 16/d²)与自助抽样版本(直接从 15 只单体的实测分布重采样,不依赖正态假设)。两者若显著不一致,说明容量分布明显偏态,这本身是一个要报告的结论。并反推:n=1 与 n=2 时,检出一个真实为零的差异的假阳性率、以及漏掉一个真实存在的 90% 提升的假阴性率各是多少。
  5. 化成与老化必须控制,否则装配顺序与批次混淆。 全部单体在同一时间窗内装配与测试;逐只记录"装配完成到首次测试"的间隔小时数,并把该间隔作为协变量检验其显著性。若间隔显著,说明自放电或电解液浸润时间在冒充装配方差,必须在结论中扣除。
  6. 可复现性。 逐只单体的装配参数记录表(刮刀间隙、压片压力、电解液体积、隔膜批次、装配时刻)、原始充放电时序数据、方差分解与功效分析脚本、夹具设计文件全部开源。这张逐只记录表本身就是本课题最有价值的交付物之一——赛道里没有第二张。

5 · 数据与工具

用途 来源 / 工具
电极与活性材料 锌片与 MnO₂ 或活性炭,约 ¥200,现货。必须避开锂系与有机电解液——这是本条课题可行的前提(有机电解液的易燃与毒性会直接把它推进受监管机构条款)
隔膜 约 ¥60,现货
电池壳/夹具 纽扣电池壳或自制夹具,约 ¥150。夹具必须带可读的装夹压力,否则接触电阻方差无法与装配方差分离
恒流充放电 Arduino + MOSFET + INA226 自制,约 ¥200,现货 3–7 天。替代方案是复用电化学工作站——但若需新购,货期 4–6 周,超期即判不可行(见 §8)
涂布与装配计量 移液器约 ¥100、压片工具约 ¥300(须带压力读数),现货
对照基准(仅用于校验与对比,不计入本项目的数据贡献 同型号同批次市售商品电池 ≥ 10 只,用于取得测量链路重测 CV 与"工业级"单体间 CV 下界;已知阻值的精密电阻用于电流与时基验证
文献对照(仅用于校验与对比,不计入本项目的数据贡献 EGSD027(2025)的 n=2 / n=1improves battery performance by 90% (p < .01);EGSD036(2025)的 "was prepared at least five times to ensure the accuracy of the results"——这是 35 篇里唯一报告过独立重复制样的一篇,是本课题唯一的正面先例

总额 < ¥1,200,现货,无受管制化学品。

须核实而非引用的量:(a)Arduino + MOSFET + INA226 自制恒流链路的实际电流稳定度、电压采样分辨率与采样率——必须在 §4 第 1 条中实测而非按芯片手册标称值;(b)若改用电化学工作站,其现货状态与到货周期(4–6 周为已知风险);(c)所选锌/MnO₂/活性炭体系试剂的 SDS 标注情况(判据是 SDS 上是否标注致癌/致畸/生殖毒性,不是 IARC 有没有分类);(d)商品对照电池的标称容量测试条件与其批次一致性说明。

6 · 方法路径

  1. 搭充放电链路 + 用商品电池与精密电阻完成 §4 第 1 条校验。 重点是拿到测量链路自身的重测 CV ≤ 1%。这一步不过不许继续——链路噪声若与装配方差同量级,后面装 15 只电池全是白装。
  2. 核实装置能力边界,逐一排查本方向的静默失败点(这些陷阱全都不报错,只是给错数): - 夹具接触压力随时间松弛,内阻缓慢上升,被误计入"单体间差异"——而它其实是时间效应。必须做一只电池的长时间空置对照来量化; - 恒流源在低电压端进入压差不足区域,实际输出电流低于设定值,但显示的仍是设定值——放电末段的容量被系统性高估或低估,且各单体因内阻不同而受影响程度不同,方差被人为放大; - 库仑效率不足 100% 时,容量按充电还是放电计的口径不一致——两种口径的方差不同,混用会得到无意义的 CV; - 天平分辨率与涂布量同量级——载量的"差异"可能全部是称量噪声,而载量直接线性传播到容量; - 室温日变化与装配顺序共线——先装的电池在较凉的早上测、后装的在较热的下午测,温度效应被完整地记成装配方差。必须记录每次测试的环境温度并做协变量检验。
  3. 装配 ≥ 15 只名义完全相同的单体,逐只记录全部工艺参数与装配时刻,全部在同一时间窗内完成。
  4. 跑完 n_dev(15 只 × 各测 1 组)与 n_rep(其中 ≥ 3 只 × 各重测 ≥ 5 次)两套数据,分别算出 CV_dev 与 CV_rep。两套数据的采集条件必须完全一致,唯一的区别是"换电池"还是"不换电池"。
  5. 做三环节方差分解(涂布量 × 压实力 × 含液量,各 ≥ 3 水平 × ≥ 3 单体),给出方差分量表与各环节可控精度表。
  6. 做功效分析与自助抽样,产出 n(Δ) 查表,并反推 n=1 / n=2 情形下的假阳性率与假阴性率。
  7. 独立交叉校验(用另一种原理测同一个量)。 用直流内阻法(DCIR,脉冲加载后的电压跳变)独立测同一批单体的内阻,与恒流放电曲线 IR 降推出的内阻对照。两者一致,说明容量方差里的内阻分量测得可信;不一致,说明装夹或采样率有问题(见第 2 步)。

7 · 新颖性边界

本课题不声称: - 不声称合成任何新电极材料。本课题的全部单体名义上完全相同——这是刻意的,被研究的对象是"名义相同"这四个字在多大程度上不成立。 - 不声称首次指出小样本会导致不可靠结论。这是统计学常识,不是发现。 本课题的贡献是给出这个赛道特有的 σ 数值,从而把常识变成一张可用的查表。 - 不声称 EGSD027 的 90% 提升是错的。该项目自己写明了 n=2n=1,本课题不复现其硅负极与羧基粘结剂体系,也不对该数字做真伪判断。本课题问的是一般性问题:在这个方差水平下,n=1 的结论有多大概率是对的。 - 不做锂系、不做有机电解液、不做全固态——这不是能力问题,是合规问题(语料中 EGSD002T 的全固态锂硫需手套箱,普通学校做不了)。 - 不把本课题包装成"加大样本量的重复实验"。 赛制明文规定"加大样本量的重复实验"不算合法延续、会被判无效。本课题的研究对象是方差本身与样本量判据,不是任何一个材料结论的重做——这个定位必须在研究计划的第一段就写清楚,它是本条课题在合规上最需要小心的一点。

已有工作做到哪: EGSD027(2025)在 n=2 vs n=1 上报出 improves battery performance by 90% (p < .01);EGSD008T(2025)报 "capacity retention of 1735 mAh/g after 600 cycles" 而未说明电池数与独立合成次数;EGSD036(2025)是 35 篇中唯一写了 "was prepared at least five times to ensure the accuracy of the results" 的一篇。整个赛道 reproducib / repeatab / triplicat / standard deviation / batch-to-batch 词频全部为 0

本项目的贡献(属「方法可复现性贡献」型): 已有工作交付的是材料结论;本项目交付的是这个赛道的实测 σ、三环节方差分解、以及一张"要检出 Δ% 的提升需要几只独立单体"的查表,并明确把"同一只电池重测"与"不同电池"这两个 n 分开。这是主结论,不是附加内容——事实上,"两个 n 必须分开"这句话就是本课题要证明的命题。

为什么有价值: 这张查表可以被这个赛道的任何人直接使用,成本是零。而它回答的问题——"我该做几个"——是每一个做器件的学生在开题第一天就会遇到、却从来没有数据可依的问题。语料显示,35 篇获奖摘要里 34 篇没有回答过它。

若结论不显著: 若 CV_dev/CV_rep < 3,H1 被否证——这同样是有效结论,甚至是更反直觉的那个:它意味着手工装配比想象中稳定,主导方差在测量端,于是这个赛道的小样本结论比预期稳健。但必须给出误差棒证明有能力分辨"3 倍"这个量级的差异,否则等于没做。

8 · 决策门槛(go / no-go)

🔴 2026-08-17(第 2 周末):确定恒流充放电链路的来源。这是本条唯一的长周期风险。 (a)自制 Arduino + MOSFET + INA226 路线(约 ¥200,现货 3–7 天)→ go,但必须在 §4 第 1 条中实测其电流稳定度与采样率,不得引用芯片手册标称值;(b)复用校内电化学工作站 → go;(c)若必须新购电化学工作站,货期 4–6 周,超过 4 周即判不可行,必须回到自制路线。 采购周期是本赛道工程类的常见死因,本条按日期执行。

🟢 2026-08-25(第 3 周末):§4 第 1 条校验通过——测量链路重测 CV ≤ 1%,且商品电池组的单体间 CV 已测得。 若链路重测 CV > 1%,先排查装夹压力与接触电阻(最常见原因),不得带着不合格的链路开始装配 15 只电池

🟡 2026-09-14(第 6 周末):15 只单体装配完成并跑完 n_dev 数据。 若装配良率不足(例如短路或漏液导致有效单体 < 12 只),降级路径:把三环节方差分解压缩为两环节(保留涂布量与压实力,放弃含液量这一最难控的环节),把节省下来的单体全部投给 n_dev。主结论框架(两个 n 分开 + 最小可判样本量查表)完全保留,被牺牲的只是方差归因的细致程度。

🔴 2026-10-12(第 10 周末):n_dev ≥ 12 与 n_rep ≥ 5 两套数据必须齐备。 这两个数是主结论的全部输入。若到此日期仍不齐,不得靠增加 n_rep 来凑 n_dev——那正是本课题批评的错误,自己犯了就无法答辩。

⚠️ 与「附属赛后不得修改」的冲突点: 容量的计算口径(按充电容量还是放电容量)、截止电压、充放电倍率、以及功效分析的 α 与 power 取值——这四项一旦在附属赛后想改就不被允许。必须在 2026 年 11 月底前定死,并在研究计划中写明。 尤其是 α 与 power:事后调整它们等于事后调整结论,是评审最敏感的问题。

须提前核实而非边做边发现的事项: - 自制恒流链路的实际采样率——采样率不足会漏掉 IR 降跳变,内阻被系统性低估,而内阻是方差的重要来源之一。 - 试剂 SDS——判据是 SDS 上是否标注致癌/致畸/生殖毒性,不是 IARC 有没有分类。锌与二氧化锰体系预期不触发,但必须自己调 SDS 复核,不得沿用他人判断。 - 本课题与"加大样本量的重复实验不算合法延续"这条赛制规定的边界——建议在开题前就把研究计划中的定位段落写好并请指导老师确认,这是本条唯一的合规风险点。

已知困难及其定位: 最容易被质疑的一句话是"你的方差是你自己手艺差造成的"。这个困难本身就是研究内容——课题的第 3 步方差分解正是为了回答"方差从哪一环来",而 §4 第 1 条用商品电池取得的工业级 CV 就是回答"手艺差多少"的定量参照。把工艺参数全部量化并报告每个环节的可控精度,这个质疑就站不住。

选择前提: 适合能忍受高度重复劳动、且对统计有真实兴趣的学生。最枯燥的一环是装配 15 只名义相同的电池并逐只记录参数(约 2 周),它既不出成果也不好看,但没有它就没有 CV_dev,整张查表不成立。 不适合希望展板上有一个漂亮实物的学生,也不适合把"做出更好的电池"当作目标的学生——本课题不追求任何性能提升。

预算裁剪顺序: 总额已不足 ¥1,200,可裁空间小。顺序为:先砍第 5 步的三环节方差分解(改为只报总方差 CV_dev,不做归因),再砍第 7 步的 DCIR 交叉校验,最后把 n_dev 从 15 降到 12。砍到只剩 CV_dev、CV_rep 与 n(Δ) 查表时,主结论仍完整成立——这三样才是本课题的核心,其余都是增强项。

🔴 展台能否展示实物:基本不能。 液体电解液与粉末(MnO₂/活性炭)不得上展台;已装配的湿电池含液体,不得带;玻璃器皿不得带。本课题不涉及 > 100 Wh 电池组。可以考虑的只有彻底干燥、未注液的空壳与夹具,且是否允许仍建议向赛务确认。 展板必须按"只有照片、视频和数据图"设计——好在本课题的核心交付物(方差分解图、n(Δ) 查表、n=1 假阳性率)天生就是图表,展示损失小。

评分: O=8, W=9, F=7, S=8, Fit=9 → base=81.8,h=5 → [77, 87],置信度:高