B175–93
器官分配预测模型的「96% 准确率」里,有多少是基线率
框架当结局事件的阳性率只有 5–10% 时,一个报告「96% 准确率、AUC 0.85」的模型,其准确率比「全部预测为存活」这个平凡基线高出多少?在肝移植 90 天生存预测这个具体任务上,这个差额是多少个百分点?
你自己的那一点你不做一个更好的模型,你做指标口径的审计。用同一个公开移植数据源,把「准确率」「AUC」「PR-AUC」「相对多数类基线的净提升」四个口径并列算出来,量化它们的排序是否一致。若一个 96% 准确率的模型对应的净提升只有 2 个百分点,那么整整一类「我们的 ML 大幅超越临床评分」的结论都需要重新表述。再加一层:按移植中心和年份做分组外推,量化时间/中心漂移带来的衰减。
擦过ISEF 2025 BMED031(Grand Award)「Data-Driven Liver Transplant Prediction Score」,摘要原文:用 UNOS 的 341,208 名候选者与 22,123 名供者数据训练 Random Forest / LightGBM / Decision Tree / HistGradientBoosting / XGBoost,「XGBoost demonstrated superior performance, achieving 96% predictive accuracy, AUC of 0.85, outperforming MELD's 48% accuracy」,并据此开发了 PRESTO 评分与桌面软件。它报告了准确率与 AUC,没有报告类别不平衡下的基线,也没有做时间或中心的外推验证。「MELD 48% 准确率」这个对比数字本身也需要核查口径——MELD 是连续风险评分,不天然产生「准确率」。
文献前作:未核查(必查 UNOS/SRTR 相关的 ML 移植预测文献,这个领域论文很多)。
约束最可能死在数据获取。 UNOS/SRTR 的 STAR file 需要申请(有正式流程、需要机构背书、周期以月计),中学生独立申请通常拿不到。最便宜的规避方式: 改用完全公开、无需申请的替代数据(如 MIMIC 派生的公开子集、Kaggle 上已发布的去标识化移植/ICU 数据集),把课题定位为「不平衡结局下的指标口径审计」这一方法学问题,肝移植只是其中一个案例。这样即使拿不到 UNOS 你也有课题。
表格: 公开去标识化数据集 → IRB 豁免第 2 类,不需要 Form 4。仍需 Form 1/1A/1B/2A。若使用需申请的受限数据集,可能触发 Form 2C(若通过某机构获取)。
B267–85
视网膜图像诊断神经发育障碍:换一台眼底相机还剩多少
框架一个在视网膜图像上区分 ASD/ADHD 的 CNN,当训练集与测试集按采集设备/采集中心切分(而不是随机切分)时,AUC 下降多少?模型的显著性热图在重新训练(换随机种子)后还指向同一批区域吗?
你自己的那一点两个正交的稳健性探针。探针一是设备漂移:眼底相机的色彩、视场、压缩伪影在不同中心系统性不同,随机切分会让模型学到「哪台机器拍的」。探针二是解释稳定性:saliency heatmap 是这类工作最常被拿来讲故事的东西,但它对随机种子极其敏感。你去量化——同一架构训 10 个种子,热图之间的空间相关系数是多少?如果只有 0.3,那么「模型定位到了黄斑与视盘」这句话就没有说服力。
擦过ISEF 2025 BMED040(Grand Award)「Retinal Models of Neurodevelopmental Disorders」,摘要原文:开发了「an interpretable retinal image-based convolutional neural network model for ASD and ADHD diagnosis through post-hoc analysis」,用潜空间可视化显示特征可分,并「Important retinal regions were localized via generation of saliency heat maps that reveal the macula, optic disc, and blood vessels as diagnostically-relevant」,随后做了丙戊酸钠处理的视网膜细胞系体外模型验证。它报告了热图指向的解剖区域,没有报告热图在重复训练下的稳定性,摘要中也未提及按采集站点切分的外部验证。
文献前作:未核查(saliency map 稳定性在医学影像 AI 领域已有专门文献,必查——这会直接决定你的新颖性边界在哪)。
约束最可能死在数据。 带 ASD/ADHD 标签的眼底图像不是公开数据。最便宜的规避方式: 把方法学问题搬到有公开多中心标注的眼底任务上(糖网分级:EyePACS / APTOS / Messidor 三个数据集本身就构成天然的站点切分),先在那里把「随机切分 vs 站点切分」的衰减幅度和热图稳定性量化出来,再论证同样的问题必然存在于 NDD 任务。这个改法把课题从「我拿不到数据」变成「我在能拿到数据的同构任务上给出了通用结论」。
表格: 公开去标识化影像 → IRB 豁免第 2 类。Form 1/1A/1B/2A。AI 政策提醒: 研究 AI 完全合法;但 AI 生成的代码必须显式引用并保留提示词日志。
B374–92
「共突变延长生存」这类发现,多少能由随机产生
框架在一个几千例的癌症基因组队列里,筛出「与生存显著相关的共突变基因」时,如果对全部候选基因做同样的筛选并置换标签,有多少个基因能达到同等显著性?换句话说:报告出来的那个「合成致死候选」,在多重比较校正后还剩什么?
你自己的那一点这是一次假发现率审计,不是重做分析。你把原分析的筛选流程完整复现,然后在标签置换的零假设下重复 10,000 次,画出「最强共突变的效应量」的零分布,看真实发现落在分位数的什么位置。同时量化第二个陷阱:亚组切分。 当队列按种族、性别、年龄分层后每层只剩几百例,「某族群预后最差」这类结论的置信区间有多宽。
擦过ISEF 2025 BMED085(Grand Award)「ARID1A Mutations in Hepatocellular Carcinoma」,摘要原文:分析了 2,351 名 HCC 患者的基因组数据,报告 ARID1A 突变者中位生存显著更短,男性/黑人/30 岁以下或 70 岁以上突变率最高,黑人患者预后最差;随后「I identified 26 gene co-mutations, with POLQ, a DNA repair gene, as the top candidate」并称 ARID1A+POLQ 双突变患者「had prolonged life with no adverse survival events, suggesting a synthetic lethal relationship」。它报告了 26 个共突变里挑出的第一名,摘要中未提及多重比较校正,也未提及亚组分层后的样本量与置信区间。 「no adverse survival events」这句话本身暗示该亚组事件数极少——这正是效应量不可信的信号。
文献前作:未核查(cBioPortal / TCGA 上的合成致死筛选有大量文献,也有专门讨论 winner's curse 的方法学论文,必查)。
约束最可能死在被判为「只是重新分析别人的数据」。 ISEF 明文排除文献综述与纯复现。最便宜的规避方式: 把交付物做成一个可复用的校准工具——给定队列规模、突变频率、事件率,输出「达到显著所需的最小效应量」与「预期假阳性数」的查表/网页。这样你产出的是方法,不是复述。数据全部来自 cBioPortal 公开下载,零成本。
表格: 公开数据 → IRB 豁免第 2 类。Form 1/1A/1B/2A。
B472–90
跨数据集比较基因表达时,批次效应贡献了多少「反向调控」
框架当把「肿瘤组织的转录组」和「运动后免疫细胞的转录组」放在一起找「反向调控的基因」时,这两组数据来自不同组织、不同平台、不同实验室。在这种设定下随机抽两组无关数据,能找出多少个同样强度的「反向极性」基因?
你自己的那一点你构造跨语境比较的零分布。取两个明确无生物学关联的公开 RNA-seq 数据集对,跑与原分析完全相同的差异表达+反向极性筛选流程,记录最强反向极性基因的 |log2FC| 之和。重复 100 组随机配对。然后问:原研究报告的那个 log2FC −2.47 / +1.08,落在这个零分布的第几分位? 再加第二步:对同一对数据做 ComBat / RUV 批次校正后重跑,看排名第一的基因是否还是同一个。
擦过ISEF 2026 BMED024(Grand Award)「Exercise-Induced Anti-Tumor Immunity」,摘要原文:「cross-context transcriptomic analyses were performed using publicly available RNA-sequencing datasets from melanoma tumors and exercise-responsive immune cells. Differential expression analysis identified conserved genes with reciprocal regulation, among which decorin (DCN) showed the strongest inverse transcriptional polarity (log₂FC −2.47 melanoma; +1.08 exercise; adj. p < 0.01)」,随后在 SK-MEL-2 与 A375 细胞里做了重组 DCN 的体外验证,并训练了 AUROC ≈ 0.82 的 Immune Readiness Score。它做了体外功能验证(这一步很扎实),但摘要中未报告跨语境比较本身的零模型或批次校正——也就是说,「DCN 是极性最强的那个基因」这一发现的统计基础没有被检验。
你必须注意的诚实之处: 该项目做了体外验证,这削弱了「纯属批次假象」的批评。你的课题不是要推翻它,而是要回答「这种跨语境筛选方法在多大概率下会指向一个错误的基因」——即使这一次碰巧指对了。这个措辞差别决定了你会不会被评委当场驳倒。
文献前作:未核查(批次效应校正方法学文献极多,ComBat/RUV/Harmony 的比较研究是必查项)。
约束最可能死在被认为「只是在挑刺」。 最便宜的规避方式: 交付一个判据而不是一个反驳——「在跨组织/跨平台比较中,要让一个反向极性基因的发现具有统计意义,|Δlog2FC| 至少需要多大」。这是可以被别人用的东西。数据全部来自 GEO/TCGA,零成本。
表格: 公开数据 → IRB 豁免第 2 类。Form 1/1A/1B/2A。
B568–86
「三个数据集共有 129 个差异基因」是巧合吗
框架当报告「某基因在三种不同疾病模型中一致下调,且三者共享 129 个差异表达基因」时,在给定各自 DEG 列表长度与基因组背景的条件下,随机期望的重叠数是多少?
你自己的那一点一个重叠显著性的零模型。多数中学生(以及不少论文)用「共有 N 个基因」当作证据,但重叠数强烈依赖于各列表长度和检测基因的背景集合。你做两件事:(1) 用超几何检验与置换检验分别算出这个重叠的期望值与 p 值;(2) 量化背景集选择的敏感性——用「全基因组」vs「三个平台的检测基因交集」作背景,p 值差多少个数量级。若差 5 个数量级,那么这类结论的强度完全取决于一个通常没人写出来的选择。
擦过ISEF 2026 BMED021(Special Award)「Music & SNCA: Protecting Brain From Stroke & GBM」,摘要原文:分析了小鼠血管损伤、小鼠卒中、人 GBM 三个公开转录组数据集,「SNCA was consistently downregulated in all three conditions. Comparative analysis identified 129 shared differentially expressed genes enriched in cell cycle pathways.」随后用刚度可控水凝胶做了体外验证,显示 SNCA 表达对基质刚度敏感。它报告了 129 这个数字与通路富集,摘要中未报告重叠本身的显著性检验或背景集定义。(另注:该项目的「音乐提升 SNCA」这一前提来自转录组文献,与其自身实验无关,这是另一条可以问的线,但更弱。)
文献前作:未核查(基因集重叠的统计学是老问题,必查 GeneOverlap / SuperExactTest 一类方法论文——这可能显著压缩你的新颖性)。
约束原创性风险偏高——「重叠显著性检验」在生物信息学界是常识,评委可能认为不算发现。最便宜的规避方式: 把重点放在背景集敏感性这个具体量上,而不是「应该做检验」这个常识;并把结论落到「跨物种跨组织比较时该用哪个背景集」这个操作建议上。
表格: 公开数据 → IRB 豁免第 2 类。Form 1/1A/1B/2A。
B659–77
用培养法和革兰氏染色推断肠道菌群比例,能推出什么
框架从昆虫肠道匀浆中通过平板培养获得的 CFU,覆盖了实际菌群多样性的多大比例?由革兰氏染色形态推断的「厚壁菌/拟杆菌比值」,与基于分子方法(qPCR 或 16S 扩增)的同一比值之间,一致性有多高?
你自己的那一点这是一次测量方法有效性的直接对照。同一批肠道样本,一半走培养+革兰氏染色路线,一半走分子路线,画 Bland–Altman 图。核心的可辩护点在于:革兰氏染色报告的是细胞壁结构,不是分类学门;拟杆菌门与厚壁菌门内部都既有革兰氏阳性也有阴性成员。 若两条路线给出的 F/B 比值相关系数低于 0.5,那么所有用培养法报告「菌群失调」的中学课题都需要重新表述结论。
擦过ISEF 2025 BMED002(Special Award)「Ant It Sweet?」,摘要原文:375 只 *Camponotus floridanus* 暴露于四种人工甜味剂 7 天,「gut microbiota analyzed through culturing and Gram staining. Colony-forming units (CFUs) were quantified, and the Firmicutes-to-Bacteroidetes ratios and general gut dysbiosis were quantified.」报告糖精使拟杆菌从 29% 降到 25%(F(12,380)=15.89),并做了 Bray-Curtis 差异热图与 Kaplan-Meier 生存曲线。它用培养+革兰氏染色量化了门水平比值,摘要中未报告该测量方法与分子方法的一致性验证。
文献前作:未核查(「great plate count anomaly」是微生物学经典问题,必查;这会决定你的贡献是「验证一个已知问题在昆虫肠道上的量级」还是「发现一个新问题」——前者仍然成立,但措辞必须准确)。
约束最可能死在合规与设备双杀。 培养肠道细菌属于潜在危险生物制剂(PHBA),家中一律禁止,必须在至少 BSL-1 的学校/机构实验室、由受训 Direct Supervisor 监督,且需 SRC 事前批准。分子端需要 PCR 仪与测序服务(16S 外送测序约每样本 ¥100–300,可接受)。最便宜的规避方式: 用 qPCR 门特异性引物代替测序(只需 qPCR 仪),或者干脆改用已发表的配对数据(有研究同时报告了培养法与测序结果)做二次一致性分析——但那样会掉进「文献研究」的排除条款,不推荐。
表格: Form 6A(潜在危险生物制剂,须 SRC 事前批准);若涉及组织/体液另加 Form 6B;Form 3(风险评估);Form 1/1A/1B/2A;在校外实验室做则加 Form 2C(须在展台竖立展示)。蚂蚁是无脊椎动物,不触发 Form 5A/5B。
B777–87
用葡萄糖显色法比较酶补充剂时,配方本身贡献了多少信号
框架当用 505 nm 葡萄糖显色法比较不同剂型(片剂 / 软糖 / 粉剂)的乳糖酶活性时,软糖剂型自带的糖分对读数贡献了多少?扣除空白配方(不含酶的同款基质)后,剂型之间的排序还成立吗?
你自己的那一点一个基质干扰的空白对照实验——原研究缺失的那一步。软糖类补充剂的辅料里通常含葡萄糖浆、蔗糖、麦芽糊精;蔗糖在模拟胃酸条件下会部分水解成葡萄糖+果糖。这意味着「软糖组读数居中、粉剂组最低」这个排序,可能有相当一部分不是酶活性差异,而是辅料糖差异。 你的实验设计极其简单:每个剂型同时跑「含酶」和「无酶空白基质」两组,用差值而非绝对值比较;再加一组「酸处理但不加乳糖底物」的对照,量化酸水解贡献。
擦过ISEF 2026 BMED048(Grand Award + Special Award)「Formulation Effects on Digested Lactase Activity」,摘要原文:把包衣片、速溶片、咀嚼片/软糖、粉剂四种剂型(初始酶量统一为 9,000 FCC 单位)经模拟胃酸后中和,「Lactase activity was then quantified via a colorimetric glucose assay at 505 nm」,结果「The tablet formulations produced the highest glucose yield while the gummy/chewable formulation produced intermediate values, and the powder formulation produced the lowest values.」它用葡萄糖产率排序了剂型,摘要中未提及无酶空白基质对照,也未提及辅料糖或酸水解的扣除。
文献前作:未核查(体外溶出/酶活测定的基质干扰在药剂学里是标准话题,必查 USP 相关方法学;但把它用在 OTC 补充剂对比上可能仍是空白)。
约束可行性极高、合规极干净,这是本组最省事的一条。 全部材料是超市可买的膳食补充剂 + 家用食品级试剂 + 商用葡萄糖检测试纸或试剂盒。不涉及人、不涉及活体、不涉及危险化学品。最可能死在「意义不足」——评委可能觉得这是消费品测评。最便宜的提升方式: 把结论上升到方法层面——「以产物浓度为读数的酶活比较,在什么条件下必须做基质空白」,并给出一个可判定的判据(例如:当空白基质信号超过总信号的 X% 时,绝对值比较失效)。
表格: Form 1/1A/1B/2A + Form 3(风险评估,涉及酸的使用)。不涉及人类受试者,不需要 Form 4。 展台注意:液体、化学品、玻璃一律不得出现——比色管、酸液、样品溶液全部只能用照片呈现。
B864–82
「抗氧化能力」换一种测法,排名还一样吗
框架用 Briggs-Rauscher 振荡反应抑制时间测得的「抗氧化能力」,与用 DPPH 自由基清除法测得的同一批样品的排名,一致性有多高?红酒样品中乙醇本身对两种方法各贡献了多少表观抗氧化能力?
你自己的那一点口径一致性 + 一个具体的混杂因子拆解。 第一部分:同一批样品(茶、咖啡、果汁、果皮提取物)分别用 BR 法和 DPPH 法测,算 Spearman 秩相关。第二部分是关键:配制乙醇浓度梯度的空白溶液(无多酚),测它们在两种方法下的表观抗氧化值。若乙醇本身在 BR 法里产生显著信号,那么「红酒的抗氧化能力归功于乙醇」这个结论就变成了方法伪像而非生物学发现。 再加 pH 与浊度两个干扰项。
擦过ISEF 2025 BMED026T(Special Award)「On the Hunt for Free Radicals」,摘要原文:分析茶、咖啡、红酒与多种水果的抗氧化含量,「The antioxidant capacity was determined using the scientifically recognized Briggs-Rauscher reaction and quantified in mg DPPH equivalents based on a calibration curve.」结论包括「a glass of red wine contains many antioxidants and that they owe their existence only to the alcohol」。注意措辞:它用 BR 反应测量、用 DPPH 当量表达,但摘要中没有说它实际跑过 DPPH 法作平行验证;「归功于乙醇」这个因果结论也没有说明是如何与乙醇的方法干扰区分开的。这正是你要问的那个问题。
文献前作:未核查(BR 法作为抗氧化测定的适用性、以及各类抗氧化测定法之间的不一致性,在食品化学界有大量文献,必查——这一条的新颖性可能被压缩得很厉害)。
约束最可能死在新颖性:「不同抗氧化测定法结果不一致」是食品化学的老结论。最便宜的规避方式: 不要把课题定位成「发现方法不一致」,而定位成「针对 BR 法这一特定中学常用方法,给出一张干扰因子(乙醇、糖、pH、浊度、颜色)的定量修正表」。这是可以被别人直接用的东西,而且档案里没人做过。
表格: Form 1/1A/1B/2A + Form 3。BR 反应涉及丙二酸、碘酸钾、硫酸锰、过氧化氢、硫酸——必须先查每一种的 SDS。2027 新规:SDS 上标注致癌/致畸/生殖毒性的化学品必须在受监管研究机构或限制进入的通风橱(非普通教室)内操作。这一步在开题前就要做完,不是实验时才查。 展台禁液体/化学品/玻璃。
B967–85
果蝇爬升实验的噪声底:你测到的药效有多少大于日常波动
框架果蝇负向趋地性(negative geotaxis / 爬升)实验的测量重复性有多高?在固定基因型、固定处理的条件下,仅由测试时间、环境温度、敲击力度、试管几何、观察者带来的变异,相对于文献报告的药物效应量,孰大孰小?
你自己的那一点一个误差预算(error budget)。这是所有果蝇行为学课题都依赖、但几乎没人报告的东西。你固定一批同龄同基因型果蝇,系统性变动五个「无关」因子各三档,用方差分量分析拆出每个因子的贡献,最后给出这个装置的最小可检测效应量(MDE)。若 MDE 大于近届获奖项目报告的药效量级,那说明那些结论需要更多重复才能站住。
擦过两个直接前作。ISEF 2026 BMED042(Grand Award)「Gedunin- Parkinson's Therapy」用 dj-1β 突变果蝇,「Locomotor performance was quantified weekly for five weeks using the startle-induced negative geotaxis assay」,报告 p<0.0001(two-way ANOVA),并明说「neurodegeneration could not be quantified due to imaging limitations」。ISEF 2025 BMED028(Grand Award)「Effects of Tirasemtiv and Urtica dioica on STAC3」同样用果蝇运动性作为主要读数(成虫运动性 + 幼虫爬行距离与收缩次数)。两个项目都把爬升/运动性当作可信读数,都没有报告该读数的重复性或环境敏感性。
文献前作:未核查(果蝇 climbing assay 的标准化问题在果蝇学界有讨论,必查——若已有系统性研究,你的贡献要改成「在中学可及装置上的复现」)。
约束合规上要小心一条: 若你选用表达朊样蛋白的果蝇品系(如 tau、α-syn 果蝇),只能做行为学,不得裂解、解剖或纯化蛋白。最便宜的规避方式: 用野生型果蝇做纯粹的方法学研究,完全绕开朊样蛋白条款。果蝇本身是无脊椎动物,不触发脊椎动物规则;不涉及重组 DNA 则不触发 rDNA 条款。最可能死在「这不算生物医学」——评委可能认为纯方法学不够医学。规避方式: 用同一装置真实跑一个已知的阳性对照(如低剂量咖啡因或温度处理对运动性的影响),证明你的误差预算能正确判定什么是真效应。
表格: Form 1/1A/1B/2A;果蝇饲养属常规无脊椎动物工作,通常只需 Form 3;不需要 Form 5A/5B。
B1077–87
高糖抑制再生,是糖的作用还是渗透压的作用
框架在梯度葡萄糖培养基中,涡虫再生受抑制的效应,有多大比例可由等渗透压的甘露醇/山梨醇对照复现?换句话说:这是「糖毒性」还是「高渗胁迫」?
你自己的那一点一个缺失的对照组,就是整个课题。 高浓度葡萄糖同时改变两件事:可代谢底物浓度与培养基渗透压。分离二者的标准做法是加入等摩尔的非代谢性糖醇(甘露醇、山梨醇)作渗透压对照。你把这个对照补上,用与原研究相同的三个定量指标(体长增长、芽基面积、眼点形成时间)测量,直接给出「糖特异性效应占总效应的百分比」。这个课题的美妙之处在于:无论结果如何都是有效结论——如果渗透压解释了 80%,那是一个重要的修正;如果只解释了 20%,那是对原结论的有力加强。
擦过ISEF 2026 BMED006(Grand Award)「Glucotoxicity in Regeneration」,摘要原文:「I propose a novel model using amputated S. mediterranea in graded glucose media. Doses for experimentation were determined through a toxicity pilot. To ensure internal glucose uptake in cells, a 2-NBDG fluorescence assay was conducted, and fluorescence patterns consistent with dose-dependent uptake were observed. This validated causal interpretation of the regeneration outcomes obtained through three quantitative indicators: length growth, blastema area, and time to eyespot formation and pigmentation.」它做了 2-NBDG 摄取验证(证明葡萄糖进了细胞),这一步很扎实,并明确声称该验证「validated causal interpretation」。但摄取验证只证明糖进了细胞,不能排除渗透压同时在起作用——摘要中未提及等渗对照。这正是它自己的因果论证链上唯一没补的那一环。
文献前作:未核查(渗透压对照是细胞生物学标准做法,必查涡虫/无脊椎动物再生的高糖文献)。
约束可行性很好。 涡虫(*Schmidtea mediterranea* 或更易得的 *Dugesia japonica*)便宜、易养、无脊椎动物、不触发动物福利条款。甘露醇/山梨醇是食品级试剂。周期约 2–3 周一轮,3–4 个月窗口内可跑多轮。最可能死在测量精度——芽基面积测量的观察者间变异可能吞掉效应。最便宜的规避方式: 先做一轮盲法重复测量确定测量误差,把它写进方案作为 MDE 依据(与 B9 同一思路)。
表格: Form 1/1A/1B/2A + Form 3。涡虫为无脊椎动物,不需要 Form 5A/5B。展台禁液体与活体:涡虫和培养皿都上不了展台。
B1175–93
「社会经济错配」评分怎么定,结论就怎么变
框架当一个流行病学结论依赖于研究者自定义的分类评分(把教育×收入的 16 格矩阵映射成 1–7 的「错配」梯度)时,遍历所有合理的映射方案,报告出的 OR 分布有多宽?原报告的 OR 1.23 落在这个分布的什么位置?
你自己的那一点规格曲线分析(specification curve analysis)。这是社会科学方法学里的正式工具,但在中学生流行病学课题里几乎无人使用。你枚举所有可辩护的分析选择——矩阵映射规则、教育分档边界、收入贫困比分档、二分阈值(原研究选了 2–4 vs 5–7)、协变量集合——把它们的笛卡尔积全部跑一遍(数百到数千个规格),画出 OR 的分布图。如果 95% 的规格都给出 OR>1 且方向一致,那是对原结论的强力支持;如果一半规格跨过 1,那么这个发现主要是分析者自由度的产物。 两种结果都是有价值的交付物。
擦过ISEF 2026 BMED019(Special Award)「Socioeconomic Mismatch & Smoking: An NHANES Study」,摘要原文:用 NHANES 2017–2020.3(N=7,825)做横断面分析,「A 16-cell matrix crossed four educational levels with four income-to-poverty ratios to quantify inconsistency along a gradient (1=low education/high income; 7=high education/low income). Logistic regression models using complex survey weights evaluated the association between inconsistency scores and current smoking status, adjusting for age and gender.」报告 OR 1.23(95% CI 1.10–1.37),校正教育后升至 OR 1.60,并「Scores were dichotomized into low (2-4) and high (5-7) stress categories」,黑人非西班牙裔高错配 OR 2.43。它用了正确的复杂抽样权重(这一点很规范),但整条因果链依赖于一个研究者构造的 16 格→7 档映射,摘要中未报告该映射的敏感性分析,二分阈值 2–4 / 5–7 也未说明选择依据。
文献前作:未核查(specification curve / multiverse analysis 有 Simonsohn 等人的方法学论文,必查;status inconsistency 与健康行为也是社会流行病学的老题目)。
约束合规极干净、成本为零,这是本组最省事的第二条。 NHANES 是完全公开的去标识化数据,直接下载,IRB 豁免第 2 类。最可能死在「学科契合」——BMED 评委可能认为这属于社会科学(BEHA)。最便宜的规避方式: 把结局变量换成有生物学测量的项目(NHANES 自带血清可替宁 cotinine 浓度,是吸烟的客观生物标志物),用它替代自报吸烟状态,把课题锚定在「自报暴露 vs 生物标志物暴露下,同一个社会经济梯度效应的稳健性」。这一改同时提升了学科契合和可辩护性。
表格: 公开去标识化数据集 → IRB 豁免第 2 类,不需要 Form 4。Form 1/1A/1B/2A。
B1276–86
食品中检出的微塑料,有多少来自实验室空气
框架用拉曼光谱在食品样品中鉴定微塑料时,程序空白(走完全部处理流程但不含样品的对照)中检出的颗粒数,占报告总检出数的多大比例?其中纤维类与颗粒类的空白污染率有何差异?
你自己的那一点程序空白污染率的系统量化——微塑料研究领域公认的头号方法学问题,也是所有中学微塑料课题几乎从不报告的东西。空气中的合成纤维(来自衣物、滤纸、塑料器皿、通风系统)会在任何开放操作中沉降到样品上。你设计三级空白:(1) 实验室空气沉降对照(敞口培养皿放置等长时间);(2) 全流程试剂空白;(3) 器皿淋洗空白。然后给出「校正前 vs 校正后」的食品微塑料检出量,以及一个可复用的最低污染控制方案。
擦过ISEF 2026 BMED018(Grand Award)「Microplastics in Hawai'i Foods: Impacts and Design」,摘要原文:「Raman spectroscopy identified microplastic types within food groups.(…)Microplastics were found in all food groups which confirms dietary exposure.」随后做了 100 组分子对接(10 种塑料配体 × 10 种人体蛋白)、10 ns 分子动力学、体外消化率实验,以及一个遗传算法设计的吸附分子。它报告「所有食品组均检出微塑料」,摘要中未提及程序空白或污染控制。「所有食品组均检出」这一结果本身在微塑料文献里就是空白污染的经典信号——真实的食品微塑料负荷通常在不同食品间差异很大。
文献前作:未核查(微塑料研究的 QA/QC 指南(如 Hermsen 等人的评分体系)是必查项,这会显著影响你的新颖性表述)。
约束最可能死在设备。 拉曼光谱仪中学基本没有。最便宜的规避方式: 把鉴定端降级为显微镜 + 热针法 + 尼罗红荧光染色这套低成本组合(文献中有标准流程),因为你要测的是相对污染率,不是绝对材质鉴定——空白与样品用同一套方法,比值仍然成立。这个降级必须在开题前用已知阳性样品验证可行。
表格: Form 1/1A/1B/2A + Form 3(涉及消解试剂如 H₂O₂ 或 KOH,必须查 SDS)。食品样品从商店购买、非培养 → 不触发 Form 6A。不涉及人类受试者。 展台禁液体/化学品/玻璃。
B1364–74
2D 单层测出来的药效排序,在 3D 里还成立吗
框架一组化合物在 2D 单层细胞培养中测得的 IC50 排序,与在同一细胞系的 3D 球体/类器官中测得的排序,秩相关系数是多少?排序反转发生在哪一类化合物上?
你自己的那一点把一个偶然观察变成一个系统性的量化结论。 已有获奖项目报告了「在 2D 里显著、在 3D 里显著减弱」这个现象,但那是 n=3 个化合物、1 条通路的偶发观察。你把它做成一个排序一致性研究:选 8–12 个机制各异的化合物(含已知易受 3D 影响的:依赖增殖速率的、依赖渗透的、依赖氧梯度的),在同一细胞系上并行测 2D 与 3D 的 IC50,报告 Spearman ρ 与反转发生的机制类别。交付物是一张「哪类机制的 2D 结果不能外推」的对照表。
擦过ISEF 2026 BMED060(Special Award)「Regulation of the PPARγ Pathway in Lung Cancer」,摘要原文:三种肺癌细胞系用 PPARγ 拮抗剂(GW9662、T0070907)与反向激动剂 BAY-0069 处理,「In 2D monolayers, all three compounds significantly reduce cell proliferation in a dose-dependent manner in two of three lines. However, growth inhibition was markedly weaker when cells were cultured as neurospheres or 3D tumor organoids, suggesting that PPARγ's role in proliferation is highly dependent on model complexity and tumor microenvironment. These findings highlight the importance of using complex relevant models for drug testing.」这个项目自己就得出了「模型复杂度决定结论」的观察——它给你的课题提供了直接证据支持(这也是本条 h=5 的原因),但它只测了 3 个化合物、1 条通路,没有给出这个现象的普遍性或适用边界。
文献前作:未核查(2D vs 3D 药敏差异在药物筛选领域有大量文献,必查——这一条的新颖性很可能已被文献占据,务必先查再定)。
约束最可能死在可行性。 需要细胞培养设施、CO₂ 培养箱、无菌操作、3D 球体培养耗材(低吸附板或悬滴)、活性检测试剂盒。中学基本不具备,必须进 RRI。且已建系细胞系虽然豁免 SRC 事前批准,仍须在研究计划与 Form 3 中标明来源/目录号。最便宜的规避方式: 若拿不到细胞培养,用同样的逻辑换一个可及的体系——例如比较「悬浮培养 vs 生物膜」状态下某抑制剂对酵母的 IC50 排序(酵母发酵在多数条件下豁免 PHBA 事前审查)。这个替代显著降低了意义,但保住了课题。
表格: 已建系细胞系 → 须在 Form 3 中标明来源/目录号;在大学/医院实验室完成 → Form 2C(须在展台竖立展示) + 可能的 Form 2B(合格科学家);Form 1/1A/1B/2A。
B1471–89
n=4 的重复测量设计,p<0.001 有多容易凭空产生
框架在一个 4 名受试者 × 3 个时间点 × 3 种处理的重复测量设计中,当受试者内相关(ICC)为 0.6–0.9 时,标准的重复测量 ANOVA 在零假设下产生 p<0.001 的概率是多少?如果分析把「局次」当作独立观测(伪重复),这个概率变成多少?
你自己的那一点一个纯模拟研究,零受试者、零风险,但直接刺中一整类课题的软肋。 运动科学、康复、可穿戴设备这类 ISEF 常见课题,受试者数普遍是个位数,但报告的 p 值常常小到 0.001 以下。你构造一个参数化的模拟框架:给定受试者数、时间点数、ICC、处理效应=0,重复 10 万次,统计各种常见分析方案(重复测量 ANOVA、伪重复的单因素 ANOVA、混合效应模型、Bonferroni 校正的成对比较)的第一类错误率。交付物是一张「给定 n 和分析方案,你的 p 值该打多少折」的查表,加一个开源脚本。
擦过ISEF 2026 BMED023(Grand Award)「Recovery Methods for High School Baseball Athletes」,摘要原文:「Four high school pitchers, aged 16, underwent three testing days(…)Statistical analyses identified a significant main effect of recovery method on BLa clearance (p<0.001) and an interaction between recovery method and inning (p = 0.003). Simple planned, Bonferroni corrected comparisons suggest that EMS and PR conditions outperformed the AR condition across all innings.」四名受试者,主效应 p<0.001,交互 p=0.003,并做了 Bonferroni 校正的计划内成对比较。摘要中未报告受试者内相关或效应量置信区间。 这是本组里最适合做「元问题」的锚点:不是说它错了,而是问「这个设计在零效应下能多容易产生这样的 p 值」。
你必须注意的诚实之处: 该项目用了正确的重复测量框架和 Bonferroni 校正,比很多同类项目规范。你的课题不能写成「它错了」,只能写成「这一类设计的第一类错误率是多少」——前者会被评委用原文驳倒,后者站得住。
文献前作:未核查(小样本重复测量的第一类错误率在生物统计学里有大量文献,伪重复问题有 Hurlbert 1984 的经典论文,必查——你的新颖性只能落在「针对 ISEF 常见设计的具体校准表」上)。
约束可行性满分(F=10):只需一台电脑,零受试者,零合规风险。最可能死在学科契合——BMED 评委可能认为这是数学/统计(MATH)。最便宜的规避方式: (1) 用一个真实的公开生理数据集(如 PhysioNet 上的运动生理数据)做实证校准,而不只是纯模拟;(2) 把交付物明确定位为「生物医学小样本研究的设计工具」,并给出针对本类目常见设计的具体建议。若仍担心,考虑投 MATH 或 SOFT 类目。
表格: 无受试者、无生物材料 → 只需 Form 1/1A/1B/2A。这是本文件里合规负担最轻的一条。
B1573–91
医疗问答 AI 换成低资源语言后,错误率涨多少、错在哪
框架一个基于检索增强生成(RAG)的医疗问答系统,在从英语切换到低资源语言时,其回答的事实正确率下降多少?下降中有多少来自检索失败(检索不到正确文档),多少来自生成失败(检索到了但答错)?
你自己的那一点错误来源的分解,加一个明确合规的评测协议。 现有的多语言医疗 AI 项目普遍报告一个总体准确率,但不区分是检索坏了还是生成坏了——而这两者的修复方式完全不同。你搭一个可控的 RAG 流水线,用公开医学问答基准(MedQA、MedMCQA、PubMedQA 等有公开测试集的),把题目机器翻译成若干低资源语言,然后分别测量:检索召回率@k、给定正确文档时的生成正确率、端到端正确率。再加一个安全维度:统计「自信的错误答案」比例——即模型给出明确断言但事实错误的比例,这是医疗场景中真正危险的失效模式。
擦过ISEF 2026 BMED041(Special Award)「ArogyaLoka HealthBridge AI: Patient Care Assistant」,摘要原文:「The first module uses a Retrieval-Augmented Generation (RAG) pipeline connected to a verified medical knowledge base, combined with native-language natural language processing to deliver accurate, context-aware health guidance(…)Evaluated against benchmarks for diagnostic accuracy, language coverage, and processing latency, results demonstrate that AI-driven multilingual platforms can advance research, development, and innovation in global health equity.」它报告了「针对诊断准确率、语言覆盖、处理延迟的基准评测」,摘要中未给出具体数字,也未分解错误来源。
⚠️ 这一条同时是一个合规教学案例。 原项目的产品逻辑是「向用户提供健康指导」。如果你把这样的系统给真人用户测试并返回结果,2027 规则下直接撞线(禁止向受试者提供建议、诊断或医学信息)。本课题的设计是纯离线评测:只用公开基准题库,不接触任何活人,不部署任何面向用户的服务。 这是这个热门方向在 2027 规则下唯一走得通的形态。
文献前作:未核查(多语言医疗 LLM 评测、RAG 错误归因都是当前热点,论文很多且更新极快,必查最近 12 个月的 arXiv)。
约束最可能死在被已有工作抢跑——这个方向学术界推进极快。最便宜的规避方式: 把语言选择落到本地语料几乎没人做的语种上(例如你自己母语的方言变体、或某个具体的南亚/东南亚低资源语言),并公开你的翻译后基准与标注,让贡献落在「一个可复用的评测集」而不是「一个结论」上。
次要约束: 需要 LLM API 额度(几十到几百元)与足够的算力。AI 政策: 研究 AI 完全合法;但不得用生成式 AI 撰写研究计划/摘要/展板/引文,AI 生成的代码必须显式引用并保留提示词日志——这条课题会大量用到 AI 生成代码,日志必须从第一天就开始记。
表格: 无受试者、公开数据 → Form 1/1A/1B/2A。不需要 Form 4。