ISEF Topic Scoping 2027

BEHA

行为与社会科学 · 15 条候选课题

Behavioral and Social Sciences

每条课题都是同一个动作:拿一个近届 ISEF 获奖作品,问它没问的那个关于自身有效性的问题。 分数是区间不是点值,也不预测奖级——评审看的是答辩表现,那是观察不到的。


B186–96

"指南对种族量刑差异毫无解释力"——这个零结果的检验功效是多少,换成个案级数据还成立吗

框架一项研究用 94 个联邦地区法院的院级汇总数据做线性回归,跨十个财年均未发现"指南适用率"与"黑白量刑差异"的显著关联,并据此结论"指南在结构上已崩坏、无可修复"。(a) 这个设计能检测到多大的效应?把真实效应注入模拟数据,功效曲线长什么样?(b) 院级汇总是否掩盖了个案级关联(生态学谬误)?(c) 在控制了犯罪严重度、毒品种类与数量、认罪协议、5K1.1 减刑之后,个案级关联是多少?

你自己的那一点三个自产结果。功效曲线是核心——一个零结果只有在配上"我们能检测到 X 大小的效应"时才是证据,否则它只是"我们没看到"。汇总—个案对照用同一份公开数据的两种粒度做同一个回归,直接展示辛普森悖论是否发生。协变量分层回答"未控制的严重度差异能否解释掉差异"。前作明确写了"首次证明指南无效",这是从零结果跳到"证明"的推断跨度,而这个跨度恰好可以被功效分析量化。

擦过BEHA019(2026 BEHA Grand Award)"Federal Sentencing Guidelines and Racial Disparity"——摘要原文:使用美国量刑委员会 Interactive Data Analyzer,26,435 个案件,2015–2024 十个财年,仅保留犯罪历史类别 1 的黑人或白人毒品走私被告;对 94 个联邦地区法院各自计算"在建议区间内量刑的案件百分比"与"黑白平均刑期百分比差",再用线性回归衡量两者关联;"Across ten fiscal years, no statistically significant association was found, indicating that judicial application of the Guidelines explains none of the variation in racial disparity. Moreover, these are the first findings to prove that the Guidelines have been ineffective at reducing racial disparity in sentencing. Ultimately, I conclude that the Guidelines are structurally broken and beyond reform." 摘要没有报告任何功效分析,也未提及个案级分析或严重度控制变量。相关:BEHA065(2025 Grand)用双重差分研究分区法改革(另一个因果推断类获奖项目,见 B6)。

约束最可能死在数据粒度——USSC 的 Interactive Data Analyzer 提供的是聚合查询,个案级数据需要下载 USSC 的年度个案数据文件(公开但体量较大、需要读码本)。这是 go/no-go:先确认个案级文件可下载且含所需变量。 若拿不到,退化为"功效曲线 + 汇总层面的敏感性分析",仍是完整结果。
人类受试者:不触发。 USSC 公开数据为已去标识化的行政记录,属于"公开可得的既有数据",不构成人类受试者研究——但必须在研究计划里明示这一判断依据,并按要求提交相应表格。
规则 7 规避: 功效模拟、个案级回归、分层分析全部是你自己跑出来的新分析结果,不是对已有结论的整理。

B283–93

99.8% 的准确率:分类器用的特征,是不是就是标签的定义

框架一项研究用"语言分析 + 跨子版块活动模式"的混合方法识别 Reddit 上的 incel 用户,达到 99.8% 准确率。但正类组的定义方式本身就是"在 incel 相关子版块活动的用户"。当用于定义标签的那些子版块被从特征中移除后,准确率还剩多少?只用语言特征(76%)与只用活动模式(79%)时准确率明显更低,为什么两者结合会跳到 99.8%?

你自己的那一点你产出特征剥离阶梯:全特征 → 移除标签来源子版块 → 移除全部与标签来源同主题的子版块 → 仅语言特征,四档准确率。第二产出:信息论诊断——直接计算"标签来源子版块的活动"与标签之间的互信息;如果接近标签的全部熵,那么 99.8% 就是恒等式而不是预测。第三产出:时间外推——用户在进入 incel 社区之前的行为能否预测其之后的进入?这才是前作宣称的应用价值("在深度陷入之前识别高风险个体"),而它测的是已经陷入之后的状态。

擦过BEHA061(2025 BEHA Grand Award)"Identifying Incel Behavior on Reddit"——摘要原文:分析 14,000 名用户的活动模式与评论;"construct a 7000 user incel-positive group and an equal-sized incel-negative group who share similar activity levels in the neutral subreddits frequented by the positive users""utilizing language analysis alone yields a classification accuracy of 76%, while using only the subreddit activity patterns of users achieves an accuracy of 79%. Remarkably, my hybrid method blends both approaches and reduces false positives and negatives by cross-referencing data to achieve 99.8% accuracy, improving 20% over the state-of-the-art";宣称价值是"spot individuals at risk of joining harmful groups early on"。摘要未说明正类标签的具体来源,也未说明标签来源子版块是否被排除在活动特征之外。相关:BEHA021(2026 Grand)对 r/antiwork 等三个子版块做纵向计算语言学分析(见 B7)、BEHA044(2025 Grand)用混沌理论分析 COVID 谣言传播。

约束最可能死在数据获取——Pushshift 类 Reddit 历史存档的可用性近年多次变化。这是 go/no-go:先确认可获得带子版块标签的公开 Reddit 语料。 若原始数据不可得,可改用任何一个"按社区成员身份定义标签、又用社区活动做特征"的公开数据集,结论同样成立(本课题的对象是这一类设计,不是 incel 这个主题本身)。
人类受试者:需谨慎判定。 Reddit 用户名是可识别信息。必须先做不可逆去标识化(哈希化用户名、不保留原文引用),并且不得试图去匿名化任何个体。 分析层面只处理聚合与统计量。研究计划中须明确写出去标识化流程与"仅使用公开可得既有数据"的定位;这一条务必与 SRC 事先沟通,不要自行判断为豁免。
规则 7 规避: 剥离阶梯、互信息诊断、时间外推实验全部是你自己跑的。

B384–94

"零误分类"的自闭症筛查模型:标签是不是由输入直接算出来的

框架一项研究用 Q-CHAT-10 问卷项目(A1–A10)训练随机森林与神经网络预测自闭症特质,报告准确率、精确率、召回率、F1 全部完美,混淆矩阵零误分类,并指出 Q-CHAT-10 总分贡献了超过 75% 的预测。在广泛使用的公开自闭症筛查数据集里,"类别"标签往往就是把 A1–A10 求和后按阈值二值化得到的。 这个恒等关系是否成立?把总分与各项目全部移除后,剩余特征(年龄、性别、族裔、家族史等)还能达到多少准确率?

你自己的那一点你产出恒等性证明 + 残余信号测量。第一步是可以在几行代码内完成的决定性实验:直接检验 sum(A1..A10) >= 阈值 是否与标签完全一致——如果一致,任何模型都必然是 100%。第二步才是真正有价值的:在移除定义性特征后,人口学与病史变量还剩多少判别力,并把这个残余 AUC 与临床筛查工具的实际表现对照。第三产出:把同一检验套用到该数据集家族的多个版本(幼儿/儿童/青少年/成人),给出一张跨版本恒等性表

擦过BEHA015T(2025 BEHA Special Award)"AI Usage to Optimize Diagnosing for Autism"——摘要原文:使用 Q-CHAT-10 问卷回答与个体行为指标(如 A1、A2、A5、A8)作为行为生物标志物,训练随机森林与神经网络预测 ASD 特质;"Both models had perfect evaluation metrics (accuracy, precision, recall, F1) scores and a confusion matrix that confirms the zero misclassifications.""The Q-CHAT 10 score was revealed as a significant contributor to model predictions, as it contributed over 75% to model predictions." 摘要把完美指标当作模型有效性的证据呈现。同题密度提示:mine_isef 显示 BEHA023(2024 Fourth Award)"Towards Improved Recognition and Diagnosis of Autism Among Females – A Novel Approach Using Machine Learning" 是标题级同题(无摘要,需手工核查)。

约束最可能死在被读成"批斗一个学生项目"。规避方式:题目与摘要必须完全指向数据集——"广泛使用的自闭症筛查数据集中的标签构造与其对机器学习评估的影响"——前作只作为动机在一处出现,并明确承认它诚实报告了"Q-CHAT 总分贡献 75%"这个关键线索(这句话本身就是问题的证据,必须原样引用)。主体是你对数据集家族的系统检验。
人类受试者:不触发。 使用的是公开发布的去标识化筛查数据集。
规则 7 规避: 恒等性检验、残余 AUC、跨版本表格全部是你自己跑出来的实验结果。
这是本文件可行性最高的一条:数据集只有几百到几千行,全部实验在笔记本上是秒级到分钟级。

B480–90

"脑龄预测误差减少六年":换一个年龄跨度的测试集,这个数字会变多少

框架脑龄预测有两个众所周知但常被忽略的性质:(a) 平均绝对误差(MAE)几乎完全由测试集的年龄跨度决定——跨度越大,MAE 越大,跨度越小,MAE 越小;(b) 预测的"脑龄差"存在系统性回归偏倚(年轻人被高估、年长者被低估),不做年龄偏倚校正就直接解读"哪些脑网络老得快"会得到系统性错误的结论。一项研究报告脑龄估计比现有模型准确 58%、误差减少六年以上,并据此得出"执行/记忆、视觉、运动网络老化最快"。做年龄偏倚校正后,网络排序还一样吗?把测试集年龄跨度对齐后,58% 的优势还剩多少?

你自己的那一点三个自产结果:(a) MAE—年龄跨度曲线:同一个模型在不同年龄跨度的测试子集上的 MAE,说明这个指标在跨研究比较时几乎不可比;(b) 校正前后的网络排序对照表:这是有实质科学后果的产出——如果排序在校正后改变,那么"哪些网络老得快"这个结论就是伪影;(c) 一个可复用的报告模板(须报告年龄跨度、校正方法、校正后效应量)。

擦过BEHA035(2025 BEHA Grand Award)"Novel Brain Aging Analysis With CLIMB"——摘要原文:CLIMB 从简单到精细渐进学习,定位个体层面的加速老化模式;在 1400+ 次扫描上验证(p<0.001),用自创的 fMRI 增强方法 ASWAC,优于传统静态分块;"it estimates a person's 'brain age' with 58% greater accuracy than current models, reducing error by more than six years""on average, executive & memory, visual, and motor networks show the fastest aging, often before symptoms appear";另用同一方法预测生理性别达 93% 准确。摘要未提及年龄偏倚校正,也未说明测试集的年龄分布。相关:BEHA043(2026 Grand)用 CNN-Transformer 在静息态 fMRI 连接上做精神分裂症分类(见 B5)、BEHA032(2026 Grand)用 DTI 预测人工耳蜗结局(见 B15)。

约束最可能死在算力——原始 fMRI 预处理不可能在窗口内用 CPU 完成。规避方式(这是本条可行性的关键):使用已发布的预计算功能连接矩阵(多个公开脑影像数据集提供 ROI×ROI 连接矩阵与年龄标签),跳过全部影像预处理。在连接矩阵上做岭回归/梯度提升脑龄模型,笔记本纯 CPU 分钟级。先确认可下载带年龄标签的预计算连接组,这是 go/no-go。
人类受试者:不触发(公开去标识化神经影像衍生数据)。
规则 7 规避: 三条曲线/表格都来自你自己训练与评估的模型。

B578–88

多站点脑影像分类 91.3%:把站点当标签能预测到多少

框架一项研究在 1,684 名精神分裂症患者与 1,684 名对照的静息态 fMRI 功能连接上达到 91.3% 准确率、AUC 0.92。这个量级的样本必然来自多站点汇集。多站点 fMRI 的扫描仪效应极强,若患者与对照在站点间分布不均,分类器可以靠站点特征取胜。用同一份数据:(a) 把"站点"当作标签训练分类器,能达到多少准确率?(b) 把随机划分换成留一站点验证(leave-one-site-out),诊断分类准确率掉到多少?

你自己的那一点你产出站点可预测性 + 留一站点性能这一对诊断量,并进一步做站点—诊断混杂度量化:计算站点与诊断标签之间的关联强度(如 Cramér's V),把"最大可能的捷径收益"算出来。第三产出:谐调方法的代价——用 ComBat 类站点谐调后,诊断分类还剩多少(谐调可能在去掉站点效应的同时去掉真实信号,这个代价很少被报告)。

擦过BEHA043(2026 BEHA Grand Award)"Interpretable AI for Early Schizophrenia Detection"——摘要原文:可解释的 CNN-Transformer 模型,从静息态 fMRI 功能连接分类精神分裂症并预测治疗轨迹;"Preprocessing and feature extraction were performed on data from 1,684 SCZ patients and 1,684 healthy controls";3D CNN 空间编码器 + 多头 Transformer 时间编码器 + 预后头,把被试分为三类(稳定对照、治疗响应型 SCZ、进展性精神病/治疗抵抗)——摘要称这是"a stratification previously impossible without longitudinal clinical observation"准确率 91.3%、AUC 0.92、灵敏度 86.4%、特异度 92.9%;SHAP 确认 ACC-DLPFC 额-扣带回失连接为主导标志物;管线已作为开源 Python 库发布到 PyPI。摘要未提及站点/扫描仪效应,也未说明交叉验证是否按站点分层且"三分类预后头"是在没有纵向随访数据的情况下训练的——这一点本身值得单独追问(见"自己继续找题")

约束最可能死在原始影像的算力与体量。规避方式同 B4:使用公开的预计算功能连接矩阵(须带站点标签——这是 go/no-go,没有站点标签就做不了这个课题)。模型可用逻辑回归/梯度提升替代 CNN-Transformer——站点混杂的结论对模型类别不敏感,这是可行性的关键论证,必须写进研究计划。
人类受试者:不触发(公开去标识化衍生数据)。
规则 7 规避: 三个诊断量全部来自你自己训练的模型。

B681–91

双重差分的平行趋势假设:五个中西部城市是怎么选出来的

框架一项研究用明尼阿波利斯 2040 分区改革作为自然实验,与五个中西部城市对比四个 ACS 时期,用双重差分估计上调容积率对城市不平等的因果影响。双重差分的全部效力来自平行趋势假设,而这个假设需要:(a) 改革前的趋势检验(event study 的 pre-trend);(b) 对照城市选择的敏感性分析(换一组对照,结论变吗);(c) 安慰剂检验/置换推断(把"改革"随机指派给其他城市,估计值的分布长什么样)。这三项在摘要中均未出现。做完之后,结论还成立吗?

你自己的那一点三个自产结果,全部基于公开的 ACS 数据:事件研究图(改革前后逐期系数,配 95% 置信区间)——这是因果推断领域判断可信度的标准图,展板上极有说服力;捐赠池敏感性分析(把对照城市扩展到全部中西部大城市,报告估计值的分布,而不是一个点值);置换推断 p 值(把处理指派随机化 1000 次,看真实估计值落在零分布的什么位置)。第四个可选产出:合成控制法作为双重差分的替代估计量。

擦过BEHA065(2025 BEHA Grand Award)"Modern Redlining"——摘要原文:提出"空间资本"概念并假设其遵循 Piketty 的 r > g 动态;"I use difference-in-differences causal inferencing to quantify the causal impact of American zoning law""Using Minneapolis's 2040 zoning reform as a natural case study, I compare outcomes across five midwestern cities over four ACS time periods";发现总体双边种族隔离与收入隔离下降、社会经济混合度、住房多样性与可负担性上升;摘要自己承认"the analysis faces limitations such as a short post-reform period"(这个自省必须承认并引用)。摘要未提及平行趋势检验、对照城市选择依据或安慰剂检验。相关:BEHA031(2026 Grand)用双向固定效应研究极端温度对医院财务的影响(见 B10)、BEHA019(2026 Grand)量刑差异回归(见 B1)。

约束最可能死在被理解为"推翻明尼阿波利斯改革有效"。这不是目标。 你的结论应当写成"在做完 X/Y/Z 三项标准稳健性检验后,该效应的可信区间是……"——三种可能结果(稳健、脆弱、方向反转)都是完整的科学产出,这是本条不会因结果不显著而报废的原因。
人类受试者:不触发(ACS 为公开发布的聚合人口普查数据)。
规则 7 规避: 事件研究、敏感性分析、置换推断都是你自己跑的新估计。
可行性高:ACS 数据通过公开 API 可下载,R/Python 的固定效应与合成控制包成熟,纯 CPU 分钟级。

B777–87

LDA 换个随机种子,主题还是那些主题吗

框架一项研究用 VADER 情感分析 + LDA 主题模型,跨三个 Reddit 反工作子版块做 2019–2025 的纵向分析,结论是"挑衅性、观点性内容驱动最多互动,负面情绪是持续对话的核心媒介"。LDA 的主题在不同随机种子下常常显著不同,主题数 K 的选择也高度主观;VADER 是为社交媒体短文本构建的词典,在长篇、含反讽与行业黑话的语境下有效性存疑。换 20 个随机种子重跑,主题的稳定性有多高?结论还成立吗?

你自己的那一点三个自产结果:(a) 主题稳定性矩阵——20 个种子、每个种子的 K 个主题,两两计算主题词分布的相似度,报告"跨种子可复现的主题"占比;(b) K 敏感性——K 从 5 到 30 时结论的漂移;(c) VADER 有效性检验——用一个独立的、更强的情感标注来源(如公开的众包情感标注语料,或同时用多个词典与模型交叉比对)测量 VADER 在这个语域上的一致性,给出情感分数的可靠性上界。有了这三项,"负面情绪驱动互动"这个结论第一次有了误差棒。

擦过BEHA021(2026 BEHA Grand Award)"Computational Analysis of Antiwork on Reddit"——摘要原文:纵向计算语言学分析,跨 r/antiwork、r/workreform、r/workersstrikeback 三个子版块,2019 到 2025"Valence Aware Dictionary and Sentiment Reasoner (VADER) sentiment analysis was utilized to obtain polarity and objectivity scores, while Latent Dirichlet Allocation (LDA) topics revealed underlying thematic ideas""Results suggest that provocative, opinion-based content drives the greatest user interaction, with negative emotions acting as a central agent for sustained conversations." 摘要未报告主题数选择依据、种子稳定性或情感工具的验证。相关:BEHA044(2025 Grand)同样用 LDA 组织 COVID 谣言话题,随后用递归量化分析(RQA)研究观点变化——RQA 对嵌入维数与半径参数同样极度敏感,这是一条平行的、未被本文件展开的线索

约束最可能死在数据获取(同 B2 的 Reddit 语料风险)。规避方式:主题稳定性与 K 敏感性这两条结论对语料选择完全不敏感,可以换成任何一个公开的大规模文本语料(新闻、评论、论文摘要)来做,前作只提供动机。这让本条的可行性显著高于 B2。
人类受试者: 若使用 Reddit 数据,处理同 B2(哈希化、不去匿名化、与 SRC 事先沟通);若改用非用户生成的公开语料则完全不触发。
规则 7 规避: 稳定性矩阵、K 曲线、情感一致性全部是你自己跑的。纯 CPU,gensim LDA 在几万篇文档上是分钟级。

B880–90

号称"非个人身份信息"的面部局部图:能不能反推出这是谁

框架一项研究把人脸切成局部区域(眼、眉、鼻、口)作为"非个人身份信息(non-PII)"来训练情绪识别模型,主张这样可以规避隐私法规、扩大可用数据。但"去掉整脸"不等于"去掉身份"。 在同一批局部图上训练一个身份再识别模型,能达到多少准确率?如果眼部区域就能以高准确率识别个体,那么"non-PII"这个前提不成立,整个隐私论证随之崩塌。

你自己的那一点你产出隐私—效用曲面:横轴是切分粒度(全脸 → 上半脸 → 眼区 → 眼区+模糊 → 眼区+像素化),纵轴同时画两条线——情绪识别准确率身份再识别准确率。这张图是本课题的全部价值:它把"隐私保护"从一个断言变成一个可测量的权衡,并能直接指出是否存在"情绪可识别而身份不可识别"的可用区间。这正是前作主张成立所必需、却从未被检验的那个前提。

擦过BEHA034(2026 BEHA Grand Award)"Advancing AI Emotion Detection With Partial Faces"——摘要原文:"training FER models currently relies on full face images that are restricted by data privacy regulations. Consequently, it remains unclear whether FER models can perform effectively when trained on non-personally identifiable data (non-PII)";把公开数据集分割提取 non-PII 特征;初期结果:全脸 60–80% 准确,鼻口区与旋转图约 14%,眼与眉区不到 50%"A second experiment using a larger, higher-resolution dataset improved convergence. After modifying model layers, rotated images and nose-mouth regions matched full-face at 60–80% accuracy.";结论是 non-PII 数据可有效训练 FER,从而"expand access to restricted datasets ... while preserving privacy protections"。摘要从未检验局部图是否真的不可识别身份——而这正是"non-PII"这个标签的全部含义所在。
另外值得注意: 从 14%(接近多类随机水平)经"modifying model layers"跳到 60–80%,若模型调整是在同一测试集上迭代做的,则存在测试集调参偏差。这是本条可以附带的第二问。

约束最可能死在算力(再识别模型需要训练)。规避方式:用度量学习/最近邻而非端到端训练——在局部图上提取轻量特征(HOG、小型预训练网络的冻结特征),做被试内/被试间的最近邻检索,报告 rank-1 识别率。这在 CPU 上完全可行,且再识别攻击的标准评估本来就用检索指标。数据须用公开、带被试 ID 的人脸表情数据集(这是 go/no-go:没有被试 ID 就无法评估再识别)。
人类受试者:不触发(公开发布的既有人脸数据集)。但必须严格遵守该数据集的使用许可,不得公开展示可识别的个体图像——展板上只能放聚合曲线,不能放人脸。
规则 7 规避: 隐私—效用曲面是你自己跑出来的。

B971–89

从新闻里抽出的受害者画像,反映的是暴力分布还是报道偏好

框架一项研究用 NLP 从新闻报道中抽取杀害女性案件的人口学信息,识别出 174 名受害者,并得出黑人女性占 49%、31–50 岁占 36%、亲密伴侣作案占 48.7% 的分布,报告峰值指数 1.25/10 万女性,"超过官方记录"但新闻报道本身有强烈的选择性——某些受害者更容易被报道。这个分布反映的是暴力的真实分布,还是媒体的报道偏好?把新闻抽取的分布与官方登记数据逐维度对照,各维度的偏差是多少?

你自己的那一点你产出覆盖率偏差矩阵:按种族、年龄、地区、作案关系各维度,计算"新闻可捕获率"(新闻中出现的案件数 / 官方登记案件数)。如果各维度的捕获率不同,那么新闻抽取的分布必然是有偏的,而且偏差方向可以被精确量化。第二产出:捕获—再捕获估计——用生态学的捕获再捕获方法(把"官方记录"与"新闻记录"当作两次独立捕获)估计真实案件总数,这给出比"超过官方记录"更强的结论。第三产出:偏差校正后的分布

擦过BEHA040(2026 BEHA Grand Award)"Demographic Analysis of Feminicide With ML"——摘要原文:分析巴西塞阿拉州 2022 年 1 月至 2025 年 6 月的案件,整合人工智能、统计与制图;NLP 系统从新闻文章中收集、抽取并分类人口学信息,用 10,000 篇报道训练以识别日期、年龄、种族/族裔、地点、作案情境;"Random Forest achieved the best performance, with 98.8% accuracy, 98.7% sensitivity, and 99.4% AUC-ROC";抽取数据与巴西官方数据库整合,用 Feminicide Index、社会经济相关与专题制图分析;"The results identified 174 victims, with higher prevalence among Black women (49%), individuals aged 31 to 50 (36%), and cases involving intimate partners (48.7%)""a peak Feminicide Index of 1.25 per 100,000 women was observed, exceeding official records";结论是该系统"improves detection of underreported cases"。摘要未讨论媒体报道的选择性偏差——而"改善漏报检测"这个主张的成立与否,完全取决于新闻覆盖是否随机。

约束最可能死在数据可及性——需要同时拿到巴西官方登记数据与新闻语料。这是 go/no-go。 最便宜的规避:把课题迁移到任何一个新闻覆盖与官方登记并存的公开领域(例如美国的警察用枪致死:既有官方统计,也有媒体众包数据库如 Fatal Encounters/Mapping Police Violence,两者都公开且已被反复对比过——这也意味着必须先做文献核查确认新颖性边界)。覆盖率偏差与捕获再捕获这两条方法学产出对具体领域不敏感。
人类受试者:不触发(公开的既有记录与新闻报道;不接触任何个体)。但涉及暴力受害者信息,研究计划中须写明数据仅以聚合形式呈现,不展示任何个体身份信息。
规则 7 规避: 覆盖率矩阵与捕获再捕获估计都是你自己算的新结果。纯 CPU。

B1070–88

极端高温多一天,医院坏账多 3 万美元:换一组温度分箱还成立吗

框架一项研究用 36,961 个观测(4,568 家美国医院、2011–2019)的双向固定效应模型,发现高于 80°F 的极端高温每多一天,医院未补偿医疗成本增加 30,087 美元(0.4%),而低于 20°F 的极端低温无显著关联。温度阈值 80°F / 20°F 是怎么选的? 把阈值改成 75/85/90°F、把分箱改成 5°F 等宽箱或分位数箱,系数与显著性怎么变?标准误按县聚类与按医院聚类,结论一致吗?在这么多种设定里,多重比较校正后还剩多少?

你自己的那一点三个自产结果:(a) 设定曲线(specification curve)——把阈值、分箱方式、聚类层级、控制变量集合的所有合理组合跑一遍(数百到数千个设定),把全部系数按大小排序画出来,标注哪些显著。这是社会科学近年公认的稳健性呈现方式,展板上极有冲击力;(b) 分布式滞后模型——高温的健康与财务影响存在滞后,单日效应可能低估或高估累积效应;(c) 安慰剂结局——用一个理论上不应受温度影响的医院财务指标做同样回归,如果它也显著,说明模型捕捉的是别的东西。

擦过BEHA031(2026 BEHA Grand Award)"The Financial Impact of Extreme Temperatures"——摘要原文:自建面板数据 36,961 个观测、4,568 家美国医院、2011–2019,含医院财务记录与县级天气及社会经济信息,全部来自公开来源;双向固定效应模型"extreme heat above 80°F increases hospital uncompensated care costs ... one additional day of extreme heat is associated with a $30,087, or 0.4%, increase in unaffordable medical expenses. In contrast with excessive heat, extreme cold temperatures below 20°F do not have a statistically significant relationship";另发现温度落在 60–80°F 之外时医院盈利能力更高。摘要未报告阈值选择依据、聚类层级或任何稳健性检验。相关:BEHA065(2025 Grand)双重差分分区改革(B6)、BEHA019(2026 Grand)量刑回归(B1)——本类目连续三届都有高质量的因果推断获奖项目,但没有一个报告了标准的稳健性套件。

约束最可能死在数据整备工作量——医院财务数据(HCRIS 成本报告)体量大、变量码本复杂,天气数据需要按县聚合。这是主要工作量所在,须预留至少三分之一的时间窗口。 最便宜的规避:不必复现全部 4,568 家医院;抽样 500–1000 家仍能给出稳定的设定曲线,且抽样本身可以作为一项敏感性分析。
人类受试者:不触发(医院层面的公开行政与财务数据,不含个体患者信息)。
规则 7 规避: 设定曲线、滞后模型、安慰剂结局全部是你自己跑的回归。纯 CPU(面板固定效应在几万行上是秒级,数千个设定是小时级)。

B1171–89

"延迟过度反应是堵车的主因":换一个交通流模型,这个结论还在吗

框架一项研究用统一的微观交通模型同时模拟蚂蚁与人类车流,通过参数敏感性分析得出"延迟过度反应是人类交通拥堵的主因",并据此提出一种自动驾驶算法。这个结论有多依赖于所选的模型族? 换成智能驾驶员模型(IDM)、Nagel-Schreckenberg 元胞自动机、Optimal Velocity 模型、Gipps 模型分别重做同一个敏感性分析,"延迟"与"过度反应"的相对重要性排序是否一致?

你自己的那一点你产出跨模型族的敏感性排序表:四到五个主流跟驰模型 × 同一组参数(反应延迟、增益、期望间距、最大加速度)的 Sobol 指数或方差贡献。如果排序在模型间一致,那是对原结论的强力支持;如果不一致,那说明结论是模型工件。 两个结果都完整。第二产出:自动驾驶渗透率结论的稳健性——原研究称"即使少量自动驾驶车也能改善整体交通",这个阈值在不同模型族下是多少?这是一个有政策含义的量。

擦过BEHA057(2026 BEHA Grand Award)"Collective Intelligence"——摘要原文:受蚂蚁、蜜蜂、鱼群、鸟群的集体智能启发,比较蚂蚁与人类车辆两个交通系统;"I simulated both ants' and human vehicular traffic using a simple, unified microscopic model to find out why traffic jams occur in the latter. I hypothesize that delayed overreaction is the main cause and perform parameter sensitivity study to test this idea.";用密度、速度、流量比较两系统;随后提出一种自动驾驶算法,融合车辆的物理参数(最大速度、加速度)与蚂蚁的行为参数(间距敏感度、反应延迟);"My simulations show that even a small fraction of self-driven cars improves the overall traffic." 摘要未说明使用了哪个跟驰模型,也未做跨模型族的稳健性检验。相关:BEHA054(2026 Grand,SmartBlink)用 SUMO 仿真评估自适应信号灯——SUMO 默认用 Krauss 跟驰模型,这本身也是一个可以追问的模型选择

约束最可能死在被认为"只是多跑了几个模型"。规避方式:核心产出必须是方差分解的定量对照(Sobol 指数)而不是"我也跑了 IDM";并明确论证为什么跨模型族的排序一致性是判断结论稳健性的正确判据。
人类受试者:完全不触发(纯仿真,不涉及任何人)。这是本文件里合规风险最低的一条。
规则 7 规避: 全部结果来自你自己实现与运行的仿真。
可行性很高:跟驰模型是常微分方程或元胞自动机,Python 实现每个模型几十行;Sobol 敏感性分析用 SALib,纯 CPU 小时级。

B1271–89

n=12 对 n=12 得到 d=1.76:这个效应量本身有多大偏倚

框架小样本研究报告的效应量存在系统性膨胀(只有效应恰好被高估的那些研究才会跨过显著性阈值,即"胜者诅咒")。一项 n=12/12 的随机对照报告 t(22)=4.31, p=0.003, Cohen's d=1.76。给定这个样本量与显著性门槛,在真实效应为 d=0.5 的世界里,"被观察到且显著"的研究会报告多大的 d? 更广地问:ISEF BEHA 获奖项目报告的效应量分布,与它们的样本量之间是什么关系?

你自己的那一点两个自产结果。(a) 条件期望效应量模拟:给定 n 与 α,模拟大量研究,画出"真实 d"→"显著研究报告的平均 d"的膨胀曲线;这条曲线让 1.76 这个数字第一次有了解读方式。(b) 语料层面的漏斗图:从公开的 ISEF 获奖摘要中系统抽取所有报告了样本量与效应量/p 值的行为科学项目,画出效应量对样本量的散点(漏斗图)。如果小样本项目系统性地报告更大的效应量,那就是选择性效应的直接证据。 这第二项是你自己的数据抽取与分析,是本条避开规则 7 的关键。

擦过BEHA036T(2026 BEHA Special Award)"C-MAP Braille"——摘要原文:"Twenty-four visually impaired participants (ages 13–17) were assigned to adaptive (n=12) or fixed-curriculum (n=12) groups across 11 sessions""The adaptive group reached 90% proficiency in 6.2 sessions; no control participant reached this threshold (t(22) = 4.31, p = 0.003, d = 1.76)";混淆对错误下降 77.2% vs 36.9%(p=0.001);NASA-TLX 在第 10 次训练时分化(37.2 vs 57.1, partial η²=0.38);抬高点高度在触觉敏感度低于中位数的参与者中提升 10.9 个百分点(p=0.007)。这个摘要还有一个值得称道之处:它明确点名了先前的 ISEF 参赛作品("Prior ISEF entries — BrailleSense (2025) and eiBraille (2024)")并说明了自己的差异——这正是本文件反复要求的做法。(注:eiBraille 在本地语料中是 TECA016T(2025 Grand Award),年份标注与本地记录不一致,须手工核实。)相关小样本高效应的例子:BEHA062(2025 Grand+Special)n=12 双相患者八周干预、BEHA006(2026 Special)n=8 参与者(6 实验 2 对照)报告 t=10.108 与 Cohen's d>0.80。

约束最可能死在两点。第一,措辞。 这个课题极易被读成"指控获奖者造假"。它不是。 效应量膨胀是抽样分布的数学性质,与研究者的诚信完全无关,摘要与展板必须把这一点写在最前面第二,规则 7。 单纯"统计已有摘要的效应量"非常接近文献综述。规避的关键在于 (a) 那半部分:模拟研究是你自己产生的实验数据,且它才是解释 (b) 的理论框架;两者必须以"理论预测 + 语料验证"的结构呈现,缺一不可。
人类受试者:不触发(模拟数据 + 公开发布的摘要文本)。

B1370–88

每种口音只用一位说话人:你测的是口音还是那个人

框架一项研究给 100 名母语者随机播放美式、西班牙式或日式口音的"标准化、内容相同"的音频,发现口音条件解释了 59% 的记忆回忆方差,可信度下降 50%,智力评分每提升一个口音等级下降 1.5 分。如果每个口音条件只用了一段录音(一位说话人),那么"口音"与"这位说话人的语速、清晰度、音质、录音条件"完全共线——这就是经典的"语言材料作为固定效应"谬误(Clark, 1973)。在公开的口音语音语料上,同一口音内不同说话人之间的可懂度差异,与不同口音之间的差异相比,孰大孰小?

你自己的那一点你产出方差分解:用公开的多说话人口音语料,计算客观可懂度指标(语速、发音清晰度指标、自动语音识别的词错误率、STOI 类可懂度度量)在"口音之间"与"同口音的说话人之间"的方差占比。如果说话人内差异与口音间差异同量级,那么单说话人设计在原理上就无法归因到口音。 第二产出:功效—说话人数量曲线——要把口音效应与说话人效应分离,每个口音需要多少位说话人?这给出一份可操作的设计建议。第三产出:把 59% 这个方差解释度放进模拟中,看在单说话人设计下、真实口音效应为零时,能否偶然观察到这么大的数值。

擦过BEHA044(2026 BEHA Grand Award + Special Award)"Accent Familiarity: Memory, Bias & the Brain"——摘要原文:"100 native English speakers were randomly assigned to standardized, identical American, Spanish, or Japanese-accented audio groups";记忆用 10 道选择题测量,社会知觉用 6 个李克特维度(能力与情感复合);"The accent condition explained 59% of the variance in memory recall and was highly statistically significant. Credibility dropped 50%, intelligence ratings fell 1.5 points per accent step";结论是"perceived phonetic distance is the primary driver"。摘要中 "standardized, identical ... audio" 指的是内容相同,并未说明每个条件用了几位说话人——这是本课题成立与否的关键,必须先核实

约束最可能死在前提核对——如果原研究每个口音用了多位说话人并做了随机效应建模,本课题的第一问就不成立退路:即便如此,"同口音内说话人差异 vs 口音间差异"的方差分解本身仍是一个独立成立的、有用的结果,可作为对该文献的方法学基础设施贡献。
人类受试者:不触发。不播放音频给任何人——全部指标是客观声学量与自动语音识别输出,在公开语音语料上离线计算。这正是本课题相对于"再做一次听觉实验"的决定性优势:后者需要 IRB + 招募 + 未成年人家长许可,在 3–4 个月窗口内几乎不可行。
规则 7 规避: 方差分解、功效曲线、模拟全部是你自己算的。纯 CPU(librosa + 小型 ASR 模型或公开转写)。

B1467–85

2⁴ 析因设计里的交互效应:要多少人才看得见

框架一项研究用 2⁴ 全因子设计(无限滚动 × 自动播放 × 社会认同 × 通知徽章)测量界面元素对认知负荷的"超可加"compounding,报告自动播放 × 社会认同的交互超出预测 1.34 倍,并注明"sampling toward N=480 ongoing"。在析因设计中,检测二阶交互所需的样本量约为检测同等大小主效应的四倍。 在 N=480、四因子全交互的设定下,能可靠检测到多大的交互效应?1.34 倍这个观察值落在零分布的什么位置?做了多少次交互检验,多重比较校正后还剩什么?

你自己的那一点三个自产结果:(a) 析因设计功效表——给定 N、因子数、主效应大小,列出各阶交互的检测功效;这张表对任何做析因设计的行为科学项目都直接可用;(b) 多重比较代价——2⁴ 设计有 11 个交互项,在族错误率控制下的临界效应量是多少;(c) 度量收敛效度的上界——原研究报告 NASA-TLX 与双任务反应时的相关 r=0.68,两个度量的相关只有 0.68 意味着它们共享约 46% 的方差,这为任何基于两者的推断设置了信噪比上限,可以用模拟量化这个上限如何压缩可检测的交互。

擦过BEHA056(2026 BEHA Grand Award)"The Cognitive Cost of Addictive Design"——摘要原文:整合心理物理叠加、Fogg 行为模型、认知负荷理论三套理论;"A 2⁴ full-factorial experiment varied four interface primitives (infinite scroll, autoplay, social proof, and notification badges) within a controlled prototype";认知负荷用 NASA-TLX 与双任务算术反应时操作化,"demonstrated convergent validity (r=0.68)""The control condition produced a mean NASA-TLX of 38.1 against 72.4 at maximum exposure, consistent with non-additive compounding. The autoplay-social proof interaction exceeded prediction by 1.34x (largest effect), supporting non-independent compounding (sampling toward N=480 ongoing)." 摘要未报告功效分析或多重比较校正,且自己注明样本仍在收集中(这个自省应当被承认)。

约束最可能死在"这只是一个统计练习,不算行为科学"。规避方式:把课题定位成"行为科学交互假设的可检验性边界",并把功效表套用到本类目近两届多个报告了交互效应的获奖设计上(B12 的漏斗图思路可以合并进来),使其成为一份针对 BEHA 类目的设计指南。同时这也是规则 7 的规避点:模拟是你自己产生的数据。
人类受试者:不触发(纯模拟)。

B1580–90

n=17、九个预测变量、调整后 R²=0.985:这个模型能预测新病人吗

框架一项研究用扩散张量成像的微结构指标预测人工耳蜗术后言语识别得分,报告调整后 R² = 0.968(AzBio)与 0.985(CNC)。样本是 17 名人工耳蜗候选者,三条听觉通路 × 三个 DTI 指标 = 9 个候选预测变量。在 n=17、p=9 的情形下:(a) 纯噪声数据能得到多大的调整后 R²?(b) 留一交叉验证下的 R² 是多少(样本外 R² 常常为负)?(c) 若预测变量是从 9 个中挑选出来的,选择过程本身如何抬高 R²?

你自己的那一点三个自产结果:(a) 零数据校准——生成 n=17、p=9 的纯随机数据,跑同样的多元线性回归 + 变量选择流程,报告调整后 R² 的零分布;这条零分布是本课题的核心产出,它直接给出"0.985 有多罕见"的答案。(b) 样本外验证:在任何一份公开的 DTI + 行为结局数据上,对比样本内 R² 与留一交叉验证 R²,量化两者落差随 n/p 比的变化。(c) 所需样本量:给定希望的样本外 R²,n 应该是多少——这是给该领域的直接建议。

擦过BEHA032(2026 BEHA Grand Award)"DTI for Predicting Cochlear Implant Outcomes"——摘要原文:"DTI data from 12 normal-hearing controls and 17 CI candidates";概率纤维追踪重建三条中枢听觉通路(斜方体、外侧丘系 LL、下丘臂 BI),沿通路提取三个 DTI 微结构指标,代入普通最小二乘多元线性回归预测术后 CNC 与 AzBio 言语得分;"The MLR models demonstrated high predictive accuracy, accounting for 96.8% of the variance in AzBio scores (adj. R-squared = 0.968) and 98.5% in CNC scores (adj. R-squared = 0.985)"摘要自己写明"the current predictive model is limited by a small longitudinal cohort (n = 5). A larger sample size is required to confirm MLR coefficients and ensure generalizability"——这个自省非常关键,必须原样引用并承认;你的课题不是指出它没意识到问题,而是把它意识到的问题量化。 相关:BEHA035(2025 Grand)脑龄分析(见 B4)、BEHA043(2026 Grand)精神分裂症 fMRI(见 B5)。

约束最可能死在被读成"挑一个已经自我承认了局限的项目下手"。规避方式:这恰恰是优点——你可以在摘要里明确写"该研究已正确指出样本量限制;本研究把这一限制转化为可操作的量化指南"。这种定位既尊重前作、又有独立贡献,是本文件中措辞风险最低的高分条目之一。
人类受试者:不触发(零数据模拟 + 公开去标识化影像衍生数据)。
规则 7 规避: 零分布、留一 R²、样本量曲线全部是你自己跑的。
可行性极高:核心实验(零数据校准)完全不需要任何真实数据,几十行代码、笔记本上秒级。

← 返回全部赛道