ISEF 白皮书 · 2027 赛季准备版
第八章 把方向变成可以完成的研究
浏览本章 12 个小节
8.1 题目不必一开始就很大
“我想做医疗 AI。”“我想研究环保。”“我想做一个帮助老人的设备。”这些都是合理的兴趣,但还不是可以安排实验的研究问题。它们没有告诉我们要测什么、与什么比较、在什么条件下算成功。
我们之前整理过分学科题库、历届近邻项目和若干方向的深入分析。本章把其中适合学生理解的部分重新组织成选题推演。它们是研究设计示例,不是已经替你完成的原创性认证,也不是可以直接提交的研究计划。自己的问题、条件、预期分析和研究文本,仍应由学生理解并完成。
从方向走向问题,通常要经历一次收缩。比如“帮助老人”可以缩为“测量步态变化”,再缩为“换一双鞋后,传感器还能否给出可比较的步态参数”。每缩小一次,研究少承诺一点,却更接近能够验证的内容。
这并不意味着只能做简单题。一个表面很小的问题可能涉及困难的测量、模型或理论。读者需要看得清楚:你观察的对象是什么,哪些解释经过检验,结论到了哪里就应停下。
8.2 查近邻作品,要比较到哪一层
查新时只读标题,很容易出现两种误判:见到相同关键词就认定“别人已经做完了”;没有搜到相同句子就宣布“从来没人研究过”。更有用的办法,是把相关作品放进同一张比较表。
| 比较内容 | 要记录的具体信息 | 为什么重要 |
|---|---|---|
| 研究对象 | 什么人群、材料、设备、环境或数学对象 | 同一方法换对象可能有意义,也可能只是换数据 |
| 主要问题 | 想解释、预测、测量还是改进什么 | 防止把背景主题误当研究贡献 |
| 输入与来源 | 数据、样本、仪器和获得方式 | 判断自己有没有相应条件 |
| 比较基线 | 与原方法、简单模型还是空白处理比较 | 没有公平基线,很难判断改进 |
| 测试范围 | 新对象、新日期、新地点或独立批次 | 判断结论能否离开原始样本 |
| 已知限制 | 作者承认了什么,摘要没说明什么 | 寻找值得继续研究的问题 |
表格可以从三到五个最相关的项目开始,不必一口气收集上百条标题。随后再加入学术论文与现实中的产品或流程。ISEF 数据库说明其他学生做过什么,专业文献说明更广泛的研究进展,两者不能互相替代。
记录“摘要未说明”与“作者没有做”也要分开。短摘要常省略细节。如果某个判断决定题目是否值得继续,应该寻找全文、公开补充材料或其他可靠资料,不能凭空白替别人下结论。
8.3 智能鞋垫:把设备题改成测量题
此前的检索在十三年档案中找到 16 个直接标题近邻,涉及七届比赛。它们包括智能鞋、足底压力、步态分析及相关疾病场景。更宽的步态主题有 234 个项目。因此,“把压力传感器放进鞋垫,再做一个手机界面”很难单独说明贡献。
例如,2022 年的 Smart Sole 已以可获得的步态分析为目标,2025 年已有低成本、多传感或无标记的三维步态测量相关作品,2026 年还有新的智能鞋垫记录。它们提供的是需要继续比较的先例,而不是阻止学生研究的清单。2022 Smart Sole 摘要、2025 步态测量项目摘要、2026 智能鞋垫项目摘要
先问输出是否真的是你以为的物理量
传感器给出的原始电压或数字值,不会自动变成足底压力。接触面积、安装位置、鞋垫变形和传感器本身的响应,都可能影响读数。若这些条件变化,屏幕上的曲线仍可能十分平滑,却已经无法与前一天比较。
因此,一个具体问题可以是:同一套测量方法在换鞋、重新安装或不同日期后,误差怎样变化?研究的主要结果是可重复性与条件变化带来的误差,而不是疾病诊断。
起步时可以先在安全台架上验证传感器响应,再决定是否确实需要人的数据。台架只能回答台架问题,不能替代步态验证;但它可以先排除电路、安装和重复测量中的明显问题。若系统在静态条件下都不稳定,直接招募更多参与者并不会修复它。
比较压力、惯性与融合方法,保持其他条件一致
如果有条件开展获准的人体研究,可以比较压力传感、惯性传感,以及二者融合的方案。三个方案应使用相同参与者和相同测试划分,避免融合模型获得更多数据或更充分调参。
测试可以围绕一个具体变化,例如不同速度或不同鞋型。研究重点不是所有情况下都获得最高分,而是判断融合在哪些条件下有帮助,在哪些条件下没有帮助,或者反而变差。
需要注意,某位参与者的一千个步态窗口不等于一千名参与者。如果要讨论对新人的适用性,应将人作为划分单位;若讨论跨天稳定性,还需把日期结构保留在分析中。随机打散全部窗口通常无法回答这两个问题。
结论应停在实际测量的地方
如果研究只与实验室步态参数比较,可以报告测量误差和一致性。没有临床诊断或前瞻性结局,就不要声称检测了疾病或预测了未来跌倒。一个装置能分辨两种行走方式,不等于能识别真实病患。
ENBM 的生物力学或传感方向可能适合这类测量研究;若贡献主要在电路、实时采集与功耗,EBED 更值得考虑。类别由贡献决定,而不是看设备放在身体哪一处。
若结果显示换鞋后表现下降,仍然可以形成有价值的结论:下降有多大,哪些测量受影响,哪种校准有帮助。后来使用类似系统的人,可以据此知道换鞋或重新安装后要检查哪些变化。
8.4 ACL:动作风险指标不能代替真实损伤
ACL 指膝关节前交叉韧带。此前的标题检索找到四个直接近邻,宽泛的运动与相关生物力学主题为五十个。少量标题并不能证明这是无人研究的方向;体育医学、生物力学文献与已有测量产品中还有大量相关工作。
从学生研究的角度,最需要澄清的是终点。你究竟在测落地时的膝关节角度、评价动作模式,还是预测未来损伤?这三个问题需要不同的数据。没有真实损伤结局,不能用动作代理指标直接训练一个名为“ACL 撕裂检测”的模型。
一个边界清楚的版本:低成本测量的误差
假设有合适的指导、参照设备和事前批准,可以讨论消费级视频或惯性传感器对某个动作参数的测量能力。首先把任务写小,例如某一规定动作中某个角度或时间参数的误差,再与合适的参照测量比较。
研究需要说明参照本身的误差、坐标定义和同步方式。相关系数高不表示两种方法读数相同:一种方法可能始终比另一种高十度,却仍然高度相关。因此,应同时观察偏差、误差分布与不同量值下的一致性。
拍摄角度、衣物遮挡、体型和动作速度都可能影响视频结果。与其一开始采很多动作,不如先选一个主要任务,把这些影响条件分开检验。每增加一种条件,都要考虑独立参与者和重复测量是否足够。
不要为了题目制造更危险的任务
关于疲劳或高风险落地的研究,需要专业人员判断是否适宜、怎样控制风险以及何时停止。本书不提供诱发疲劳或损伤的操作方案。学生完全可以选择已有公开数据、适当的模型,或在批准范围内的低风险测量问题。
若没有可靠参照设备,项目可转为研究不同标注者或算法之间的一致性,但结论也应相应缩小。不能因为设备不足,就把某个软件输出当成绝对真值。
这个方向与 ENBM 生物力学相连,也可能涉及 BMED。选择类别前,先完成一句结论草稿:“本研究在什么条件下,对哪种测量达到了什么程度的一致性。”如果这句话已经清楚,就不必用更大的医学承诺包装题目。
8.5 环境传感器:同型号为什么不能直接互换
低成本空气质量或水质监测器很容易形成演示:有读数、有曲线、有远程界面。但研究可以从更不显眼的问题开始——同型号的两个单元,是否真的给出可比较的结果?在第一周建立的校正,数周后是否仍适用?
此前的方向审查没有在特定标题检索式下找到完全吻合的直接近邻,但这不能证明“无人做过”。专业文献已经研究低成本空气传感网络的校准与迁移;学生应在明确条件下研究具体限制,而不是宣称发明了传感器校准。低成本空气质量传感网络校准研究
先获得真正可比较的参考
共址比较指让待测传感器与参考仪器在同一地点、同一时间观察尽量一致的环境。附近站点的公开数据可以提供背景,却不能自动充当严格校准真值:相距数百米的道路、建筑和排放条件可能不同。美国 EPA 的共址说明与性能评价资料可作为阅读起点。EPA 共址说明、EPA 性能评价资料
如果只能得到附近监测站的数据,就应把问题写成“两个地点的观测关系”,并讨论空间差异。不能在结论里突然改称“测出了传感器绝对误差”。
参考设备也不是一个只在采购表上出现的名称。你需要知道它测什么、多久输出一次、是否经过维护,以及数据能否合法获得。参考条件没有落实之前,不宜先购买大量节点。
一个可以拆开的比较设计
可以把问题分成三个层次:同一单元重复测量是否稳定,不同单元是否一致,校准关系随时间或环境怎样变化。它们分别对应重复性、设备差异和迁移问题,不能只用一条总相关系数概括。
例如,在有真实参考的条件下,用一部分日期建立校正关系,把之后的日期留作测试;再把某些设备完全留在训练之外,观察模型能否迁移。若随机打散所有小时数据,模型很容易在训练和测试中看到近乎相同的环境,结果会过于乐观。
评价时可以报告平均偏差、误差分布,以及高湿、低浓度等条件下的表现。若某种改进降低了平均误差,却在少数条件下发生很大的偏差,仍需讨论使用风险。只画平均曲线会把这些信息藏起来。
没有观察到漂移,也能回答问题
项目开始时可以设想长期漂移,但实验不应以“一定要出现漂移”为目标。若观察期内没有明显变化,应报告测量精度、观察时长和能排除的变化范围。设备间差异或湿度影响可能仍然是有效结果。
这类题目可落在 EBED 的传感器与信号处理,也可根据主要贡献联系 EAEV 或 ENEV。购买现成传感器并不妨碍研究,前提是新增知识来自清楚的评价,而不是把厂家例程换个界面。
8.6 低成本光谱:从“能看见谱线”到“别人也能测出来”
我们之前的标题检索找到八个与低成本、手机或便携光谱相关的直接近邻。早在 2014 年的档案中便已有手机光谱装置。因此,搭出一台装置是学习成果,却不能单凭这一点主张研究新颖。
更具体的问题是复现性:同一设计做出几台装置,测到的结果是否一致?拆装之后是否改变?换一个相机或光源,原来的校准还能不能用?你自己的装置测得不错,别人照着做也能测出来吗?这正是复现性研究要回答的问题。
把误差分开,而不是都交给算法
低成本装置的误差可能来自光路、样品位置、相机曝光、背景光和标定。先固定可以控制的条件,再逐项改变某个因素,往往比一次收集大量杂乱数据更容易解释。
波长准确度、分辨能力和强度响应也不是同一个概念。能看到两个峰,不代表能准确比较它们的强度;某条峰的位置接近参考,不代表整个量程都已校准。报告里应分别说明测了哪些性能。
一个教学设计可以比较同一装置的重复测量、不同装置之间的差异,以及重新装配后的变化。每个层次保留自己的编号与日期。若把它们全部合并求平均,读者便无法知道主要误差来自哪里。
先明确可接受的用途
教学级装置可能适合比较某种颜色变化,却不适合识别极低浓度物质。研究不需要证明它能代替所有商用仪器,只需把适用范围说清。用安全、适宜的标准或参考样品验证,具体选择应由具有相关经验的指导者确认。
如果主要贡献是光学结构与测量能力,PHYS 或 EBED 可能合适;若核心是分析方法的选择性、检测能力和样品干扰,则更接近 CHEM 的分析化学。不要为了获得医学背景而把未经充分验证的装置直接用于疾病筛查。
一份好的结果可以是:某个改动降低了装配误差,却没有改善强度稳定性。下一步因此十分明确。相比笼统地宣布“低成本、高精度”,这样的结论更容易被别人理解和复现。
8.7 遥感:地图画得漂亮,模型就可靠了吗
遥感方向的已有检索找到三十九个直接标题近邻,其中十三个来自 2024—2026 年。它们涵盖土地覆盖、水体、火灾、空气质量与农业等问题。制作某个城市的地图,已经不足以自动说明研究贡献。
第二章的农业排放和泥炭地修复案例提示了一个更深入的问题:模型在原来的地点表现好,换城市、换季节、换地表条件后会怎样?这个问题称为泛化,也可以直白地理解为“离开原来的数据还能不能用”。
测试地点应该真的没有被模型见过
如果从同一幅影像随机抽像素,训练点与测试点可能紧挨着。它们共享光照、地物和处理误差,因此测试结果未必代表对新地区的能力。按空间区域或日期留出测试,通常更接近相应的实际问题。
不过,按地区划分也不是万能答案。两个地区的类别比例、影像质量和标签标准可能不同。研究需要说明到底想测试什么变化,并分别考察主要误差来源。不能只看到掉分,就归结为模型“不够先进”。
参考标签也可能错
把一个现成土地覆盖产品当作标签,是方便的起点,却不代表获得了绝对真值。模型与产品一致,只能先说明二者一致;如果产品本身把某类地物标错,模型可能只是学会复制错误。
可以从产品彼此判断不同的区域入手,设计独立核验。谁来判读、依据哪一天的影像、怎样处理看不清的地物,都应留下记录。有限样本如何代表整个区域,需要在抽样时考虑,不能只挑容易判断或最漂亮的样点。
对学生而言,可以从两类容易区分的地物或一个小区域开始。明确记录无法确定的标签,比强行给每一个像素贴上确定答案更诚实。不确定样本怎样影响结果,也可以成为分析内容。
用失败位置解释结果
地图之外,应提供按类别的误差、不同地区的表现和典型失败图。例如模型主要在阴影中混淆,还是在季节变化后失效?小面积类别是否被总体准确率掩盖?这些问题能把一个展示项目变成方法评价。
类别选择也随主问题变化:研究地表或环境过程可能属于 EAEV,服务于修复方案评价可能属于 ENEV,研究通用算法本身则需要考虑 SFTD。选择能准确表达贡献的类别,比跟随一个热门名称更有效。
8.8 另外三个已有方向,什么条件下值得继续
此前还整理过氢能电催化、电池健康与边缘辅助设备等方向。它们并不因为列入题库就适合所有学生。下表把需要先落实的条件写在题目前面。
| 方向 | 可以缩小的研究问题 | 最先确认的条件 | 容易过度宣称的地方 |
|---|---|---|---|
| 氢能电催化 | 同一测试体系中,某项材料改动对性能与稳定性的影响 | 合适实验室、指导者、可比较的测试与安全条件 | 把单个电化学指标写成整个制氢系统更廉价、更环保 |
| 电池健康 | 预测模型对未见过的电池或工况是否可靠 | 数据许可、循环记录完整性、按电池划分的独立测试 | 把同一电池相邻周期的高预测分数写成普遍寿命预测 |
| 边缘辅助设备 | 在资源受限、信息不足时怎样识别失败并提醒使用者 | 明确任务、可控测试环境、适用的人体参与审批 | 把演示成功写成可保障真实使用者安全 |
电池方向可以采用公开循环数据,但必须保留电池个体信息。若同一电池的早期与后期记录随机分布在训练和测试中,就不能据此声称模型适用于新电池。健康状态、剩余寿命和故障预警也不是同一个目标,应先选定其中一个。
边缘辅助设备很容易强调“实时识别”,却忽略识别失败时怎么办。研究可以聚焦系统何时应该拒绝给出答案、怎样提示不确定性。评价需要同时记录任务成功与误导使用者的情况,而不只平均准确率。未经适当验证,不应让真实使用者在高风险环境中依赖原型。
氢能方向对实验条件的依赖较强。若条件不足,继续查阅可比较的文献数据、研究评价口径,可能比仓促采购设备更合适。复杂的材料名称不会自动产生清楚的研究问题。
选这几个方向时,最先要落实的是证据从哪里来。先确认参照测量、独立测试或必要指导,再决定题目规模,能够减少做了几个月才发现无法验证的情况。
8.9 给自己的题目写一页说明
在正式研究计划之前,先写一页能讲给同学听的说明。第一段交代一个具体困难:谁在什么条件下遇到什么问题。不要从“随着科技飞速发展”开始,也不要急着写社会影响有多大。
第二段介绍最相关的已有方法,指出你理解的限制。引用两三个真正读过的来源,说明它们在哪些条件下有效,以及你的研究准备比较哪一点。若只是个人猜测,就明确写成待检验的判断。
第三段用一个可以回答的问题收住题目。例如“在未参与校准的设备上,加入湿度变量是否降低后续日期的测量误差?”比“打造智能环境监测平台”更接近研究。
第四段写比较对象与主要结果。你准备与什么比,哪个指标决定主张是否成立,什么结果会使你接受原来的想法没有得到支持?不需要提前猜出最终答案,但要知道怎样判断。
最后一段写条件:数据从哪里来,设备与场所是否落实,是否涉及事前审批,学生承担哪些工作,最可能在哪一步受阻。这个部分不必写得好看,设备尚未借到、标签还未核实,都应照实写。
把这一页交给导师讨论时,你们就能谈具体问题。导师可以帮助判断方法与范围;学生仍应理解并决定自己要回答什么。正式研究计划、摘要等材料的 AI 使用要求,见第三章。
8.10 研究开始前,怎样做一次小规模可行性检查
可行性检查的目的,是发现核心测量能否成立。它不应被混同为可以绕过审批的“先试试看”。凡需要事前审查的内容,必须先完成适用程序,再开始相关研究活动。
如果使用公开数据,可以先核对许可、字段和标签,尝试复现一个简单基线。若连样本单位和目标变量都解释不清,继续训练复杂模型只会把问题藏得更深。
如果自制仪器,可以先检查输出是否随已知输入合理变化,重复测量是否稳定,记录是否能完整保存。若仪器常常丢失时间戳,应先修复记录,而不是急着扩大实验。
如果开展理论研究,可以先复核关键定义、重做已知小例子,并尝试寻找猜想的反例。发现猜想不成立不等于浪费时间,它可能指出更准确的条件。
小规模检查后,题目可能会缩小。例如原来想做跨城市预测,后来发现独立标签不足,于是改为研究一个地区的标签不确定性;原来想评估临床风险,后来发现只能可靠测量动作参数,于是转为测量效度。这类改变应如实记录,不能在最终报告中假装一开始就知道结果。
8.11 结果不理想时,怎样继续写出有用的研究
研究结束时,没有预期中的改进很常见。先判断是测量或实现存在问题,还是结果本身不支持假设。两种情况需要不同处理:前者需要修复或缩小证据范围,后者可能构成清楚的否定结果。
软件冷却案例就提供了一个例子:过热减少,但冷却使用增加。若作者只保留温度曲线,读者会误以为所有目标都实现了。把两项结果同时报告,才让后来的人知道需要如何调整控制目标。
若样本太少、误差太大,不能把“没有显著差异”写成“两种方法完全一样”。更准确的说法是,在当前样本和测量精度下,没有得到足够证据支持所设想的差异,并说明还无法排除多大的变化。
失败案例也应有组织地保存。记录它发生在什么对象、什么条件下,是否重复出现,与成功案例有什么不同。若失败来自一个稳定的条件,就可能形成比总体平均数更有用的结论。
写作时不必让每一页都看起来成功。把判断怎样随证据改变写出来,读者才能跟上你的研究过程。最后那张图也会因此更容易理解。
8.12 从这八章走回自己的研究
选题时,用第二章判断研究范围,用第七章查找已有工作与趋势,再用本章把问题缩小。准备实施时,回到第三章核对设计、材料与适用的规则;安排参赛时,回到第四章确认实际路径。
第五章的获奖案例适合在中途再读一次。第一次阅读容易记住题目和奖项,自己经历过采样、比较和失败后,会更关心作者为什么选择某种验证。读者能够提出的问题会变得更具体,这就是进步。
家长和导师可以帮助学生落实时间、场所与指导,但应让学生保有解释研究的责任。一个题目真正适合学生,应该能让他逐渐说清每项选择的理由,并在遇到新证据时修改自己的判断。
最后写在展板上的研究问题,可能已经与最初的兴趣句子很不一样。只要这个变化来自认真阅读、测量和思考,题目变小并不是退步。你终于知道自己能够回答什么了。