Tian2
← 返回手记
ISEF · AI工具

助力总决赛:ISEF Judge Skill上线


在几百个小时做实验、整理数据、做海报后,站在ISEF展台前时,你可能还是迷茫的——流动的评委、每年都不太一样的规则、各种罗生门式的信息分享,奖项公布后你一脸懵,不知道项目哪里还不够好。

science-fair-judge就是为了解决这个问题而制作的。这个Skill基于ISEF评委内部的评分和流程文档,结合过往经验,模拟一个由三位顶尖专家组成的评审团,从科学内容、评分标准、面试准备三个维度对你的项目海报进行全方位"审判",最终给你一份可以直接行动的详细报告。

鉴于自己背景是物理工程方向,所以这个Skill可能会偏向这个方向一些,但其他项目也可以使用。

它是怎么工作的?

第一步:读懂你的海报

目前技能支持三种格式:

  • PPTX(PowerPoint文件)——分析每个文本框的位置,重建海报的阅读顺序,不是简单地把文字堆在一起
  • PDF
  • 图片(PNG、JPG等)

安装Skill后,把文件路径告诉Claude Code、Codex或OpenClaw,找到海报文件即可。也可以在当前文件夹直接打开。测试基于Claude Opus 4.6、GPT-5.4、GLM-5.1。

第二步:三个专家,同时开工

专家一:科学内容核查员

你海报上所有可以被验证的科学声明(通常8到15条)会被逐条上网搜索核实:

  • 你引用的数据是否正确?
  • 你的实验方法在这个领域是标准做法吗?
  • 你的结论有没有过度夸大?
  • 结果是否"好得不像真的"(比如生物数据里R²=0.999……几乎不可能)?

每条核查都会给出[可信度:高/中/低]的评级,附上近五年支持或反驳你结论的相关论文。

专家二:评分标准评估员

这位专家手里拿着ISEF官方的100分评分表,逐项给你打分:

评分项满分
研究问题10分
设计与方法论15分
执行与数据分析20分
创新性与影响力20分
展示(海报+面试)35分

此外还会检查你的海报设计是否符合ISEF的硬性规定(尺寸、禁止物品、图表规范),找出"应该有但没有"的内容,并打上优先级标签:紧急/重要/一般

最关键的是,它会给出一个判断:评委在caucus(评审讨论会)会不会愿意为你的项目背书?这个问题比分数本身更重要。

专家三:面试问题准备员

除去常规的Motivation、Obstacle类问题外,会按四个类别准备具体问题:

  1. 理解与深度——你真的懂你在做什么吗?(5—7题)
  2. 批判性分析——你的研究有哪些局限?如果结果相反怎么办?(4—5题)
  3. 独立性与主导权——这个项目是你做的还是导师做的?(3—4题)
  4. 影响力与未来方向——这项研究意味着什么?(3—4题)

每道题都会给出:评委为什么问这道题;好答案是什么样的;差答案是什么样的;以及红旗警告——什么样的回答会让评委怀疑你根本没做这项目。

第三步:交叉验证

在每一位"专家"结束工作后,这个技能会让三份报告互相"对话"。如果内容核查员发现某个数据有问题,评分员的扣分就会对应调整;面试准备员的问题也会专门针对评分员发现的弱点。最终的报告是一个有机整体,不是三份孤立的意见。

第四步:生成报告

技能会在你的项目目录里生成一份完整的Markdown报告文件,包含:科学声明逐条核查表、评分标准详细打分、缺失要素优先级清单、面试问题完整准备册,以及优先行动清单(分为"展前必须修复"和"面试必须能回答"两类)。

一个容易被忽略的ISEF内幕

ISEF每位评委提交的是0—100的整数分,经过两轮归一化处理后,只是用来确定初步排序。所有作品分数排名显示在大屏幕上后,真正决定能不能拿奖的,是caucus(评审讨论会)

评委们围坐在一起,为他们认为值得获奖的项目"辩护",通过多数投票决定最终名次。如果没有评委在讨论会上为你发声,再高的分也可能石沉大海。

评委愿不愿意为你发声,很大程度上取决于你的面试——他们在和你交谈的10—12分钟里,有没有真正"理解"你的项目,有没有被你打动。这就是为什么这个技能把面试评估放在非常核心的位置。

使用方法

/science-fair-judge

或者指定文件路径:

/science-fair-judge path/to/my-poster.pptx
场合支持程度
ISEF完整支持,内置官方评分标准
地区/州级科学展会根据Prompt信息搜索后修改标准
Regeneron STS会搜索最新评审标准,但输出格式不太适合(后续会定制)

使用建议

建议在参赛前2—4周使用,这样还有时间修改海报、准备面试答案。不要盲目信任输出结果和评分,可能会根据不同配置产生信息没有读全、识别错误等问题。自己的大部分配置是在Claude Code(安装Oh-My-Claudecode插件后)生成的,GPT-5.4的结果会更细一点,Opus和GLM会比较快。

对报告里标注"紧急"的缺失项目要优先处理——没有误差棒、没有参考文献、结论没有直接回应假设,这些在评委眼里都是经验不足的信号。

来源:github.com/tian2-ai/Tian2-skill——CC BY-NC 4.0,仅供个人学习和研究使用。

← 返回手记