ISEF Topic Scoping 2027

M570–88

一条 16S 序列能定到种吗:把物种鉴定的错判率算出来

推荐优先级:中 · 参赛子类:Microbiology — Microbial Genetics · 资源需求:一台笔记本,零器材、零试剂、零生物材料 · 技能取向:生物信息学管线 / 分类学 / 分类器评估

1 · 研究问题

用一段常规质量的 16S rRNA Sanger 读段做物种级鉴定,错判率是多少,这个错判率在不同菌属之间差多少?具体到弧菌属——V. vulnificus 与其近缘种——一条学生实际能拿到的读段能否可靠区分致病种与非致病近缘种?

2 · 研究背景与空白

背景。 16S rRNA 基因是细菌"身份证"式的标记基因:它在所有细菌里都存在、长度约 1,500 bp、由九段高度保守区(用来设计通用引物)与九段可变区(V1–V9,用来区分不同菌)交替组成。标准做法是用通用引物扩增出来、Sanger 测序、拿去数据库比对,看最像谁。问题在于分辨率是有上限的: 16S 演化得慢,近缘种之间的可变区差异可能只有几个碱基,甚至完全相同。学生实际拿到的往往还不是全长——一次 Sanger 反应的高质量读长通常只有 700–900 bp,且两端质量衰减严重,实际可用区段更短;只覆盖 V3–V4 这样一两个可变区的短片段,属级判定通常没问题,种级判定则经常给不出唯一答案。这不是操作水平问题,是标记基因本身的信息量上限。弧菌属尤其棘手:该属内多个种的 16S 相似度极高,是分类学文献里长期公认的"16S 分不开"的类群之一。

已有工作到哪一步。 MCRO045(2026,Grand Award,"Warming-Driven Vibrio Pathogen and a Novel Control")。摘要原文:"Vibrio abundance was quantified using thiosulfate citrate bile salts sucrose (TCBS) agar plating, and 54 isolates were identified by 16S rRNA gene sequencing"、"V. vulnificus comprising 39% of isolates"、"Pathogenic isolates showed a significantly stronger temperature response (Temperature × Pathogenicity interaction p = 0.002)"。整个"致病株 vs 非致病株"的对比完全建立在 16S 的种级判定之上——如果 16S 在弧菌属内分不开致病与非致病近缘种,那个 p = 0.002 的交互作用就失去了意义。 同类依赖也见于 MCRO029(2025,Top + Grand,同一作者) 的"7 个弧菌种"分类,以及 MCRO006(2026,Special Award) 的乳酸菌 16S 鉴定。

空白在于:分类学界当然知道 16S 有分辨率上限,但没有人以"学生实际能得到的那种读段"为条件、按分类群系统地量化过这个上限,更没有人把结论翻译成一份"哪些属可以只靠 16S、哪些必须补多位点"的操作性清单。这个空白适合一年期学生课题的四个理由:(1)零实验室、零合规、零器材、零耗材——本文件里唯二完全不受"你有没有实验室"这条约束支配的课题之一;(2)数据全部来自公开参考数据库,一次下载即可全部落盘,不存在"数据拿不到"的中途崩盘风险;(3)结论正负都成立——错判率低说明 16S 够用(对整类项目是好消息),高则给出"必须补确证手段"的判据;(4)它对语料中多个获奖项目直接相关,答辩时的"为什么做这个"极好回答。

3 · 可检验假设

H1 在模拟"学生级"读段(覆盖 V3–V4、有效长度 400–500 bp、注入典型 Sanger 错误率与末端质量衰减)的条件下,种级鉴定的准确率 ≤ 70%,而属级准确率 ≥ 95%——即 16S 短读段的可靠分辨层级是"属"而非"种"。

H2(机制假设,H1 被否证时仍有内容)错判率在分类群之间不是均匀分布的:按属分层后,错判率最高的 10% 的属贡献了 ≥ 50% 的全部种级错判,且弧菌属(Vibrio)位于该高错判组内;错判率与"属内种间 16S 平均相似度"呈显著负相关(Spearman ρ ≤ −0.6,p < 0.05)。

4 · 量化验收标准

  1. 方法学校验(硬门槛,不过关不许往下做,后续全部结论无效)。 零噪声回判自检:把参考数据库中的全长序列原样(不截取、不注入错误)投回自己的比对判定流程,种级回判准确率必须 ≥ 99%(理论上应为 100%,允许 1% 的容差用于数据库内部的同物异名与重复条目)。跑不出 ≥ 99% 说明比对流程或标签解析有 bug,此时后续所有"错判率"数字都是自己代码的错误率而不是 16S 的分辨率上限——不过关不许往下做。 同时须做留一交叉验证:判定某条序列时必须把它本身从参考库里剔除,否则准确率会被"查到自己"污染而虚高到 100%。这两条自检是本课题唯一能向评委证明学生真的自己做了的证据。
  2. 统计口径预先写死。(a)"独立样本"的定义必须写死:同一物种的多条参考序列不是独立样本,必须按物种(或按属)分组,报告"按序列计"与"按物种计"两套准确率,主结论用"按物种计",理由是数据库中常见种的序列条数远多于稀有种,按序列计会被少数几个种支配。这是本课题的伪重复来源,等价于湿实验中的技术重复问题。(b)类别极不平衡(少数属占据大部分序列):报告宏平均(macro-average)准确率、每类召回与精确率,以及 PR-AUC;明确写「不报总体 accuracy 及其原因」——总体 accuracy 会被大类支配,一个只会把所有东西判成最常见属的分类器也能拿到高 accuracy。(c)"模糊调用"必须单列为第三类结果,不许强行归入对或错:定义为"最优命中与次优命中的相似度差 < 阈值 δ",δ 的取值必须预先声明并做敏感性扫描(至少 3 个取值)。(d)所有准确率给 bootstrap 95% 置信区间(≥ 2000 次重抽样,按物种重抽样而非按序列)。
  3. 模拟条件必须覆盖 ≥ 3 组读段设定:全长(约 1,500 bp,作为上限参照)、单次 Sanger 高质量段(约 700–900 bp)、短可变区(V3–V4,约 400–500 bp)。错误率与末端质量衰减的具体参数须写明出处——若无法找到可引用的公开 Sanger 错误率模型,必须做参数扫描(如错误率 0.1%/0.5%/1%)并把它作为敏感性分析呈现,绝不许拍一个数字当作实测值。需核实。
  4. 分层报告的最小样本量:每个纳入分层分析的属,参考库中须有 ≥ 5 个不同物种、每物种 ≥ 1 条高质量全长序列;不满足的属合并入"数据不足"组并报告其占比。
  5. 交付物必须包含一份"属级可靠性清单":按属列出属级准确率、种级准确率、模糊调用率,并给出"只靠 16S 是否足够"的三档判定(够 / 需谨慎 / 必须补多位点或全基因组)。这份清单就是主结论。
  6. 可复现性。 全部下载脚本(含数据库版本号与下载日期)、模拟与比对管线、自检断言、统计脚本开源存档,原始数据快照落盘(参考数据库是活数据库,会随版本更新变化,必须冻结快照并记录版本与日期),第三方可一键重跑得到同样的数字。

5 · 数据与工具

用途 来源 / 工具
16S 全长参考序列与分类标签 公开的 16S 参考数据库(SILVA、RDP、GreenGenes2、NCBI 16S RefSeq 等均为学界常用)。具体选哪一个、其当年版本号、许可条款与下载方式——需核实必须记录版本号与下载日期并冻结快照
引物覆盖区段的界定 通用 16S 引物对(如 27F/1492R 覆盖近全长,341F/805R 覆盖 V3–V4)的序列与坐标。具体引物序列须引用可查的公开来源,不许凭记忆写——需核实
序列比对与判定 BLAST+(本地安装,公开免费)或 VSEARCH/USEARCH 类工具;分类判定可用朴素贝叶斯分类器(RDP Classifier / q2-feature-classifier 思路)作为第二条独立判定路径
读段模拟 自写脚本注入替换错误与末端质量衰减;若采用现成的测序模拟器,须写明工具名与版本——需核实是否有维护良好的 Sanger 模拟器(多数模拟器面向 Illumina,这一点必须核实,不要假定有现成的 Sanger 模型
统计与作图 Python(biopythonpandasscikit-learn 的分类指标、matplotlib)。纯 CPU,笔记本即可;数据量为参考序列的 FASTA,MB–GB 量级
对照基准(仅用于校验与对比,不计入本项目的数据贡献 MCRO045(2026,Grand Award)的 54 个 16S 鉴定分离株与 V. vulnificus 39% 的构成;MCRO029(2025,Top + Grand)的 7 个弧菌种分类;MCRO006(2026,Special Award)的乳酸菌 16S 鉴定。这三条仅用作"结论对谁有影响"的说明,不重新分析它们的数据
须核实项 ① 所选参考数据库的版本号、许可条款、是否允许再分发衍生数据;② 常用引物对的准确序列与坐标出处;③ 是否存在可引用的 Sanger 错误率公开模型;④ 数据库中"同物异名"与"未定名种"(sp.)条目的处理规则——这一条会直接影响准确率数字,必须预先定死

6 · 方法路径

  1. 装环境 + 跑通已知对照 + 完成 §4 第 1 条的校验。 下载数据库并冻结快照,搭建比对判定管线,跑零噪声回判(≥ 99%)与留一交叉验证。这一步不过不许继续——回判不到 99% 说明管线有 bug,后面所有数字都是 bug 的度量。
  2. 一次性落盘全部数据并记录版本与下载日期。 参考数据库是活数据库,跨版本的分类标签会变动;尽早冻结快照可完全消除"数据变了、前后分析对不上"这一类中途崩盘风险。
  3. 核实工具与数据的能力边界。 本方向已知的静默失败点,逐一验证并写进记录本:(a)16S 短片段无法定到种——这是研究对象本身,但也意味着"模糊调用"必须单列,把它塞进"错"或"对"都会扭曲结论;(b)数据库自身的标签错误——公开 16S 库中存在已知的错误注释与污染条目,必须报告你采用的过滤规则(如只保留有模式株标注的条目)并做一次"有无过滤"的敏感性对照;(c)同物异名与 "sp." 未定名条目——判成同物异名算对还是算错?判据必须预先写死并在文中声明;(d)多拷贝异质性——同一个基因组内的多个 16S 拷贝之间可能有差异,参考库若混入同一菌株的不同拷贝,会造成假的"属内高相似",须说明是否去冗余;(e)留一验证漏做——不剔除自身条目会让准确率虚高到 100%,这是本方向最容易犯且最致命的静默失败;(f)引物覆盖区段的坐标偏差——不同参考序列的比对起点不同,直接按碱基位置截取会截错区段,必须按比对后的坐标截取而非按原始序列位置
  4. 生成三组模拟读段并做全库判定。 全长 / 单次 Sanger 段 / V3–V4 短段,各自跑错误率扫描。
  5. 按分类群分层统计并定位热点。 逐属报告属级/种级准确率与模糊调用率,画出错判率的分布,标出弧菌属的位置。"错判"的判据须明确、可复现地写死(判成同属不同种 / 判成不同属 / 判成模糊,三类分开计)。
  6. 产出属级可靠性清单并写出微生物学后果。 明确写出"这意味着 X 类环境微生物学结论需要额外的确证手段(如 gyrB/rpoB 多位点序列分析或全基因组平均核苷酸一致性 ANI)",并把这份清单做成可直接查阅的表——这一步是本课题避免被评委归入 CBIO 的关键动作。
  7. 独立交叉校验(用另一种方法算同一个量)。第二条完全独立的判定路径(例如最优命中比对 vs 朴素贝叶斯分类器)对同一批模拟读段判一遍,报告两条路径给出的准确率差异。若两条路径给出的属级可靠性清单一致,结论就不依赖某一个工具的怪癖;不一致的部分本身就是结果(说明该属的判定对方法敏感,可靠性更低)。

7 · 新颖性边界

本课题不声称: - 不声称发现 16S 的种级分辨率有限。这是分类学的公认事实,多位点序列分析(MLSA)与 ANI 标准的存在本身就是证据。 - 不声称提出新的分类方法、新的引物或新的分类器。本项目一个新方法都不发明。 - 不声称 MCRO045(2026,Grand Award)MCRO029(2025,Top + Grand)MCRO006(2026,Special Award) 的结论错误。本项目没有重新分析它们的任何数据,只指出它们的结论所依赖的鉴定步骤有一个可以被量化的不确定度,而这个不确定度此前没有被量化过。这个姿态必须写进文书。 - 不对任何真实菌株做鉴定,不接触任何生物材料。

已有工作做到哪: MCRO045 用 TCBS 平板定量弧菌丰度、对 54 个分离株做 16S 鉴定,报告 V. vulnificus 占 39%,并据此把分离株分成致病/非致病两组做温度响应比较(交互作用 p = 0.002);MCRO029 用 16S rDNA 测序把 24 株环丙沙星耐药弧菌分类为 7 个种;MCRO006 用 16S rRNA 基因 PCR 与测序鉴定乳酸菌分离株。分类学界已有 MLSA 与 ANI 作为种级确证的标准手段。

本项目的贡献(属「评价维度转换」型): 已有工作把 16S 当作工具,用它产出物种标签;本项目把 16S 当作被评价的对象,量化"在学生实际能得到的读段条件下,这个标签有多大概率是错的,以及在哪些属上最容易错"。这个评估是主结论,不是附加内容。

为什么有价值: 16S 测序是学生环境微生物学项目里最常见的鉴定手段(成本低、有商业测序服务、门槛低),而几乎没有项目报告过鉴定的不确定度。一份按属分层的可靠性清单,能让后来的项目在设计阶段就知道自己的物种标签能不能支撑它想说的那句话。

若结论不显著: 若种级准确率高于 70%(H1 被否证),这同样是有效结论——它说明 16S 比预期可靠,是对一大批学生项目的独立支持;但必须给出误差棒(按物种重抽样的 bootstrap 置信区间)证明有能力分辨"65%"与"75%"这个差异,否则等于没做。同理,若 H2 的分层差异不显著,"错判率在属间均匀分布"也是一个有内容的结论,因为它意味着不存在需要特别警惕的热点属。

8 · 决策门槛(go / no-go)

🟡 条件 1(第 4 周末,2026 年 9 月初):零噪声回判 ≥ 99%,且留一交叉验证已正确实现。 若 9 月初回判 < 99%,立即降级: 先排查标签解析与去冗余(最常见原因是同物异名被判成错)。若数据库本身质量导致上限达不到 99%,把纳入范围收缩到只保留"有模式株(type strain)标注"的高质量条目子集,在这个子集上重跑自检。主结论框架完全保留,只是数据规模缩小、结论表述加上"限于模式株参考集"这一限定——这个限定反而让结论更干净、更好辩护。

🟡 条件 2(第 8 周末,2026 年 10 月上旬):找到可引用的 Sanger 错误率公开模型,或确认其不存在。 若到期仍未找到可引用的公开模型,立即降级(这是预期中的大概率情形,不是失败): 放弃"注入真实错误率"这一路径,改以"错误率参数扫描"为主线——把错误率从 0% 扫到 2%,报告准确率随错误率的衰减曲线。主结论框架完全保留(仍是"16S 在学生级条件下的分辨率上限"),且这个版本反而更有信息量:它给出的是一条曲线而非一个点,读者可以按自己的实际测序质量查表。本方向不因这一项失败而整体报废——这是它相对其他课题的核心优势。

⚠️ 与「附属赛后不得修改」的冲突点: 五件事必须在 2026 年 11 月底前定死并写进研究计划,附属赛后一律不许改:① 参考数据库的选择与版本号(换库等于换数据集);② 条目过滤规则(是否只保留模式株、如何处理 "sp." 与同物异名);③ "模糊调用"的阈值 δ 及其敏感性扫描点位;④ 三组读段设定的长度与区段;⑤ 主结论采用"按物种计"还是"按序列计"。其中第 ② 和第 ⑤ 条最容易在分析阶段被临时调整,而它们对最终数字的影响可以很大——一旦附属赛后再改就违规。

须提前核实而非边做边发现的事项: - 本方向未做外部文献核查,「未找到前作」不等于「不存在前作」。 "16S 的种级分辨率评估"在分类学与微生物组学方法论文献里很可能已有系统研究(这是本课题最大的新颖性风险,明显高于本文件其他条目)。学生必须在开题前自己补一轮扎实的文献检索,找到前作后主动引用,并把定位收缩到前作没覆盖的那一块——最可能的立足点是"以学生实际可得的读段条件为约束、并把结论翻译成面向学生项目的操作清单",而不是"首次评估 16S 分辨率"。绝不可声称首次。 - 所选参考数据库的许可条款是否允许再分发衍生数据(影响你能否把处理后的数据开源)。 - 是否存在可引用的 Sanger 测序错误率公开模型(见条件 2)。 - 本课题被归错类目的风险: 评委可能认为这是生物信息学(CBIO)而非微生物学(MCRO)。规避动作写在 §6 第 6 步:结论必须落在微生物学的实际后果上并给出属级操作清单;同时应在 8 月内确认目标附属赛的类目设置——ISEF 的参赛类目不必与附属赛相同,若附属赛没有 MCRO 的对应细分,须提前规划。

已知困难及其定位: 缺少可引用的 Sanger 错误率模型。这个困难本身就是研究内容——参数扫描把"我不知道真实错误率"从缺陷变成了敏感性分析,产出的曲线比单点估计更有用。

选择前提: 适合会写脚本、能接受"主结论是一张表和几条曲线"的学生。本课题不接触任何生物材料,因此它是本文件里唯二不受"你有没有实验室"支配的路径之一(另一条是 M11)。代价是:它的新颖性风险最高——因为没有实验室门槛挡着,专业研究者做同类工作的成本也很低。必须做扎实的文献检索,且必须接受"可能要把定位收得很窄"这个前提。

预算裁剪顺序: 零成本,无预算可裁。时间不足时依次砍:先砍第 7 步的第二条判定路径(交叉校验);再砍读段设定的组数(从 3 组减到 2 组:全长 + V3–V4,保留这两组即可支撑 H1);再砍错误率扫描点位(从 5 点减到 3 点);最后砍属级分层的粒度(只报最高与最低的各 10 个属,不出全表)。砍到最后 H1 仍成立。

合规与表格: - ✅ 本课题不接触任何生物材料,因此完全不触发 PHBA 相关条款。 家中禁培养、BSL 等级、Direct Supervisor 监督这些约束对本课题不适用——但这也意味着它不能替你回答"我有没有实验室"这个问题,它是绕过这个问题的路径。 - ✅ 无需 SRC 事前批准,因此不需要扣除 2–6 周的 PHBA 审批窗口。 这让它在 2026-08 起算的 3–4 个月净窗口里拥有本文件最长的有效工作时间——是资源受限学生最诚实的一条路。 - 🔴 抗生素耐药性红线: 本课题不培养任何菌、不做任何耐药性研究。需要注意的唯一一点是:引用的前作(MCRO029、MCRO045)涉及环丙沙星耐药弧菌,你在文书中只能作为"结论受影响的对象"提及它们,绝不能把耐药性作为自己的研究变量、也不能重新分析它们的耐药数据。 - 朊病毒样蛋白: 不适用(本课题不涉及蛋白)。注意规则明确"纯计算不受限",但本课题连计算对象都不是朊样蛋白。 - 人类受试者: 不适用。本课题不采集任何人源样本——这一点值得写进文书,因为许多"微生物组"课题会误踩这条线(从同学身上采集唾液/粪便/皮肤拭子这个动作本身就是人类受试者研究,需 Form 4 + IRB 事前批准 + Form 6A/6B + SRC 事前批准,且 2027 版一律禁止向受试者反馈数据)。本课题只用公开参考数据库,属人类受试者豁免第 2 类(公开既有数据集、无任何人际互动)。 - 表格(2027 版编号): Form 1 + 1A(含研究计划)+ 1B + Form 2A(2027 新增学生支持披露表,所有项目必填) + Abstract。通常仅此五项——不触发 Form 3(无危险化学品/活动/装置)、不触发 Form 4/5A/5B/6A/6B。若在学校之外的机构(大学实验室、企业)接受任何指导,包括线上远程指导,即触发 Form 2C,且须在展台竖立展示。 Form 1A 第 10 题的 Source of Data 应勾选 "publicly available",并在研究计划中写明数据库名称与版本号。 - 展台:本课题无任何禁带物(无活体、无液体、无土壤、无玻璃、无锐器、无化学品)。展台靠:① 属级可靠性清单表(主结论);② 准确率随读段长度/错误率衰减的曲线族;③ 错判类型的构成图;④ 弧菌属的近缘种相似度热图。全是图表,完全不吃展台禁令的亏。注意展板不得出现二维码、网址、邮箱或数据库链接——数据来源写在参考文献区,不要印 URL 到展板显眼处。 - AI 政策: 不得用生成式 AI 撰写研究计划、摘要、展板或生成引文。本课题代码量大,AI 生成代码的诱惑最大——规则允许用 AI 写初始代码,但必须显式引用、说明哪些部分由 AI 生成、并保留完整提示词日志。 数据解释必须由学生本人完成。

评分: O=8, W=8, F=9, S=6, Fit=8 → base=79.0,h=9 → [70, 88],置信度:中