T179–89
一百张图叠出来的清晰度:是亚像素超分辨,还是单纯的降噪
框架一个项目拍摄 100 张同一段小字文本、故意不做像素级对齐,经灰度化、归一化、双线性上采样、互相关对齐后平均,再用 8 个 OCR 引擎测量识别改善。多帧平均同时做了两件事:降低随机噪声(√N 增益),以及利用亚像素位移恢复高频信息(真正的超分辨)。 这两件事各贡献了多少?做一个关键对照就能分开:对齐后平均 vs 不对齐直接平均 vs 单张长曝光等效——如果不对齐平均的效果与对齐平均相当,那么增益来自降噪而非超分辨。
你自己的那一点你产出三路对照的 OCR 准确率曲线(横轴是帧数 N,三条线),以及频域证据:对齐平均结果与单帧的功率谱对比——真正的超分辨会在高于单帧奈奎斯特限的频段恢复能量,降噪不会。这张频谱图是本课题的决定性证据,而且它极适合展板(一张静态图讲完整个结论)。第三产出:位移分布的作用——人为控制帧间位移(全部整数像素 vs 均匀分布的亚像素位移),看增益差异,直接验证亚像素机制。
擦过TECA009(2025 TECA Special Award)"Algorithmic Image Enhancement by Combining Images"——摘要原文:目的是"find a mathematical process to enhance images ... deriving results purely from data in the subject being observed rather than relying on AI assumptions";"Data was collected by taking 100 pictures of the same illegible text, intentionally not aligned at a pixel level. The text used was 50 assorted words, in five-point Arial font."(大小写、首字母大写三种版本);处理链是 OpenCV 的裁剪、灰度化、归一化、反相、双线性插值上采样、互相关、位移到最大对齐点后平均;"The input and output images were analyzed using eight optical character recognition engines to measure the improvement. The results for all samples were significant, although improvements were most drastic for lowercase words." 摘要未做"不对齐平均"这个对照,因而无法区分降噪与超分辨。TECA 内无同题(mine_isef 确认)。
约束最可能死在被认为"只是补一个对照"。规避方式:核心产出是频域证据 + 位移分布实验,这两项超出了简单补对照,构成对"多帧超分辨在何种条件下真正发生"的量化刻画;并把结论延伸到艺术档案数字化这个 TECA 语境(低分辨率历史照片、褪色手稿的多帧恢复),保住学科契合。
可行性极高:一台相机或手机 + OpenCV + Tesseract/EasyOCR,纯 CPU,全部实验可在两周内完成。本文件里器材门槛最低的一条。
展台合规: 全部产出是曲线与图像对比,无液体无玻璃,完全静态。
T283–93
"文风指纹"识别的是文风,还是话题和年代
框架一个作者身份验证系统用 112 个写作特征构建"风格指纹",在 BAWE(英国学术写作语料,当代学生论文)上达 85%、在 Project Gutenberg(多为 1928 年前的文学作品)上达 92%。这两个语料在话题、体裁、年代上完全不同——同一位作者的多篇文章往往也在同一学科、同一时期。"这两篇文章出自同一人"与"这两篇文章讲同一话题"在这些语料里高度共线。 做话题控制之后(只用功能词与句法特征、剔除全部内容词;或在配对时强制话题匹配),准确率还剩多少?
你自己的那一点你产出特征族剥离阶梯:全部特征 → 剔除内容词 → 仅功能词 → 仅句法/标点/长度统计,四档的验证准确率。第二产出:话题匹配对照集——构造两类负样本对(随机配对 vs 强制同话题配对),两者的准确率差就是话题捷径的贡献量。第三产出(针对一个具体的可疑数字):摘要称传统检测器在 GPT-4o 模仿样本上只有 0–2% 准确率。0–2% 远低于随机(二分类随机是 50%),这通常意味着阈值方向或标签定义有问题,而不是检测器"很差"。 你可以在同样的设定下复现若干公开检测器,说明这个数字应当如何解读。
擦过TECA020(2025 TECA Grand Award + Special Award)"VerifyMe"——摘要原文:主张"a stylometric approach focusing on individual authorship verification"而非"检测 AI";"captures an author's unique 'stylistic fingerprint' by measuring 112 different aspects of their writing",用基于 Transformer 编码器的孪生网络比对;"trained on a combined corpus of BAWE and filtered Project Gutenberg samples (2,034 authors total)";"VerifyMe achieved 85% accuracy on human-human verification from BAWE and 92% from Gutenberg. Against GPT-4o's mimicry attempts, while traditional detectors achieved only 0-2% accuracy, VerifyMe maintained 96% accuracy. The system outperformed commercial AI detectors by factors of 1.89× to 17.84×.";MCC 0.776/0.829,AUC 0.956/0.972。摘要未报告任何话题控制或特征族消融。TECA 内无同题(mine_isef 确认 TECA020 是唯一的文体计量项目)。
约束最可能死在语料获取——BAWE 需要申请学术许可。规避方式:Project Gutenberg 完全公开,且话题捷径的检验只需要一个带作者标签与话题标签的语料;可改用公开的博客作者语料(Blog Authorship Corpus)或 arXiv 摘要(作者 + 学科标签俱全)。你的结论是关于这一类文体计量验证设置的,不依赖于复现 VerifyMe 的确切分数。
可行性高:功能词频率 + 句法统计 + 逻辑回归/孪生小模型,纯 CPU 分钟到小时级。
学科契合: 保住 TECA 定位的关键是把语境放在创作者身份与著作权上(写作作为艺术表达、AI 时代的作者身份),而不是泛化的文本分类。
T376–86
用自己录的小提琴音频训练、99% 识别乐曲:换一位演奏者、换一次录音呢
框架一个小提琴教学系统在"数千个自录并清洗的小提琴音频"上训练混合深度网络,预测乐曲达 99%、预测音符达 87%。如果训练与测试音频来自同一位演奏者、同一把琴、同一个房间、同一次录音会话,模型可以靠录音会话的声学指纹(房间混响、麦克风频响、琴的共振峰)而非音乐内容取胜。 换成演奏者不重叠与录音会话不重叠的划分,准确率掉到多少?
你自己的那一点你产出划分粒度阶梯(随机片段 → 会话不重叠 → 演奏者不重叠 → 乐器不重叠),四档准确率。第二产出是决定性诊断:把"录音会话"当作标签重训——如果模型能以极高准确率识别会话,那么会话指纹的存在就被直接证实。第三产出:这个问题在音乐教育应用上的实际后果——一个学生用自己的琴在自己房间练习时,系统的准确率会掉到哪一档?这是把方法学问题翻译成用户可感知后果的一步,也是保住 TECA 学科契合的关键。
擦过TECA006(2025 TECA Grand Award)"SmartStrings: AI-Driven Violin Pedagogy System"——摘要原文:"I devised a hybrid deep neural network trained on thousands of self-recorded and cleansed violin audio datafiles, augmented using waveform manipulation techniques and enriched through graphical analysis, zero-padding, and One-Hot Encoding";用短时傅里叶变换提取梅尔频谱特征,"achieving accuracies of 99% and 87% in predicting songs and notes respectively";另有色度图、动态时间规整、欧氏距离、余弦相似度、代价矩阵的比较分析,以及基于 3D 关键点的姿势评估与 Arduino 触觉反馈(分类模型 99% 准确)。摘要未说明训练/测试划分是否跨演奏者或跨录音会话。相关(同为音乐练习反馈,须在文中区分):TECA010(2026 Grand,Synchronome)、TECA014T(2026,未获奖,Cadenza)、TECA004(2025,未获奖,Musical Property Classification)。
约束最可能死在数据——需要多演奏者、多会话的小提琴/弦乐录音。这是 go/no-go:先确认可获得带演奏者与会话标注的公开乐器演奏数据集(音乐信息检索领域有若干此类公开集,须自行核实)。若拿不到多演奏者数据,退路是自采多会话数据:同一人在不同房间、不同麦克风、不同日期录制,这至少能验证"会话指纹"这一半,且器材成本极低(手机 + 一把琴)。
可行性:梅尔频谱 + 小型 CNN 或梯度提升,纯 CPU 可行;避免复现"混合深度网络"的规模。
展台合规: 全部产出为曲线与混淆矩阵;注意乐器本身可以带到展台,但不要依赖现场演奏来传达结论。
T476–86
"95% 的错误检测准确率":其中有多少错误其实是乐谱识别读错了
框架一个面向盲人音乐家的练习系统,把 PDF 乐谱经光学乐谱识别(OMR)转成 MusicXML 提取期望的音高与节奏,再与实时演奏音频比对,报告平均错误检测准确率 95%。这条链上有两个独立的误差源:OMR 把乐谱读错,与音高追踪把演奏听错。 如果 OMR 读错了一个音,系统会在演奏者完全正确时报告一个错误——对盲人用户而言这是最糟的失败模式,因为他无法回看乐谱去核对。这 95% 拆开来,两个误差源各占多少?
你自己的那一点你产出误差源分解表:用已知正确的符号级乐谱(MusicXML 原生文件)作为参照,分别测量 (a) 把该乐谱渲染成 PDF 再经 OMR 还原的符号错误率,(b) 在完全正确的合成演奏音频上系统报告的假阳性率,(c) 两者的联合效应。第二产出:乐谱复杂度—OMR 错误率曲线(单声部 vs 多声部、印刷 vs 扫描、有无连音符与装饰音)——这直接说明该系统在什么样的曲目上可以信任。第三产出:面向盲人用户的失败模式清单,把 OMR 错误在无障碍语境下的特殊危害讲清楚。这一步保住了 TECA 的学科定位。
擦过TECA010(2026 TECA Grand Award)"Synchronome: Smart Practice for Blind Musicians"——摘要原文:"The Optical Music Recognition (OMR) mechanism involves converting uploaded PDF scores into an encoded MusicXML structure, enabling pitch, rhythm, and notation data extraction.";实时数字信号处理提取基频与音符起始点,与期望的乐谱数据连续比对;偏差经触觉信号与听觉提示反馈;聚合演奏数据由生成式 AI 产生个性化反馈并经文字转语音输出;"Prototype testing confirmed the system's ability to analyse and detect pitch and rhythm deviations with low latency, achieving a mean error detection accuracy of 95%." 摘要从未报告 OMR 环节自身的准确率——而整条链的可靠性上界由它决定。相关:TECA006(2025 Grand,SmartStrings)同为音乐练习反馈但不用 OMR;TECA014T(2026,未获奖,Cadenza)报告"音高检测精度 ±5 音分、延迟 <50 ms"(可作为音高追踪侧的参照数值)。
约束最可能死在 OMR 工具的选择——开源 OMR(Audiveris 等)与商业 OMR 的错误率差异很大,结论可能被读作"你选的 OMR 不好"。规避方式:至少测两个 OMR 引擎,并把结论表述为"在当前可得的 OMR 精度下,端到端 95% 意味着什么",而不是"某个引擎不行"。
可行性高:MusicXML 语料公开(如公有领域乐谱库),渲染—识别—比对全链条纯 CPU;合成演奏音频可用音源直接生成,不需要真人演奏(这也顺带避开了任何人类受试者问题)。
展台合规: 全部产出为表格与曲线。
T573–91
用西方音乐训出来的指标,评价越南才子乐有意义吗
框架一个生成越南南部"才子乐"(Đờn ca tài tử,联合国教科文组织非遗)的深度学习框架,报告在"多项客观指标"上匹配或超过近期方法。生成音乐的主流客观指标(如 Fréchet Audio Distance)依赖于一个在西方流行/通用音频上训练的嵌入模型。 对一个音阶体系、装饰音、即兴规范都与西方音乐迥异的传统乐种,这个嵌入空间是否具备分辨力?具体地:把真实的才子乐录音与(a)其他越南传统音乐、(b)西方音乐、(c)白噪声/退化音频分别比较,FAD 能否正确排序?把真实录音随机打乱段落顺序后,FAD 变化多少?
你自己的那一点你产出指标分辨力诊断:一组"退化阶梯"(原始录音 → 段落乱序 → 音高整体偏移 → 加噪 → 时间拉伸 → 白噪声),测量 FAD 及若干替代指标随退化程度的单调性。一个有效的指标应当单调上升;如果段落乱序几乎不改变 FAD,那么它对音乐结构不敏感,而结构恰恰是长篇生成最需要评价的东西。 第二产出:参照集敏感性——同一批生成音频,用不同参照集计算的 FAD 排序是否一致。第三产出:面向非西方乐种的评价建议,包括基于该乐种自身音阶与装饰音统计的领域特定指标。
擦过TECA021T(2025 TECA Grand Award)"Don Ca Tai Tu Generation via Deep Learning"——摘要原文:从多个在线来源、经验乐师与文化专家处收集录音并精细过滤构建专门数据集;提出 DcttGen 统一框架,含 (1) 音乐分词器从原始波形高效提取音乐特征、(2) 自回归 Transformer 维持长篇结构连贯性、(3) Rectified Flow Transformer 从低采样率表示合成高保真音频;并为才子乐重新设计了思维链提示技术;"Experimental results show that DcttGen matches or even surpasses recent methods in various objective metrics." 摘要未列出具体是哪些客观指标,也未讨论这些指标对非西方乐种的适用性。TECA 内相关:TECA008(2026 Grand+Top,HARMONI)含 Transformer 音乐生成,TECA004(2025,未获奖)古典音乐属性分类。
约束最可能死在算力与数据。你不需要训练任何生成模型——本课题只需要计算指标,而 FAD 所用的嵌入模型(VGGish 类)体积很小、CPU 推理可行。真正的 go/no-go 是能否获得足量的才子乐或其他非西方传统音乐录音;若才子乐语料难获取,可换成任何一个有公开录音的非西方传统乐种(印度古典、伽美兰、阿拉伯木卡姆),结论同样成立且新颖性边界更宽——但换乐种后必须重新做文献核查。
学科契合极强:这是本文件里最直接触及"技术能否评价艺术"这一 TECA 核心命题的一条。
展台合规: 产出全部是曲线与排序表;音频可以用耳机播放但不能依赖它传达结论。
T681–91
SSIM 0.778、PixCorr 0.682:一张训练集平均图能拿到多少
框架一个脑机接口项目从 fMRI 与脑电重建被试所见的自然图像,报告 PixCorr 0.682、SSIM 0.778,并称比先前方法改善 183.7%。逐像素相关与 SSIM 都是众所周知会奖励模糊的指标——一张平滑的、接近数据集平均的图往往能拿到不低的分数,而它显然没有重建任何具体内容。在同一个评测协议下,三个平凡基线各能拿到多少:(a) 输出训练集平均图像,(b) 输出高斯模糊后的真值(模拟"只对了低频"),(c) 从训练集中随机检索一张图?
你自己的那一点你产出平凡基线对照表:三个平凡基线 × 四个常用指标(PixCorr、SSIM、以及两个语义指标如 CLIP 相似度、Inception 特征距离)。如果平凡基线在 PixCorr/SSIM 上接近报告值而在语义指标上崩溃,那么这两个指标就不足以支撑"重建了所见内容"这个主张。 第二产出:指标—人类判断的对齐度——用配对的图像三元组构造一个客观的辨识任务(给定重建图,从 N 张候选真值中检索出正确的那张),报告 top-1 检索率,这是一个不会被模糊欺骗的指标。第三产出:面向"神经艺术"这一 TECA 语境的评价建议——当作品的价值是表达而非精确复现时,应该报告什么。
擦过TECA012(2025 TECA Grand Award + Special Award)"BrainSync: Reconstructing Visual Perceptions"——摘要原文:整合 7 特斯拉 fMRI 与密集阵列脑电重建自然视觉刺激,"utilizing a proprietary EEG dataset of 46,080 high-density 64-channel recordings alongside synchronized fMRI acquisitions";用扩散先验架构结合 CLIP 潜空间映射解码 V1/V2 活动;"yields reconstruction fidelity of 0.682 PixCorr, 0.778 SSIM, and a Dynamic Temporal Correlation (DTC) score of 0.687—an improvement of 183.7% over previous methods";双流管线融合 512 Hz 脑电与 0.8 mm³ 体素 fMRI,"reducing operational costs by 330x ($1M to $3K using EEG)";并称双向跨模态注意力与对抗训练把"real-world expression accuracy"提升 267%。摘要未报告任何平凡基线,也未说明 183.7% 与 267% 的对照对象。TECA 内无同题。
约束最可能死在数据。规避方式(关键):本课题的核心实验完全不需要神经数据。 平凡基线对照是一个纯图像实验:取任意一个自然图像数据集,构造三个平凡"重建器",在四个指标上评分。这可以在一天内完成,且结论直接适用。 只有第二产出(检索率)需要真实重建结果,可以用公开发布的神经重建方法的输出样例来做,或干脆用模拟的"部分正确重建"(对真值做不同强度的退化)来刻画指标的行为。
展台合规: 图像对比 + 指标表,完全静态。
注意措辞:BrainSync 的核心贡献主张是低成本可及性(330 倍成本下降),你的课题只针对保真度指标的解读,不应被写成对整个项目的否定。
T777–87
"与未受训成人等效":五位治疗师之间自己有多一致
框架一个语音治疗评分 AI 通过等效性检验(TOST)证明自己与"未受过语音治疗训练的成人(教师)"在统计上等效。这个结论完全建立在"五位语音治疗师的平均评分"作为金标准之上。 但摘要从未报告这五位治疗师彼此之间的一致性。如果治疗师之间的一致性本身就低,那么"与教师等效"这个结论的信息量会被大幅压缩——因为金标准本身带着大量噪声,而评分噪声会系统性地压缩所有相关系数、扩大所有平均绝对误差。 给定 20 个评分样本、5 位评分者,在不同的评分者一致性水平下,TOST 的等效边界应当如何设定?
你自己的那一点三个自产结果,全部为模拟与离线分析,不接触任何人:(a) 评分者噪声—相关系数衰减曲线:模拟已知真值 + 不同一致性水平的评分者,画出观察到的 Spearman 相关如何被压缩,给出"给定 ICC 时相关系数的理论上界";(b) n=20 时 TOST 的检验功效——等效性检验在小样本下极易因功效不足而"证明等效"(无法拒绝等效边界并不等于等效);(c) 等效边界的预设问题:摘要未说明边界是事前设定还是事后选择,你可以模拟展示边界选择对结论的影响。第四产出(可选):在公开的语音病理数据集上用客观声学指标复现该任务,给出一个不依赖人类评分的参照。
擦过TECA004(2026 TECA Grand Award)"ArticuRace: Accessible AI-Powered Speech Therapy"——摘要原文:"Five speech therapists and five teachers were given 20 pronunciations from the Ultrax Speech Sound Disorders Dataset, and asked to rate the clarity of the /s/ sound from 'Normal' to 'Very Poor'. Therapist ratings were averaged to create an accepted standard, and teacher ratings were averaged to create a control group.";两种 AI 方法(MFCC 与谱质心/滚降/平坦度)与教师评分同时对照治疗师评分;"The results showed that the teachers had higher Spearman Rank Correlations than both AI methods, and that the teachers also had a lower Mean Absolute Error (MAE) than both AI methods. An Independent Sample T-Test showed that there was no statistically significant difference between the teacher's MAE and the MAEs of both AI methods. After conducting multiple Two One-Sided Tests (TOSTs) and a Paired T-Test, both AI methods were statistically equivalent to a teacher."(注意:AI 在两个点估计上都不如教师,随后由等效性检验判定为等效——这个组合正是小样本等效检验最容易出现的情形)。摘要未报告治疗师间信度(ICC/Krippendorff's α),也未说明等效边界如何设定。
约束最可能死在被读成"否定一个做得相当规范的项目"。这个项目做得比大多数同类严谨——它设了人类对照组、用了等效性检验而非仅仅 t 检验、并诚实报告了 AI 在点估计上不如教师。你的摘要必须先说这些,然后把课题定位成"小样本评分任务中等效性结论的解读框架"。
人类受试者:不触发(纯模拟 + 公开语音数据集的离线声学分析;不招募任何评分者——这也是本课题相对于"再请更多治疗师评一次"的决定性优势)。
可行性极高:模拟部分几十行代码、秒级;Ultrax 数据集须核实获取条件。
展台合规: 曲线与表格,完全静态。
T875–85
大词汇量手语识别 30 FPS:换一个从没见过的手语者呢
框架一个实时美国手语翻译系统主打大词汇量与超过 30 FPS 的实时性。手语识别领域一个反复出现的结果是:在手语者不重叠(signer-independent)的划分下,准确率会大幅低于手语者重叠的划分——因为手部形态、体型、习惯性签署风格构成强个体指纹。在同一份公开大词汇量手语数据集上,手语者重叠与手语者不重叠划分的准确率差是多少?这个差随词汇量增大如何变化?
你自己的那一点你产出双划分 × 词汇量规模的准确率矩阵(词表 100/300/1000 词 × 两种划分)。这张矩阵回答的是一个对无障碍应用极其实际的问题:一个手语系统要在"没见过的用户"身上工作,需要付出多大的性能代价? 第二产出:个体指纹的直接测量——用关键点特征训练一个"手语者身份分类器",报告其准确率;如果它很高,指纹的存在被直接证实。第三产出:少样本个性化的收益曲线——给新手语者提供 1/5/20 个样本做适配,能挽回多少性能。这第三点直接对应 2026 年 TECA001T(HearMe)摘要中提出的"通用模型 + 个性化模型"混合思路,可以把两代 ISEF 项目串起来。
擦过TECA018(2025 TECA Grand Award)"Real-Time Focused Sign Language Translation System"——摘要原文:"This project aims to build a real-time, scalable system for American Sign Language (ASL) recognition, capable of large-vocabulary recognition and translation capabilities at over 30 FPS for both word- and sentence-level signing.";整合 MediaPipe 手部关键点追踪与"混合静态—动态融合"方法,用 MobileViT 类轻量 Transformer 结合多尺度注意力同时计算静态空间特征与时间动态;功能包括手语转文本/语音、手部与非手部标记(表情、体态)的多模态融合、实时反馈。摘要没有报告任何具体准确率数值,也未说明划分方式——这意味着你无法对话它的分数,只能针对这一类系统的评估方式。
同类目内同题密度是 TECA 最高的一族(已全部核对):TECA013(2026 Grand,Echo-Glove)用 IMU;TECA008/TECA010(2025,未获奖,HandTalk/Bidirectional ASL Glasses);TECA001T(2026,未获奖,HearMe)用 sEMG+IMU 并明确指出"通用模型难以适应手语的地区与个体差异",提出个性化模型——这段话是本课题问题真实存在的直接证据,务必引用;TECA016T(2026,未获奖,Oracle)做委内瑞拉手语,报告 91.64% 准确率与 1,400 次受控试验;TECA015(2026,未获奖,EVA-SL)。
约束最可能死在同题密度——这是 TECA 里唯一一族真正拥挤的方向(40 项中至少 7 项是手语系统)。但没有任何一个在做手语者独立性的评估,这正是空位所在;你的课题必须在摘要第一句就把这个区别讲清楚:你不做手语识别系统,你评估这一类系统的泛化边界。
数据 go/no-go:需要带手语者 ID 的公开大词汇量手语数据集(该领域有若干公开集,须自行核实获取条件与 ID 标注)。
可行性:用 MediaPipe 提取关键点后训练小型时序模型,纯 CPU 可行;避免端到端视频模型。
展台合规: 全部为矩阵与曲线;不要依赖现场演示手语识别。
T964–82
手套摘下来再戴上,识别率还剩多少
框架一个基于惯性测量单元的手语手套用机器学习识别手势。可穿戴手势识别有一个众所周知但极少被报告的失败模式:重新佩戴(re-donning)会改变传感器相对于手部的位置与朝向,导致特征分布漂移。 一个在单次佩戴内交叉验证达到高准确率的模型,在"训练用第 1 次佩戴、测试用第 5 次佩戴"的设定下往往显著下降。这个跨佩戴的性能落差有多大?用什么校准可以最便宜地补回来?
你自己的那一点你产出跨佩戴性能矩阵(训练佩戴次 × 测试佩戴次的准确率热图)——对角线是同次佩戴,非对角线是跨佩戴,两者的差就是漂移代价。第二产出:校准收益曲线——三种由便宜到贵的补偿手段(重力向量对齐的坐标系归一化 → 每次佩戴录 3 个校准手势做仿射对齐 → 每次佩戴做少样本微调)各能挽回多少,代价是多少秒的用户操作。这条曲线是给设计者的直接建议。第三产出:哪些手势最脆弱——按手势类别拆解漂移敏感度。
擦过TECA013(2026 TECA Grand Award)"Echo-Glove"——摘要原文:可穿戴双向沟通设备,"The system employs inertial measurement units to capture three-dimensional hand motion, a microcontroller for real-time signal filtering and preprocessing, and a central processing unit executing machine learning-based gesture recognition algorithms.";识别出的手势经文字转语音输出,来话经自动语音识别显示在集成屏幕上;表情分析用于调节语音韵律以保留情感语境;配套应用支持手势自定义;"Preliminary testing focuses on gesture recognition accuracy, system responsiveness, and overall usability." 摘要未报告跨佩戴评估。
相关且必须区分:TECA001T(2026,未获奖,HearMe)用 sEMG+IMU,摘要明确写"personalized model that learns from user-recorded gestures, adapting to individual signing styles"——它已经在做个性化,但针对的是人与人之间的差异,不是同一人不同次佩戴之间的差异,这个区别是你的新颖性边界,必须在文中写明;TECA019(2025,未获奖)用 sEMG 做 ASL 指拼,数据来自 2 名受试者共 10,400 个样本;TECA003(2026,未获奖)振动触觉手形原型。
约束最可能死在这需要自己采数据——公开的手势 IMU 数据集很少标注"佩戴次数"。这是本条 F 分偏低的主因。 最便宜的方案:一副带 IMU 的自制手套(MPU6050 类模块 + 微控制器,成本可控在数百元),由研究者本人在多次佩戴下录制固定手势集。
人类受试者: 若数据仅由研究者本人采集,通常按自我实验处理,但仍须向 SRC 确认(2026 年的 TECA003 摘要就提到"momentary restriction to self-experimentation",说明这条路是有先例的);一旦招募他人,就必须先取得 IRB 批准,绝不可先录后批。
展台合规: 手套本身可以带到展台(无液体、无玻璃、无锐器),但结论必须由热图与曲线承载。
T1067–85
在人工降质的语音上训练:真实的失语症语音也吃这一套吗
框架一个痴呆照护 AI 用"课程学习"在逐步降质的语音上微调 Whisper,报告词错误率显著下降。关键问题是这些降质语音是怎么来的。 如果是对健康语音施加信号处理(加噪、时间拉伸、频谱扭曲)人工合成的,那么模型学到的是对该合成过程的鲁棒性,而真实的构音障碍语音在音段时长、共振峰轨迹、发声起始时间、停顿结构上的偏离是信号处理无法复制的。人工降质语音与真实病理语音在声学空间中的距离有多大?
你自己的那一点你产出声学分布距离测量:在同一组声学特征空间中(时长、语速、共振峰离散度、发声/清音比、谱变化率等),计算三组语音两两之间的分布距离——健康语音、人工降质语音、真实病理语音。如果人工降质语音离健康语音的方向与真实病理语音离健康语音的方向不同,那么在前者上做课程学习就无法保证迁移。 这个结论可以用一张二维投影图讲完,极适合展板。第二产出:方向性诊断——逐个特征报告"人工降质把它推向了哪边、真实病理把它推向了哪边",找出符号相反的那些特征。第三产出:更好的降质方案——基于测得的偏离方向设计一组更贴近真实的增强,并验证其分布距离更小。
擦过TECA018(2026 TECA Special Award)"SAMA: Self-Evolving AI Assistant for Dementia Care"——摘要原文:三个子系统之一是自演化自动语音识别系统,用 Whisper 检测紊乱语音并持续标注/学习用户语音数据;"I designed a two stage training pipeline to fine-tune SAMA to auto adapt to daily degraded speech. Stage one utilizes a curriculum learning pipeline to improve Whisper's accuracy in progressively degrading speech, while stage two experimented several training algorithms including SFT and RL training to enhance the text reasoning of Qwen 3 for hypothesis ranking.";"Testing of the two stage pipeline show significant reduction of WER"。摘要未说明"progressively degrading speech"是真实纵向录音还是人工合成的降质序列——这是本课题的前提,必须先核实。相关:TECA013(2025,未获奖)在人为削波失真下比较四个 ASR 模型的词错误率(Whisper、RealtimeSTT、Wav2vec2、SpeechRecognition),并做了傅里叶分析说明高频受影响更大——这是同一类问题的一个较早的、诚实的探索,可作为正面参照引用;TECA019(2026,未获奖)用 35,182 条话语区分言语障碍与双语口音(多层感知器 97.6%)——该项目的数据组合方式本身也值得追问,见下方"继续找题"。
约束最大的 go/no-go 是真实病理语音语料的获取——主要的构音障碍语音数据库(TORGO、UASpeech 等)需要签署使用协议,未成年人申请可能受限。必须在立项前解决这一步。 若无法获取,退路是使用公开的老年语音或带口音/嘈杂环境语音语料,把课题改成"人工降质是否能代理真实的说话人变异",结论形态相同但主张收窄。
人类受试者:不触发(使用既有的、经许可的去标识化语音语料;不录制任何新语音)。且务必遵守语料许可,展板上不得播放任何可识别个体的录音。
可行性:声学特征提取(librosa/praat-parselmouth)与分布距离计算纯 CPU;不需要微调 Whisper——这是可行性的关键。
T1172–82
情绪识别 88%:换一个语料库还剩多少
框架一个 AI 音乐治疗平台用 11 个模型的集成融合面部表情、声音韵律、生理信号与心理量表,得到统一的效价—唤醒状态表示,报告混合模型准确率 88%、κ=0.78、F1=86%,并称跨模态一致性更高。多模态情绪识别有一个反复被证实的结果:同语料库内的性能与跨语料库的性能差距巨大(在语料库 A 上训练、在 B 上测试常常掉到接近随机)。在公开的情绪识别语料上做严格的跨语料库评估,88% 会变成多少?"跨模态一致性"这个指标在跨语料库设定下还成立吗?
你自己的那一点你产出跨语料库混淆矩阵:N 个公开情绪语料两两之间"训练→测试"的准确率矩阵,对角线是同库、非对角线是跨库。这张矩阵是本课题的核心。第二产出:融合是否真的带来鲁棒性——单模态与多模态在跨库设定下的性能对比;一个常见但少被检验的假设是"多模态更鲁棒",而实际上多模态可能只是更充分地过拟合了同一个语料库的采集条件。第三产出:面向治疗应用的后果陈述——在音乐治疗这个 TECA 语境里,情绪识别错误会导致选择错误的干预音乐,这个错误率的实际含义是什么。
擦过TECA008(2026 TECA Grand Award + Top Award)"HARMONI: An AI-Powered Music Therapy Platform"——摘要原文:基于 Iso-principle 的自适应干预;"HARMONI integrates facial affect, vocal prosody, physiological signals & psychometric measures into a unified latent valence-arousal state representation. An ensemble of 11 AI models powers hybrid emotion detection, RAG personalization, conversational support, agentic orchestration for diffusion-based image synthesis & transformer-based music generation.";"Weighted hybrid model exceeded unimodal models (acc=88%, κ=0.78, F1=86%) with higher cross-modal consistency.";另有 4 项随机对照实验(n=108,70k 数据点)报告 ΔGAD7=-5.78、ΔPSS10=-8.19、ΔHR=-9.04(p<0.001),效应量 d=0.63–1.28。摘要未报告跨语料库评估。相关:BEHA006(2026 BEHA Special)做 EEG 情绪识别(跨类目)、TECA015(2026,未获奖,EVA-SL)做情绪到颜色的映射。
约束最可能死在被读成"想推翻一个拿了 Top Award 的项目"。规避方式:明确把范围限定在情绪检测子模块的泛化性,并在摘要里承认那 4 项随机对照试验是本课题无法也不试图评估的部分(它们需要 IRB 与受试者,你没有)。这个自我限定反而让课题更可辩护。
人类受试者:不触发(仅使用公开发布的情绪语料做离线评估;不采集任何新数据、不对任何人施加干预)。注意:本项目原型涉及心理健康干预,你的衍生课题必须彻底剥离干预成分——2027 规则禁止学生向受试者反馈研究数据或提供任何建议。
可行性:面部/语音情绪语料的公开集较多但许可条件不一,须逐个核实;用冻结特征 + 小型分类器可在 CPU 上完成。
T1267–85
单张照片重建的金缮三维碎片:没有真值几何,"稳健"是怎么判定的
框架一个项目从单张智能手机照片生成金缮作品的碎片级三维点云,在 14 件不同的金缮作品上实验,称"在各种修复风格与构图下表现稳健",并把框架开源发布。但摘要没有说明任何几何真值来源——没有真值,"稳健"只能是视觉判断。该框架已经开源,因此可以被直接复现。 建立一个真值基准(对同一件器物做多视角摄影测量重建作为参照),单照片重建的碎片边界与三维形状误差是多少?误差随什么因素变化(碎片数量、金缮线的对比度、器物釉面反光、拍摄角度)?
你自己的那一点三个自产结果:(a) 真值基准——用多视角摄影测量(COLMAP 类开源管线,CPU 可跑)为若干器物建立参照几何,这本身就是一份可复用的公开资源;(b) 误差—因素曲线:碎片分割的 IoU 与三维形状误差随上述因素的变化;(c) 复现报告:开源代码在你的环境下能否复现论文中的定性结果,遇到哪些障碍。第三项是对开源可复现性的直接贡献,而该项目自己就把可复现性列为发布 GitHub 的理由,因此这个课题与它的目标完全一致而非对立。
擦过TECA006(2026 TECA Grand Award)"Kintsugi 4D"——摘要原文:把金缮作品的三维几何以及"金缮匠人的意图与器物主人的记忆"这些先前难以保存的要素整合进一部编年史;提出 Kintsugi-Splitter,输入一张照片与一段叙述,输出碎片级三维点云与结构化编年史;"Experiments on 14 diverse kintsugi works demonstrated that fragment-level 3D point clouds can be generated from a single smartphone image without the need for specialized equipment, showing robustness across various repair styles and compositions.";"By publicly releasing Kintsugi-Splitter on GitHub, this project promotes reproducibility and extensibility, enabling others to apply and expand both the framework and dataset." 摘要未报告任何定量几何误差或真值来源。TECA 内无同题(唯一的文化遗产三维重建项目;2025 年 TECA002(未获奖,RestART)做二维艺术品修复,也是在人工制造的损伤上评估)。
约束三个风险。第一,器物获取——金缮器物不易得。规避方式:用陶瓷碎片自行修复(金缮的现代替代材料如环氧树脂 + 金粉),或改用任何"可见修复痕迹的器物";注意展台禁玻璃、禁锐器,陶瓷碎片带到展台有割伤风险,只能用照片呈现。第二,开源代码的实际状态——GitHub 上的代码可能不完整或依赖不可得的模型权重,这是 go/no-go,务必先克隆下来跑通再立项。第三,算力——若其管线依赖大型视觉模型,CPU 可能跑不动;这一点必须在同一步验证。
这三项验证加起来只需要一两天,但必须在写研究计划之前完成。
展台合规: 照片、点云渲染图、误差曲线;实物碎片不要带。
T1378–88
CNN 20%、SVM 95%:五分类里 20% 就是随机,这说明了什么
框架同一个 /s/ 发音分类任务,在 ISEF 上出现过两次。2025 年那次比较了四个模型,报告 CNN 与 LSTM 平均准确率 20%,而 SVM 95%、KNN 92%,并把这作为"假设被推翻"的结论。但任务是五分类,20% 正好等于随机水平。 一个深度模型跌到恰好随机,通常不意味着"深度模型不适合这个任务",而意味着训练没有收敛(学习率、归一化、标签对齐、类别顺序、梅尔倒谱系数的形状处理任一环节出错都会导致这个结果)。在同一份公开数据上,一个正确训练的小型 CNN 能达到多少?如果它接近 SVM,那么原结论就应当被改写。
你自己的那一点你产出训练诊断阶梯:从"故意配置错误"到"正确配置"逐步修正(未归一化 → 归一化 → 正确的 MFCC 时频轴 → 合适的学习率与早停 → 数据增强),报告每一步的准确率与训练曲线。这条阶梯把"深度模型输给 SVM"这个结论转化成一个可诊断的问题:在什么条件下它成立,在什么条件下它不成立。 第二产出:小样本下的模型选择建议——1,200 个音频文件对 CNN 而言确实偏小,你可以给出"样本量 vs 最佳模型族"的实测曲线,这是对语音病理学这类小数据领域的实用贡献。第三产出:把结论放回语音治疗可及性这个 TECA 语境。
擦过两个项目构成本课题的完整背景,都已核对原文:
- TECA004(2026 TECA Grand Award)"ArticuRace"——同一个 /s/ 发音评价任务,用了 MFCC 与谱质心/滚降/平坦度两种方法,并做了与治疗师、教师的对照(见 T7)。这是本课题派生的获奖项目。
- TECA017(2025,未获奖)"Coding AI To Enhance Speech Therapy"——摘要原文:1,200 个音频文件(正确、齿音、齿间音、唇齿音、爆破音各 240 个,共五类),转为梅尔频率倒谱系数,按 70/15/15 划分;CNN、LSTM、SVM、KNN 各经超参数优化;"The hypothesis was the CNN would identify correct pronunciations and each type of mispronunciation with the best accuracy because of its ability to classify images. ... The CNN and LSTM had an average accuracy of 20% on the test data, while the SVM had an average accuracy of 95% and the KNN had an average accuracy of 92%, proving the hypothesis incorrect." ——五分类的随机水平正是 20%。
约束最可能死在数据——TECA017 的 1,200 个音频是自建的,不公开。规避方式:用公开的语音病理或音素分类数据集重建同构任务(五类音段区分),你的结论是关于小数据音频分类中深度模型的训练条件,不依赖复现那批音频。这也让课题更普适。
措辞: 必须写成"复现一个反直觉结果并诊断其成因",而不是"某项目训练出了 bug"——你没有他们的代码,不能断言原因;你能断言的是"在同构任务上,正确训练的 CNN 达到 X"。
人类受试者:不触发(公开语音数据集的离线分析)。
可行性极高:1,200 条短音频 + 小型 CNN,纯 CPU 分钟级。
T1470–88
"成本降低 330 倍":脑电和 fMRI 各自贡献了多少重建保真度
框架同一个脑机接口艺术项目提出了两个耦合的主张:(a) 融合 7T fMRI 与密集阵列脑电能达到高重建保真度;(b) 用脑电替代 fMRI 可把成本从 100 万美元降到 3 千美元,降低 330 倍。但 (b) 的成立要求脑电单独就能承载大部分保真度,而摘要报告的指标是融合系统的。 如果保真度主要来自 fMRI 的高空间分辨率(0.8 mm³ 体素),那么 330 倍的成本节省对应的是显著更低的重建质量——这个权衡从未被量化。
你自己的那一点你产出模态消融曲线:在公开的脑电—图像配对数据上,测量 (a) 仅脑电、(b) 脑电 + 模拟的粗空间信息、(c) 已发表的 fMRI 重建结果三者在同一套指标上的位置。核心产出是"保真度 vs 成本"的帕累托点位图——把每个方案的设备成本放在横轴、保真度放在纵轴,让 330 倍这个数字第一次有了纵轴上的代价。第二产出:脑电的信息上界——用互信息或线性可解码性估计 64 通道脑电对图像类别/低层特征的信息量上界,这给出了"脑电最多能重建到什么程度"的理论参照。第三产出:面向"神经艺术"应用的实用结论——如果目标是表达而非精确复现(这正是 BrainSync 自己强调的艺术定位),那么保真度损失是否可接受?
擦过TECA012(2025 TECA Grand Award + Special Award)"BrainSync"——摘要原文(与 T6 同源,此处引用另一组主张):"Its dual-stream pipeline merges real-time EEG (512 Hz) with high-spatial fMRI (0.8mm³ voxels) via a transformer architecture for precise neural alignment while reducing operational costs by 330x ($1M to $3K using EEG).";并称系统"enables real-time visualization of internally generated imagery, converting thought or vision into dynamic art"、"empowers artists to document the fluidity of human experience"。摘要没有给出任何单模态消融——既没有仅 fMRI 也没有仅脑电的保真度数字,而 330 倍成本主张恰恰需要后者。
约束最可能死在数据。go/no-go:须确认可获得公开的脑电—图像配对数据集(近年有若干大规模公开集,须自行核实许可与体量)。算力上必须避开端到端扩散重建——用线性解码或小型回归到预训练图像特征空间,报告特征空间中的重建质量而非像素级图像,这在 CPU 上完全可行,且与 T6 的结论(像素级指标不可靠)一脉相承。
措辞: BrainSync 的可及性主张是真诚且重要的(把神经艺术工具从百万美元设备解放出来)。你的课题不是否定它,而是给它加上纵轴——"成本降了 330 倍,保真度降了多少"是这个主张真正需要的第二个数字。
人类受试者:不触发(公开去标识化神经数据的离线分析)。
T1572–90
同一个人换个体裁写作,"风格指纹"还认得出来吗
框架作者身份验证的实用场景是"这份提交的作业是不是这位学生写的"。但学生在不同任务下的写作风格差异可能很大——议论文、实验报告、反思日志、非正式邮件在句长、被动语态、连接词、标点习惯上系统不同。一个在同体裁样本上训练的"风格指纹",在跨体裁配对上的验证准确率是多少?跨体裁的同一作者,会不会被判为不同人(假阴性)? 在教育应用中,假阴性意味着诬告一名诚实的学生——这是比假阳性更严重的错误,而摘要报告的指标里看不出它。
你自己的那一点三个自产结果:(a) 体裁内 vs 体裁间的验证准确率对照(用带作者与体裁双标注的公开语料);(b) 假阴性率的绝对量——在教育场景的实际基率下(绝大多数提交是诚实的),一个 85% 准确率的系统每 100 名学生会误伤几个?这是一条基率曲线,也是本课题最有说服力的一张图;(c) 需要多少样本才能建立稳定指纹——每位作者的参考样本数从 1 篇到 20 篇,验证准确率的收敛曲线,直接对应"新学期开学时系统还没有足够样本"这个真实约束。
擦过TECA020(2025 TECA Grand Award + Special Award)"VerifyMe"(与 T2 同源,此处针对另一组主张)——摘要原文的应用定位明确是学术场景:"OpenAI's ChatGPT has blurred the line between human and AI-written text, challenging academia's ability to verify authorship. Existing AI detection systems fail with paraphrased content or mimicked writing styles and misclassify human work."(注意最后半句:它明确把"误判人类作品"列为现有系统的缺陷之一——那么它自己的误判率是多少?摘要只给了准确率与 MCC/AUC,没有在教育基率下给出假阴性的绝对数量);训练语料是 BAWE(学术写作)与 Gutenberg(文学),两者内部体裁都相对单一;"When tested on unseen authors, VerifyMe achieved 85% accuracy on human-human verification from BAWE"。摘要未报告跨体裁验证。
约束最可能死在语料——需要同一作者、多个体裁的标注语料。这是 go/no-go。 可能的来源:博客作者语料(同一博主的不同类型文章)、公开的学生写作语料、Gutenberg 中同时写小说与书信/散文的作者(后者完全公开且免费,是最稳妥的起点)。
与 T2 的区别必须写清楚:T2 问"跨作者的区分是否靠话题",T15 问"同作者的跨体裁是否仍被认作同一人"——一个是假阳性方向,一个是假阴性方向,实验设计与结论都不同。同时选这两条投同一个赛季会构成自我重复,只能选一条。
人类受试者:不触发(公开既有文本语料)。若使用任何真实学生写作,必须确认其为已公开发布的去标识化语料。
可行性高:特征提取 + 距离度量,纯 CPU。