S187–97
用亮度预测火辐射功率:SHAP 指出的头号特征,是不是被预测量自己
框架一个野火预测项目用 MODIS 数据训练模型预测火辐射功率(FRP),R² > 0.60,SHAP 分析显示影响最大的两个特征是 brightness 与 bright_t31。但 FRP 在 MODIS 产品里正是由亮度温度按 Kaufman 公式计算出来的。 把这两个通道移除后,R² 还剩多少?剩下的那部分是不是才是真正的"预测"?
你自己的那一点你产出特征剥离阶梯:全特征 → 去 brightness → 去 bright_t31 → 两者都去 → 只留地理/时间特征,五档 R²。再产出解析对照:直接用 MODIS 的 FRP 计算公式从亮度反算 FRP,看纯解析式能达到多少 R²——如果解析式就有 0.9+,那么机器学习模型的 0.60 说明它连恒等式都没学好,这是一个更尖锐的结论。第三产出:真正的预测任务——用 t 时刻的特征预测 t+1 时刻的 FRP,这才是"预测"而非"重算"。
擦过SOFT031T(2025 SOFT Grand Award)"Wildfire Predictiveness With Explainable AI"——摘要原文:数据取自 NASA 公开网站,Random Forest Regressor 与 TabNet Regressor,Grid Search CV(5 折)与 K-Folds CV(5 折)调参,"An r^2 score of greater than 60 for both cases confirms the relationship between predicted and actual FRP values";"SHAP analysis ... revealed that parameters with largest impact for both models were 'brightness' and 'bright_t31', but the third largest differing: 'latitude' for TabNet and 'confidence' for Random Forest"。摘要没有讨论 FRP 与亮度温度之间的产品级派生关系。相关:SOFT047(2025 Grand)灰斑病严重度评估也用 SHAP 类可解释性但未做泄漏检验。
约束最可能死在被说成"太容易了"。规避方式:不要停在"这是泄漏"。把课题定位成"遥感产品派生关系导致的目标泄漏在多大范围内存在",并把同一检验套用到另外两三个常见 FIRMS 派生量上,给出一份可复用的检查清单 + 每一项的实测 R² 落差。数据完全公开(NASA FIRMS 可直接下载 CSV),纯 CPU,随机森林在几十万行上是分钟级。规则 7 规避:五档 R² 与 t+1 预测任务全部是你自己跑出来的。
S280–90
一个"不用机器学习"的 AI 图像检测器,在重新压缩之后还剩多少
框架一个基于噪声统计偏差的 AI 生成图像检测器在自建数据集上达到 98.6%。真实社交平台上的图片都经过重压缩、缩放、裁剪。把测试图像分别做 JPEG 质量 95/85/75/60 重压缩、按 0.75/0.5 倍缩放、随机裁剪后,准确率各是多少?换一批不同相机/不同来源的真实图像作为"真"类,误报率是多少?
你自己的那一点你产出一张退化—准确率曲面:横轴是压缩质量或缩放比例,纵轴是准确率,每条曲线对应一种生成器。噪声统计类方法对重采样极度敏感是可以预期的,但没有人给出过这条曲线的形状与拐点位置。第二产出:跨来源真实图像的误报率——如果"真"类全部来自作者自己的相机,那么检测器可能只是在识别那台相机的传感器噪声指纹。
擦过SOFT013(2025 SOFT Grand Award + Special Award)"Integrity: Generalized Artificial Image Detection"——摘要原文:"a software tool without machine learning that detects images generated by any model by analyzing statistical deviations in the noise pattern, looking for indicators of authenticity rather than signs of artificialness";"An original dataset of high-resolution authentic images was paired with artificial images from multiple models";"Authentic image scores were empirically determined to fit within a threshold";平均分类准确率 98.6%(on the custom dataset),并称"outperforming other detectors by more than 23%",还含"built-in protection mechanism for detecting potential attacks"。摘要没有报告任何压缩/缩放鲁棒性测试,也没有说明真实图像的来源多样性,且明确写了阈值是"empirically determined"(即在同一批数据上定的)。
约束最可能死在无法复现原算法(细节未公开)。规避方式:不要复现它。用两三个公开可得的无学习噪声统计检测方法(如基于 PRNU、DCT 系数统计、色彩通道相关性的经典方法)自建同类检测器,你的结论是关于这一类方法的鲁棒性,前作只是动机。生成图像可用公开的 AI 图像数据集,真实图像用多来源公开图库。纯 CPU,全是频域统计。
S380–90
字典和测试语料来自同一个来源:3.37 倍压缩率里有多少是这句话造成的
框架一个词素级文本压缩方案报告比 ASCII 短 3.37 倍、比 LZW 短 2.77 倍。但摘要原文承认测试句来自与字典相同的来源。换成域外语料(不同体裁、不同年代、不同领域)后,压缩比降到多少?换成现代基线(zstd 带训练字典、brotli、PPMd、xz)而不是 LZW 后,优势还剩多少?
你自己的那一点你产出一张 2×4 矩阵:{同源语料, 域外语料} × {ASCII, LZW, zstd+字典, brotli},八个压缩比。这张表把一个孤立的 3.37 变成了可解读的量。第二产出:字典体积计入总开销后的公平比较——静态字典必须在两端预置,把字典字节数摊入短文本传输成本后,在句子长度多短时该方案才真正获胜?这正是它主打的场景(卫星短文本通信),而摘要从未把字典开销计入。
擦过SOFT011(2025 SOFT Special Award)"Natural Language Compression (NLC)"——摘要原文:词素级(word / punctuation / 常用词组如 "such as")变长编码,静态字典两端预置;平均比 ASCII 短 3.37 倍、比 LZW 短 2.77 倍;"On tests individually performed on over 200,000 sentences from the web (originating from the same source as the dictionary, adequately representing NLC for general purposes)",97.4% 的句子比 ASCII 效率高一倍以上,72% 高三倍以上。目标场景明确写着卫星文本通信(传输成本 > 计算成本)。相关:SOFT014(2023 Second Award)做 DICOM 医学图像无损压缩(不同介质,非同题)。
约束最可能死在被认为是"欺负人"。规避方式:措辞必须是"为短文本领域自适应压缩建立公平比较框架",并明确承认词素级思路本身是合理的、与 zstd 的训练字典是同一族思想。你的贡献是把它放进正确的对照组里,并给出字典开销的盈亏平衡点——后者是一个前作与现代基线都没有明确回答的实用问题。可行性极高:Python 标准库 + zstandard/brotli 包,公开语料(Wikipedia、Gutenberg、Common Crawl 样本),纯 CPU 分钟级。
S480–90
用压缩率近似柯尔莫哥洛夫复杂度:换一个压缩器,结论还成立吗
框架一个 PDF 隐写恶意软件检测方法用"压缩后大小 + 解压脚本"作为柯尔莫哥洛夫复杂度的上界。这个上界完全依赖于所选压缩器。换成 gzip / bzip2 / zstd / xz / PPMd 后,真阳率与假阳率各是多少?排序会不会反转?另外:从 100% TPR / 86.2% FPR 调到 97.8% TPR / 3.7% FPR 的那次"精细化",是在同一批数据上做的吗? 在真正的留出集上,性能是多少?
你自己的那一点两个自产结果。第一是压缩器敏感性矩阵:五种压缩器 × 若干 PDF 组件(JavaScript / OpenAction / 元数据)的 TPR-FPR 表,直接回答"这个方法测的是复杂度还是某个压缩器的建模能力"。第二是阈值选择的诚实代价:把阈值在训练折上选定、在从未见过的留出集上评估,报告乐观偏差的大小。前作的 86.2% → 3.7% FPR 是巨大的改进,但改进依据是"refining the approach to analyze specific PDF components"——这是在观察到结果之后做的选择。
擦过SOFT033(2025 SOFT Grand Award)"Stegomalware Detection Using Kolmogorov Complexity"——摘要原文:因停机问题无法直接计算柯氏复杂度,改为"compressing the object, and concatenating that with a decompressor script to form a self-extracting archive, with the total size of that code serving as an upper bound";与已知干净文档导出的基线比较偏差;"Initial testing achieved a 100% true positive rate but an 86.2% false positive rate when analyzing the entire PDF as a whole. Refining the approach to analyze specific PDF components such as javascript or open actions ... improved results to a 97.8% true positive rate and a 3.7% false positive rate." 摘要未指明使用了哪个压缩器,也未说明精细化后的评估是否在独立留出集上。相关:SOFT010(2025 Special)仿噬菌体的 AI 杀毒(在"模拟恶意软件数据集"上测试)、SOFT059T(2025 Special)SENTRY 端点检测。
约束最可能死在样本获取——真实恶意 PDF 涉及安全与合规风险,不要在个人机器上处理活体恶意样本。规避方式:使用公开的、已消毒的 PDF 恶意软件研究数据集,或按公开文献描述的注入方式在受控、不可执行的条件下自行构造隐写载荷(这也让你完全掌握真值标签)。这一点必须在研究计划里明确写清楚处理流程。纯 CPU,压缩是本地操作。
S573–83
九类驾驶员状态 F1 95.51%:换成驾驶员不重叠的划分呢
框架分心驾驶数据集(如 State Farm 类)的每位驾驶员会贡献数百张连续帧。随机划分会把同一位驾驶员的相邻帧同时放进训练与测试。改成驾驶员不重叠划分后,F1 从 95.51% 掉到多少?再问:模型识别的是"手在打电话"还是"这个人是谁"——用驾驶员身份作为标签重训,能达到多少准确率?
你自己的那一点你产出划分粒度阶梯(随机帧 → 随机片段 → 驾驶员不重叠)三档 F1,以及身份可预测性这个诊断量。第二产出针对该项目的第二层主张:它把分类概率经滑动平均后估计"分心时长",误差 10.78%。这个时长估计的误差在驾驶员不重叠划分下会怎么变? 时长估计的误差会随分类误差非线性放大,而摘要只在同一划分下报告了一个数。
擦过SOFT040(2025 SOFT Grand Award)"DISTRACT: Real-Time Vision Model for Safer Driving"——摘要原文:CNN-ViT 混合模型分类九种驾驶员状态,F1 = 95.51%;分类概率经简单移动平均(SMA)平滑以识别正常驾驶与分心之间的转换,时序分析在估计分心时长上平均误差 10.78%;再由严重度函数把时长映射为 0–1 分数,该函数"derived from empirical crash risk data"。摘要未说明数据集划分方式。相关(同为驾驶场景但不同题):SOFT030(2025 Special)智能人行道信号、BEHA056(2025 Grand)驾驶疲劳监测(跨类目,用了 EyeBlink8/DMD/UTA-RLDD 标准数据集并报告 F1 94%/80%——这是一个做了标准基准的正面参照)。
约束最可能死在算力:CPU 训 ViT 不可行。规避方式:把模型换成小型 CNN 或冻结特征 + 线性分类器,只要三档划分用同一模型,落差就成立。数据集须选公开且带驾驶员 ID 的版本——没有驾驶员 ID 就做不了这个课题,这是 go/no-go。
S675–85
PlantVillage 上训练的病害严重度模型,把背景遮掉还剩多少
框架在实验室统一背景下拍摄的叶片数据集上训练的模型,可能靠背景而非病斑做判断。把叶片区域之外全部置零/替换为随机背景后,分割与严重度评估的性能掉多少?把模型迁移到田间实拍图像上,性能掉多少?"比人类专家更一致"这个结论在哪一档下仍然成立?
你自己的那一点三个自产结果:(a) 背景消融(原图 / 仅叶片 / 仅背景——如果"仅背景"就能达到高准确率,结论立刻成立);(b) 跨域迁移:实验室训练 → 田间测试的性能落差;(c) 一致性 vs 准确性的分离:模型比专家"更一致"是必然的(确定性算法的重测一致性天然是 100%),一致性高并不意味着准确。这第三点是前作结论表述里的一个具体逻辑跳跃,可以用实测数据讲清楚。
擦过SOFT047(2025 SOFT Grand Award)"Deep Learning Detection System for Gray Leaf Spot"——摘要原文:YOLOv8 提取叶片区域与病害类型,U-Net 分割 GLS 病斑并计算百分比严重度;"The models were trained on the PlantVillage and Corn Disease & Severity datasets";"GLS severity assessments produced by the models showed a strong correlation and exhibited even higher levels of consistency than expert human evaluations";另接入 LLM 给出田间管理建议。摘要未做背景消融,也未报告田间图像上的独立评估。
约束最可能死在算力(U-Net 在 CPU 上训练很慢)。规避方式:把任务缩小到分类而非分割(背景泄漏效应在分类任务上同样成立且更快测),或用极小的 U-Net + 降采样图像。田间图像的获取是第二个 go/no-go——须先确认有公开的田间玉米叶病害图像集,拿不到就把课题收缩为纯背景消融,那仍然是一个完整结果。
S775–85
肺 CT 结节分类 98.6%:把同一位患者的切片分到两边会怎样
框架CT 数据集里每位患者贡献几十到上百张连续切片,相邻切片高度相似。按切片随机划分 vs 按患者划分,98.6% 会掉到多少?另一层:该项目对纤维化分类做了分层 5 折交叉验证(做得对),但对结节分类只报告了单一准确率——两个任务的评估严格程度不一致,这本身是可测量的。
你自己的那一点你产出患者级 vs 切片级的双划分对照,并且在同一份公开数据集上对六个骨干网络全部重跑——因为前作对比了 VGG16/VGG19/ResNet50/ResNet50V2/MobileNetV2/EfficientNetB0 六个模型,你可以直接问:在正确划分下,六个模型的排序还一样吗? 如果排序在两种划分下不同,那么"VGG16 与 ResNet50V2 更能应对不同对比度条件"这个结论就依赖于划分方式。这是一个前作自己提出的具体结论,可以被具体检验。
擦过SOFT002(2025 SOFT Special Award)"Lung Tumor and Fibrosis Detection"——摘要原文:纤维化系统用 CLAHE 增强 + 数据增强 + 下采样,六个 CNN,分层 5 折交叉验证,指标显示 VGG16 与 ResNet50V2 更能应对不同对比度;结节系统分类良性/恶性/正常,"an approximate 98.6% accuracy is achieved by extensive augmentation and hyperparameter tuning";另有基于阈值分割 + 形态学算子 + 形状过滤的结节定位。摘要对结节任务未说明划分粒度,也未说明 98.6% 是哪一折/哪一次。
约束最可能死在数据集选择——必须选带患者 ID 的公开肺 CT 数据集(这是 go/no-go)。算力上把六个骨干换成同一个小型 CNN 的六种配置也能成立,但那样就不能直接对话前作的排序结论;折中做法:用冻结的预训练特征提取 + 线性分类器,这样六个骨干的特征提取只需前向推理(CPU 可承受),排序对比仍然成立。
S878–88
在随机电路上赢 Qiskit 79%:换成真实工作负载、给对手同样的时间预算呢
框架一个强化学习量子电路优化器在随机电路上平均超过 Qiskit L3 / PassManager / Tket / PyZX 达 79.03%。随机电路不代表真实工作负载。换成结构化基准电路(QASMBench / MQT Bench:QFT、Grover、VQE ansatz、Trotter 演化)后,优势是多少?再给对手匹配的编译时间预算(Qiskit L3 允许多次不同 seed 取最优、开启 SABRE 多次试探)后,优势是多少?
你自己的那一点你产出 2×2 对照:{随机电路, 结构化电路} × {单次编译, 时间预算匹配},四格下的深度削减率。这直接回答"79% 是算法优势还是评测设置优势"。第二产出:保真度指标的可比性——前作报告 50.30% 保真度提升,但保真度依赖于所用噪声模型的校准快照,你可以测量同一优化结果在不同日期校准数据下的保真度波动,给出这个数字的固有不确定度。
擦过SOFT049(2025 SOFT Grand Award)"Novel RL-Based, Noise-Adaptive QC Optimization"——摘要原文:自称首个适应量子设备校准漂移与硬件约束的 RL 算法;在线学习环境持续更新比特错误率、相干时间、连通性约束,噪声模型由真实校准数据构建(如 "ibm_torino")并逐时间步更新;Monte-Carlo 验证下 深度削减 49.34%(p=0.0004)、保真度提升 50.30%(p=0.0021);"the algorithm outperformed each tool by an average of 79.03% on random circuits (p < 0.0001, sample size = 30)";并称比现有算法成本效率高 125–300 倍。相关:SOFT045(2023 First Award)中电路测量对旁观比特的影响、SOFT054(2025,未获奖)QEC 实时综合征处理、SOFT035(2025,未获奖)量子支持向量分类器优化。
约束最可能死在需要复现 RL 智能体。不要复现它。 你的课题是评测设置的敏感性,只需要跑那四个公开的经典优化器(Qiskit、Tket、PyZX 全是开源 CPU 工具),在两类电路、两种时间预算下测深度削减。RL 那一侧可以留空并诚实说明"我们无法评估该 RL 方法本身,只能刻画它所用的评测设置在多大程度上决定结论"。这个限定反而让课题更干净。 Qiskit transpiler 在笔记本上是秒级到分钟级。
S978–88
心杂音检测 90%:换成官方挑战赛的划分与官方指标呢
框架一个心杂音检测与特征刻画方法在 CirCor DigiScope 上报告"约 90% 准确率、F1 0.91、测试准确率 87%"。CirCor 是 PhysioNet/CinC 2022 挑战赛的官方数据集,有官方的患者级划分、隐藏测试集和官方加权指标。改用官方划分与官方指标后,数字是多少?同一位患者的多个听诊位点是否被分到了两侧?
你自己的那一点你产出指标翻译表:同一个模型在 {随机片段划分, 随机患者划分, 官方划分} × {准确率, F1, 官方加权准确率, 加权成本} 下的全部数值。这张表让所有在该数据集上自报数字的项目第一次可以互相比较。第二产出:"约 90%/F1 0.91/测试 87%"三个数之间的关系——摘要同时给了三个不同的数而未说明各自对应什么,你可以用自己的实验说明这类差异典型来自哪里(类别不平衡、宏平均 vs 微平均、验证 vs 测试)。
擦过SOFT057(2025 SOFT Grand Award + Special Award)"HM-Detect Using Novel C^2-LSTM Architecture"——摘要原文:不只检测还刻画杂音特征(时相、位置等);特征用滤波器组能量 + 谱子带质心及其统计矩;提出双记忆通道的 C²-LSTM 以对抗不同频率模式间的耦合,并推广为 Cⁿ-LSTM;"validated on signals from the clinically verified CirCor DigiScope dataset, achieving a performance accuracy of around 90% and having an F1 score of 0.91 and a test accuracy of 87%"。摘要未提及官方挑战赛划分或官方评分指标,也未说明听诊位点的分组方式。
约束最可能死在被认为只是"重跑别人的基准"。规避方式:核心产出必须是指标翻译表这个可复用工具,而不是某一个模型的分数;并主动把表格套用到两三个不同的模型族(树模型、LSTM、简单谱特征 + SVM)上,说明翻译关系对模型类别是否稳定。CirCor 公开可下载,音频特征提取 + 小型模型纯 CPU 可行。
S1079–89
"4097 比特熵 vs 256 比特":这个比较测的是安全性吗
框架一个后量子消息认证的评估以"密钥熵比特数"作为安全性指标,得出格基方案(4097.585 比特)优于 HMAC(256 比特)的结论。但密钥长度不等于安全强度,而且 HMAC 并不被 Shor 算法攻破——Grover 至多把 n 比特安全砍半。 用正确的安全强度定义重做这个比较,排序是什么?在相同的目标安全等级下(如 128 位后量子安全),两者的实际时间/内存开销各是多少?
你自己的那一点你产出一份安全等级对齐的基准:把 HMAC-SHA256/SHA384/SHA512 与 NIST 后量子标准(ML-DSA 等)按各自的宣称安全等级(NIST Level 1/3/5)对齐,测量签名/验证时间、密钥与签名大小、内存峰值。这才是"该选哪个"的可操作依据。第二产出:熵这个指标的失效演示——构造一个熵极高但安全性为零的玩具方案(如超长密钥的异或),说明为什么熵不能当安全度量。这个演示是一个极其清晰、可放上展板的教学性结果。
擦过SOFT012(2025 SOFT Special Award)"Evaluating Message Authentication MACs for Y2Q"——摘要原文:比较格基门限签名与 HMAC;"The results show that HMAC was faster and used less memory compared to lattice, while lattice had 4097.585 bits of entropy in comparison to HMAC's 256 bits";结论是"lattice is more efficient and quantum-resistant than HMAC"(注意这句与前半句"HMAC 更快更省内存"在字面上冲突);测得响应时间 < 1 秒、最大内存 160 KB。相关:SOFT045(2023 First Award)量子电路方向但非密码学。
约束最可能死在被读成"羞辱一个高中生项目"。这是本文件里措辞风险最高的一条。 规避方式:题目与摘要必须完全指向方法学——"后量子方案比较中安全度量的选择"——前作只在"动机"一段出现一次,且必须承认它正确地报告了时间与内存这两个真实的工程量。主体是你自己的基准与玩具演示。可行性极高:liboqs / PyCryptodome 都是 CPU 库,笔记本上分钟级。
S1168–86
参数量少 7 倍:在真正的边缘 CPU 上快了几倍
框架一个轻量惯性导航模型宣称参数量比 SOTA 少 7 倍而精度相当,适合部署在资源受限设备上。但参数量与实际推理延迟、内存峰值、能耗之间没有固定关系——Neural ODE 骨干需要自适应步长的 ODE 求解器,参数少而计算量可能更大。在同一台 CPU 上实测,延迟比是多少?内存峰值比是多少?另外:轨迹误差"每 250 米 < 4 米"是在被试不重叠的划分下测的吗?
你自己的那一点你产出参数量—延迟—内存三维散点:在一组公开的轻量惯性导航/时序模型上,横轴参数量、纵轴实测 CPU 延迟,看两者的相关性有多弱。Neural ODE 类模型很可能是这张图上的离群点,这就是你的核心发现。第二产出:被试不重叠划分下的 ATE——行人航位推算的性能对被试划分极其敏感(不同人的步态差异巨大)。
擦过SOFT021T(2025 SOFT Grand Award + Special Award)"LiDRNet: Lightweight Inertial Navigation"——摘要原文:Neural ODE 技术应用于 ResNet 与 LSTM,在朝向无关坐标系上操作并对速度损失反传;"reducing parameter count by 7 times while achieving comparable accuracy";"an average error of less than 4 meters for every 250 meters travelled";结论是"well-suited for deployment on resource-constrained edge devices such as smartphones or IoT platforms"。摘要没有报告任何实测延迟、内存或能耗数据,也未说明划分是否被试不重叠——而"适合边缘部署"这个核心主张恰恰只能由这些量支撑。
约束最可能死在拿不到 LiDRNet 的实现。规避方式:这个课题不需要它。你测的是"参数量作为边缘部署代理指标的有效性",用公开的惯性导航模型族(RoNIN 系列的开源实现、若干轻量时序模型)加上你自己实现的 Neural ODE 版本即可。这也让本条的可辩护性更依赖于你的实现质量,是 W 分未给满的原因。公开数据集(RoNIN/OxIOD)须先确认可下载——这是 go/no-go。
S1273–91
99% 的威胁检测准确率:正常流量占 99% 的时候,这个数字是什么
框架一个端点检测方案在 Windows 事件日志上报告二分类 99% 准确率、8 类 MITRE ATT&CK 战术上 83%。真实企业环境里恶意事件占比可能低于 0.1%。在真实基率下,每天会产生多少条误报?在固定的分析师可处理告警量(如每天 50 条)下,能召回多少真实攻击?
你自己的那一点你产出基率—精确率曲线与告警预算下的召回率:这是安全运营真正关心的两个量,而"准确率"在极端不平衡下几乎不携带信息(全判良性即可达 99.9%)。第二产出:半监督设定的诚实评估——Seeded K-means 的性能强烈依赖于种子标签的数量与代表性,你可以测量种子数从 1% 到 20% 时性能的变化曲线,回答"最小维护"这个卖点需要多少人工。
擦过SOFT059T(2025 SOFT Special Award)"SENTRY: Semi-Supervised Threat Recognition System"——摘要原文:半监督方案以适应新威胁并"minimal maintenance";Seeded K-means 训练于 Windows EVTX 日志,推理 < 0.1 秒、内存 < 250 MB;"We achieved a binary threat-detection accuracy of 99% and a multi-class accuracy of 83% using 8 MITRE ATT&CK TTPs, outperforming current solutions in our testing"。摘要未报告类别比例、精确率/召回率或误报率,"outperforming current solutions in our testing"也未说明对照方案与设置。相关:SOFT010(2025 Special)噬菌体仿生 AI 杀毒(在"模拟数据集"上评估)。
约束最可能死在数据——公开的带标注 Windows EVTX 攻击数据集数量有限。最便宜的规避:使用公开的攻击模拟日志集合(如基于 Atomic Red Team 的公开采集),或用公开的网络入侵检测基准(CIC-IDS 类)替代——基率与告警预算这两条结论对具体数据源不敏感,只要类别比例可控。纯 CPU。
S1365–83
一个新发现的取证痕迹,换一台机器、换一个系统版本还在吗
框架一个项目发现并解析了 macOS Spotlight 的 PSID.DB 痕迹,能恢复比已知 Store.db 更完整的历史文件列表(某些测试中多 5 倍记录)。取证痕迹的价值取决于普适性与持久性:换 macOS 版本、换文件系统(APFS/HFS+/exFAT)、换外置 vs 内置盘,PSID 出现率与恢复率各是多少?随着磁盘使用时间增长,记录被覆盖的速率是多少?
你自己的那一点你产出痕迹可用性矩阵(系统版本 × 文件系统 × 卷类型)与衰减曲线(记录留存率 vs 写入量/时间)。取证工具最需要的恰恰是这两张表——"这个痕迹在什么条件下可以依赖"。前作已经明确指出"文件系统是影响恢复的关键因素",但只做到了发现这一点,没有给出矩阵。
擦过SOFT015(2025 SOFT Grand Award)"PSID.DB: New Deleted File Spotlight Artifact"——摘要原文:在前人 Store.db 研究(Atwal et al., 2019)基础上发现新痕迹 PSID.DB,通过分析十六进制模式、压缩、编码、加密与常见时间戳格式解读其专有结构,开发 Python 解析脚本;模拟典型用户存储活动后比较 PSID 与 Store.db 的恢复结果;"Results showed PSID recovery matched or exceeded Store.db whenever PSID was present. In some tests, PSID recovered all previous file records, while in others, it recovered five times as many records as Store.db. The storage drive file system was found to be a key factor affecting PSID recovery."
约束最可能死在硬件条件——需要多台/多版本 macOS 与多种文件系统的外置卷。这是本文件里唯一一条对物理条件有实质要求的课题,也是 F 分较低的原因。最便宜的规避:用虚拟机跑多个 macOS 版本 + 用磁盘映像(.dmg)模拟不同文件系统的外置卷,可以把硬件需求压到一台机器;但 Apple Silicon 上虚拟旧版 macOS 有限制,必须先验证可行性再立项。另一个风险:前作的解析脚本若未公开,你需要自己重建解析器,工作量不小。
S1460–78
用里程表当真值:里程表自己的不确定度有多大
框架一个用分形维数修正 GPS 距离的方法报告平均误差 0.3%(相对里程表),比现有 GPS 应用误差小 24 倍。但自行车里程表本身的误差来自轮周长标定、胎压、载重与滑移,量级可达百分之几——与被测量同量级。先独立标定里程表的不确定度,再问:0.3% 这个数字在里程表不确定度面前还有分辨力吗?另外:分形维数是在同一批路线上拟合的还是在独立路线上验证的?
你自己的那一点两个自产结果。(a) 参考器不确定度预算:在已知长度的场地上多次测量,量化里程表在不同胎压/载重下的重复性与系统偏差——这给出了 0.3% 这个数字的"分辨力下限"。(b) 留出路线验证:把路线分成拟合集与留出集,报告在留出路线上的误差;如果分形维数是逐路线拟合的,留出误差会显著变大。
擦过SOFT005(2025 SOFT Special Award)"Novel Fractal Algorithm for Bike Route Distance"——摘要原文:骑行者携带里程表与 GPS 走不同蜿蜒度路线;方法仅在转角与速度呈反相关的选定路段上做多尺度距离计算;低蜿蜒路线平均分形维数 1.05、高蜿蜒 1.15;"The hybrid fractal approach achieved a mean error of 0.3% (max 5.7%, SD 2.2%) relative to odometer distance—reducing the mean distance error by 24 times and SD by 2 times compared to current GPS application." 注意 max 5.7%、SD 2.2% 与 mean 0.3% 之间的巨大落差——平均误差接近零可能只是正负抵消。摘要未讨论里程表自身的不确定度,也未说明分形维数是否在独立路线上验证。
约束最可能死在需要野外骑行采数据(3–4 个月窗口内可行但受天气影响),以及"这个课题看起来像重做前作"。规避方式:核心产出是参考器不确定度预算这个方法学结果,它对任何"以里程表/GPS 为真值"的距离测量项目都适用;骑行采数据可以最小化到几条固定路线的多次重复。也可以完全改用公开 GPS 轨迹数据集做留出验证那一半,只保留最小量的自采数据做参考器标定。这是本文件评分最低的一条,列出来是因为它的方法学问题(参考器不确定度未扣除)是所有测量类项目的通病。
S1583–93
攻击分类器训练在"攻击图 − 原图"的差值上:部署时你没有原图
框架一个对抗攻击防御流水线的五类攻击分类器训练于攻击图像与原始图像的像素差。在真实部署中,防御方只拿得到一张可疑图像,拿不到对应的干净原图。当分类器的输入换成"只有攻击图像本身"时,五类攻击分类准确率从 95% 掉到多少?下游的攻击缓解准确率(85% vs 对照 74%)还剩多少?
你自己的那一点你产出信息可得性对照:{差值图输入, 单图输入, 单图 + 去噪残差输入} 三种设定下的攻击分类与缓解准确率。这直接量化了"训练时可得但部署时不可得的信息"贡献了多少性能——这是机器学习系统设计里一类极其常见但很少被量化的缺陷(与目标泄漏同族,但机制不同:不是标签泄漏,是部署时不可得特征)。第二产出:把这个检查提炼成一份可复用的部署可得性核查清单,并把它套用到另外一两个公开的对抗检测方法上。
擦过SOFT007(2025 SOFT Grand Award)"A Novel Adaptive Adversarial Defense Technique"——摘要原文:SplitSafe 流水线按每张图识别出的攻击类型自适应选择防御;"A unique attack classification method was created utilizing a five-way attack classifier trained on the difference between the pixels of the attacked and original images, highlighting the distinct noise generated by different attacks";攻击分类准确率 95% vs AutoEncoder 基线 69%(paired t(14)=44.2, p=2.33×10⁻²⁶);缓解后下游分类 85% vs 非攻击特异对照 74%(McNemar χ²(3599)=308, p=2.93×10⁻⁵²);两条流水线都基于预训练 EfficientNetV2。摘要没有说明部署时如何获得"原始图像"。相关:SOFT013(2025 Grand+Special)AI 图像检测(不同任务,但同为图像取证族)。
约束最可能死在前提核对——必须先确认摘要这句话的字面含义:也可能它只在训练阶段用差值来学习"噪声指纹",推理时用另一种方式提取(例如去噪残差)。如果推理路径其实不需要原图,本课题的第一问就不成立,必须立刻改成第二问(去噪残差作为差值代理的信息损失有多大)。这正是本文件反复强调的核对规矩。技术上完全可行:攻击生成用 Foolbox/ART(CPU 可跑 FGSM/PGD/DeepFool 等经典攻击),小图像 + 小模型,纯 CPU。