Yau Awards Archive 2020 — 2025

K20

0.5B–3B 开源模型 GGUF 量化退化的中英不对称性——困惑度与下游任务联动的全档位测绘

优先级:探索(风险最高)分族:LLM 评测 / 鲁棒性资源:纯 CPU(墙钟重)/ 零 API 预算技能:llama.cpp + 统计类型:新参数区间 + 评价维度联动

1 · 研究问题

Marchisio 等(2024)在 8B–103B 模型上证明量化对非拉丁文字语言伤害更大。在消费级 CPU 唯一可部署的 0.5B–3B 小模型区间、GGUF Q2–Q8 全档位上,中文相对英文的退化不对称性是否仍成立、是否更剧烈?困惑度(perplexity)退化能否作为下游任务退化的可靠代理?

2 · 研究背景与空白

训练后量化(post-training quantization)是无 GPU 部署 LLM 的唯一途径。Marchisio 等(EMNLP Findings 2024)发现:4-bit 下非拉丁文字语言退化约为拉丁文字的 2.7 倍(-1.9% vs -0.7%),自动指标还系统性低估真实伤害;2025 年机器翻译量化研究进一步表明低资源语言最多损失 10+ COMET 分。llama.cpp 社区维护的困惑度表只覆盖英文 wikitext。

空白在:(a)0.5B–3B 区间未被上述工作覆盖——小模型权重冗余更少,退化规律可能不同(可否证的机制假设);(b)Q2–Q8 全档位细扫 × 中英双语 × 困惑度-下游联动这一组合没有公开测绘。全部为推理评测,无训练,绕开算力墙——但墙钟总量是本题最大风险。

3 · 可检验假设

  • H1:同一量化档位下,中文任务(C-Eval 子集)的相对退化 ≥ 英文任务(MMLU 子集)的 1.5 倍,且该不对称性随模型变小、比特数变低而放大。
  • H2:困惑度退化与下游准确率退化在(模型 × 档位)网格上的 Spearman 秩相关 <0.7,即困惑度不是可靠代理——与社区默认实践相悖,两个方向都有文献张力,正反都成文。

4 · 量化验收标准

  1. 方法学校验(硬门槛):其一,各模型 Q8/FP16 基线在 C-Eval 与 MMLU 子集上的准确率与模型卡/技术报告公开值偏差 ≤3 个百分点;其二,wikitext-2 困惑度与 llama.cpp 社区公开表对应值偏差 ≤5%。不过关则后续全部结论无效。
  2. 测绘网格预登记:3 模型(Qwen2.5-0.5B/1.5B/3B-Instruct)× 6 档位(Q2_K/Q3_K_M/Q4_K_M/Q5_K_M/Q6_K/Q8_0)× 2 语言 × 2 指标层(困惑度、选择题准确率),共 36 个模型-档位点,缺一须声明。
  3. 统计口径预先写死:下游任务用选择题(单 token 比较,避免生成毛刺);每个点对题目顺序做 3 次随机重排取均值 ± SD;退化量为相对基线的配对差 + 题级自助 95% CI;不报单一汇总分,逐学科切片保留。困惑度用同一 1M token 语料(中文用公开新闻语料切片,英文 wikitext-2),语料清单冻结。
  4. 可复现性硬要求:GGUF 文件哈希、llama.cpp 版本号(提交 commit)、全部运行命令与种子开源;量化文件用官方发布版,不自行量化(避免引入自变量),来源写明。
  5. 墙钟预算表先行:每点评测(500 题 + 1M token 困惑度)估 2–4 CPU 小时,36 点 ≈ 72–144 小时,夜间分批 4–6 周完成(第 1–2 周实测校准并冻结预算表)。
  6. 全部原始 logits/输出落盘开源。

5 · 数据与工具

用途 来源 / 工具
模型 Qwen2.5-0.5B/1.5B/3B-Instruct 官方 GGUF 全档位(HuggingFace 下载,共约 20–40 GB 磁盘)——预训练模型与官方量化文件不计入本项目贡献
推理 llama.cpp(版本冻结);实测标尺:1.5B Q4 约 15–25 token/s、3B Q4 约 6–12 token/s、0.5B Q4 约 40–60 token/s(8 核笔记本,第 1 周校准);选择题评测走单 token logits,比自由生成快一个量级
中文下游 C-Eval 验证集子集(HuggingFace 公开)——仅作输入,不计入贡献;抽 500 题分层覆盖学科
英文下游 MMLU 子集 500 题(HuggingFace 公开),与 C-Eval 学科尽量配对
困惑度语料 wikitext-2(英)+ 公开中文语料 1M token 切片(来源写明、冻结)

6 · 方法路径

  1. 装 llama.cpp,实测三模型 token/s 与单点评测墙钟,冻结预算表与能力边界表(如 7B超出范围须明写)。
  2. 完成 Q8/FP16 基线双校验(硬门槛)。
  3. 搭选择题 logits 评测器,在 100 题人工核对下抽取错判率 ≤1%。
  4. 按网格逐点评测,夜间批处理,中途落盘断点续跑。
  5. 计算逐点退化量与不对称比,检验 H1;做困惑度–下游秩相关,检验 H2。
  6. 学科切片分析:不对称性集中在哪些学科(语言知识型 vs 推理型)。
  7. 交叉校验:抽 3 个点用另一推理后端(如 candle 或 transformers+bitsandbytes CPU)复测方向一致性。

7 · 新颖性边界

  • 本课题声称发现「量化伤害多语言」现象——Marchisio et al. (EMNLP Findings 2024) 与 2508.20893 已发表,不得声称为本项目发现;不提出新量化方法,不自行量化模型。
  • 已有工作:Marchisio 覆盖 8B/35B/103B 与多语言宽度;llama.cpp 社区表只有英文困惑度;小模型区间 × 全档位 × 中英配对 × 代理有效性这一组合未见发表(已换三种检索式确认;「未找到」不等于「不存在」,第 3 周文献补查为准)。
  • 本项目贡献(主结论):消费级区间的量化退化中英测绘图 + 困惑度代理有效性的定量判定。
  • 价值:直接指导中文用户「几比特以下不该用」;若不对称性消失(H1 否证)或困惑度是好代理(H2 否证),同样是对社区实践有用的结论——但须以 CI 证明有能力分辨 1.5 倍的不对称。

8 · 决策门槛(go / no-go)

  • 第 2 周末:墙钟实测。若单点 >6 CPU 小时(机器较弱)→ 具名降级 A:砍 3B 模型与 Q5/Q6 档,网格缩至 2 模型 × 4 档 = 16 点,主结论框架不变、分辨率变粗。
  • 第 6 周末:基线校验不达标(常见原因:提示模板与官方评测不一致)→ 排查至第 8 周;仍不过则降级 B:放弃与公开值对齐,改为「全部配置自洽对比」(同一管线内部配对差仍有效),并在限制一节声明绝对值不可外推。
  • 第 16 周:若各档位退化量的 CI 宽度 > 效应量本身(噪声淹没)→ 加大题量至 1000 或减档聚焦 Q2–Q4 低比特区(效应最大处),保证至少低比特区结论有分辨力。
  • 选择前提:仅适合机器可整夜运行、且能接受「效应可能很小」这一风险的学生;本题排 K20 因为墙钟总量最大、效应量最不确定。