K20
0.5B–3B 开源模型 GGUF 量化退化的中英不对称性——困惑度与下游任务联动的全档位测绘
1 · 研究问题
Marchisio 等(2024)在 8B–103B 模型上证明量化对非拉丁文字语言伤害更大。在消费级 CPU 唯一可部署的 0.5B–3B 小模型区间、GGUF Q2–Q8 全档位上,中文相对英文的退化不对称性是否仍成立、是否更剧烈?困惑度(perplexity)退化能否作为下游任务退化的可靠代理?
2 · 研究背景与空白
训练后量化(post-training quantization)是无 GPU 部署 LLM 的唯一途径。Marchisio 等(EMNLP Findings 2024)发现:4-bit 下非拉丁文字语言退化约为拉丁文字的 2.7 倍(-1.9% vs -0.7%),自动指标还系统性低估真实伤害;2025 年机器翻译量化研究进一步表明低资源语言最多损失 10+ COMET 分。llama.cpp 社区维护的困惑度表只覆盖英文 wikitext。
空白在:(a)0.5B–3B 区间未被上述工作覆盖——小模型权重冗余更少,退化规律可能不同(可否证的机制假设);(b)Q2–Q8 全档位细扫 × 中英双语 × 困惑度-下游联动这一组合没有公开测绘。全部为推理评测,无训练,绕开算力墙——但墙钟总量是本题最大风险。
3 · 可检验假设
- H1:同一量化档位下,中文任务(C-Eval 子集)的相对退化 ≥ 英文任务(MMLU 子集)的 1.5 倍,且该不对称性随模型变小、比特数变低而放大。
- H2:困惑度退化与下游准确率退化在(模型 × 档位)网格上的 Spearman 秩相关 <0.7,即困惑度不是可靠代理——与社区默认实践相悖,两个方向都有文献张力,正反都成文。
4 · 量化验收标准
- 方法学校验(硬门槛):其一,各模型 Q8/FP16 基线在 C-Eval 与 MMLU 子集上的准确率与模型卡/技术报告公开值偏差 ≤3 个百分点;其二,wikitext-2 困惑度与 llama.cpp 社区公开表对应值偏差 ≤5%。不过关则后续全部结论无效。
- 测绘网格预登记:3 模型(Qwen2.5-0.5B/1.5B/3B-Instruct)× 6 档位(Q2_K/Q3_K_M/Q4_K_M/Q5_K_M/Q6_K/Q8_0)× 2 语言 × 2 指标层(困惑度、选择题准确率),共 36 个模型-档位点,缺一须声明。
- 统计口径预先写死:下游任务用选择题(单 token 比较,避免生成毛刺);每个点对题目顺序做 3 次随机重排取均值 ± SD;退化量为相对基线的配对差 + 题级自助 95% CI;不报单一汇总分,逐学科切片保留。困惑度用同一 1M token 语料(中文用公开新闻语料切片,英文 wikitext-2),语料清单冻结。
- 可复现性硬要求:GGUF 文件哈希、llama.cpp 版本号(提交 commit)、全部运行命令与种子开源;量化文件用官方发布版,不自行量化(避免引入自变量),来源写明。
- 墙钟预算表先行:每点评测(500 题 + 1M token 困惑度)估 2–4 CPU 小时,36 点 ≈ 72–144 小时,夜间分批 4–6 周完成(第 1–2 周实测校准并冻结预算表)。
- 全部原始 logits/输出落盘开源。
5 · 数据与工具
| 用途 | 来源 / 工具 |
|---|---|
| 模型 | Qwen2.5-0.5B/1.5B/3B-Instruct 官方 GGUF 全档位(HuggingFace 下载,共约 20–40 GB 磁盘)——预训练模型与官方量化文件不计入本项目贡献 |
| 推理 | llama.cpp(版本冻结);实测标尺:1.5B Q4 约 15–25 token/s、3B Q4 约 6–12 token/s、0.5B Q4 约 40–60 token/s(8 核笔记本,第 1 周校准);选择题评测走单 token logits,比自由生成快一个量级 |
| 中文下游 | C-Eval 验证集子集(HuggingFace 公开)——仅作输入,不计入贡献;抽 500 题分层覆盖学科 |
| 英文下游 | MMLU 子集 500 题(HuggingFace 公开),与 C-Eval 学科尽量配对 |
| 困惑度语料 | wikitext-2(英)+ 公开中文语料 1M token 切片(来源写明、冻结) |
6 · 方法路径
- 装 llama.cpp,实测三模型 token/s 与单点评测墙钟,冻结预算表与能力边界表(如 7B超出范围须明写)。
- 完成 Q8/FP16 基线双校验(硬门槛)。
- 搭选择题 logits 评测器,在 100 题人工核对下抽取错判率 ≤1%。
- 按网格逐点评测,夜间批处理,中途落盘断点续跑。
- 计算逐点退化量与不对称比,检验 H1;做困惑度–下游秩相关,检验 H2。
- 学科切片分析:不对称性集中在哪些学科(语言知识型 vs 推理型)。
- 交叉校验:抽 3 个点用另一推理后端(如 candle 或 transformers+bitsandbytes CPU)复测方向一致性。
7 · 新颖性边界
- 本课题不声称发现「量化伤害多语言」现象——Marchisio et al. (EMNLP Findings 2024) 与 2508.20893 已发表,不得声称为本项目发现;不提出新量化方法,不自行量化模型。
- 已有工作:Marchisio 覆盖 8B/35B/103B 与多语言宽度;llama.cpp 社区表只有英文困惑度;小模型区间 × 全档位 × 中英配对 × 代理有效性这一组合未见发表(已换三种检索式确认;「未找到」不等于「不存在」,第 3 周文献补查为准)。
- 本项目贡献(主结论):消费级区间的量化退化中英测绘图 + 困惑度代理有效性的定量判定。
- 价值:直接指导中文用户「几比特以下不该用」;若不对称性消失(H1 否证)或困惑度是好代理(H2 否证),同样是对社区实践有用的结论——但须以 CI 证明有能力分辨 1.5 倍的不对称。
8 · 决策门槛(go / no-go)
- 第 2 周末:墙钟实测。若单点 >6 CPU 小时(机器较弱)→ 具名降级 A:砍 3B 模型与 Q5/Q6 档,网格缩至 2 模型 × 4 档 = 16 点,主结论框架不变、分辨率变粗。
- 第 6 周末:基线校验不达标(常见原因:提示模板与官方评测不一致)→ 排查至第 8 周;仍不过则降级 B:放弃与公开值对齐,改为「全部配置自洽对比」(同一管线内部配对差仍有效),并在限制一节声明绝对值不可外推。
- 第 16 周:若各档位退化量的 CI 宽度 > 效应量本身(噪声淹没)→ 加大题量至 1000 或减档聚焦 Q2–Q4 低比特区(效应最大处),保证至少低比特区结论有分辨力。
- 选择前提:仅适合机器可整夜运行、且能接受「效应可能很小」这一风险的学生;本题排 K20 因为墙钟总量最大、效应量最不确定。