Q//ATLAS大模型低比特研究档案
15 篇核心工作2022—2025更新:2026-09-10
RESEARCH DOSSIER · 中文学习版

模型压缩与量化
从算法,到可复现实验。

这不是论文标题清单,而是一套可操作的学习地图:把每篇工作的核心假设、校准成本、数据集、硬件、真实实验时间、系统收益和复现风险放进同一坐标系。

15论文 / 框架
5技术路线
4复现实验
8可研究缺口
时间口径:优先记录论文或官方 artifact 明确给出的 wall-clock;没有公开的数据均标注“未报告”,不以经验值冒充原文。
01 / START HERE

四步读懂这条技术线

推荐按“坐标系 → 异常值 → 极低比特 → 系统”阅读;每一步都带着上一层的评价尺度。

01

建立量化坐标系

先分清 PTQ / QAT、weight-only / W+A / KV、标量 / 向量 / 码本,以及“位宽”和“有效 bpw”的差异。

LLM.int8() → GPTQ → SmoothQuant
02

理解异常值处理

比较迁移、缩放、旋转、置换四条路线;它们都在改变误差分布,但在线成本不同。

AWQ → QuaRot → DuQuant → SpinQuant
03

进入极低比特

2–3 bpw 往往需要码本、格量化或原生训练,表示能力提高,但校准、元数据和 kernel 成本也会增大。

AQLM → QuIP# → CCQ → BitNet
04

从论文走到服务

最后把精度与 batch、TTFT、TPOT、吞吐、峰值显存和 GPU 型号绑在一起分析。

QServe → QLLM-Eval
量化对象权重激活KV cache
误差治理二阶补偿缩放 / 迁移旋转 / 置换码本
最终验收精度有效 bpwTTFT / TPOT校准成本

阅读每篇论文时,只追四个问题

  1. 异常值或量化误差到底被“消除”、转移,还是仅被高精度旁路?
  2. 优化目标是权重误差、层输出误差,还是端到端任务能力?
  3. 论文的位宽是否包含 scales、zeros、codebooks 和未量化层?
  4. 加速来自更少访存、整数 Tensor Core,还是只来自更小显存?