↓
zzszmyf
笔记
分类
标签
量化
2026
AWQ 和 GPTQ 有什么区别?4-bit 权重量化怎么选
·
·
LLM推理优化
量化
GPTQ
AWQ
GGUF
量化模型怎么部署到 vLLM?QServe 与 FP8 Attention 实践
·
·
LLM推理优化
量化
量化后精度掉了怎么定位?perplexity 与评测怎么用
·
·
LLM推理优化
量化
QAT 什么时候才值得做?PTQ、QLoRA、BitNet 路线对比
·
·
LLM推理优化
量化
KV Cache 量化怎么做?KIVI 与「量化还是压缩」的区别
·
·
LLM推理优化
量化
激活量化为什么比权重量化难?LLM.int8() 与 SmoothQuant 原理
·
·
LLM推理优化
量化
AWQ 量化原理是什么?和 GPTQ、SqueezeLLM 怎么选
·
·
LLM推理优化
量化
RTN 和 GPTQ 有什么区别?权重量化方法怎么选
·
·
LLM推理优化
量化
量化粒度怎么选?为什么离群值会让 INT8 精度崩掉
·
·
LLM推理优化
量化
FP16、BF16、FP8、FP4 有什么区别?该选哪种数值格式
·
·
LLM推理优化
量化
1
2
→
↑