↓
zzszmyf
笔记
分类
标签
LLM推理优化
2026
AWQ 和 GPTQ 有什么区别?4-bit 权重量化怎么选
·
·
LLM推理优化
量化
GPTQ
AWQ
GGUF
笔记
·
·
LLM推理优化
SGLang RadixAttention 原理是什么?前缀缓存怎么提升命中率
·
·
LLM推理优化
注意力内核
注意力优化上线怎么验收?吞吐、显存与精度怎么测
·
·
LLM推理优化
注意力内核
注意力内核怎么优化?算子融合、CUDA Graph 与 Triton
·
·
LLM推理优化
注意力内核
PagedAttention 是怎么省下 KV Cache 显存的?
·
·
LLM推理优化
注意力内核
稀疏注意力、滑动窗口和线性注意力怎么选
·
·
LLM推理优化
注意力内核
MQA、GQA、MLA 有什么区别?KV Cache 该怎么省
·
·
LLM推理优化
注意力内核
FlashAttention 原理是什么?为什么又省显存又快
·
·
LLM推理优化
注意力内核
注意力计算复杂度是怎么来的?prefill 和 decode 差在哪
·
·
LLM推理优化
注意力内核
1
2
3
⋯
4
→
↑