跳转到主要内容

LLM 推理优化学习路线

LLM 推理优化完整学习路线,从 Attention、KV Cache 到推理引擎架构,系统掌握推理工程

· 约 4 分钟阅读

学习路线总览

基于你已经掌握 prefill/decode/forward 流程的基础,按以下顺序学习:

想先动手观察参数方向,可以打开推理性能优化交互实验室:调整 Dense/MoE、Batch、ISL/OSL、精度和 TP/DP/EP,查看 per-rank 显存与计算、访存、通信压力。它是教学级理论账本,不替代生产模拟器或实测。

① Attention / KV    → ② 性能瓶颈分析    → ③ 量化
   (计算与记忆)         (Compute/Memory)     (INT4/INT8/FP8)
        │                    │                    │
        └────────────────────┼────────────────────┘

④ 批处理与调度       → ⑤ 投机解码        → ⑥ 推理引擎
   (Continuous Batch)    (Speculative)       (vLLM 源码)

文件索引

序号文件核心内容
00.5Token Flow 与 Hidden State用 hidden state 串起 Attention、MoE、LM Head 和 Sampling
00.8Attention 架构演化缩放点积注意力、MHA 参数、GQA/MLA、稀疏与线性/混合路线
01KV Cache内存计算公式、MHA/GQA、PagedAttention、长文本策略
01.2DeepSeek MLA低秩 KV 联合压缩、RoPE 解耦、矩阵吸收、serving cache layout
01.5Causal Attention 与 KV hit 面积模型用下三角 attention 区域解释 1-h² 缩放
01.6KV Cache Hit Ratio 修正模型三张图解释 hit 后 attention/FFN/TTFT/TPM 缩放与统一修正公式
02Compute vs Memory BoundRoofline 模型、Prefill 算力瓶颈、Decode 带宽瓶颈
02.5MoE 推理Expert dispatch/combine、EP/TP/PP、单卡显存估算与 DeepEP
02.8CPU 工程师理解量化从 INT8、VNNI、AMX、Cache 和 perf/IBS 迁移到 Scale、Tensor Core、HBM 与 GPU trace
03量化:从 Scale 到 W4A8量化对象、数值格式、Scale 粒度、运行时合同与性能边界
03.2量化方法与评测PTQ/QAT 方法谱系、实验矩阵与执行/质量/容量/性能四道验收门
03.4FP4/FP8 量化Current/Delayed/MXFP8/NVFP4 的 Scale 配方与运行时能力边界
03.6GLM-5.2 量化执行图W4A8、低精度 BMM、BF16 Attention 与 KV8 的算子级精度契约
04批处理与调度静态/动态/连续批处理、Chunked Prefill、分离调度
04.5Chunked Prefill 深入分析chunk size、输入分桶、attention 形状、调度权衡与实验矩阵
04.6GDN 与 Chunked PrefillQwen3Next/GDN、64-token kernel chunk、prepare_chunk_indices 与 GPU->CPU 同步
04.7Prefill Trace 解读Worker 供给、DSA/MLA、Queue Length、prefix cache 与 chunked prefill
05投机解码Draft-Verify 流程、EAGLE/Medusa、无损加速证明
05.5DSpark 与 MTPDeepSeek DSpark 半自回归草稿模型、置信度调度验证、DeepSpec 源码实现与 MTP-1 对比
06推理引擎vLLM/TRT-LLM/SGLang 架构、FlashAttention、并行策略
06.5推理框架对比 2026从 Engine 到 Serving Stack:P/D 分离、KV cache、MoE/EP、spec decode 与生产编排
PaperDeepSeek-V3 Technical Report:中英对照解读MLA、DeepSeekMoE、MTP、FP8、Prefill/Decode 分离部署

一句话路线图

Attention 如何选择信息 → KV Cache 如何保存历史 → Prefill/Decode 瓶颈 → 量化与调度 → 推理引擎

相关页面