跳转到主要内容
← 三条旗舰路线

Track 01 · Inference Systems

推理系统

把一次生成请求从模型状态、资源瓶颈一路追到 Serving 决策。

读者目标
建立跨模型、运行时与服务层定位推理瓶颈的共同坐标。
完成产出
能画出请求主路径,指出算力、带宽、容量或通信约束,并选择下一项验证。
唯一入口

从这里开始

LLM 推理系统全栈地图 先把请求数据流与四类资源压力装进同一张地图。
  1. 阶段一

    状态与物理上限

    先判断系统保存了什么,以及瓶颈来自计算还是数据搬运。

    1. 1.1 KV Cache:推理性能的命根子 掌握 KV 的容量、分页、共享与生命周期。
    2. 1.2 Compute-bound vs Memory-bound:推理的两大瓶颈 用算术强度和 Roofline 区分计算与访存瓶颈。
  2. 阶段二

    服务控制面

    理解调度和并行如何用容量、延迟与通信交换吞吐。

    1. 2.1 批处理与调度:推理服务的灵魂 从请求队列和 token budget 理解连续批处理。
    2. 2.2 推理并行:DP、TP、PP、EP 与 CP 怎么选 按显存、计算、通信与拓扑选择 DP、TP、PP、EP 或 CP。
    3. 2.3 MoE 推理:Expert Parallelism(EP)、显存与调度 把 Expert 放置、dispatch/combine 与 EP 成本接回服务路径。
  3. 阶段三

    执行与组装

    把低精度和 Kernel 控制点组装进可部署、可验收的 Serving Stack。

    1. 3.1 量化:从 Scale 到 W4A8 的完整坐标 区分数值格式、Scale、Kernel 支持与端到端收益。
    2. 3.2 推理 Kernel / Runtime 优化:少搬、少启、少等 沿少搬、少启、少等定位执行层优化。
    3. 3.3 推理框架对比 2026:从 Engine 到 Serving Stack 用 workload 和运行合同完成框架选型。