Track 01 · Inference Systems
推理系统
把一次生成请求从模型状态、资源瓶颈一路追到 Serving 决策。
- 读者目标
- 建立跨模型、运行时与服务层定位推理瓶颈的共同坐标。
- 完成产出
- 能画出请求主路径,指出算力、带宽、容量或通信约束,并选择下一项验证。
唯一入口
LLM 推理系统全栈地图 先把请求数据流与四类资源压力装进同一张地图。 从这里开始
-
阶段一 状态与物理上限
先判断系统保存了什么,以及瓶颈来自计算还是数据搬运。
-
阶段二 服务控制面
理解调度和并行如何用容量、延迟与通信交换吞吐。
-
阶段三 执行与组装
把低精度和 Kernel 控制点组装进可部署、可验收的 Serving Stack。