Agentic Infra:LLM 推理性能优化与 GPU 利用率提升
Agentic Infra 推理优化方法论摘要:从 Profiling、根因分类和分层优化走到 A/B 验证闭环
这是一份来源摘要,只压缩原文的方法论、分类和案例;其中收益数字来自原来源,不代表本站复现或生产承诺。
30 秒复习
- 一句话:推理优化应形成“观测 → 归因 → 最小干预 → 同 Case 验证 → 回归守护”的循环。
- 三个判断:低 GPU 利用率不是根因;Prefill/Decode 的阶段直觉必须由证据确认;任何局部优化都要同时检查吞吐、尾延迟、容量和质量副作用。
- 来源问题:原文回答 AWP 能力怎样连接六类根因、六层优化手段和持续验证流程。
- 边界:原文中的行业案例和预期收益是来源陈述;迁移到目标系统前必须固定硬件、模型、负载和版本复测。
方法论骨架
原文把性能工作组织成一个闭环:
常驻遥测发现异常
→ 按需 Profiling 定位时间
→ Roofline / Timeline / Memory / Communication 归因
→ 选择最小优化控制点
→ 同一 Case 做 A/B
→ 持续监控防止回归
Profiling 在三个位置出现:
- 发起:证明问题存在并限定 Case;
- 验证:证明改动触达目标时间块;
- 守护:在负载、版本或模型变化后检测回归。
六类根因
| 根因 | 典型问题 | 需要的证据 |
|---|---|---|
| 计算利用低 | shape、Tensor Core、无效工作 | Kernel、Roofline |
| 内存与 Cache | 权重/KV 读取、碎片、换入换出 | HBM、KV、Memory trace |
| Batching / 调度 | Batch 不足、Prefill 干扰、排队 | Scheduler、Queue、Timeline |
| Runtime | CPU launch、同步、框架空隙 | CPU-GPU Timeline |
| 通信 | collective、跨节点、负载不均 | NCCL/Network trace、拓扑 |
| 系统 | 资源空闲、Straggler、租户/流量差异 | 集群遥测与分组对照 |
这些类别是诊断入口,不是可直接相加的精确损失账本。特别是显存容量常通过限制 Batch 间接影响访存效率,必须避免重复计数。
分层优化手段
| 层 | 原文列出的代表手段 | 本站主责入口 |
|---|---|---|
| Kernel | IO-aware Attention、Fusion、Graph | Kernel / Runtime |
| 调度 | Continuous Batching、Chunked Prefill、P/D 分离 | 批处理与调度 |
| KV | Paged KV、Prefix Cache、低精度、GQA/MLA | KV Cache |
| 算法 | 量化、投机解码 | 量化、投机解码 |
| 分布式 | TP/PP/EP、放置、通信重叠 | 推理并行 |
| Serving | 路由、资源池、弹性与框架组合 | Serving Stack |
本页不再重复这些机制;链接页分别负责原理、模型和边界。
原文强调的工程实践
- 先诊断再排优先级:按关键路径和可操作性选 P0/P1,而不是按流行度选技术。
- 分层指标:业务结果、系统行为和硬件执行要能互相下钻。
- 真实负载 A/B:固定模型、硬件、请求分布和 SLA,单变量比较。
- 副作用检查:吞吐提高时同时检查 P99、OOM、质量和功耗;延迟降低时检查容量利用。
- 规模化抽样:常驻低开销遥测负责发现,按需 Trace 负责解释,避免全量深度 Profiling。
- 自动回归:把 Case 身份、配置和证据留存,才能判断后续版本是否退化。
如何使用这份来源
把它当成流程模板,而不是收益手册:
- 用全栈地图确定数据流和资源压力;
- 用 Agentic AWP或现有 Profiling 工具形成证据;
- 进入对应主责页选一个最小控制点;
- 用相同 Case 复测服务指标和执行证据;
- 记录未解释项,不把估算或单次 Trace 升格为因果结论。
相关页面
- Agentic AWP — 同来源体系的 Breakdown 侧摘要
- Profiling → Simulation 证据链 — 从观测到可校准模型
- LLM 推理系统入口 — 所有机制的唯一主责页
← 被以下页面引用(5)
- LLM 推理系统全栈地图ai-systems · synthesis
- Python AI Profilingai-systems · concept
- HTA 算法原理与实现ai-systems · entity
- Agentic AWP:规模化 Profiling 驱动的 GPU 效率 Breakdown 与能力体系ai-systems · source-summary
- Hyperloom Specialist 与配置调优:一个 Agentic 调参系统的源码拆解ai-systems · source-summary
修改历史5 次提交
- docs: refine LLM inference knowledge systemxiaocheng··
f8756b9 - feat(wiki): enforce lifecycle metadata and search aliasesxiaocheng··
1dad7ef - feat(wiki): connect core topics and add reading seriesxiaocheng··
9fc9884 - docs: add inference profiling notesxiaocheng··
6885adf - fix(wiki): clean all lint errors to enable strict CI (PR-3)xiaocheng··
9acd1f2