WeiGao · 性能工程研究
我是 WeiGao,专注 AI 系统性能优化。通过源码、Trace 与实验,研究从模型到硬件的执行机制,记录可验证的优化方法。
从执行依赖与关键路径,理解真正决定端到端延迟的事件链。
沿 vLLM 源码追踪异步调度、投机解码与状态提交,辨析重叠发生的条件。
从计算、加载与重叠出发,推导固定配置下 Cache 命中对 TTFT 与 TPM 的影响。
把一次生成请求从模型状态、资源瓶颈一路追到 Serving 决策。
把观测、归因、模型和实验组织成一条可证伪的性能证据链。
从执行模型、内存层次和互联出发,建立解释 AI 工作负载的硬件直觉。