01
Hyperloom Specialist 与配置调优:一个 Agentic 调参系统的源码拆解
ai-systems / llm-inference
llm-inferencegpu-optimizationagentichyperparameter-tuning
+4
02
vLLM Async Scheduling:三态配置、投机解码与状态提交
ai-systems / llm-inference
llm-inferencevllmdecodekv-cache
+1
03
KV Cache:推理性能的命根子
ai-systems / llm-inference
LLMInferenceKV CachePagedAttention
+2
04
GDN 与 Chunked Prefill:为什么 prepare_chunk_indices 会出现在 trace 里
ai-systems / llm-inference
llm-inferencegdnqwen3nextchunked-prefill
+3
05
Chunked Prefill 深入分析:调度、Chunk Size 与 Attention 形状
ai-systems / llm-inference
llm-inferencechunked-prefillschedulingprefill
+3
06
推理框架对比 2026:从 Engine 到 Serving Stack
ai-systems / llm-inference
vllmsglangtensorrt-llminference-framework
+2
07
批处理与调度:推理服务的灵魂
ai-systems / llm-inference
LLMInferenceBatchingScheduling
+3