完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
LLM 推理手册
LLM 推理手册 集技术术语表、指南和参考资料于一体。它覆盖你理解 LLM 推理所需的关键内容,从核心概念与性能指标(例如 Time to First Token and Tokens per Second), 到优化技术(例如 continuous batching 和 prefix caching)、GPU architecture,以及 BYOC 与 on-prem 等部署模式。
- 提供在生产环境部署、扩展和运维 LLM 的实用指导。
- 借助交互式计算器、模拟器和可视化工具直接理解核心概念。
- 通过适配不同场景的优化技术提升性能。
- 持续更新最新最佳实践与经过实战验证的经验。
编写动机
我们编写这本手册,是为了应对开发者常遇到的一个问题:LLM 推理知识往往极其 碎片化。它可能埋在学术论文里,散落在厂商博客中,藏在 GitHub issue 里,或 零星出现在 Discord 讨论串中。更麻烦的是,很多内容默认你已经理解了半套栈。
几乎没有多少资料能把这些内容真正串起来,比如 inference differs from training, 为什么 goodput matters more than raw throughput 对于满足 SLO 比原始吞吐量更重要,或者 prefill-decode disaggregation 在实践中到底如何工作。
因此,我们开始把这些内容系统地整理起来。
适合谁阅读
这本手册面向在生产环境中部署、扩展或运维 LLM 的工程师。无论你是在微调一个 小型开源模型,还是在自有技术栈上运行大规模部署,它都适用。
如果你的目标是让 LLM 推理更快、更便宜或更可靠,这本手册就是为你准备的。
如何使用
你既可以从头读到尾,也可以把它当作查询手册来使用。没有唯一正确的阅读路径。 随着领域不断演进,我们也会持续更新内容,因为 LLM 推理变化很快,今天有效的 方法,明天未必仍是最佳实践。
交互式工具
本手册提供了多种交互式工具,帮助你通过亲自试验来理解概念:
- LLM Inference Visualizer: 逐步查看请求生命周期,理解 token 如何流经预填充与解码。
- LLM Lifecycle Visualizer: 观察训练与推理在模型生命周期中的位置,以及推理如何发生在每一次请求上。
- Token-by-Token Decode Loop: 按步骤查看自回归解码,观察每个新 token 如何扩展序列与 KV 缓存。
- Latency Timeline Visualizer: 理解每一步解码后如何接着执行 detokenization,以及 TTFT、ITL、E2EL 各自覆盖哪些阶段。
- Context Window Simulator: 观察完整对话如何在每一轮都被重新发送,并逐步填满上下文窗口。
- Latency Metrics Playground: 探索 TTFT、E2EL、TPOT 以及基于 SLO 的 goodput。
- Top-p vs Top-k Filter: 比较两种过滤方式如何处理尖峰型、混合型与平坦型分布。
- Model Explorer:浏览热门开源 LLM,并比较它们的架构、规模、上下文长度和常见 GPU 部署方式。
- GPU Comparison Table: 将热门开源 LLM 映射到合适的 NVIDIA 与 AMD GPU。
- GPU Memory Calculator: 估算服务一个 LLM 所需的 VRAM。
- Quantization Memory Impact Visualizer: 对比不同量化格式下的权重内存占用。
- Batching Strategy Simulator: 对比静态、动态和连续批处理的行为差异。
- Chunked Prefill Scheduler: 观察完整预填充如何阻塞活跃解码,以及分块后如何让解码继续推进。
- KV Cache Memory Calculator: 估算 KV 缓存消耗的内存大小。
- GPU Execution and Memory Map: 可视化线程、warp、SM 与 GPU 内存层级如何组合在一起。
贡献
欢迎贡献。如果你发现错误、有改进建议,或者想补充新主题,请在我们的 GitHub 仓库 提交 issue 或 pull request。