重要提示:如需以 Markdown 形式查看本页,请在 URL 后追加 `.md`。 完整文档索引见 llms.txt
跳到主要内容
完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。

LLM 推理手册

LLM 推理手册 集技术术语表、指南和参考资料于一体。它覆盖你理解 LLM 推理所需的关键内容,从核心概念与性能指标(例如 Time to First Token and Tokens per Second), 到优化技术(例如 continuous batchingprefix caching)、GPU architecture,以及 BYOCon-prem 等部署模式。

  • 提供在生产环境部署、扩展和运维 LLM 的实用指导。
  • 借助交互式计算器、模拟器和可视化工具直接理解核心概念。
  • 通过适配不同场景的优化技术提升性能。
  • 持续更新最新最佳实践与经过实战验证的经验。

编写动机

我们编写这本手册,是为了应对开发者常遇到的一个问题:LLM 推理知识往往极其 碎片化。它可能埋在学术论文里,散落在厂商博客中,藏在 GitHub issue 里,或 零星出现在 Discord 讨论串中。更麻烦的是,很多内容默认你已经理解了半套栈。

几乎没有多少资料能把这些内容真正串起来,比如 inference differs from training, 为什么 goodput matters more than raw throughput 对于满足 SLO 比原始吞吐量更重要,或者 prefill-decode disaggregation 在实践中到底如何工作。

因此,我们开始把这些内容系统地整理起来。

适合谁阅读

这本手册面向在生产环境中部署、扩展或运维 LLM 的工程师。无论你是在微调一个 小型开源模型,还是在自有技术栈上运行大规模部署,它都适用。

如果你的目标是让 LLM 推理更快、更便宜或更可靠,这本手册就是为你准备的。

如何使用

你既可以从头读到尾,也可以把它当作查询手册来使用。没有唯一正确的阅读路径。 随着领域不断演进,我们也会持续更新内容,因为 LLM 推理变化很快,今天有效的 方法,明天未必仍是最佳实践。

你目前处在技术栈的哪个阶段?
3 个问题,帮你找到最适合的起点
1
2
3
结果
1 题,共 3
你目前是如何运行 LLM 的?

交互式工具

本手册提供了多种交互式工具,帮助你通过亲自试验来理解概念:

贡献

欢迎贡献。如果你发现错误、有改进建议,或者想补充新主题,请在我们的 GitHub 仓库 提交 issue 或 pull request。