完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
什么是 LLM 推理?
LLM 推理指的是使用训练好的 LLM,例如 GPT-5、GLM-5 和 DeepSeek-V3.2, 根据用户输入生成有意义的输出;这些输入通常以自然语言 prompts 的形式给出。在推理期间, 模型会让提示词经过其庞大的参数体系,生成文本、代码片段、摘要、翻译等响应。
本质上,这就是 LLM 真正“开始工作”的时刻。下面是一些现实世界中的例子:
- 客服聊天机器人:实时生成个性化且符合上下文的客户回复。
- 写作助手:补全文句、纠正语法或总结长文档。
- 开发者工具:把自然语言描述转换成可执行代码。
- AI agents:自主执行复杂、多步骤的推理与决策流程。
使用下面的可视化工具来查看一次请求在 LLM 推理过程中的流转方式。更详细的 介绍可见 how LLM inference works.
什么是 inference server?
Inference server 是负责管理 LLM 推理运行方式的组件。它加载模型,连接所需 硬件(如 GPU),并处理应用请求。当提示词到达时,server 会分配资源、执行 模型并返回输出。
LLM inference server 远不只是简单的请求-响应程序。它还提供了大规模运行 LLM 所需的关键能力,例如:
- 批处理:合并多个请求,提高 GPU 效率
- 流式输出:随着 token 生成立即发送,以降低感知延迟
- 扩缩容:根据需求增加或减少副本
- 监控:暴露性能与调试相关指标
在 LLM 领域,人们经常把 inference server 和 inference framework 这两个词交替使用。
- Inference server 通常强调的是接收请求、运行模型并返回结果的运行时组件。
- Inference framework 则更强调提供 API、优化能力与各类集成,用于高效 服务模型的更广义工具链或库。
Popular inference frameworks 包括 vLLM、SGLang、MAX 和 TensorRT-LLM。它们的目标是在让 LLM 更易于大规模 部署的同时,尽可能榨干 GPU 效率。
serving 和 inference 有什么区别?
Inference 是计算本身;serving 是把这种计算能力以生产方式提供给用户和应用的 过程。
在日常交流中,人们常常混用这两个词,因为现代框架往往同时处理两者。像 vLLM、 SGLang 和 TensorRT-LLM 这样的工具,不仅能高效执行推理,也会负责请求管理与 API 暴露。因此,“inference framework”和“serving framework”经常指向同一套 系统。
但严格来说,它们并不相同,而这种区别一旦进入基础设施设计阶段就会变得重要。
- Inference 是前向计算:token 输入,输出 next-token 分布,并在预填充与 解码循环中不断重复。这是一个纯计算过程。你完全可以在 Jupyter notebook 或 Python 脚本里执行推理,即便根本没有 server 存在。那依然是 inference, 但你并没有在服务任何用户。
- Serving 则是把这种能力变成可靠生产服务所需的一切:API 接口(HTTP/gRPC)、 请求排队与调度、跨并发请求的批处理、跨副本的负载均衡、自动扩缩容、模型 加载与版本管理、健康检查、可观测性以及资源分配。
所以当有人混用这两个词时,通常只是宽泛地表示:他们的 inference engine 恰好也承担了 server 的角色,而这种情况本来就非常常见。
什么是推理优化?
推理优化 是一组让 LLM 推理更快、更便宜、更高效的技术。它的目标是在不 损害模型质量的前提下,降低延迟、提高吞吐量,并减少硬件成本。
常见策略包括:
- Continuous batching: 动态组合请求,提高 GPU 利用率
- KV cache management: Reusing 或卸载 attention cache,更高效地处理长提示词
- Speculative decoding: Using a 更小的 draft model 来加快 token 生成
- Quantization: Running models in lower precision(例如 INT8、FP8)下运行模型,以节省内存和算力
- Prefix caching: Caching common prompt 片段,减少重复计算
- Multi-GPU distribution/Parallelism: 把 LLM 拆分到多块 GPU 上,以支持更大的上下文窗口
在实践中,推理优化往往决定了你的应用究竟是“又慢又贵”,还是能提供敏捷、 成本友好的用户体验。
更多内容可见推理优化章节。
为什么我应该关心 LLM 推理?
你可能会想: 我只是用 OpenAI 的 API,真的还需要理解推理吗?
像 OpenAI、Anthropic 这类 serverless API,会让推理看起来非常简单:你发送 提示词,拿到响应,按 token 付费。底层基础设施、模型优化和扩缩容过程都被 隐藏起来了。
但关键在于:你走得越深,推理就越重要。
随着应用增长,你迟早会碰到 serverless API 无法彻底解决的限制,例如成本、 延迟、定制能力或合规要求。到了这个阶段,团队往往就会开始探索混合式或 自托管方案。
Understanding LLM inference (e.g., batching, caching, quantization and routing) early gives you a clear 优势。它能帮助你评估不同模型服务提供商和 inference frameworks, 从而做出更聪明的选择,减少意外,并构建更可扩展的系统。
- 如果你是开发者或工程师:在现代 AI 应用开发中,推理正变得和数据库、 API 一样基础。理解它如何工作,能帮助你设计更快、更便宜、更可靠的系统。 糟糕的推理实现会导致响应缓慢、算力成本高、用户体验差。
- 如果你是技术负责人:推理效率会直接影响利润。一个缺乏优化的方案, 可能消耗 10 倍 GPU 小时,却给出更差的性能。理解推理能帮助你评估供应商、 做 build-vs-buy 决策,并为团队设定现实可行的性能目标。
- 如果你只是对 AI 感兴趣:推理就是“魔法真正发生的地方”。理解它的工作 方式,能帮助你区分 AI 热潮与现实,也会让你在 AI 讨论中更有判断力。