重要提示:如需以 Markdown 形式查看本页,请在 URL 后追加 `.md`。 完整文档索引见 llms.txt
跳到主要内容
完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。

什么是 LLM 推理?

LLM 推理指的是使用训练好的 LLM,例如 GPT-5、GLM-5 和 DeepSeek-V3.2, 根据用户输入生成有意义的输出;这些输入通常以自然语言 prompts 的形式给出。在推理期间, 模型会让提示词经过其庞大的参数体系,生成文本、代码片段、摘要、翻译等响应。

本质上,这就是 LLM 真正“开始工作”的时刻。下面是一些现实世界中的例子:

  • 客服聊天机器人:实时生成个性化且符合上下文的客户回复。
  • 写作助手:补全文句、纠正语法或总结长文档。
  • 开发者工具:把自然语言描述转换成可执行代码。
  • AI agents:自主执行复杂、多步骤的推理与决策流程。

使用下面的可视化工具来查看一次请求在 LLM 推理过程中的流转方式。更详细的 介绍可见 how LLM inference works.

LLM 推理可视化器
跟随一个提示词,查看它如何从输入一路走到流式输出
提示词"什么是 LLM 推理?"
1
分词
2
调度
3
预填充
4
输出
点击 播放,让提示词穿过整条推理流水线。

什么是 inference server?

Inference server 是负责管理 LLM 推理运行方式的组件。它加载模型,连接所需 硬件(如 GPU),并处理应用请求。当提示词到达时,server 会分配资源、执行 模型并返回输出。

LLM inference server 远不只是简单的请求-响应程序。它还提供了大规模运行 LLM 所需的关键能力,例如:

  • 批处理:合并多个请求,提高 GPU 效率
  • 流式输出:随着 token 生成立即发送,以降低感知延迟
  • 扩缩容:根据需求增加或减少副本
  • 监控:暴露性能与调试相关指标

在 LLM 领域,人们经常把 inference serverinference framework 这两个词交替使用。

  • Inference server 通常强调的是接收请求、运行模型并返回结果的运行时组件。
  • Inference framework 则更强调提供 API、优化能力与各类集成,用于高效 服务模型的更广义工具链或库。

Popular inference frameworks 包括 vLLM、SGLang、MAX 和 TensorRT-LLM。它们的目标是在让 LLM 更易于大规模 部署的同时,尽可能榨干 GPU 效率。

serving 和 inference 有什么区别?

Inference 是计算本身;serving 是把这种计算能力以生产方式提供给用户和应用的 过程。

在日常交流中,人们常常混用这两个词,因为现代框架往往同时处理两者。像 vLLM、 SGLang 和 TensorRT-LLM 这样的工具,不仅能高效执行推理,也会负责请求管理与 API 暴露。因此,“inference framework”和“serving framework”经常指向同一套 系统。

但严格来说,它们并不相同,而这种区别一旦进入基础设施设计阶段就会变得重要。

  • Inference 是前向计算:token 输入,输出 next-token 分布,并在预填充与 解码循环中不断重复。这是一个纯计算过程。你完全可以在 Jupyter notebook 或 Python 脚本里执行推理,即便根本没有 server 存在。那依然是 inference, 但你并没有在服务任何用户。
  • Serving 则是把这种能力变成可靠生产服务所需的一切:API 接口(HTTP/gRPC)、 请求排队与调度、跨并发请求的批处理、跨副本的负载均衡、自动扩缩容、模型 加载与版本管理、健康检查、可观测性以及资源分配。

所以当有人混用这两个词时,通常只是宽泛地表示:他们的 inference engine 恰好也承担了 server 的角色,而这种情况本来就非常常见。

什么是推理优化?

推理优化 是一组让 LLM 推理更快、更便宜、更高效的技术。它的目标是在不 损害模型质量的前提下,降低延迟、提高吞吐量,并减少硬件成本。

常见策略包括:

在实践中,推理优化往往决定了你的应用究竟是“又慢又贵”,还是能提供敏捷、 成本友好的用户体验。

更多内容可见推理优化章节。

为什么我应该关心 LLM 推理?

你可能会想: 我只是用 OpenAI 的 API,真的还需要理解推理吗?

像 OpenAI、Anthropic 这类 serverless API,会让推理看起来非常简单:你发送 提示词,拿到响应,按 token 付费。底层基础设施、模型优化和扩缩容过程都被 隐藏起来了。

但关键在于:你走得越深,推理就越重要。

随着应用增长,你迟早会碰到 serverless API 无法彻底解决的限制,例如成本、 延迟、定制能力或合规要求。到了这个阶段,团队往往就会开始探索混合式或 自托管方案。

Understanding LLM inference (e.g., batching, caching, quantization and routing) early gives you a clear 优势。它能帮助你评估不同模型服务提供商和 inference frameworks, 从而做出更聪明的选择,减少意外,并构建更可扩展的系统。

  • 如果你是开发者或工程师:在现代 AI 应用开发中,推理正变得和数据库、 API 一样基础。理解它如何工作,能帮助你设计更快、更便宜、更可靠的系统。 糟糕的推理实现会导致响应缓慢、算力成本高、用户体验差。
  • 如果你是技术负责人:推理效率会直接影响利润。一个缺乏优化的方案, 可能消耗 10 倍 GPU 小时,却给出更差的性能。理解推理能帮助你评估供应商、 做 build-vs-buy 决策,并为团队设定现实可行的性能目标。
  • 如果你只是对 AI 感兴趣:推理就是“魔法真正发生的地方”。理解它的工作 方式,能帮助你区分 AI 热潮与现实,也会让你在 AI 讨论中更有判断力。

更多内容可见 serverless vs. self-hosted LLM inference.