完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
LLM 推理通常运行在哪里?
在把 LLM 部署到生产环境时,选对硬件至关重要。不同硬件类型在性能与成本效率 上差异很大。最主要的三类选择是 CPU、GPU 和 TPU。理解它们各自的优缺点, 有助于你更有效地优化推理工作负载。
CPU
Central Processing Unit(CPU)是所有计算机和服务器都会使用的通用处理器。 CPU 广泛可得,适合运行小模型或处理低频请求。但它们缺乏高效运行 LLM 所需的 并行处理能力。对于生产级 LLM 推理,尤其是较大模型或高请求量场景,CPU 往往 在延迟和吞吐量上都难以胜任。
GPU
Graphics Processing Unit(GPU)最初是为图形渲染和数字可视化任务设计的。 由于它们擅长高度并行的运算,也逐渐成为 ML 和 AI 工作负载的理想选择。如今, GPU 已经成为 LLM 这类生成式 AI 在训练与推理上的默认硬件。
The architecture of GPUs 针对矩阵乘法和张量运算做了优化,而这些正是基于 Transformer 的模型的核心 组成部分。现代推理框架和运行时(例如 vLLM、SGLang、LMDeploy、 TensorRT-LLM 和 Hugging Face TGI)都是围绕充分利用 GPU 加速而设计的。
TPU
Tensor Processing Unit(TPU)是 Google 为加速训练和推理等 AI 工作负载而定制 打造的硬件。相比 GPU,TPU 从一开始就是围绕张量运算设计的,而张量运算正是 神经网络背后的基础数学。这种专门化设计让 TPU 在很多 AI 计算任务上都比 GPU 更快、更高效,其中就包括 LLM 推理。
TPU 支撑着当今一些最先进的 AI 应用:agents、推荐与个性化系统、图像/视频/ 音频生成等等。Google 在 Search、Photos、Maps 中使用 TPU,也用它来驱动 Gemini 和 DeepMind 模型。
下面是一个并列对比:
| 项目 | CPU | GPU | TPU |
|---|---|---|---|
| 设计目标 | 通用计算 | 面向图形和深度学习的并行计算 | 针对高密度张量运算优化 |
| 核心优势 | 灵活,能处理多种任务 | 大规模并行,非常适合训练和推理 | 张量运算效率极高 |
| 并行性 | 低 | 高 | 很高 |
| 最适合 | 分支逻辑、小型负载、传统应用 | LLM 训练与服务、图像模型、视频任务 | 大规模训练与高吞吐量推理 |
| 内存类型 | DRAM | GDDR / HBM | HBM |
| 内存带宽 | 低 | 高 | 很高 |
| 延迟特性 | 单核延迟低 | 单次延迟较高,但能被并行性摊薄 | 矩阵运算延迟低 |
| 能效 | 中等 | 中等到高 | 对 ML 工作负载非常高 |
| 软件生态 | 成熟、通用 | CUDA、ROCm、PyTorch、TensorFlow | XLA、JAX、TensorFlow |
| 成本 | 低 | 中到高 | 高,且主要通过云提供 |
| 可扩展性 | 对深度学习支持有限 | 在多 GPU 环境中扩展性好;LLM 仍会面临冷启动问题 | 在 TPU pod 中扩展能力很强 |
| 典型场景 | 数据预处理、后端服务、运行小型本地模型 | LLM 训练与推理 | 大批量训练、Google 内部生产推理 |
为 LLM 推理选择合适的硬件
选择合适的硬件,要求你先理解模型规模、推理量、延迟要求、成本约束以及现有 基础设施。GPU 仍然是最流行的选择,因为它兼具通用性和广泛支持;TPU 在一些 专门场景下也有明显优势;而 CPU 对轻量级、预算敏感的负载仍然有其位置。
关于不同开源 LLM 适合选择哪些 GPU,可继续阅读 GPU 选择。
选择合适的部署模式
部署模式会影响从延迟、可扩展性到隐私与成本的方方面面。不同模式适合不同的 企业运维需求。
- Cloud:云是当今最主流的 LLM 推理环境。它提供按需使用的高性能 GPU 与 TPU,以及丰富的托管服务、自动扩缩容和监控工具生态。
- Multi-cloud and cross-region: 这种灵活部署策略 会把 LLM 工作负载分布到多个云服务商或地理区域中。它有助于降低全球用户的 延迟、提升 GPU 可用性、优化算力成本、减轻供应商锁定,并支持数据驻留合规。
- Bring Your Own Cloud (BYOC): BYOC 部署 允许你把厂商软件(例如 LLM 推理平台)直接运行在自己的云账号内。这种模式把托管式编排与对数据、 网络和成本的完全控制结合起来。对于既要合规、成本效率和可扩展性,又不想 完全自托管的企业来说,它非常合适。
- On-prem: On-premises deployments mean 在你自己的基础设施上运行 LLM 推理,通常是在私有数据中心里。这种模式对 数据、性能和合规拥有完全控制权,但需要更高的运维开销。
- Edge:在 edge 部署中,模型直接运行在用户设备或本地边缘节点上,更靠近 数据产生的位置。这能降低网络延迟并提高数据隐私,特别适合对时效敏感或离线 使用的场景。由于算力资源有限,边缘推理通常会使用更小、经过优化的模型。