完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
规划部署方案
在生产环境中运行 LLM 之前,你需要先做出几个关键决策。这些早期选择会直接 影响你的基础设施需求、成本结构,以及模型在具体场景中的表现。
Serverless vs. self-hosted LLM 推理
理解 serverless LLM API 与 self-hosted LLM 部署之间的差异。
选择合适的模型
为你的用例选择合适的模型。
选择合适的 GPU
为 LLM 推理选择合适的 NVIDIA 或 AMD GPU(例如 L4、A100、H100、B200、MI250X、MI300X、MI350X)。
计算为 LLM 服务所需的 GPU 内存
学习如何计算为 LLM 提供服务时所需的 GPU 内存。
选择合适的推理框架
了解 LLM 推理框架的作用、为什么原始模型执行不足以支撑生产环境,以及如何为你的用例选择合适的推理框架。
Bring Your Own Cloud (BYOC)
Bring Your Own Cloud (BYOC) 是一种部署模式,供应商在你的云中运行软件,将托管编排与完整的数据控制结合起来。
On-prem LLM 部署
On-prem LLM 是部署在组织自有基础设施中的大语言模型,例如私有数据中心或气隙环境。这种模式提供对数据、模型、性能和成本的完全控制。