完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
什么是 LLM 推理基础设施?
LLM 推理基础设施,指的是在生产环境中以可靠且具成本效益的方式运行 LLM 推理所需的整套系统与工作流。它涵盖从硬件供给、软件协同到运维监控的全部内容。
LLM 推理基础设施的关键组成通常包括:
- 硬件供给:获取 GPU、TPU 等高性能计算资源。
- 模型部署:把模型权重、运行时配置、adapter 与服务代码打包好,使模型 能安全发布、回滚和更新。
- 服务运行时:负责加载模型、接收请求、执行推理,并通过 API 或应用 工作流返回结果的软件。典型例子包括 inference server、model gateway 与特定框架的 runtime。
- 编排系统:管理资源分配、动态扩缩容,并在多个环境之间维护模型版本。
- 可观测性系统:提供日志、监控和 tracing,帮助你洞察 GPU 利用率、 延迟、吞吐量、失败率等性能指标。
- 安全与访问控制:保护敏感提示词、输出、模型制品和内部数据,并限制 哪些人可以调用或修改已部署模型。
- 服务成本管理:跟踪每类工作负载的成本,并通过调整模型选择、硬件、 批处理、路由和扩缩容策略,让服务在经济上可持续。
- 运维流程:通过标准化工作流与自动化能力,让团队能够发布更新、管理 版本、处理故障并保障高可用。随着推理需求增长,可重复且高效的运维就会 变得至关重要。