完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
基础设施与运维
LLM 并不是孤立运行的。它背后需要稳健的基础设施支持,从高性能 GPU 到部署 自动化,再到全面可观测性都不可或缺。强大的模型与扎实的推理优化决定了应用 性能的上限,而你的基础设施平台与推理运维实践,则决定了系统能扩展到多大规模, 以及能否稳定增长。
什么是 LLM 推理基础设施?
通过面向推理而设计的基础设施来部署、扩展和管理 LLM。
什么是分布式推理?
分布式推理是指在多个 GPU、worker、节点或区域之间运行模型推理,以实现可扩展、可靠且具成本效益的服务。本文将说明什么是分布式推理、团队为何在生产环境中使用它、它面临的关键挑战,以及现代运行时和平台如何支持大规模分布式 LLM 推理。
LLM 可观测性
LLM 可观测性通过指标、日志和事件提供端到端视角,以保障模型在推理时的可靠性、效率和可扩展性。
快速扩缩容
快速扩缩容使 AI 系统能够处理动态变化的 LLM 推理工作负载,同时尽量降低延迟与成本。
构建与维护成本
在内部自建 LLM 基础设施成本高昂、复杂,并会拖慢 AI 产品开发与创新。
多模型推理流水线
多模型推理流水线会将多个模型串联到同一应用路径中,以提升专业化能力和可控性,但代价是额外的延迟与运维复杂性。
多云与跨区域推理
多云与跨区域推理是指在多个云提供商或多个区域之间运行 LLM 工作负载,以提升延迟表现、可用性和成本效率。
InferenceOps 与管理
通过 InferenceOps 工作流和基础设施最佳实践,可靠地扩展 LLM 推理。