完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
多云与跨区域推理
当团队扩展 LLM 推理时,很少会把所有东西都放在同一个地方。 相反,它们会把工作负载分布到多个云,或同一云中的不同区域。 这样一来,系统就能从最合适的位置提供服务。
例如,你可以同时在 AWS 和 GCP 上运行推理, 也可以将其分布到 Azure 的三个区域,以覆盖北美、欧洲和亚洲。 这种方式给了你灵活性:工作负载可以迁移到 GPU 更容易获得且更具成本效益的地方、 性能最高的地方,或合规规则要求数据必须停留的地方。
最终结果是更好的韧性、为全球用户提供更快响应,以及降低对单一供应商的依赖。
多云推理
多云推理是指同时在多个云提供商上运行 LLM 工作负载。 这种模式并不是把所有东西从一个提供商迁移到另一个提供商, 而是在两个或更多环境中同时运行。例如,同一个模型可以在 AWS 上服务一部分用户, 在 GCP 上服务另一部分用户,并在 Azure 上作为兜底方案。
跨区域推理
跨区域推理是指在同一云提供商的多个地理区域中运行 LLM 工作负载。 需要注意,这并不意味着每个区域运行不同的模型。相反, 是将同一个应用复制到多个站点,以便从最近或最可用的位置处理请求。 例如,一个部署可能在 AWS us-east-1 服务北美,在 eu-west-1 服务欧洲, 在 ap-southeast-1 服务亚洲。
为什么多云与跨区域推理很重要
LLM 推理有其独特需求,而单一云或单一区域往往难以满足。 多云与跨区域策略通过让部署更灵活、更具韧性来填补这些缺口。
难以预测的需求
与训练不同,LLM 推理由实时使用驱动,通常呈现突发性且难以预测。 一次产品发布、一个爆款功能,或季节性流量,都可能导致请求量突然飙升。 需求可能在几分钟内从空闲转为饱和,而你的计算容量偏偏会在最糟糕的时候耗尽。 这会增加运维压力、潜在故障和服务中断风险。
多云与跨区域部署能够提供额外余量来吸收这些突发流量。 如果某个区域耗尽计算容量,流量可以转移到其他地方。 如果某个云提供商出现资源短缺,工作负载可以溢出到另一个提供商。
对于 LLM 而言,这种灵活性尤为重要,因为推理并不只是受 CPU 或存储限制。 它高度依赖 GPU 的可用性。像 DeepSeek-V3.1 和 gpt-oss-120b 这样的前沿模型, 需要 NVIDIA H100、AMD MI300X 等硬件,而这些硬件既昂贵又稀缺。
采用多云或跨区域架构后,你在需要时找到 GPU 的概率会更高。 因此,团队可以更平滑地应对流量峰值、避免请求丢失,并在扩展过程中保持一致的体验。
合规与数据驻留
LLM 常常为 AI agent 和 RAG 系统等应用提供能力,而这些应用往往需要频繁访问 客户记录等敏感信息。因此,企业必须遵守法律与监管要求。 许多地区都执行数据驻留规则,要求企业在特定地理边界内处理和存储用户数据。 例如,欧盟 GDPR 就限制个人数据或敏感数据在跨境场景中的自由流动。
多云与跨区域部署使团队能够在不牺牲可用性的前提下满足这些规则。 团队可以将模型部署在数据产生的同一区域。对于全球化应用而言, 这通常意味着在不同区域运行同一模型的多个副本,并分别只服务本地用户。
GPU 定价
LLM 推理成本与 GPU 的可用性和价格密切相关。GPU 价格在不同提供商、
不同区域,甚至同一云内部的不同可用区之间都可能存在巨大差异。
下面是 GCP 上 a3-highgpu-1g 实例(1 个 GPU)的按需 NVIDIA H100 定价示例。
| 区域 | 月成本(USD) |
|---|---|
| us-central1 | $8,074.71 |
| europe-west1 | $8,885.00 |
| us-west2 | $9,706.48 |
| asia-southeast1 | $10,427.89 |
| southamerica-east1 | $12,816.56 |
最便宜区域(us-central1)与最贵区域(southamerica-east1)之间的差距接近 60%。 如果只做单区域或单云部署,就意味着你会错过其他区域和其他云中更具成本效益的 GPU 选项。
多云与跨区域部署为团队围绕这些差异进行优化提供了空间。 通过将工作负载路由到 GPU 更便宜或更容易获得的区域,团队可以在不牺牲性能的 情况下降低成本。这种灵活性在运行前沿模型时尤其重要, 因为持续推理可能会将计算成本推高到数百万美元级别。
供应商锁定
一旦企业围绕某个平台的 API 和 GPU SKU 构建了自己的 LLM 推理栈, 迁移出去就会变得昂贵且复杂。这种依赖会限制灵活性, 让你暴露在突发价格变动、区域性故障或供应短缺的风险之下, 也会削弱你未来的议价能力。
多云推理有助于降低这种风险。通过在不同提供商之间运行工作负载, 你可以避免将基础设施绑定到单一生态上。如果某个提供商涨价、淘汰某类 GPU, 或发生服务中断,你都可以转移推理流量。
你是否应该采用多云或跨区域推理策略?
并不是每个团队都需要在多个云或多个区域中运行 LLM。 只有当相关权衡与你的业务目标和工作负载要求一致时,这一策略才有意义。
如果满足以下情况,你应考虑多云或跨区域推理:
- 你的 LLM 应用依赖供应紧张的 GPU,因此需要分散资源来源。
- 你必须满足合规或数据驻留要求。
- 你希望在面对供应商锁定和价格变化时保有主动权。
- 你很看重单一云内部(或跨提供商)的可用性与故障切换能力。
- 跨区域或跨提供商的成本优化是优先事项。
自建还是采购
一旦你决定采用多云或跨区域方案,接下来就需要考虑下一步。 应该自己构建吗?还是使用一个替你处理复杂性的现成平台更合适?
自建多云与跨区域推理
工程团队可以使用 vLLM、Kubernetes、Terraform 和全局负载均衡器等工具, 自行拼装一套方案。这会带来最大的灵活性与控制力,但也会引入挑战:
- 模型分发:你需要在不同区域或不同提供商之间持续复制 LLM。
- 路由逻辑:请求需要被路由到 GPU 最充足且最具成本效益的区域或云。 这可能要求进行实时容量检查,并在某个区域饱和时重新路由。
- 监控与可观测性:团队必须能够以统一方式跟踪所有区域和提供商上的性能、 延迟与成本。
- 运维开销:管理故障切换、扩缩容、合规与网络本身就是持续负担。
这一路径适合具备强大基础设施能力、且有严格定制需求的团队。
第三方推理平台
推理平台和托管服务可以抽象掉其中很大一部分复杂性。它们通常提供:
- 开箱即用的 全局负载均衡
- 跨区域的 自动模型复制
- 带有区域级指标的 统一可观测性
- 内建故障切换能力的 简化扩缩容
这一路径能够缩短上线时间并降低运维开销,但你仍应仔细评估:
- 路由与传输成本:不同区域的 token 定价是否一致,以及会产生哪些数据传输费用。
- 额外延迟:跨区域重路由会引入多少额外延迟。
- 区域与提供商灵活性:是否能够选择最符合你需求的区域或提供商。
- 故障切换成本:与跨区域故障切换相关的额外成本,例如管理、数据传输和网络使用。