重要提示:如需以 Markdown 形式查看本页,请在 URL 后追加 `.md`。 完整文档索引见 llms.txt
跳到主要内容
完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。

Bring Your Own Cloud (BYOC)

企业 AI 团队面临一个挑战:如何在不失去对数据、基础设施或成本控制的情况下,快速扩展 LLM 工作负载。

大多数组织一开始会采用 SaaS 推理平台,因为它们部署很快且为全托管。但随着工作负载增长,这些平台可能会变得昂贵且限制较多。

  • 你的数据会离开虚拟私有云(VPC)
  • 你永远无法真正知道 GPU 时间的费用究竟花在哪里
  • 合规检查会更难通过

这正是 Bring Your Own Cloud (BYOC) 发挥作用的地方。

什么是 Bring Your Own Cloud (BYOC)?

Bring Your Own Cloud (BYOC) 是一种部署模式,它允许你将供应商的软件(例如 LLM 推理平台)直接运行在你自己的云账户中。你既能享受托管编排的便利,又能让计算、数据和网络完全处于自己的控制之下。

这一模式对现代 AI 基础设施尤为重要。一方面,AI 模型和工具演进极快,如果把推理栈的每一个部分都在内部自行构建和维护,会拖慢创新与产品上市速度。另一方面,你仍然希望掌握工作负载运行的位置和方式,尤其是在它们处理敏感数据时。

BYOC 弥合了这一差距。它让组织在保持对数据、安全和运维控制的同时,依然能够受益于供应商托管的编排。换句话说,你可以快速推进,而不必放弃合规性或主权控制。

一个简单的理解方式是:

  • SaaS:供应商运行一切。
  • On-prem:你运行一切。
  • BYOC:供应商在你的云中、按照你的规则运行软件。

BYOC 最初只是数据敏感型企业的一个小众选项。如今,它正在成为大规模 LLM 和 AI 工作负载的主流部署模式。

BYOC 如何工作?

在 BYOC 部署中,你和供应商共同承担责任。供应商管理控制平面,而数据平面组件则完全留在你的云环境中。作为客户,你需要负责管理自己的云资源(尽管某些任务可能会交由供应商处理)、IAM 权限和网络配置,以确保安全性与可靠性。理想情况下,供应商永远无法直接访问你的原始数据或私有网络。

其典型工作方式如下:

  1. 控制平面(供应商管理):负责部署协调、扩缩容策略、调度、更新等。它通过安全 API 与你的环境通信。
  2. 数据平面(客户管理):这里是真正发生推理的地方。你的模型、GPU、计算实例和数据都位于你自己的 VPC 内,从而确保合规、隐私和完全隔离。
  3. 网络与 IAM 边界:BYOC 依赖严格的权限范围控制。供应商可以通过编程方式管理部署(例如通过 IAM 角色或跨账户访问),但无法查看或外传数据。日志(供应商可能会因调试需要访问)、指标和模型输出都保留在你的环境中。
Bring-your-own-cloud:供应商管理的控制平面与客户 VPC 中的数据平面Bring-your-own-cloud:供应商管理的控制平面与客户 VPC 中的数据平面

这种混合设计兼具两方面优势:

  • 托管平台在编排和更新方面的易用性。
  • 你的 LLM 工作负载、数据和 GPU 始终由你掌控所带来的确定性。

像基于 vLLM、SGLang 或 MAX 构建的现代推理系统,非常自然地适配这一模式。它们运行在你现有的云基础设施上,同时无缝连接到集中式控制平面。

BYOC 对 LLM 工作负载的优势

BYOC 的吸引力远不止合规。以下是几个关键优势:

数据主权与合规

LLM 已广泛应用于 RAG 或 AI agent 等企业系统中。这些应用通常需要访问无法离开私有网络的敏感信息(例如客户记录)。

采用 BYOC 后,所有模型输入、输出和日志都保留在你自己的 VPC 和云区域内。除非你主动共享,否则不会有任何内容离开你的环境。这使得满足 GDPR 等监管要求以及通过内部安全审查变得容易得多。

对于金融、医疗或公共部门的组织而言,这种控制级别是刚需。

GPU 灵活性与可用性

LLM 推理高度依赖 GPU,而不同区域和供应商之间的供给经常波动。许多供应商为 BYOC 提供多云架构支持。它们让你可以自行选择工作负载运行的位置,无论是在 AWS、GCP、Azure,还是三者的组合。

这意味着你可以:

  • 选择 GPU 供应和价格最适合你工作负载的云供应商。
  • 利用特定区域的价格优惠或促销活动。
  • 混合使用不同 GPU 类型(例如 NVIDIA A100、H100 或 AMD MI300X)来匹配成本与性能需求。

这种灵活性确保你不会因为等待容量而卡住,也不会为算力支付过高费用。

成本优化与效率

在 BYOC 中,你的推理与数据位于同一环境,从而减少跨云数据传输带来的高昂出口费用。对于处理大型数据集的团队来说,仅这一点就可能带来可观的成本节省。

它还可以帮助你最大化利用现有云投入:

  • 直接在自己的账户中使用云额度或创业计划。
  • 将长期承诺折扣、savings plans 或 spot pricing 应用于推理工作负载。
  • 汇总不同工作负载的支出,以解锁供应商提供的企业级折扣。

例如,Modular Cloud BYOC 会直接在你的账户中配置计算资源,因此你可以使用自己已有的额度、折扣和计费关系来部署模型。

无供应商锁定

BYOC 让你的基础设施保持云中立。你不会被单一云供应商的技术栈或硬件所绑定。这意味着你的 LLM 部署策略更具前瞻性。随着需求变化,你可以自由地在不同云、GPU 或编排工具之间迁移工作负载。

SaaS vs. BYOC vs. On-prem

选择如何部署 LLM,本质上取决于模型运行在哪里,以及由谁来运行基础设施。SaaS、BYOC 和 On-prem 三种部署模式,分别在控制、成本和复杂度之间提供了不同的权衡。

下面是一个快速对比:

模式运行位置由谁管理基础设施数据控制最适合
SaaS供应商的云供应商低:数据驻留在供应商的多租户环境中快速启动、最低运维开销、快速原型验证、非敏感数据
BYOC客户的云账户(如 AWS、GCP、Azure)供应商与客户共同承担高:数据保留在客户的 VPC 中有安全/合规需求、需要优化 GPU 成本、需要灵活扩缩容的企业
On-prem客户的私有数据中心客户完全:数据和计算资源完全留在客户基础设施中气隙或高度受监管的行业(如国防、医疗)

对于大多数企业级 LLM 工作负载而言,BYOC 提供了最佳的中间地带。它部署快、默认安全,并且在规模化时具备成本效率。


我们提供功能完备的 AI 推理平台,可部署到你自己的云账户中,以实现最大的控制力、安全性和可定制性。

通过我们的 BYOC 部署,你可以:

  • 在 AWS、GCP 或 Azure 等供应商的自有 VPC 中运行模型,并利用你现有的额度和承诺
  • 让你的数据和工作负载完全保留在自己的环境中
  • 在同一个 BYOC 部署中跨 NVIDIA、AMD、CPU 等硬件运行并扩展推理
  • 在私有云中应用最新的分布式推理技术,例如 prefill-decode disaggregation

常见问题

BYOC 能与多云部署配合使用吗?

可以。BYOC 非常适合多云架构。根据你的安全与合规策略,敏感工作负载可以留在某一个云中,而全球推理流量则扩展到其他云。

BYOC 与 SaaS 有何不同?

在 SaaS 中,供应商在自己的环境中托管并管理一切。而在 BYOC 中,供应商管理控制平面,数据平面则运行在你的云中。你仍然拥有计算、存储和网络资源的控制权。

BYOC 的权衡是什么?

你会获得更高的主权控制与灵活性,但也需要承担部分运维负担,主要包括管理自己的云环境、IAM 角色和监控。许多团队会通过使用托管式 BYOC 解决方案来抵消这部分复杂度。