重要提示:如需以 Markdown 形式查看本页,请在 URL 后追加 `.md`。 完整文档索引见 llms.txt
跳到主要内容
完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。

Serverless vs. self-hosted LLM 推理

在使用 LLM 构建应用时,你通常有两种主要基础设施选择:serverless(托管 API)和 self-hosted 方案。它们是很适合对比的两个端点,但生产部署实际上可以落在这两者之间的任意位置。两者在易用性、可定制性、可扩展性和合规性方面各有不同权衡。

Serverless LLM 推理

由 OpenAI、Anthropic 以及其他托管 API 提供商提供的 serverless 推理服务,能显著简化应用开发。它们替你管理一切,你只需按使用量付费,不必承担基础设施开销。

这些服务不仅由 GPT-5 或 Claude-Sonnet-4.5 这样的专有模型提供能力支持。像 DeepSeek-R1 和 Llama 4 这样的开源模型,也可以通过 Together AI 和 Fireworks 等平台提供的 serverless 端点来使用。

serverless API 的主要优势包括:

  • 易于使用:你可以用极少配置快速开始,只需要一个 API key 和几行代码。无需管理硬件、软件环境或复杂的扩缩容逻辑。
  • 快速原型开发:它非常适合快速验证想法、构建演示或内部工具,而无需承担基础设施开销。
  • 硬件抽象:大规模 self-hosting LLM 通常需要高端 GPU(例如 NVIDIA A100 或 H100)。serverless API 将这些硬件复杂性抽象掉,使你能够绕过 GPU 短缺、配额限制和资源配置延迟。

Self-hosted LLM 推理

Self-hosted LLM 推理意味着由你自己部署并管理 LLM 基础设施,无论是在云 GPU、私有 VPC,还是 on-prem 服务器上。这让你能够完全控制模型如何部署、优化和扩展,而这对企业建立长期竞争优势至关重要。

self-hosting 的关键收益包括:

  • 数据隐私与合规:LLM 已广泛用于 RAG 和 AI agent 等现代应用。这些系统通常需要频繁访问敏感数据(例如客户详情、医疗记录、财务信息)。对于有合规和隐私要求的受监管行业组织来说,这通常不是可以接受的外部托管选项。self-hosting LLM 可以确保你的数据始终留在安全环境中。
  • 高级定制与优化:通过 self-hosting,你可以按具体需求定制推理流程,例如:
  • 可预测的性能与控制力:当你 self-host 自己的 LLM 时,你可以完全控制系统行为和性能。你不会受制于外部 API 的速率限制或突发政策变化,这些因素都可能影响应用的性能和可用性。

对比总结

在 serverless 与 self-hosted LLM 推理之间做选择,取决于你对易用性、数据隐私、性能优化和控制力的具体需求。

项目Serverless APIsSelf-hosted inference
易用性高(简单 API 调用)较低(需要部署和维护 LLM)
数据隐私与合规有限完全控制
可定制性有限完全灵活
规模化成本更高(按使用量计费,可能显著上涨)可能更低(基础设施可预测并可优化)
硬件管理已被抽象掉需要 GPU 部署与维护

如何理解成本

对于 serverless API,单个 token 的成本是固定的,但总支出会随着使用量线性增长。这对早期原型开发没问题,但在生产环境中会很快变得昂贵。

对于 self-hosting,前期工作和基础设施成本更高。但随着规模扩大,你的单 token 成本会显著下降,特别是在采用 KV cache offloading 等推理优化技术时。

在 AI 采用的不同阶段,你可能需要重新评估自己的方案,并在敏捷性与控制力之间重新权衡。

还值得注意的是,serverless 和 self-hosted 两种选择都会随着时间推移变得更便宜,原因包括:

  • 由于竞争加剧,API 价格持续下降。从 OpenAI 等供应商可以明显看出这一趋势,它们随着时间推移已经大幅下调了 token 价格,如下图所示。

    OpenAI API 成本随时间下降

    图片来源:davidtsong

  • GPU 硬件正在变得更高效、更便宜。

  • vLLM 和 SGLang 等项目正在提升模型推理效率。

  • 性能更好的开源模型在配合不同优化技术时,对资源的需求更少。

什么时候从 serverless 起步,什么时候开始掌控基础设施

如果你刚开始接触 LLM,serverless API 是一种很好的快速推进方式。它们让原型开发变得容易,降低了入门门槛,也让你可以在不处理基础设施的情况下验证用例。

但这种简单性伴随着权衡。serverless API 依然会把一些服务层决策留给你:使用哪种端点类型、如何将服务接入你的应用和数据系统、如何管理隐私边界,以及随着流量增长如何理解延迟和成本。

随着你的 AI 用例增长,以及你对性能、隐私和差异化的需求提高,serverless 的局限会越来越明显。每一家构建严肃 AI 产品的公司,都需要的不只是一个好模型。推理层才是让模型真正发挥作用的地方。仅仅依赖第三方 API 也许能让你的应用起步,但它无法给你带来所需的长期控制力或竞争优势。与 self-hosted 推理相比,serverless 模型 API 很难让你细粒度地控制性能调优和成本优化。你只是像其他所有人一样在调用同一个 API。而这种缺乏定制性的情况,会削弱你构建持久优势的能力:

  1. Compound AI systems 是顶尖团队获胜的方式。它们将多个模型和工具串联成丰富而灵活的工作流。
  2. Tailored inference stacks 让你能够围绕不同工作负载,精确设计 SLA 与成本目标。
  3. Fine-tuned and custom models 则带来面向领域的准确性和 IP 保护,而通用 API 无法做到这一点。

归根结底,推理质量就是产品质量。如果你的 AI 是关键能力,你就需要快速、可靠、安全,并且贴合自身目标的基础设施。

那时,你就该超越 API,开始真正拥有自己的推理层。

如果我选择 self-hosting,需要解决哪些问题?

Self-hosting LLM 让你获得完全的控制力与灵活性,但它也带来了超出“启动几台 GPU 服务器”之外的运维责任,例如:

  • 用于部署和维护的 DevOps 时间:搭建基础设施、管理部署,并保持系统稳定运行。
  • 监控与告警系统:实现可观测性(包括 TTFT 和 TPS 等 LLM 专用指标),以跟踪性能、发现故障并维持 SLA。
  • 数据传输与存储成本:处理大型模型文件,并管理云带宽或磁盘 I/O 成本。
  • 潜在宕机与冗余成本:确保高可用,并在硬件或服务中断时做好故障切换规划。
  • 冷启动缓慢:包括启动 GPU 实例、拉取 LLM 容器,以及将模型权重加载到内存中。优化启动时间对于快速扩缩容、以应对实时或突发工作负载至关重要。

不过,这并不意味着你必须从零构建一切。推理平台可以帮助缓解这些成本并降低运维开销,从长期看可能更具成本效益。


我们致力于帮助企业以灵活的分布式架构和定制化推理优化,自托管任何开源或自定义 LLM。借助我们的 Inference Platform,你可以实现比 serverless API 最多低 6 倍的成本。

常见问题

self-hosted AI 是什么意思?

Self-hosted AI 指的是在你自己的基础设施上运行和管理 AI 模型(例如本地数据中心、私有云或专用 GPU 服务器)。

通过 self-hosting,你可以完全掌控数据隐私、性能调优和成本优化。它适合那些需要:

  • 部署 DeepSeek-R1 等开源模型
  • 使用特定优化技术定制模型
  • 使用专有数据微调模型
  • 满足内部合规或数据主权要求

的团队。

专有模型一定比开源模型更强吗?

不一定。这取决于你的目标。

专有模型通常在通用推理、代码和对话质量方面领先,因为它们基于海量数据集训练,并通过高级对齐技术进行优化。如果你想立刻获得高性能而不想管理基础设施,它们会是很好的选择。

开源模型,例如 Llama、Qwen 和 DeepSeek,则提供更多控制力、透明性和灵活性。你可以对它们进行微调、在任何地方部署,并针对延迟和成本进行优化。开源模型与专有模型之间的差距正在迅速缩小,尤其是在特定领域工作负载上。

例如,当你在法律、医疗或金融语境中,使用专有数据对开源 LLM 进行微调时,它在该特定领域中可能会优于专有模型。这正是当今许多行业所需要的专业化能力。