完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
Serverless vs. self-hosted LLM 推理
在使用 LLM 构建应用时,你通常有两种主要基础设施选择:serverless(托管 API)和 self-hosted 方案。它们是很适合对比的两个端点,但生产部署实际上可以落在这两者之间的任意位置。两者在易用性、可定制性、可扩展性和合规性方面各有不同权衡。
Serverless LLM 推理
由 OpenAI、Anthropic 以及其他托管 API 提供商提供的 serverless 推理服务,能显著简化应用开发。它们替你管理一切,你只需按使用量付费,不必承担基础设施开销。
这些服务不仅由 GPT-5 或 Claude-Sonnet-4.5 这样的专有模型提供能力支持。像 DeepSeek-R1 和 Llama 4 这样的开源模型,也可以通过 Together AI 和 Fireworks 等平台提供的 serverless 端点来使用。
serverless API 的主要优势包括:
- 易于使用:你可以用极少配置快速开始,只需要一个 API key 和几行代码。无需管理硬件、软件环境或复杂的扩缩容逻辑。
- 快速原型开发:它非常适合快速验证想法、构建演示或内部工具,而无需承担基础设施开销。
- 硬件抽象:大规模 self-hosting LLM 通常需要高端 GPU(例如 NVIDIA A100 或 H100)。serverless API 将这些硬件复杂性抽象掉,使你能够绕过 GPU 短缺、配额限制和资源配置延迟。
Self-hosted LLM 推理
Self-hosted LLM 推理意味着由你自己部署并管理 LLM 基础设施,无论是在云 GPU、私有 VPC,还是 on-prem 服务器上。这让你能够完全控制模型如何部署、优化和扩展,而这对企业建立长期竞争优势至关重要。
self-hosting 的关键收益包括:
- 数据隐私与合规:LLM 已广泛用于 RAG 和 AI agent 等现代应用。这些系统通常需要频繁访问敏感数据(例如客户详情、医疗记录、财务信息)。对于有合规和隐私要求的受监管行业组织来说,这通常不是可以接受的外部托管选项。self-hosting LLM 可以确保你的数据始终留在安全环境中。
- 高级定制与优化:通过 self-hosting,你可以按具体需求定制推理流程,例如:
- 精确调整延迟与吞吐量之间的权衡。
- 实现高级优化,例如 prefill-decode disaggregation, prefix caching 和 speculative decoding。
- 面向长上下文或 batch-processing 场景进行优化。
- 强制使用 structured decoding,以确保输出遵循严格 schema
- 使用专有数据对模型进行 Fine-tuning models, 从而获得竞争优势。
- 可预测的性能与控制力:当你 self-host 自己的 LLM 时,你可以完全控制系统行为和性能。你不会受制于外部 API 的速率限制或突发政策变化,这些因素都可能影响应用的性能和可用性。
对比总结
在 serverless 与 self-hosted LLM 推理之间做选择,取决于你对易用性、数据隐私、性能优化和控制力的具体需求。
| 项目 | Serverless APIs | Self-hosted inference |
|---|---|---|
| 易用性 | 高(简单 API 调用) | 较低(需要部署和维护 LLM) |
| 数据隐私与合规 | 有限 | 完全控制 |
| 可定制性 | 有限 | 完全灵活 |
| 规模化成本 | 更高(按使用量计费,可能显著上涨) | 可能更低(基础设施可预测并可优化) |
| 硬件管理 | 已被抽象掉 | 需要 GPU 部署与维护 |
如何理解成本
对于 serverless API,单个 token 的成本是固定的,但总支出会随着使用量线性增长。这对早期原型开发没问题,但在生产环境中会很快变得昂贵。
对于 self-hosting,前期工作和基础设施成本更高。但随着规模扩大,你的单 token 成本会显著下降,特别是在采用 KV cache offloading 等推理优化技术时。
在 AI 采用的不同阶段,你可能需要重新评估自己的方案,并在敏捷性与控制力之间重新权衡。
还值得注意的是,serverless 和 self-hosted 两种选择都会随着时间推移变得更便宜,原因包括:
-
由于竞争加剧,API 价格持续下降。从 OpenAI 等供应商可以明显看出这一趋势,它们随着时间推移已经大幅下调了 token 价格,如下图所示。

图片来源:davidtsong
-
GPU 硬件正在变得更高效、更便宜。
-
vLLM 和 SGLang 等项目正在提升模型推理效率。
-
性能更好的开源模型在配合不同优化技术时,对资源的需求更少。
什么时候从 serverless 起步,什么时候开始掌控基础设施
如果你刚开始接触 LLM,serverless API 是一种很好的快速推进方式。它们让原型开发变得容易,降低了入门门槛,也让你可以在不处理基础设施的情况下验证用例。
但这种简单性伴随着权衡。serverless API 依然会把一些服务层决策留给你:使用哪种端点类型、如何将服务接入你的应用和数据系统、如何管理隐私边界,以及随着流量增长如何理解延迟和成本。
随着你的 AI 用例增长,以及你对性能、隐私和差异化的需求提高,serverless 的局限会越来越明显。每一家构建严肃 AI 产品的公司,都需要的不只是一个好模型。推理层才是让模型真正发挥作用的地方。仅仅依赖第三方 API 也许能让你的应用起步,但它无法给你带来所需的长期控制力或竞争优势。与 self-hosted 推理相比,serverless 模型 API 很难让你细粒度地控制性能调优和成本优化。你只是像其他所有人一样在调用同一个 API。而这种缺乏定制性的情况,会削弱你构建持久优势的能力:
- Compound AI systems 是顶尖团队获胜的方式。它们将多个模型和工具串联成丰富而灵活的工作流。
- Tailored inference stacks 让你能够围绕不同工作负载,精确设计 SLA 与成本目标。
- Fine-tuned and custom models 则带来面向领域的准确性和 IP 保护,而通用 API 无法做到这一点。
归根结底,推理质量就是产品质量。如果你的 AI 是关键能力,你就需要快速、可靠、安全,并且贴合自身目标的基础设施。
那时,你就该超越 API,开始真正拥有自己的推理层。
如果我选择 self-hosting,需要解决哪些问题?
Self-hosting LLM 让你获得完全的控制力与灵活性,但它也带来了超出“启动几台 GPU 服务器”之外的运维责任,例如:
- 用于部署和维护的 DevOps 时间:搭建基础设施、管理部署,并保持系统稳定运行。
- 监控与告警系统:实现可观测性(包括 TTFT 和 TPS 等 LLM 专用指标),以跟踪性能、发现故障并维持 SLA。
- 数据传输与存储成本:处理大型模型文件,并管理云带宽或磁盘 I/O 成本。
- 潜在宕机与冗余成本:确保高可用,并在硬件或服务中断时做好故障切换规划。
- 冷启动缓慢:包括启动 GPU 实例、拉取 LLM 容器,以及将模型权重加载到内存中。优化启动时间对于快速扩缩容、以应对实时或突发工作负载至关重要。
不过,这并不意味着你必须从零构建一切。推理平台可以帮助缓解这些成本并降低运维开销,从长期看可能更具成本效益。
我们致力于帮助企业以灵活的分布式架构和定制化推理优化,自托管任何开源或自定义 LLM。借助我们的 Inference Platform,你可以实现比 serverless API 最多低 6 倍的成本。
常见问题
self-hosted AI 是什么意思?
Self-hosted AI 指的是在你自己的基础设施上运行和管理 AI 模型(例如本地数据中心、私有云或专用 GPU 服务器)。
通过 self-hosting,你可以完全掌控数据隐私、性能调优和成本优化。它适合那些需要:
- 部署 DeepSeek-R1 等开源模型
- 使用特定优化技术定制模型
- 使用专有数据微调模型
- 满足内部合规或数据主权要求
的团队。
专有模型一定比开源模型更强吗?
不一定。这取决于你的目标。
专有模型通常在通用推理、代码和对话质量方面领先,因为它们基于海量数据集训练,并通过高级对齐技术进行优化。如果你想立刻获得高性能而不想管理基础设施,它们会是很好的选择。
开源模型,例如 Llama、Qwen 和 DeepSeek,则提供更多控制力、透明性和灵活性。你可以对它们进行微调、在任何地方部署,并针对延迟和成本进行优化。开源模型与专有模型之间的差距正在迅速缩小,尤其是在特定领域工作负载上。
例如,当你在法律、医疗或金融语境中,使用专有数据对开源 LLM 进行微调时,它在该特定领域中可能会优于专有模型。这正是当今许多行业所需要的专业化能力。