重要提示:如需以 Markdown 形式查看本页,请在 URL 后追加 `.md`。 完整文档索引见 llms.txt
跳到主要内容
完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。

推理优化

让 LLM 跑起来只是起点。真正让它变得更快、更高效、可扩展,才是推理优化要 解决的问题。

为什么需要做推理优化?

在演示环境里可用的方案,到了真实流量下未必还能成立。随着队列形成,延迟会 升高;吞吐量可能远低于硬件上限;成本也可能比预期增长得更快。在生产环境中, 优化能帮助你以产品可承受的成本达成延迟和吞吐量目标。

优化还能让你更主动地控制各种权衡。有些工作负载需要极低延迟来服务交互式 用户;有些则更看重批处理任务的最大吞吐量。长上下文应用需要精细管理 KV 缓存,多租户系统则需要合适的路由与调度策略,避免某一类负载拖垮另一类负载。

如果你使用的是 serverless endpoint(例如 OpenAI API),很多细节会被平台 抽象掉,但这些权衡仍然会体现在价格、速率限制和响应时间上。如果你是自托管 开源模型或自定义模型,选择合适的优化技术,才能让你的服务栈贴合真实工作负载, 而不是被动接受默认运行时提供的能力。