完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
推理优化
让 LLM 跑起来只是起点。真正让它变得更快、更高效、可扩展,才是推理优化要 解决的问题。
为什么需要做推理优化?
在演示环境里可用的方案,到了真实流量下未必还能成立。随着队列形成,延迟会 升高;吞吐量可能远低于硬件上限;成本也可能比预期增长得更快。在生产环境中, 优化能帮助你以产品可承受的成本达成延迟和吞吐量目标。
优化还能让你更主动地控制各种权衡。有些工作负载需要极低延迟来服务交互式 用户;有些则更看重批处理任务的最大吞吐量。长上下文应用需要精细管理 KV 缓存,多租户系统则需要合适的路由与调度策略,避免某一类负载拖垮另一类负载。
如果你使用的是 serverless endpoint(例如 OpenAI API),很多细节会被平台 抽象掉,但这些权衡仍然会体现在价格、速率限制和响应时间上。如果你是自托管 开源模型或自定义模型,选择合适的优化技术,才能让你的服务栈贴合真实工作负载, 而不是被动接受默认运行时提供的能力。
LLM 性能基准
LLM 性能基准是标准化测试,用于衡量 LLM 在特定条件下的表现。它们关注吞吐量、延迟、成本效率和资源利用率等实际指标。
静态、动态与连续批处理
通过静态、动态和连续批处理优化 LLM 推理,以获得更高的 GPU 利用率。
PagedAttention
通过 PagedAttention 基于块的 KV 缓存存储方式改进 LLM 内存使用。
推测解码
推测解码通过由 draft model 预测、再由 target model 验证的方式加速 LLM 推理。
预填充-解码分离
将预填充和解码分离,以获得更好的并行执行、资源分配和扩展能力。
前缀缓存
前缀缓存通过在请求之间复用共享提示词的 KV 缓存来加速 LLM 推理。
推理路由
使用缓存局部性、队列深度、KV 缓存压力和 worker 状态来路由 LLM 请求,以获得更低延迟和更好的利用率。
KV 缓存卸载
了解 KV 缓存卸载如何通过减少 GPU 内存占用、降低延迟并削减计算成本来改进 LLM 推理。
数据并行、张量并行、流水线并行、专家并行和混合并行
了解数据并行、张量并行、流水线并行、专家并行和混合并行之间的差异。
离线批量推理
使用离线批量推理在大规模场景下高效生成结果,适合非实时处理任务。