完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
LLM 可观测性
LLM 可观测性指的是在生产环境中监控并理解 LLM 推理系统行为的实践。它将 基础设施层、应用层和模型层的指标、日志与事件结合起来,提供端到端可见性。 目标是尽早发现问题、解释问题成因,并确保模型响应可靠、高效且质量稳定。
如果没有合适的可观测性,排查延迟问题、扩缩容故障或 GPU 利用率不足时就只能 靠猜。更糟的是,一些未被察觉的问题可能会悄悄拖慢性能,甚至在毫无预警的 情况下让服务失效。
应该监测什么
一个适用于生产环境的 LLM 推理可观测性栈,需要覆盖多个层面。下面给出一个 示例拆分:
| 类别 | 指标 | 它能告诉你什么 |
|---|---|---|
| 容器与部署 | Pod 状态 | 在影响可用性之前发现失败、卡住或反复重启的 Pod |
| 副本数量 | 验证自动扩缩容行为,并帮助排查扩缩容延迟或上限问题 | |
| 应用性能 | 每秒请求数(RPS) | 衡量进入系统的流量与整体负载 |
| 请求延迟 | 帮助识别响应变慢的位置与瓶颈 | |
| 处理中请求数 | 反映并发压力,判断应用是否跟得上需求 | |
| 错误率 | 跟踪失败或无效响应,对 SLA 监控很有用 | |
| 队列等待时间 | 揭示因等待可用副本而产生的延迟 | |
| 集群资源 | 资源配额与限制 | 跟踪资源使用边界,帮助调优 requests/limits,避免过度或不足供给 |
| LLM 专属指标 | 每秒 token 数 | 反映模型吞吐量与性能效率 |
| 首 token 时间 | 直接影响用户感知延迟,对流式输出或聊天体验尤为关键 | |
| 总生成时间 | 衡量完整生成任务的端到端性能 | |
| GPU 指标 | GPU 利用率 | 展示 GPU 的忙碌程度;数值过低可能意味着利用不足或批处理策略不佳 |
| GPU 内存使用量 | 有助于做容量规划并避免 OOM 错误 |
指标告诉你“发生了什么”,而事件和日志会告诉你“为什么会发生”。
- Events:适合追踪集群活动,比如 Pod 重启、扩缩容事件或调度延迟。
- 日志聚合:集中式日志让你可以跨容器、跨时间窗口搜索信息。这对于调试 请求失败、定位崩溃,以及追踪跨服务的性能问题都非常关键。