重要提示:如需以 Markdown 形式查看本页,请在 URL 后追加 `.md`。 完整文档索引见 llms.txt
跳到主要内容
完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。

LLM 可观测性

LLM 可观测性指的是在生产环境中监控并理解 LLM 推理系统行为的实践。它将 基础设施层、应用层和模型层的指标、日志与事件结合起来,提供端到端可见性。 目标是尽早发现问题、解释问题成因,并确保模型响应可靠、高效且质量稳定。

如果没有合适的可观测性,排查延迟问题、扩缩容故障或 GPU 利用率不足时就只能 靠猜。更糟的是,一些未被察觉的问题可能会悄悄拖慢性能,甚至在毫无预警的 情况下让服务失效。

应该监测什么

一个适用于生产环境的 LLM 推理可观测性栈,需要覆盖多个层面。下面给出一个 示例拆分:

类别指标它能告诉你什么
容器与部署Pod 状态在影响可用性之前发现失败、卡住或反复重启的 Pod
副本数量验证自动扩缩容行为,并帮助排查扩缩容延迟或上限问题
应用性能每秒请求数(RPS)衡量进入系统的流量与整体负载
请求延迟帮助识别响应变慢的位置与瓶颈
处理中请求数反映并发压力,判断应用是否跟得上需求
错误率跟踪失败或无效响应,对 SLA 监控很有用
队列等待时间揭示因等待可用副本而产生的延迟
集群资源资源配额与限制跟踪资源使用边界,帮助调优 requests/limits,避免过度或不足供给
LLM 专属指标每秒 token 数反映模型吞吐量与性能效率
首 token 时间直接影响用户感知延迟,对流式输出或聊天体验尤为关键
总生成时间衡量完整生成任务的端到端性能
GPU 指标GPU 利用率展示 GPU 的忙碌程度;数值过低可能意味着利用不足或批处理策略不佳
GPU 内存使用量有助于做容量规划并避免 OOM 错误

指标告诉你“发生了什么”,而事件和日志会告诉你“为什么会发生”。

  • Events:适合追踪集群活动,比如 Pod 重启、扩缩容事件或调度延迟。
  • 日志聚合:集中式日志让你可以跨容器、跨时间窗口搜索信息。这对于调试 请求失败、定位崩溃,以及追踪跨服务的性能问题都非常关键。