完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
基础
LLM 推理是模型真正接触现实世界的阶段。它支撑着从即时聊天回复到代码生成的 各种能力,并直接影响延迟、成本与用户体验。理解推理如何工作,是构建更智能、 更快速、更可靠 AI 应用的第一步。
什么是 LLM 推理?
LLM 推理是利用训练好的语言模型,根据提示词生成响应或预测的过程。
训练与推理
LLM 训练负责构建模型,LLM 推理则把模型应用到新输入上并生成实时输出。
LLM 是如何工作的?
了解 LLM 的工作方式,包括分词、Transformer 架构(注意力、注意力掩码)以及推理中的 prefill 和 decode 阶段。
LLM 推理通常运行在哪里?
了解 CPU、GPU 和 TPU 的差异,以及它们各自适合部署到哪里。
LLM 推理的关键指标
通过衡量延迟、吞吐量等关键指标来优化 LLM 推理性能。