完整文档索引见 llms.txt。 在任意 URL 后追加 `.md` 即可查看该页面的 Markdown 版本。
内核优化
内核优化关注的是如何让 GPU 内核运行得更快、更高效,核心在于改进它对计算、 内存带宽和片上资源的使用方式。对于 LLM 推理,这通常意味着减少数据搬运、 提升硬件利用率,并更精细地把工作负载映射到 GPU 上。
面向 LLM 推理的 kernel 优化
面向 LLM 推理的 kernel 优化通过编写或生成针对 LLM 计算模式定制的优化 kernel,提升 GPU 利用率与性能。
GPU 架构基础
理解 kernel 优化所需的 GPU 架构基础,包括 thread、warp、streaming multiprocessor、memory hierarchy 和 tensor core。
选择合适的 kernel 优化工具
对比 LLM 推理中 kernel 优化的主要工具,从 cuBLAS、cuDNN 到 TVM、XLA、Triton、自定义 CUDA kernel、Mojo 和 MAX。
FlashAttention
FlashAttention 是一种面向 Transformer 的快速且内存高效的 attention 算法,可加速 LLM 训练与推理,并帮助实现更长的上下文窗口。