大模型推理加速岗位学习路线
大模型推理加速岗位学习路线
基础知识
- Transformer/SelfAttention 原理(精读论文:Attention is all you need)
- FlashAttention 原理(精读论文)
- KVCache 原理
- FasterTransformer/DeepSpeed/TensorRT-LLM 使用(推理加速)
- CUDA/CANN 编程(算子开发)
vLLM
- 精读 PagedAttention 论文
- 阅读 vLLM 源码
- Prefill/Decode 性能分析(PD 混合/分离)
参考资料
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 xhj的博客!