实战项目
阶段4 | 第33-38周
🎯 项目列表
- 目标: 从零实现FlashAttention v1的核心算法
- 知识点: Shared Memory分块、Online Softmax、Tiling
- 输出: 可运行的CUDA Kernel,通过正确性测试
- 时间: 2周
- 目标: 实现支持INT8量化的推理引擎
- 知识点: 量化/反量化、矩阵乘法、融合算子
- 输出: 支持LLM INT8推理的引擎
- 时间: 2周
- 目标: 实现基于PagedAttention的LLM推理
- 知识点: KV Cache管理、内存分页、Continuous Batching
- 输出: 支持高并发的LLM服务
- 时间: 2周
🛠️ 辅助项目
- 实现多种优化版本的GEMM
- 从朴素 → Shared Memory → 向量化 → Tensor Core
- 完整性能对比报告
- 实现数值稳定的Softmax
- 支持大数组(超过单Block大小)
- 使用Warp Shuffle优化归约
🛠️ 更多实战项目
- 项目6: TopK选择算法GPU实现 →
- 项目7: NCCL多卡推理服务(Tensor Parallelism)
- 项目8: LLM Streaming输出服务(Server-Sent Events)
- 项目9: 多模型并发推理调度器