实战项目

阶段4 | 第33-38周

📅 6周学习计划

第33-34周

FlashAttention实现

第35-36周

INT8推理引擎

第37-38周

简易vLLM实现

🎯 项目列表

项目1: FlashAttention CUDA实现 难度: 高

  • 目标: 从零实现FlashAttention v1的核心算法
  • 知识点: Shared Memory分块、Online Softmax、Tiling
  • 输出: 可运行的CUDA Kernel,通过正确性测试
  • 时间: 2周

项目2: INT8推理引擎 难度: 中

  • 目标: 实现支持INT8量化的推理引擎
  • 知识点: 量化/反量化、矩阵乘法、融合算子
  • 输出: 支持LLM INT8推理的引擎
  • 时间: 2周

项目3: 简易vLLM (PagedAttention) 难度: 高

  • 目标: 实现基于PagedAttention的LLM推理
  • 知识点: KV Cache管理、内存分页、Continuous Batching
  • 输出: 支持高并发的LLM服务
  • 时间: 2周

🛠️ 辅助项目

项目4: CUDA矩阵乘法优化集 难度: 中低

  • 实现多种优化版本的GEMM
  • 从朴素 → Shared Memory → 向量化 → Tensor Core
  • 完整性能对比报告

项目5: Softmax CUDA实现 难度: 中

  • 实现数值稳定的Softmax
  • 支持大数组(超过单Block大小)
  • 使用Warp Shuffle优化归约

📚 参考项目

🛠️ 更多实战项目