每个项目包含完整代码、详细注释、编译运行方法、性能分析
实现泛型动态数组,支持移动语义、emplace_back、迭代器。理解RAII和现代C++内存管理。
从零实现GPU向量加法,掌握CUDA基础:内存分配、Kernel启动、错误处理。
实现高效的并行归约,对比Shared Memory和Warp Shuffle两种方法。
从朴素到Shared Memory到向量化到Tensor Core,4个版本性能对比。
实现计算与传输重叠的Pipeline,测量并发带来的性能提升。
使用__shfl_down_sync实现高效归约,对比传统Shared Memory方法。
实现IO感知的Attention计算,Tiling + Online Softmax,对比标准Attention。
实现vLLM核心的分页KV Cache管理,理解内存分页和CoW机制。
实现KV Cache从FP16到INT8的量化,测试精度损失和内存节省。
数值稳定的Softmax,支持大数组,面试手撕必备。
GPU上高效的TopK选择,支持大数组,面试常考。