Can Tensor Cores Benefit Memory-Bound Kernels? (No!)(张量核心能加速访存受限 kernel 吗?不能!)
从理论与实证两方面证明:把 GPU 张量核心(Tensor Core)用于访存受限(memory-bound)kernel 无法带来实质性能收益。核心理论:基于 Roofline 模型与机器平衡度(machine balance)推导,在完全不重叠(fully un-overlapped)极端情形下张量核心相对 CUDA 核心的加速上界为 Speedup < 2 − 2/(1+α);对于 FP64(张量核心算力 α=2,即 V100/A100/H100)该上界仅为 1.33×,即便 α→∞ 也不超过 2×。完全重叠情形下访存主导、计算加速对总时间无影响。实证在 A100 与 GH200 上用 STREAM SCALE、SpMV(cuSPARSE vs DASP)、迭代 stencil(EBISU/Brick vs ConvStencil/LoraStencil)三类代表性访存受限 kernel 验证:张量核心实现普遍慢于同等优化的 CUDA 核心实现,主因是张量核心访存模式次优。结论:访存受限 kernel 应优先用 CUDA 核心并聚焦访存优化(cache-aware、减少访存流量、流水/重叠),而非引入张量核心。