June 17, 2026 Flex Attention: A Programming Model for Generating Optimized Attention Kernels 编译器驱动的注意力编程模型,用几行PyTorch代码实现优化的注意力内核 attention compiler kernel system-optimization inference-serving torch-compile
June 17, 2026 TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives 基于Tile-Centric原语的编译器框架,高效生成计算-通信重叠内核 distributed-training communication kernel compiler system-optimization parallelism-sp