June 17, 2026 Flex Attention: A Programming Model for Generating Optimized Attention Kernels 编译器驱动的注意力编程模型,用几行PyTorch代码实现优化的注意力内核 attention compiler kernel system-optimization inference-serving torch-compile