深度解析 Transformer 注意力机制:Self-Attention 与 FlashAttention 演进
注意力机制公式大家都熟悉:$\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V$。
但当上下文长度从 2K 扩展到 128K 时,$O(N^2)$ 的显存占用成了致命瓶颈。
- FlashAttention:核心思想是不把中间的 $N \times N$ 注意力矩阵写回 GPU 高带宽显存(HBM),而是利用 GPU SRAM 划分分块计算与在线 Softmax;
- 速度提升 2~4 倍,显存占用降低至线性。
软硬件结合的算法优化才是真正的大师级艺术!