核心内容:
DSA 稀疏注意力机制有两个关键组成部分:
- Lightning Indexer :负责保存仅 128 个 key 的小型缓存(相比 MLA 标准的 512),并对输入的 query 按重要度打分。
- Sparse Multi-Latent Attention (MLA) :核心稀疏注意力部分,只对得分最高(Top-2048)的 token 启动 MLA 计算。
分步详解
Step-1:Query & Key 投影
- 首先,将隐状态投影到查询(Query)和键(Key)空间,并加入 Rotary embedding(旋转位置编码)。
- 创新点:每个 head 还会从隐状态投影出一组权重,用于后续重新加权 Logits分数。
Step-2:Indexer 排分
- Indexer 计算 Q- K(掩码加缩放点积),然后乘以上一步得到的每头权重。
- 这个阶段在 DeepGEMM 上运行(为 Hopper 和 Blackwell GPU 做了核优化)。
Step-3:Top-k 选择
- 对于每个 Query,Indexer 挑选出上下文中分数最高的 2048 个 Token(若上下文长度小于 2048 全部选中)。
Step-4:稀疏 MLA 计算
- 利用前面挑选的 Token 索引,FlashMLA 稀疏内核执行高效的注意力计算,跳过无关位置,大大节省计算资源。
总体 Key Idea:
- 用一个精简 Light Indexer 机制,仅保留和选取最重要的 Token,再送到 Sparse MLA 进行高效的稀疏注意力,从而提升大模型的推理和生成速度,且显著降低显存和计算压力
最后在给一个 DeepSeek 三代同堂

厉害
介绍的很详细了
很详细了