MLA
Multi-head Latent Attention
MLA(Multi-head Latent Attention,多头潜在注意力)是 DeepSeek-V2 设计的一种注意力机制:通过对 key-value 做低秩联合压缩,在效果上优于传统的 MHA(多头注意力),同时把推理所需的 KV Cache 压小很多。它要解决的正是 Attention 的核心瓶颈——O(N²) 的计算复杂度和随序列长度膨胀的 KV Cache 开销,据绿洲资本「Attention」系列访谈里清华赵天辰的说法,序列一长,Attention 几乎必然成为训练和推理的主要瓶颈,由此衍生出稀疏、线性、次平方复杂度等各种改进路线,MLA 属于其中被广泛采用的一支。
在实际工程中,MLA 已成为新一代模型的标配之一:据线性资本一篇文章,心洲科技在 GLM 5.1 上做 LoRA 强化学习后训练时,就需要适配 DeepSeek Sparse Attention(DSA)这类相关稀疏注意力结构。此外 elsewhere 还收录了其演进版本 Gated MLA 的条目,但具体设计细节暂未覆盖。
由 AI 生成,可能出现错误,请仔细核对内容。
MLA产品
Multi-head Latent Attention
暂无关系图谱
在 3 篇文章中被提及


