Kimi Linear:一种高表现力、高效率的注意力架构
Hacker News 摘要原标题:Kimi Linear: An Expressive, Efficient Attention Architecture
Kimi 团队推出了 Kimi Linear,这是一种混合线性注意力架构。在多种应用场景下,包括短上下文、长上下文以及强化学习(RL)扩展阶段,该架构在公平对比中首次实现了性能超越全注意力(Full Attention)机制。
核心技术:Kimi Delta Attention
Kimi Linear 的核心是 Kimi Delta Attention(KDA)。这是一种表现力极强的线性注意力模块,它在 Gated DeltaNet 的基础上进行了扩展。
• 细粒度门控机制:KDA 引入了更精细的门控设计,能够更高效地利用有限状态的 RNN 内存。
• 硬件效率优化:团队开发了专门的分块(Chunkwise)算法。该算法采用了一种特殊变体的对角加低秩(DPLR)转移矩阵。
• 计算优势:相比通用的 DPLR 方案,这种特殊变体显著减少了计算量,同时与经典的 Delta Rule 保持高度一致,确保了极高的硬件执行效率。
模型规格与架构设计
研究人员基于 KDA 和多头潜在注意力(MLA)的逐层混合架构,预训练了一个大规模模型:
• 参数规模:该模型拥有 30 亿(3B)激活参数,总参数量达到 480 亿(48B)。
• 混合架构:通过将 KDA 与 MLA 结合,模型兼具了线性注意力的效率和潜变量注意力的表达能力。
实验结果与性能表现
在完全相同的训练条件下,Kimi Linear 在所有评估任务中的表现均大幅领先于纯 MLA 架构的模型。其优势体现在以下几个方面:
1. 资源占用极低:KV Cache 的使用量最高可减少 75%。
2. 吞吐量大幅提升:在处理 100 万(1M) 超长上下文时,解码吞吐量最高可达原来的 6 倍。
3. 无缝替换:实验证明 Kimi Linear 可以作为全注意力架构的直接替代方案,不仅性能更优,在处理长输入和长输出任务时效率也更高。
开源贡献
为了支持学术界和工业界的进一步研究,Kimi 团队已经公开了以下资源:
• KDA 内核代码。
• vLLM 框架的推理实现。
• 预训练模型和指令微调模型的权重(Checkpoints)。