Kimi Linear:一种高表现力、高效率的注意力架构

Kimi Linear:一种高表现力、高效率的注意力架构

Hacker News 摘要

原标题:Kimi Linear: An Expressive, Efficient Attention Architecture

Kimi 团队推出了 Kimi Linear,这是一种混合线性注意力架构。在多种应用场景下,包括短上下文、长上下文以及强化学习(RL)扩展阶段,该架构在公平对比中首次实现了性能超越全注意力(Full Attention)机制。

核心技术:Kimi Delta Attention

Kimi Linear 的核心是 Kimi Delta Attention(KDA)。这是一种表现力极强的线性注意力模块,它在 Gated DeltaNet 的基础上进行了扩展。

• 细粒度门控机制:KDA 引入了更精细的门控设计,能够更高效地利用有限状态的 RNN 内存。

• 硬件效率优化:团队开发了专门的分块(Chunkwise)算法。该算法采用了一种特殊变体的对角加低秩(DPLR)转移矩阵。

• 计算优势:相比通用的 DPLR 方案,这种特殊变体显著减少了计算量,同时与经典的 Delta Rule 保持高度一致,确保了极高的硬件执行效率。

模型规格与架构设计

研究人员基于 KDA 和多头潜在注意力(MLA)的逐层混合架构,预训练了一个大规模模型:

• 参数规模:该模型拥有 30 亿(3B)激活参数,总参数量达到 480 亿(48B)。

• 混合架构:通过将 KDA 与 MLA 结合,模型兼具了线性注意力的效率和潜变量注意力的表达能力。

实验结果与性能表现

在完全相同的训练条件下,Kimi Linear 在所有评估任务中的表现均大幅领先于纯 MLA 架构的模型。其优势体现在以下几个方面:

1. 资源占用极低:KV Cache 的使用量最高可减少 75%。

2. 吞吐量大幅提升:在处理 100 万(1M) 超长上下文时,解码吞吐量最高可达原来的 6 倍。

3. 无缝替换:实验证明 Kimi Linear 可以作为全注意力架构的直接替代方案,不仅性能更优,在处理长输入和长输出任务时效率也更高。

开源贡献

为了支持学术界和工业界的进一步研究,Kimi 团队已经公开了以下资源:

• KDA 内核代码。

• vLLM 框架的推理实现。

• 预训练模型和指令微调模型的权重(Checkpoints)。


原文:https://arxiv.org/abs/2510.26692

评论:https://news.ycombinator.com/item?id=49082022

Report Page