当前位置: 首页 > news >正文

把 100 万 token 显存砍掉四分之三,聊聊 Kimi K3 的 Delta Attention 和工程美学

最近这两天,大模型圈子被 Kimi K3 那个 2.8 万亿参数、896个专家的巨无霸 MoE 给刷屏了。

大家都在算这得烧多少显卡,算力有多恐怖。

但作为一个天天在服务器端跟显存带宽、算力调度死磕的工程架构师,我盯着技术报告看了一通,最让我激动的根本不是参数多大,而是他们底层的注意力架构。

Kimi 官方披露的信息里,提到了他们上线的一个叫 Kimi Delta Attention,也就是 KDA 的机制 [1]。

你如果跑过超长文本推理,一定被那个像噩梦一样的 KV Cache 折磨过。

传统的 Transformer 模型,注意力计算复杂度是O(N2)O(N^2)O(N2),序列每翻一倍,计算量和内存占用就翻四倍。

你想跑 100 万 token 的上下文,那对不起,即便是 Multi-Head Latent Attention 这种已经极度优化过 KV 缓存的架构,显存也得直接被塞爆。

那月之暗面是怎么在 100 万 token 下,把 KV 缓存砍掉百分之七十五,解码吞吐量还提升了六倍的?

这事得从前几年学术界折腾的线性注意力说起。

线性注意力,也就是 Linear Attention,这玩意理论上很美妙,能把复杂度直接降到O(N)O(N)O(N)

但为什么前几年工业界几乎没人敢在旗舰模型里大规模用?

其实就是记忆遗忘问题。

线性注意力在传递信息的时候,就像是用一个漏勺去舀水。

虽然水流得快,但模型很容易失忆,根本分不清什么是重点,一旦做稍微复杂的逻辑推理或者代码检索,智商就断崖式下跌。

后来大家开始想办法在状态更新上下功夫,搞出了 DeltaNet,然后演进到 Gated DeltaNet [3]。

这底层的数学逻辑挺有意思,它把模型对历史状态的更新,看作是一个在线梯度下降的过程。

每次有新的输入,它不仅是简单地把信息往里堆,而是会根据当前的输入,去「纠正」或者「擦除」旧的信息。

这就好比你在本子上记笔记,发现前面的内容记错了,或者现在的信息更重要,你会拿橡皮擦把旧的擦掉重新写,而不是无脑地往后续写。

但这东西在工程落地时,依然面临很大的坎。

Kimi 的团队在 Gated DeltaNet 的基础之上,做出了 KDA [2]。

他们在工程和数学的交叉点上,解决了两个很头疼的问题。

第一件是把门控机制做到了通道级,也就是 Channel-wise Gating。

以前的 Gated DeltaNet 太粗糙了,每个注意力头只能共用一个标量衰减权重,相当于每次擦除记忆都是一刀切。

KDA 引入了细粒度的通道控制,每个特征维度都可以独立决定自己要遗忘多少。

你想想看,这就像是你的本子上,不同学科、不同重要度的词能用不同的橡皮擦去涂改,有的保留,有的擦掉,记忆的精度一下子就提上来了。

第二件是针对硬件效率的底层重构。

线性注意力在理论上省算力,但在 GPU 实际运行中,尤其是 Tensor Core 上跑得极其难受。

传统的更新公式里有很多碎步子的矩阵乘法,没法并行,算力根本压榨不出来。

为了搞定这块,KDA 引入了一个叫对角加低秩,也就是 DPLR 矩阵转换的变体 [2]。

他们利用数学技巧,把复杂的长序列更新拆解成对角矩阵和两个小矩阵的相乘,把原本不规则的计算变成了极度适合 Tensor Core 的运算。

我看到这个设计的时候真的惊叹,这简直是数学美感跟硬件特性的完美结合。

结果也是实打实的,长序列解码吞吐量直接翻了六倍,显存占用暴降。

说到这,其实还有个很多人容易忽视的细节,就是他们并没有把所有层都无脑换成 KDA。

这非常符合工程师的务实心态,要是全换成线性的,模型智商再怎么优化也得掉。

Kimi 采用的是混合注意力架构 [1]。

比如按照三比一的比例,三层轻量级的 KDA,搭配一层重量级的 Multi-Head Latent Attention,也就是 MLA。

这就像我们在公司做项目,KDA 负责在海量背景资料里做粗筛和高效的信息压缩,把大意记在脑子里,而 MLA 负责在关键节点上做最精确的跨长程检索。

好钢用在刀刃上,难怪 100 万 token 能跑得又快又准。

而且在信息传递上,他们还引入了一个叫 Attention Residuals,也就是残差注意力机制 [1]。

传统 Transformer 里,底层抽出来的特征越往上传越容易被稀释。

这个机制允许模型在深层直接去检索底层的原始细节,防止那些重要特征在深层被彻底遗忘。

除了注意力,Kimi K3 这次能塞下 2.8 万亿参数,背后的 Stable LatentMoE 也挺有意思。

调过大模型 MoE 的兄弟肯定懂那个痛,专家一多,路由极其难做。

很容易出现有的专家被塞满、有的专家闲得长草,最后模型不仅跑得慢,还特别容易在训练中途 loss 突降然后直接出 NaN。

Kimi 这套框架通过在潜在空间进行 Token 的路由和计算,极大降低了内存带宽的压力。

更骚的是,他们用了一种叫分位数均衡的机制,动态地在训练过程中平衡专家的负载,让 896 个专家各司职,只激活其中 16 个。

这种极致的稀疏性,才让 2.8 万亿的模型在推理时能算得过来。

说实话,看完整套技术方案,我的感触挺深的。

美国很多团队在拼算法极限、拼大算力硬推,而国内像月之暗面这种团队,展示出了极强的「算力平民化」倾向。

他们是通过极具巧思的数学推导、对底层硬件的压榨,以及混合注意力的折中,把长文本和超大参数的成本打下来。

这才是真正的工程美学。

很多时候,颠覆性的改变往往就发生在这一个个枯燥的矩阵拆解、显存优化,以及对 Tensor Core 特性的精细计算里。

大模型的下半场,也许真的需要更多这样接地气、重落地的硬核工程突破。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

谢谢你看我的文章,我们,下次再见。

参考文献与资料

[1] Moonshot AI Official Blog, “Kimi K3 Technical Highlights Announcement”, 2026.

[2] Kimi Team, “Kimi Linear: An Expressive, Efficient Attention Architecture”, arXiv:2510.26692, 2025.

[3] Songlin Yang, Jan Kautz, Ali Hatamizadeh, “Gated Delta Networks: Improving Mamba2 with Delta Rule”, arXiv:2412.06464, ICLR 2025.

[4] Ali Hatamizadeh, Yejin Choi, Jan Kautz, “Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention”, arXiv:2605.22791, 2026.

http://www.cnnetsun.cn/news/3598456.html

相关文章:

  • UE4 UMG主菜单UI:5分钟搭建与屏幕适配避坑指南
  • 测试文章 001119 - 请忽略
  • 2026年真石漆公司怎么选?实用选购参考指南必看!
  • SAP Workflow核心架构与业务流程自动化实践
  • 数据库日期类型转换:从字符串到datetime的实战指南
  • OpenHarmony 6.1一键搭建QEMU模拟器环境指南
  • 2026年,AI Coding Agent 正在重写「程序员」的定义——而你准备好了吗?
  • 【2027最新】基于SpringBoot+Vue的新冠物资管理pf管理系统源码+MyBatis+MySQL
  • EEPROM异常处理与可靠性设计:从EESUPP寄存器到健壮驱动实现
  • 《热江绿色版》下载官网支持三大客户端互通,安全游玩渠道
  • SQL注入高阶攻防:从WAF绕过到数据库特性利用实战
  • Vue.js报错-Maximum-recursive-updates-exceeded
  • 自学黑客(网络安全入门)
  • 爱车开销:你的智能养车好帮手
  • 实时排名系统技术解析:Redis有序集合与暗票机制实现
  • 十、Redis之布隆过滤器
  • 齐悟同源微囊体究竟是啥东西
  • TI Stellaris LM4F232评估板:从Cortex-M4F到USB OTG与CAN总线的嵌入式开发实战
  • TMS470 ARM7开发套件快速入门:从环境搭建到LED闪烁实战
  • C++编译时混淆技术:基于Clang插件保护核心代码
  • 为什么92%的AI客户管理项目半年内失效?揭秘头部企业私有化部署的3个核心风控节点
  • 本地部署AI项目183.0:环境配置、性能优化与批量任务实践
  • 从学习效率翻倍到开源机器人栈:AI智能体正在长出身体,但人形交互仍是最后一道关卡
  • FFmpeg音视频分离实战:从原理到批量移除音频流
  • 从半导体到红外:气体传感器家族大盘点
  • 影刀RPA 网页表单填写的避坑大全
  • 为什么不同平台检测同一篇论文AI率差距大深度解读:AIGC检测平台算法差异完整分析
  • 角色拉远切低模后,渲染线程为何还是很高
  • SERP抓取做排名追踪:requests加BeautifulSoup够不够用
  • 基于XR Interaction Toolkit的PICO 4沉浸式交互开发实战