当前位置: 首页 > news >正文

从 GPT-2 到 Kimi K3:22580 倍背后,真正改变的是 AI 的“记忆方式”

从 GPT-2 到 Kimi K3:22580 倍背后,真正改变的是 AI 的“记忆方式”

原帖《22580: From GPT2 to Kimi3, Explained》可以用一句话概括:

从 GPT-2 到 Kimi K3,大模型真正的进步不只是参数变多,而是学会了更高效地保存、修改、遗忘和重新检索信息。

一、“22580”究竟是什么意思?

原帖采用约 1.24 亿参数的 GPT-2 作为基准,而 Kimi K3 总参数量为 2.8 万亿:

2.8 万亿 ÷ 1.24 亿 ≈ 22580

所以,一个 Kimi K3 的总参数量大约相当于 22580 个小型 GPT-2。

但这不代表 Kimi K3 的智力、速度或者效果是 GPT-2 的 22580 倍。Kimi K3 是 MoE 混合专家模型,虽然拥有 2.8 万亿总参数,但每个 token 实际激活的参数约为 1040 亿。其官方规格为:93 层、69 层 KDA、24 层 Gated MLA、896 个路由专家,每次选择其中16个,另有2个共享专家。MoonshotAI 官方资料

因此,“22580”更像一个有冲击力的规模对比,不是性能倍数。

二、GPT-2:把全部历史都保存下来

GPT-2 使用标准 Softmax Attention。生成一个新词时,模型会拿当前的 Query 与前面所有 token 的 Key 进行比较,再从 Value 中找出相关信息。

这就像写文章时,每增加一句话,都要重新翻阅前面的所有内容。

KV Cache 可以保存已经计算过的 Key 和 Value,避免重复计算,但它仍有两个问题:

  1. 上下文越长,KV Cache 占用的显存越大;

  2. 完整注意力的计算量随序列长度近似平方增长。

所以,当上下文扩展到几十万甚至一百万 token 时,传统注意力会变得非常昂贵。

三、Linear Attention:把历史压缩到一块“白板”里

线性注意力不再保存每个 token 独立的 Key 和 Value,而是把历史信息压缩进一个固定大小的状态矩阵。

可以把它理解为:

  • 标准注意力:保存整本原始笔记,需要时逐页查找;

  • 线性注意力:把笔记不断浓缩到一块固定大小的白板上。

这样做的好处是,生成新 token 时的状态大小不再随上下文长度持续增长,特别适合超长文本。

缺点也很明显:白板容量有限。内容越写越多,不同信息会相互覆盖和干扰,模型可能记得大意,却丢失精确细节。

四、DeltaNet:让模型学会“修改记忆”

普通线性注意力只是不断往白板上叠加内容,旧信息很难被精确修改。

DeltaNet 引入了 Delta Rule:

  1. 先用当前 Key 读取旧值;

  2. 比较旧值和准备写入的新值;

  3. 只写入两者之间的差异。

这就像数据库中的更新操作:不是在旧记录后面无限追加,而是定位原记录并进行修改。

由此,固定大小的状态不再只是一个累加器,而变成了可以更新的关联记忆。

五、Gated DeltaNet 与 KDA:让模型学会遗忘

DeltaNet 能修改特定记忆,但仍缺少主动清理旧信息的能力。

Gated DeltaNet 加入了遗忘门,可以让历史状态逐渐衰减。Kimi Delta Attention,也就是 KDA,又把这种遗忘机制细化到不同通道:

  • 有些信息可以长期保留;

  • 有些信息可以快速遗忘;

  • 有些关联可以被新事实精确覆盖。

这相当于模型不但拥有一块白板,还拥有了分区域、分优先级的自动擦除机制。

六、Kimi K3 为什么仍然保留传统注意力?

固定状态再聪明,也不可能无损保存一百万 token 的全部细节。因此 Kimi K3 没有完全抛弃 Softmax Attention,而是采用混合架构:

  • 69层 KDA:负责高速、低成本地维护滚动记忆;

  • 24层 Gated MLA:周期性回到原始上下文中进行更精确的全局检索。

可以把它理解为:

平时看压缩摘要,需要核对细节时再翻原始资料。

这才是 Kimi K3 架构的关键:它不是押注某一种注意力机制,而是在“快速记忆”和“精确回查”之间做工程平衡。

此前的 Kimi Linear 在特定百万 token 测试环境中,报告了最高约6倍解码加速以及最多75%的 KV Cache 降低;这些是特定模型、硬件和上下文条件下的“最高值”,不能理解成所有任务都会快6倍。Kimi Linear 官方项目

七、MoE:容量巨大,但不是每次全部运行

Kimi K3 的2.8万亿参数主要来自 MoE 专家系统。

模型面对不同 token 时,会调用不同专家。例如:

  • 代码内容交给更擅长代码的专家组合;

  • 数学推理调用另一组专家;

  • 普通语言、视觉或者工具操作又可能选择不同组合。

每次只激活16个路由专家和2个共享专家,因此它可以拥有巨大的知识容量,而不必让2.8万亿参数每次全部参与计算。

不过,未激活的参数虽然不参与本次运算,权重仍然需要保存和分布到大量设备上。即使按理想4bit计算,2.8万亿参数的原始权重也约需1.4TB,所以它仍不是64GB内存电脑能够本地运行的模型。

八、AttnRes:不仅向前查 token,也向上查“思考过程”

传统 Transformer 的残差连接,会把前面各层的输出不断相加。模型越来越深后,早期有价值的信息可能被大量后续输出稀释。

Attention Residuals(AttnRes)允许当前层根据输入内容,选择性地调用更早层的表示,而不是把所有层等权相加。

因此,Kimi K3 实际上在两个方向上管理记忆:

  • KDA和MLA解决“序列方向”的记忆:前面哪些 token 值得保留;

  • AttnRes解决“网络深度方向”的记忆:前面哪一层的理解最值得取回。

这相当于模型不仅能翻阅之前看过的资料,还能回到自己 earlier 的某一步分析结果。AttnRes 论文

九、需要注意的两个技术细节

第一,FlashAttention 并没有从数学上消除标准注意力的平方复杂度。它主要通过分块计算减少显存读写和中间矩阵占用,从而显著提速;真正改变序列长度复杂度的是线性注意力一类架构。

第二,Kimi K3 也不是“纯线性注意力模型”。它仍保留24层 Gated MLA,因此长上下文的精确检索能力并未被完全压缩成固定状态。它追求的是混合方案,而不是把所有历史都塞进一块有限白板。

总结

从 GPT-2 到 Kimi K3,技术演进可以归纳为三个问题:

  1. 存什么:从保存全部 KV,转向固定状态和稀疏专家;

  2. 怎么更新:从不断叠加,转向差分写入和选择性遗忘;

  3. 怎么检索:从逐 token 全量查找,转向滚动记忆、周期性全局回查和跨层检索。

所以,Kimi K3 最值得关注的并不是“参数达到 GPT-2 的22580倍”,而是它已经从一个单一的 Transformer,演变成了一套分层记忆系统:

日常使用压缩记忆,重要时回查原文;不同问题调用不同专家,必要时还可以返回早期思考层重新取回信息。

这可能也是未来大模型架构的重要方向:不再寻找一种包打天下的注意力机制,而是把快速记忆、精确检索、主动遗忘和稀疏专家组合成一个完整系统。

http://www.cnnetsun.cn/news/3761007.html

相关文章:

  • C++实现24点计算器:深度优先搜索与递归算法详解
  • 破解adb root权限限制:从生产版本到深度调试的完整指南
  • DALI调光主控器安装接线全攻略:从原理到实战,打造稳定智能照明系统
  • 你的QQ空间记忆还能找回多少?GetQzonehistory帮你一键备份完整青春回忆
  • Python打包成exe终极指南:PyInstaller原理、高频报错与实战解决方案
  • LangChain消息系统架构设计与优化实践
  • 为什么说“学练考评改”五个字,才是判断培训系统好坏的唯一标准?
  • 亚洲芯片股持续下挫,AI概念股抛售潮蔓延
  • Arduino霍尔编码器测速:从原理到代码实现与避坑指南
  • AI写论文会被发现吗?2026年正确用法与避坑指南
  • 基于粒子群算法的无人机区域覆盖路径规划MATLAB实现
  • 基于CH552的USB CDC设备开发:从协议解析到工程实践
  • 掌握C语言经典算法:从数据结构到性能优化的系统学习指南
  • 港交所行情协议MMDP/OMP解析:从二进制流到低延迟订单簿实战
  • 深入解析8251A串行通信芯片:模式字、控制字与状态字实战指南
  • 千笔AI如何用智能写作技术提升学术论文效率
  • AMD/Xilinx 生态中的块级控制协议(Block-Level Control Protocol),以cmac 为例
  • 智能手机传感器全解析:从原理到应用,揭秘日常交互背后的核心技术
  • SpringBoot构建智慧社区平台的技术实践
  • LeetCode 3014.输入单词需要的最少按键次数 I:遍历 / if-else计算(比纯数学公式写起来麻烦但好想)
  • 2026年TOP5全自动焊接成型一体机专业公司排名揭晓
  • Android自动化熄屏:基于Auto.js的device.setScreenTimeout实现
  • Lua实现可扩展行为树:游戏AI模块化与热更新实战
  • 小升初数学思维提升训练:94集视频课程与PDF教材全解析
  • 【JSP】Java Web 爱鲜花——鲜花店管理系统(源码+文档)【独一无二】
  • C/C++实现二进制转十六进制:算法详解与工程实践
  • 文本相似度 API 快速上手:参数解读、示例与注意事项
  • 4.3、多体交叉存储器、Cache的基本原理、相联存储器、 Cache地址映射与变换方法
  • Python日志库选型指南:从logging到Loguru的6大方案对比
  • 基于51单片机的烟雾报警系统:从传感器原理到智能算法实现