X 社区最关注的一个细节是:Kimi K3 具有恒定状态。换句话说,随着上下文增长或对话变长,它的 KV 缓存不会线性增长(至少在大多数情况下如此——我们很快就会看到详细信息和注意事项)。
长上下文用例(例如 Agent 编程)极大地增加了内存需求,导致内存相关股票的价格上涨了 10 到 30 倍。如果不需要那么多内存来存储 KV 缓存,那么这种价格上涨是否合理?X 上对此存在着激烈的争论。
反对者表示,Kimi K3 使用的混合线性注意力机制(称为 Kimi Delta Attention,KDA)已经存在相当长一段时间了。因此,它已经被计入内存股票的价格之中。
然而,他们忽略了一个关键点——与之前的尝试不同,Kimi K3 证明了混合线性注意力在 1T+ 参数规模下能够如此出色地工作,并交付前沿性能。这是全新的信息,值得认真对待。在 Kimi K3 之前,混合线性注意力被认为不是一种前沿技术,而只是某些公司使用的巧妙技巧,比如:
- Qwen(从未真正达到前沿水平)或者
- Nvidia(他们只是因为有无限的 GPU,所以什么都尝试一下)。
让我们深入探讨!
(我想明确一点——这并非投资建议)。
混合线性注意力的简要历史:
线性模型在理论上一直前景广阔,就像共产主义一样。
线性模型不会随着上下文增长而让 KV 缓存不断膨胀,而是拥有一个可以更新的恒定状态。无论你有一千个 token 还是一百万个 token,状态大小都是恒定的。
这听起来好得令人难以置信,因为它确实如此!线性模型在完美回忆对话早期部分内容(例如对话早期的电话号码)方面存在问题。
为什么?因为这类模型会不断更新其内部对上下文的“摘要”(称为状态)。然而,由于这个上下文/摘要的大小是固定的(例如,Kimi K3 中每个注意力头的大小为 128\128),其存储容量是有限的。它会压缩信息以提高效率(这是模型在训练过程中学习到的),但肯定也会丢失一些信息。换句话说,这种压缩是有损的。*
解决这个问题的一种方法是采用“混合线性”方案,即在线性层(通常占 75%)中结合全注意力层(占 25%)。混合线性模型也可以拥有高效的全注意力版本(例如,Kimi K3 中的 DeepSeek 风格 MLA)。虽然有人尝试过,但早期的混合线性模型性能并未达到前沿水平!
Kimi K3 展示的是,通过他们称为 Kimi Delta Linear Attention (KDA) 的变体,你可以实现近乎完美的召回,与所有层都使用全注意力机制的模型一样好。无论别人怎么跟你说,这都是一项重大突破……
Kimi K3 是如何实现的?
Moonshot 并非第一个使用混合线性注意力的公司,但他们提出了一种非常有效的变体。它允许对记忆衰减进行精细控制。
当然,他们还做了许多其他事情,涉及数据工程、内核开发、注意力残差的使用、稳定潜变量 MoE 等(我们将在最后了解这些)。但他们做了一些看似简单的事情,却在注意力部分带来了显著的性能提升。
该模型的 KDA 状态本质上可以看作是一个记忆堆栈(简化版)。在每个新 token 位置,都会计算一个对角矩阵,并将状态与其相乘。这导致某些记忆被遗忘得更多,而某些记忆被遗忘得更少(术语:每通道衰减)。在早期版本中,所有记忆都会被同等程度地遗忘。这种选择性、有判断地遗忘的技巧显著提升了性能!

这是一个展示状态矩阵如何更新的漂亮可视化图。我还会写另一篇博客来解释这如何导向“持续学习”这一圣杯。

Kimi K3 能节省多少内存?**
K3 有 93 层和 96 个注意力头。KDA 的 dv 和 dk 维度为 128。

让我们看看在处理 128K token 和 100 万 token 时,状态和 KV 存储需要多少。我们来看两种情况:
1) 93 个 MLA 全注意力层(All-MLA)对比
2) 69 个 KDA + 24 个 MLA 全注意力层(如上图所示的实际 Kimi K3 模型)
在文章底部,我贴出了计算过程。
关键观察结果:
- 对于 All-MLA 模型,KV 缓存存储从 128K token 时的 13.7 GB 增长到 100 万 token 时的 107 GB。
- 如你所见,Kimi K3 的 KDA 状态在上下文长度变化时恒定保持在 0.22 GB。只有 MLA 部分的存储从 128K token 时的 3.5 GB 增长到 100 万 token 时的 29 GB。
在两种情况下,都节省了约 73% 的存储。KDA 的美妙之处在于,它在提供这些节省的同时,并未牺牲前沿性能。MLA 相较于 MHA 和 GQA 已经节省了大量资源(几乎 90%),而 KDA 又节省了 73%!
有些人会争辩说,在 Kimi K3 的规模下,DeepSeek V4 架构的节省会更高。没错,但 DeepSeek V4 尚未达到前沿水平。即使它达到了前沿水平,它也会朝着完全相同的方向改进:更少的存储。

Kimi K3 本身生成的这张精美可视化图展示了节省效果:

在如此显著的内存节省方面,Kimi K3 在行业内是独一无二的吗?
DeepSeek V4(https://arxiv.org/pdf/2606.19348v1)在将 KV 缓存削减 98% 方面做了出色的工作,但没有人认为他们接近前沿水平。当 DeepSeek V4 发布时,你在 X 上看到了同样程度的关注度吗?
此外,尽管 DeepSeek V4 的所有层都很出色,但它们要么是 CSA(压缩稀疏注意力),要么是 HCA(高度压缩注意力)——两种类型都是沿着序列维度进行压缩,并且是有损的。没有一层包含未压缩的信息,也就是说所有层都是有损的——而在 Kimi K3 中,25% 的层具有全注意力机制。
我的假设是,在长上下文场景中,Kimi K3 将能够更好地从早期上下文中检索特定信息。因此,我预见 Kimi K3 架构也将被其他实验室广泛采用(例如 ZAI、MiniMax、Qwen、腾讯、小米等),就像 DeepSeek V3(MLA)和后来的 DeepSeek V3.2(MLA + DSA)在行业内变得普遍一样。

DeepSeek 的 CSA。注意沿着序列维度的压缩。结果是每 4 个 token 生成 1 个压缩 token。
**

DeepSeek 的 HCA。注意沿着序列维度的压缩。结果是每 128 个 token 生成 1 个压缩 token。
关于 Funda AI 的观点,即需要多次缓存 KDA 状态,因为它不像 KV 缓存那样是可加的?另外,子 Agent 是否不需要 KV 缓存存储?
回顾之前的例子,69 层中总的 KDA 状态是 0.22 GB。因此,即使在一个长会话中每 20K token 就对其进行缓存/快照,在 100 万上下文中也只需要 50 次。
所以这 50 个快照将占用 50 * 0.22 GB。加起来总共只有 11 GB——(29.22 GB + 11 GB)的总和仍然远低于 100 万 token 上下文中 All-MLA 所需的 107 GB。
其次,Funda AI 的观点是主 Agent 可以生成子 Agent。人们会生成许多子 Agent。但通常,一旦子 Agent 将控制权交还给主 Agent,它的任务就完成了。它的 KV 和状态就会被删除。因此,即使人们启动的 Agent 启动了数百个子 Agent,KV 和状态的需求也不是长期的。主会话/主 Agent 的状态需要保存更长时间;这正是 KDA 节省大量资源的地方!
存在一些长时间运行的异步 Agent 的模式,在这种情况下,它们的 KV 和状态需要被维护。但我看到这些模式很少被实现。这并不是说未来不会改变。
同步子 Agent(一种非常常见的模式):

异步子 Agent(一种相对罕见的模式)

那么 KDA 的采用会对内存需求产生下行影响吗?
我不是算命先生,但存在一个微小的、非零的概率会戳破内存泡沫。
首先,为什么它可能对内存需求没有任何影响:
- 虽然节省是真实的,但如果开源 AI 被广泛采用,大多数部署的效率不会像封闭前沿实验室那样高。因此,模型层面的任何收益都将在行业层面被抵消。我们将有大量效率不高的小规模部署。例如,大多数企业和政府的使用发生在一天的 12 小时内。他们的开源模型基础设施及其内存在夜间会做什么?大型实验室的基础设施由于全球客户群,是 7x24 小时使用的。
- 此外,我们做了一个很大的假设,即领先的实验室尚未采用类似的方法。OpenAI、Anthropic、DeepMind 雇佣了世界上一些最聪明的人。因此,这类创新很可能已经在使用,并且已被计入内存需求。
话虽如此,每隔一段时间,就会出现一个 SpaceX,向行业领导者展示他们的方法是如何低效的。他们从基本原理出发思考。现有企业——由于组织架构问题,或者因为不够饥饿——未能在关键维度上进行创新。资本主义的历史上充满了成千上万个这样的例子……

因此,这是一个不太可能的情景——但仍存在一定的非零概率——如果大型实验室没有资源匮乏到那种程度,他们可能不会探索整个设计空间来将内存需求降低到如此程度。
在 AI 行业本身,之前就发生过很多次大型实验室表现出严重无能的情况:
- XAI 的训练管道 GPU 利用率 (MFU) 很低——原因在于习惯用算力堆砌问题,加上其他集群配置错误和组织层面的问题。
- 尽管 Meta 拥有所有资源,他们还是为 Llama 4 训练了一个非常糟糕的 DeepSeek MoE 版本。
- 自 ChatGPT 发布以来,Google 花了 1.5 年时间才将 Gemini 推向前沿,但它至今仍不是最流行用例(AI 编程)的首选模型。

限制催生创新,因此,高效的小型团队超越资源丰富的大型团队并非不可能。现在 K3 已经发布,其架构也已广为人知,如果像 KDA 这样——现在已在前沿规模上取得成功——的技术也被封闭实验室采用;这意味着至少对少数实验室来说,内存需求减少了 75%,而且它们各自的规模都相当大,因此影响可能达到数百亿美元。
这些内存节省肯定会因为成本降低导致的使用量增加而有所抵消(杰文斯悖论),但并不能保证消费增长总是会超过节省……

其他创新的扩散:Kimi K3 的主要创新不仅仅是 KDA!
Kimi K3 完全去除了位置编码:位置编码告知上下文中每个 token 的序列号。其 KDA 层由于具有循环性质,不需要位置编码。他们甚至为 MLA 层也去除了位置编码,并且没有造成性能损失。好处是?与早期模型相比,扩展模型上下文长度无需任何特殊努力。非常优雅。
Kimi K3 在 2.8T 规模上实现了注意力残差:它有效地确保了更高层能够有选择地关注来自低层的输入。在早期的方法中,更高层无法区分来自低层在给定 token 位置的输入,因为所有值都被聚合了。这种新方法赋予了模型更高的辨别能力。(https://arxiv.org/pdf/2603.15031)
Kimi K3 实现了 Nvidia 的稳定潜变量 MoE:稳定 潜变量混合专家 (LatentMoE) 架构的主要好处是在相同或更低的推理成本下,获得更高的模型准确率和更多的专家容量。它通过在运行专家路由和计算之前,将 token 表示投影到更小的潜变量空间来实现这一点。他们从 Nvidia 2026 年 1 月的论文中选取了这一点(https://arxiv.org/pdf/2601.18089v1)

综合所有这些创新,MoonShot 团队实现了相比其先前架构 Kimi K2 2.5 倍的训练效率。这意味着,他们实现了 2.5 倍更少的 FLOPs 达到相同的验证损失。即使对于训练计算来说,这也是巨大的节省!!!!这将使更多实验室能够在有限的算力下训练如此大规模模型……

通过 K3,Moonshot 解锁了新的扩展定律。Kimi K3 在扩展效率上相比 Kimi K2 实现了 2.5 倍的提升
MoonShot 还开源了他们的 FlashKDA GPU 内核,用于快速计算 KDA 状态,以及 MoonMoE,用于 token 的分发和合并。他们非常有信心分享如此多的知识,因为他们已经在进行下一组创新,这将使他们走得更远(归根结底,他们也是资本家)。

扩展定律并非自然法则,我们总能发现更好的方法
此外,我们可能会通过新的架构和训练范式发现新的扩展定律,提供更密集的智能。扩展定律是统计观察结果,并非不可改变的自然法则。这意味着,使用更新的模型,以更小的规模(以及更低的 KV 和状态)就能获得更好的性能。因此,需求的爆炸式增长并不意味着永远运行同样的大型模型。模型在智能密度方面将持续提高。
我们有一个由中国实验室组成的生态系统,它们资源高度受限但能力极强——正如之前讨论的,这是一个非常强大的组合。他们正在发现设计空间中那些资金更充足的实验室尚未发现的角落。由于知识的开放共享,他们取得了快速进展。这使其他人免于浪费精力和重复造轮子。架构的演变比以往任何时候都快……
此外,MoonShot 团队的成功必将激励其他同样有能力的团队,如 DeepSeek、ZAI、MiniMax、腾讯、阿里巴巴、字节跳动 SEED,甚至包括新兴玩家如 百度、蚂蚁灵、小米 Mimo、美团 等,追求卓越,不仅仅作为一个开源模型,而是成为整体上最好的模型。
西方的新兴实验室也会涌现出许多新创新,无论是 xAI 还是 MSL,现在他们已经步入正轨,开始交付出色的模型。
话虽如此,正如我一直指出的,根据 NEURIPS 统计数据,中国拥有最多的年轻 AI 研究人员。该领域的贡献不成比例地来自更年轻的研究人员(来源),因此,该地区更有可能出现更多突破性进展。

中国还有三个主要城市中心,其 AI 人才密度可与硅谷媲美,它们充当着思想碰撞的熔炉(来源)。

禁止开源 AI 无济于事:
这场讨论的一个不幸结论可能是,我们必须禁止开源 AI 以保护西方市场。但这将适得其反。
无论西方世界是否禁止开源 AI,这些设计空间都将被探索,论文也将被发表。西方也有很多新兴的出色实验室崛起。现在人们已经意识到可能还存在许多效率提升空间,他们也会发现许多新想法。
最好的做法是鼓励并采用这些创新,负责任地进行投资,避免疯狂的投机行为。
这项技术的未来非常非常光明,但我们必须小心,不要成为被追加保证金的疯狂投机者。
无论是在企业界、教育、研究还是娱乐领域,我们尚未充分利用 AI。
- 尽管编程一直是 GenAI token 使用的主要领域,但像 CoWorker 这样的应用才刚刚开始。
- 我希望印度的每个学生都能无限访问 Opus 4.8 或 Kimi K3 级别的模型。他们确实有访问权限,但只能访问较弱的模型。
- 此外,我们可以在科学、工程和医学领域实现价值更高的 AI 用例。
- 同时,我们正面临一个日益老龄化的世界,需要我们去照顾。AI 将在其中发挥巨大作用。在娱乐和游戏领域也存在许多可能性。正如黄仁勋所说:“我们在屏幕上看到的每一个用于娱乐的像素都将是生成的。”
结论:


1929 年股市崩盘——大萧条——并非需求破坏的结果。它是投机过度的结果。全世界为此遭受了二十年的痛苦。可以说,它导致了法西斯主义和第二次世界大战的兴起。
**
虽然未来充满不确定性,但根据我的观察,有一点是明确的:AI 牛市和特别是内存牛市,并没有将算法创新和发现新扩展定律考虑在内。对他们来说,一切都会被杰文斯悖论所吞噬,因此不值得关注。这种态度已经渗透到散户投资者中,并导致了可能导致多个国家经济崩溃的疯狂行为。**我想为他们的分析引入新的角度。他们拥有关于供应链状况和企业收益的远为更好的信息。我想用更多的技术视角来武装他们。
要摧毁内存和 AI 股票,我们不需要需求的大幅减少,正如 [Jaya Gupta 所指出的。](https://x.com/JayaGup10/status/2082301754872369331) 即使是需求的小幅减少,也可能引发博弈论上的竞争,现有的持仓者为了以后低价买入而开始获利了结,这可能导致整个市场崩溃。而这似乎已经开始发生……
重要的是,不要让如此巨大的泡沫形成并给社会带来灾难性的破裂。总体而言,我对这项技术(甚至内存需求)的潜力以及未来的基础设施建设保持非常乐观的态度。这是活着的最激动人心的时代!
(非投资建议)
附录
内存节省的详细计算:
为了展示 Kimi K3 有多好,我让 K3 自己进行了这些计算,并验证了其正确性。如前所述,我们考虑两种情况:
1) Kimi K3: 69 个 KDA + 24 个门控 MLA 全注意力层对比
2) 全 MLA: 93 个 MLA 全注意力层








