Kimi K3 のメモリ削減とジェヴォンズのパラドックス:技術的および歴史的観点からの詳細分析

@bookwormengr
英語3 日前 · 2026年7月29日
160K
457
45
7
985

TL;DR

本分析では、ハイブリッド線形アテンションを採用し、最先端のパフォーマンスを維持しつつ大幅なメモリ削減を実現した Kimi K3 の KDA アーキテクチャについて探求します。これは AI メモリ市場に大きな影響を与える可能性があります。

X コミュニティの想像力を掻き立てている詳細の一つは、Kimi K3 が constant state(定常状態)を持つことです。つまり、コンテキストが長くなったり、会話が長引いたりしても、KV キャッシュが線形に増加することはありません(詳細や注意点については後ほど説明します)。

長いコンテキストのユースケース(エージェント型コーディングなど)は、メモリ需要を大幅に増加させ、メモリ関連株の価格を 10 倍から 30 倍に押し上げました。もし KV キャッシュを保存するためにそれほど多くのメモリを必要としないのであれば、この価格上昇は正当化されるのでしょうか?このトピックについては、X 上で活発な議論が交わされています。

批判派は、Kimi K3 が使用する Hybrid Linear attention(Kimi Delta Attention、KDA)はかなり前から存在すると言います。そのため、これはすでにメモリ株の価格に織り込まれているというのです。

しかし、彼らは重要な点を見逃しています。これまでの試みとは異なり、Kimi K3 は Hybrid Linear が 1T+ パラメータ規模で非常にうまく機能し、フロンティアレベルのパフォーマンスを発揮できることを証明したのです。これは完全に新しい情報であり、真剣に注目する価値があります。Kimi K3 以前は、Hybrid Linear はフロンティアのための技術ではなく、単なる便利なトリックとして考えられていました。

- Qwen(フロンティアに到達したことはありません)や

- Nvidia(無限の GPU を持っているという理由だけで、ありとあらゆることを試みています)のような企業が使うようなものです。

さあ、詳しく見ていきましょう!

(明確にしておきますが、これは投資アドバイスではありません)。

Hybrid Linear の簡単な歴史:

線形モデルは、紙の上では常に大きな可能性を約束してきました。まるで共産主義のように。

コンテキストが増えるにつれて KV キャッシュが絶えず増加する代わりに、線形モデルは更新される定常状態を持ちます。状態のサイズは、トークンが 1000 個でも 100 万個でも一定です。

うますぎる話に聞こえますが、その通りです!線形モデルには、会話の初期の部分(例えば、電話番号など)の内容を完全に想起するという問題があります。

なぜでしょうか?これは、これらのモデルがコンテキストの内部「要約」(状態と呼ばれる)を絶えず更新しているためです。しかし、このコンテキスト/要約はサイズが固定されているため(Kimi K3 の場合、ヘッドあたり 128128 など)、そのストレージ容量には限りがあります。情報を効率的に圧縮します(これはモデルがトレーニング中に学習することです)が、確実にいくつかの情報をドロップしなければなりません。言い換えれば、圧縮は非可逆的です。*

この問題を解決する一つの方法は、線形層(通常 75%)とフルアテンション層(25%)を組み合わせた「ハイブリッド線形」を採用することです。Hybrid Linear は、フルアテンションの効率的なバージョン(Kimi K3 の DeepSeek スタイルの MLA など)も持つことができます。この試みは行われましたが、初期のハイブリッド線形モデルはフロンティアレベルでのパフォーマンスを達成できませんでした!

Kimi K3 が示したのは、Kimi Delta Linear Attention (KDA) と呼ばれる彼らのバリエーションを用いることで、すべての層でフルアテンションを使用するモデルと同等の、ほぼ完全な想起を達成できるということです。これは、あなたがこれまで信じさせられてきたことにかかわらず、巨大なブレークスルーです。

Kimi K3 はどのようにそれを達成したのか?

Moonshot はハイブリッド線形の最初の使用者ではありませんが、非常に効果的なバリエーションを考案しました。これにより、メモリ減衰の細かい制御が可能になります。

もちろん、他にもデータエンジニアリング、カーネル開発、アテンション残差、安定した潜在 MoE など、多くのことを行っています(これらについては後ほど理解します)。しかし、彼らは一見シンプルなことを行い、アテンション部分で非常に優れたパフォーマンス向上を実現しました。

モデルの KDA 状態は、基本的にはメモリのスタックと考えることができます(非常に単純化したバージョン)。新しいトークン位置ごとに対角行列が計算され、状態がそれと乗算されます。これにより、一部の記憶はより多く忘れられ、一部の記憶はより少なく忘れられることになります(専門用語:チャネルごとの減衰)。以前のバージョンでは、すべての記憶を同じ程度に忘れていました。選択的かつ賢明に忘れるこのトリックにより、パフォーマンスが大幅に向上しました!

GDP - inline image

これは、状態行列の更新がどのように行われるかを示す美しい可視化です。これがどのようにして「継続的学習」という聖杯につながるのかを説明する別のブログを近日公開予定です。

GDP - inline image

Kimi K3 によるメモリ節約量はどのくらいですか?

K3 は 93 層、96 ヘッドを持ちます。KDA は 128 の dv と dk 次元を持ちます。

GDP - inline image

128K トークンと 100 万トークンを処理するために、状態と KV ストレージの観点から何が必要かを見てみましょう。2 つのケースを考えます:

1) 93 の MLA フルアテンション層(All-MLA) vs

2) 69 の KDA + 24 の MLA フルアテンション(実際の Kimi K3 モデル、上記の通り)

記事の下部に計算結果を掲載しています。

主な観察結果:

  1. All-MLA の場合、KV キャッシュストレージは 128K トークンから 1M トークンに増えるにつれて、13.7 GB から 107 GB に増加します。
  1. ご覧の通り、Kimi K3 の KDA 状態はコンテキスト長に関係なく 0.22 GB で一定です。MLA 部分のみが 128K から 1M トークンのコンテキストで 3.5 GB から 29 GB に増加します。

どちらの場合も、約 73% の節約になります。KDA がフロンティアパフォーマンスを損なわずにこれらの節約を提供するのが素晴らしい点です。MLA はすでに MHA や GQA よりも大幅な節約(約 90%)ですが、KDA はさらに 73% 節約します!

Kimi K3 の規模で DeepSeek V4 アーキテクチャを使用した場合の節約はさらに大きいと主張する人もいるでしょう。確かに、DeepSeek V4 はまだフロンティアに到達していません。そして、たとえフロンティアに到達したとしても、それはまったく同じ方向(より少ないストレージ)で改善されるでしょう。

GDP - inline image

Kimi K3 自身が生成したこの美しい可視化は、節約効果を示しています:

GDP - inline image

このような劇的なメモリ節約において、Kimi K3 は業界で唯一無二なのでしょうか?

DeepSeek V4 (https://arxiv.org/pdf/2606.19348v1) は KV キャッシュを 98% 削減するという例外的な仕事をしましたが、誰もフロンティアに近いとは考えていません。DeepSeek V4 がリリースされたとき、X 上で同じレベルの活動を観察しましたか?

また、その素晴らしさにもかかわらず、DeepSeek V4 のすべての層は CSA(Compressed Sparse Attention)または HCA(Highly Compressed Attention)のいずれかです。どちらのタイプもシーケンス次元に沿って圧縮されており、非可逆的です。非圧縮の情報を持つ層は一つもなく、つまりすべての層が非可逆的です。Kimi K3 では 25% の層がフルアテンションを持っていることを思い出してください。

私の仮説では、Kimi K3 は長いコンテキストシナリオにおいて、以前のコンテキストから特定の情報をより高い精度で取得できるでしょう。したがって、Kimi K3 アーキテクチャは、DeepSeek V3(MLA)やその後の DeepSeek V3.2(MLA + DSA)が業界で広く普及したように、他のラボ(ZAI、MiniMax、Qwen、Tencent、Xiaomi など)でも広く採用されるだろうと予測しています。

GDP - inline image

DeepSeek の CSA。シーケンス次元に沿った圧縮に注目してください。4 トークンごとに 1 つの圧縮トークンになります。

**

GDP - inline image

DeepSeek の HCA。シーケンス次元に沿った圧縮に注目してください。128 トークンごとに 1 つの圧縮トークンになります。

Funda AI の指摘について:KDA 状態は KV キャッシュのように加算的ではないため、複数回キャッシュする必要があるのではないか?また、サブエージェントは KV キャッシュストレージを必要としないのか?

先ほどの例を思い出してください。69 層にわたる KDA 状態の合計は 0.22 GB です。そのため、長いセッション中に 20K トークンごとにキャッシュ/スナップショットを取ったとしても、1M コンテキストでは 50 回になります。

したがって、これらの 50 個のスナップショットには 50 * 0.22 GB が必要になります。合計(29.22 GB + 11 GB)は、1M トークンコンテキストでの All MLA に必要な 107 GB を十分に下回ります。

第二に、Funda AI の指摘は、メインエージェントがサブエージェントを生成できるという点でした。人々は多くのサブエージェントを生成するでしょう。しかし、典型的には、サブエージェントがメインに制御を戻すと、その仕事は終了します。その KV + 状態は削除されます。そのため、たとえ人々が何百ものサブエージェントを生成するエージェントを起動しても、KV + 状態のニーズは長期的ではありません。メインセッション/メインエージェントの状態はより長く保存する必要があります。ここで KDA が大きな節約を実現します!

長時間実行される非同期エージェントのパターンもあります。そのような場合、それらの KV + 状態を維持する必要があります。しかし、私はこれらのパターンが実装されることは稀だと見ています。これは将来変わらないと言っているわけではありません。

同期サブエージェント(非常に一般的なパターン):

GDP - inline image

非同期サブエージェント(比較的稀なパターン):

GDP - inline image

KDA の採用はメモリ需要に下方圧力となるのでしょうか?

私は占い師ではありませんが、メモリバブルを崩壊させる可能性は小さいながらもゼロではありません。

まず、メモリ需要に影響を与えないかもしれない理由:

  • 節約は現実のものですが、オープンソース AI が広く採用されれば、ほとんどのデプロイメントは閉じたフロンティアラボほど効率的にはなりません。したがって、モデルレベルでのいかなる利益も、業界レベルでは失われるでしょう。非常に効率的ではない、多数の小規模なデプロイメントが存在することになります。例えば、ほとんどの企業や政府の利用は 1 日 12 時間にわたって行われます。彼らのオープンソースモデルインフラとそのメモリは夜間に何をするのでしょうか?大規模ラボのインフラは、グローバルな顧客ベースのため 24 時間 365 日使用されています。
  • また、大手ラボがすでに同様のアプローチを持っていないという大きな仮定をしています。OpenAI、Anthropic、DeepMind は世界で最も賢い人々の一部を雇用しています。したがって、そのような革新がすでに使用されており、メモリ需要に織り込まれている可能性は非常に高いです。

とはいえ、時折、SpaceX のように現れ、業界リーダーに彼らのアプローチがいかに非効率的であったかを示す企業が現れます。彼らは第一原理から考えます。既存企業は、組織構造の問題や、十分に貪欲でないなどの理由から、重要な側面で革新を行いません。資本主義の歴史は、そのような例で何千と埋め尽くされています。

GDP - inline image

したがって、これはありそうもないシナリオですが、それでもゼロではない確率で、もし大手ラボがリソースにそれほど飢えていなかったら、メモリ需要をこれほどまでに削減するために設計空間全体を探索しなかった可能性があります。

AI 業界自体でも、大手ラボが著しい無能さを示した例はこれまでに何度もあります:

  1. XAI のトレーニングパイプラインは MFU(GPU 使用率)が低かった。これは、問題に計算リソースを投入する習慣や、その他のクラスタ設定ミス、組織レベルの問題によるものです。
  2. 利用可能なすべてのリソースにもかかわらず、Meta は Llama 4 のために DeepSeek の MoE の粗悪なバージョンをトレーニングしました。
  3. Google は ChatGPT のローンチ以来、Gemini を最前線に引き上げるのに 1.5 年かかり、最も人気のあるユースケースである AI コーディングにおいて、依然として誰のお気に入りのモデルでもありません。
GDP - inline image

制約が革新を促進するため、小規模でよく組織化されたチームが、リソース豊富な大規模チームを凌ぐことは珍しくありません。そして今、K3 がリリースされ、そのアーキテクチャがよく知られるようになった今、KDA のような、フロンティア規模で成功した技術がクローズドラボにも採用されれば、少なくとも一部のラボでメモリ需要が 75% 削減されることを意味します。これらのラボは個々に非常に大きいため、その影響は数百億ドルに及ぶ可能性があります。

これらのメモリ節約は、コスト削減による使用量増加で確実に食いつぶされるでしょう(ジェボンズのパラドックス)。しかし、消費の成長が常に節約を上回るとは限りません。

GDP - inline image

その他の革新の拡散:Kimi K3 の主要な革新は KDA だけではない!

Kimi K3 は位置エンコーディングを完全に排除しました:位置エンコーディングは、コンテキスト内の各トークンのシーケンス番号をモデルに伝えます。KDA 層は、その反復的性質により、位置エンコーディングを必要としません。MLA 層からも位置エンコーディングを排除しており、パフォーマンスに悪影響はありません。利点は?以前のモデルと比較して、モデルのコンテキスト長を拡張するために特別な努力を必要としません。エレガントです。

Kimi K3 は 2.8T 規模でアテンション残差を実装しています:これにより、上位層が下位層からの入力に選択的に注意を払うことができるようになります。以前のアプローチでは、すべての値が集約されていたため、上位層は特定のトークン位置で下位層からの入力を区別できませんでした。この新しいアプローチにより、モデルははるかに高い識別力を獲得します。(https://arxiv.org/pdf/2603.15031

Kimi K3 は Nvidia の Stable Latent MoE を実装しています:安定した潜在 Mixture-of-Experts (LatentMoE) アーキテクチャの主な利点は、同じまたはより低い推論コストで、より高いモデル精度とより多くのエキスパート容量です。これは、エキスパートのルーティングと計算を実行する前に、トークン表現をより小さな潜在空間に投影することで実現します。彼らはこれを Nvidia の 2026 年 1 月の論文から採用しました (https://arxiv.org/pdf/2601.18089v1

GDP - inline image

これらすべての革新を組み合わせることで、MoonShot チームは以前のアーキテクチャ Kimi K2 と比較して、2.5 倍のトレーニング効率を達成しました。つまり、2.5 分の 1 の FLOPs で同じ検証損失を達成するということです。これはトレーニング計算においても大きな節約です!これにより、多くのラボが限られた計算リソースでこのような大規模モデルをトレーニングできるようになるでしょう。

GDP - inline image

K3 により、Moonshot は新たなスケーリング則を解き放ちました。Kimi K3 は Kimi K2 と比較してスケーリング効率で 2.5 倍の向上を達成しました。

MoonShot はまた、KDA 状態の高速計算のための FlashKDA GPU カーネルと、トークンのディスパッチと結合のための MoonMoE をオープンソース化しました。彼らはこれほど多くの知識を共有することにかなり自信を持っています。なぜなら、彼らはすでにさらに先を行く次の一連の革新に取り組んでいるからです(結局のところ、彼らも資本家です)。

GDP - inline image

スケーリング則は自然法則ではなく、私たちは常により良いものを発見できる

さらに、新しいアーキテクチャとトレーニングパラダイムにより、さらに高密度な知能を提供する、新たなスケーリング則を発見するかもしれません。スケーリング則は統計的な観察であり、変更できない自然法則ではありません。これは、新しいモデルでは、より小さなサイズ(そしてより低い KV と状態)でより良いパフォーマンスを実現できることを意味します。したがって、需要の爆発は同じ大規模モデルを永遠に実行し続けることを意味しません。モデルは知能の密度を高め続けるでしょう。

私たちは、非常に制約があり、非常に能力の高いエコシステムを中国のラボの形で持っています。これは、議論したように、非常に強力な組み合わせです。彼らは、より資金力のあるラボが発見していない設計空間の領域を発見しています。彼らは知識のオープンな共有により急速な進歩を遂げています。これにより、他の企業が努力を無駄にしたり、車輪の再発明をすることを防ぎます。アーキテクチャの進化は、そうでない場合よりもはるかに急速に起こります。

また、MoonShot チームによるこの成功は、DeepSeek、ZAI、MiniMax、Tencent、Alibaba、ByteDance SEED や、新興プレーヤーである Baidu、Ant Ling、Xiaomi Mimo、Meituan など、他の同様に能力の高いチームが、単なるオープンソースモデルとしてだけでなく、全体的に最高になることを目指すように刺激することは間違いありません。

西側の新興ラボでも、xAI や MSL が体制を整え、優れたモデルを提供し始めた今、多くの新たな革新が起こるでしょう。

とはいえ、私が繰り返し指摘しているように、NEURIPS の統計によると、中国は最も多くの若い AI 研究者を抱えています。この分野への貢献は、若い研究者から不釣り合いに多くもたらされます(ソーススレッド)。そのため、世界のその地域からさらに多くの画期的な進歩が生まれる可能性が高いです。

GDP - inline image

中国にはまた、シリコンバレーに匹敵する AI 人材密度を持つ 3 つの主要な都市圏があり、アイデアが混ざり合うるつぼとして機能しています(ソーススレッド)。

GDP - inline image

オープンソース AI の禁止は役に立たない:

この議論の残念な結論は、西側市場を保護するためにオープンソース AI を禁止しなければならないというものかもしれません。しかし、それは非常に逆効果でしょう。

西側世界でオープンソース AI が禁止されるかどうかにかかわらず、これらの設計空間は探求され、論文は発表されるでしょう。西側にも多くの新しい優れたラボが出現しています。まだ多くの効率性向上の余地があることが認識された今、彼らも多くの新しいアイデアを発見するでしょう。

最善の策は、これらの革新を奨励し採用し、投資に対して責任を持ち、投機的な行動を避けることです。

この技術のおかげで未来は非常に明るいですが、追証が発生するような狂った投機家にならないように注意する必要があります。

私たちは、企業、教育、研究、エンターテイメントのいずれにおいても、AI を可能な限り活用できていません。

  1. コーディングは GenAI トークン使用の主流ですが、CoWorker のようなアプリケーションは始まったばかりです。
  2. 私はインドのすべての学生が Opus 4.8 や Kimi K3 レベルのモデルに無制限にアクセスできるようになればと願っています。彼らはアクセス権を持っていますが、より弱いモデルに限られています。
  3. さらに、科学、工学、医学における AI のより価値の高いユースケースが存在します。
  4. また、私たちはケアを必要とする高齢化社会を迎えています。AI はそこで非常に有益になるでしょう。エンターテイメントやゲームの分野にも多くの可能性があります。Jensen Huang が述べたように:「エンターテイメントのために画面に表示されるすべてのピクセルは、生成されるようになるでしょう」

結論:

GDP - inline image
GDP - inline image

1929 年の株式市場の暴落——大恐慌——は、需要の破壊の結果ではありませんでした。それは投機的な過剰の結果でした。全世界が 20 年間苦しみました。それは間違いなくファシズムの台頭と第二次世界大戦につながりました。

未来は不確実ですが、私の観察で明らかなのは、AI 強気派、特にメモリ強気派は、アルゴリズムの革新や新しいスケーリング則の発見を考慮に入れていないということです。彼らにとって、すべてはジェボンズのパラドックスによって食いつぶされるため、関心の対象ではありません。この姿勢は個人投資家にも浸透し、複数の国の経済を崩壊させる可能性のある異常な行動につながっています。彼らの分析に新しい視点を導入したいと考えています。彼らはサプライチェーン状況や企業収益についてはるかに優れた情報を持っています。私は彼らに、より技術的な視点を提供したいと思います。

メモリと AI 株を暴落させるために、需要の大幅な減少は必要ありません。Jaya Gupta が指摘したように。需要のわずかな減少でも、ゲーム理論的な競争が始まり、既存の保有者が後で株を買い戻す目的で利益確定を始め、市場全体が暴落する可能性があります。そして、これはすでに始まっているようです。

このような大きなバブルが形成され、社会に破滅的な打撃を与えることを防ぐことが重要です。全体として、私はこの技術(そしてメモリ需要さえも)の可能性と将来のインフラ構築について非常に楽観的です。生きている中で最もエキサイティングな時代です!

(これは投資アドバイスではありません)

付録

メモリ節約の詳細な計算:

Kimi K3 がどれほど優れているかを示すために、K3 自身にこれらの計算をさせ、正しいことを確認しました。前述のように、2 つのケースを考えます:

1) Kimi K3: 69 KDA + 24 Gated MLA フルアテンション vs

2) Full MLA: 93 MLA フルアテンション

GDP - inline image
GDP - inline image
GDP - inline image
ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る