Экономия памяти в Kimi K3 против парадокса Джевонса: глубокий технологический и исторический анализ

@bookwormengr
АНГЛИЙСКИЙ3 дня назад · 29 июл. 2026 г.
160K
457
45
7
985

Суть

В этом анализе рассматривается архитектура KDA в Kimi K3, которая использует гибридное линейное внимание для достижения колоссальной экономии памяти без ущерба для передовой производительности, что может повлиять на рынок акций в сфере ИИ-памяти.

Одна из деталей, которая поразила воображение сообщества X, заключается в том, что Kimi K3 имеет постоянное состояние. Другими словами, у него нет линейно растущей KV-кэш-памяти по мере увеличения контекста или длины вашего разговора (по большей части — скоро мы увидим детали и оговорки).

Сценарии использования длинного контекста, например, агентное программирование, значительно увеличили спрос на память, что привело к 10–30-кратному росту цен на акции производителей памяти. Если для хранения KV-кэша требуется меньше памяти, оправдан ли такой рост цен? На X ведется оживленная дискуссия на эту тему.

Критики утверждают, что гибридное линейное внимание, используемое Kimi K3 и называемое Kimi Delta Attention (KDA), существует уже довольно давно. Поэтому оно уже учтено в ценах на акции производителей памяти.

Однако они упускают из виду, что, в отличие от предыдущих попыток, Kimi K3 доказал, что гибридное линейное внимание может отлично работать в масштабе 1 триллион+ параметров и обеспечивать производительность на передовом уровне. Это СОВЕРШЕННО НОВАЯ информация, которая заслуживает серьезного внимания. До Kimi K3 считалось, что гибридное линейное внимание — это не техника для передового уровня, а просто ловкий трюк, используемый такими как

- Qwen (которые так и не вышли на передовой уровень) или

  • Nvidia (которая пробует всё подряд, просто потому что у них бесконечное количество GPU).

Давайте погрузимся!

(Хочу внести ясность — ЭТО НЕ ИНВЕСТИЦИОННАЯ РЕКОМЕНДАЦИЯ).

Краткая история гибридного линейного внимания:

Линейные модели всегда подавали большие надежды на бумаге, прямо как коммунизм.

Вместо постоянно растущей KV-кэш-памяти по мере роста контекста, у них есть постоянное состояние, которое обновляется. Размер состояния постоянен независимо от того, есть ли у вас тысяча токенов или миллион токенов.

Это звучит слишком хорошо, чтобы быть правдой, так оно и есть! Линейные модели испытывают проблемы с идеальным воспроизведением информации из более ранних частей разговора — например, номера телефона из начала разговора.

Почему? Потому что такие модели постоянно обновляют свое внутреннее «резюме» (называемое состоянием) контекста. Однако, поскольку это резюме/состояние имеет фиксированный размер (например, 128\128 в случае Kimi K3, на голову), его емкость для хранения ограничена. Он сжимает информацию для эффективности (этому модель учится во время обучения), но он обязательно должен отбрасывать некоторую информацию. Другими словами, сжатие является потерянным.*

Один из способов решения проблемы — использовать «гибридное линейное» внимание, где вы комбинируете линейные слои (обычно 75%) со слоями полного внимания (25%). Гибридное линейное внимание также может иметь эффективную версию полного внимания (например, DeepSeek-стиль MLA в случае Kimi K3). Хотя такие попытки предпринимались, более ранние гибридные линейные модели не обладали производительностью на передовом уровне!

Что показал Kimi K3, так это то, что с их вариацией, называемой Kimi Delta Linear Attention (KDA), вы можете достичь почти идеального воспроизведения, такого же хорошего, как у моделей, использующих полное внимание во всех слоях. Это огромный прорыв, независимо от того, во что вас заставляли верить...

Как Kimi K3 этого добился?

Moonshot не первые, кто использовал гибридное линейное внимание, но они придумали его вариацию, которая оказалась очень эффективной. Она позволяет тонко контролировать затухание памяти.

Конечно, они сделали много других вещей, связанных с инженерией данных, разработкой ядер и т. д., использованием остаточного внимания, стабильным латентным MoE и т. д. (мы поймем их в конце). Но они сделали нечто, казалось бы, простое, что привело к исключительному приросту производительности в части внимания.

Состояние KDA модели, по сути, можно представить как стек воспоминаний (упрощенная версия). На каждой новой позиции токена вычисляется диагональная матрица, и состояние умножается на нее. Это приводит к тому, что одни воспоминания забываются больше, а другие — меньше (жаргон: поканальное затухание). В более ранних версиях вы забывали все воспоминания в равной степени. Этот трюк с избирательным и продуманным забыванием значительно улучшил производительность!

GDP - inline image

Это красивая визуализация, показывающая, как происходит обновление матрицы состояний. У меня будет еще один пост в блоге, который объяснит, как это приводит к «святому Граалю» — непрерывному обучению.

GDP - inline image

Насколько велика экономия памяти с Kimi K3?

K3 имеет 93 слоя и 96 голов. KDA имеет размерности dv и dk, равные 128.

GDP - inline image

Давайте посмотрим, что требуется для обработки 128K токенов и 1 миллиона токенов с точки зрения хранения состояния и KV. Рассмотрим два случая:

1) 93 слоя полного внимания MLA (All-MLA) vs

2) 69 KDA + 24 слоя полного внимания MLA (фактическая модель Kimi K3, как показано выше)

Внизу статьи я привел расчеты.

Ключевые наблюдения:

  1. Для All-MLA хранилище KV-кэша растет с 13,7 ГБ до 107 ГБ при переходе от 128K к 1M токенам.
  1. Как видите, состояние KDA для Kimi K3 постоянно и составляет 0,22 ГБ независимо от длины контекста. Растет только часть MLA — с 3,5 ГБ до 29 ГБ при переходе от контекста в 128K к 1M токенам.

В обоих случаях экономия составляет около 73%. Прелесть в том, что KDA не идет на компромисс с производительностью на передовом уровне, обеспечивая при этом такую экономию. MLA уже обеспечивает огромную экономию по сравнению с MHA и GQA (почти 90%), а KDA экономит 73%!

Некоторые будут утверждать, что экономия с архитектурой DeepSeek V4 в масштабе Kimi K3 была бы еще выше. Это правда, DeepSeek V4 еще не на передовом уровне. И даже если он достигнет передового уровня, он будет улучшаться в том же направлении: меньшее хранилище.

GDP - inline image

Эта красивая визуализация, созданная самим Kimi K3, показывает экономию:

GDP - inline image

Уникален ли Kimi K3 в индустрии в плане такой драматической экономии памяти?

DeepSeek V4 (https://arxiv.org/pdf/2606.19348v1) проделал исключительную работу по сокращению KV-кэша на 98%, но никто не считает его близким к передовому уровню. Когда был запущен DeepSeek V4, наблюдали ли вы такой же уровень активности на X?

Кроме того, при всем их блеске все слои в DeepSeek V4 — это либо CSA (Compressed Sparse Attention), либо HCA (Highly Compressed Attention) — оба типа сжимаются по размерности последовательности, и это потерянно. Нет ни одного слоя с несжатой информацией, то есть все слои являются потерянными — в то время как в Kimi K3 25% слоев имеют полное внимание.

Моя гипотеза состоит в том, что Kimi K3 будет лучше извлекать конкретную информацию из более раннего контекста в сценариях с длинным контекстом. Поэтому я предвижу, что архитектура Kimi K3 будет широко принята другими лабораториями (например, ZAI, MiniMax, Qwen, Tencent, Xiaomi и т. д.), точно так же, как DeepSeek V3 (MLA) и позже DeepSeek V3.2 (MLA + DSA) стали широко распространены в индустрии.

GDP - inline image

CSA от DeepSeek. Обратите внимание на сжатие по размерности последовательности. Оно дает 1 сжатый токен на каждые 4 токена.

**

GDP - inline image

HCA от DeepSeek. Обратите внимание на сжатие по размерности последовательности. Оно дает 1 сжатый токен на каждые 128 токенов.

Что насчет утверждения Funda AI о том, что вам нужно кэшировать состояние KDA несколько раз, поскольку оно не является аддитивным, как KV-кэш? И не потребуют ли субагенты хранения KV-кэша?

Вспомните предыдущий пример: общее состояние KDA по 69 слоям составляет 0,22 ГБ. Таким образом, даже если вы кэшируете/делаете снимок его состояния каждые 20K токенов во время длинной сессии, это будет 50 раз на протяжении контекста в 1M.

Таким образом, эти 50 снимков займут 50 * 0,22 ГБ. В сумме это всего 11 ГБ — общий объем (29,22 ГБ + 11 ГБ) остается значительно ниже 107 ГБ, необходимых для All MLA при контексте в 1M токенов.

Во-вторых, утверждение Funda AI заключалось в том, что главные агенты могут порождать субагентов. Люди будут порождать множество субагентов. Но обычно, как только субагент возвращает управление главному агенту, его задача выполнена. Его KV + состояние удаляются. Таким образом, даже если люди запускают агентов, которые запускают сотни субагентов, потребности в KV + состоянии не являются долгосрочными. Состояние главной сессии / главного агента должно сохраняться гораздо дольше; и именно здесь KDA очень экономит!!!

Существуют паттерны с долго работающими асинхронными агентами, в таких случаях их KV + состояние необходимо поддерживать. Но я вижу, что эти паттерны реализуются редко. Это не значит, что в будущем это не изменится.

Синхронные субагенты (очень распространенный паттерн):

GDP - inline image

Асинхронные субагенты (относительно редкий паттерн)

GDP - inline image

Окажет ли тогда принятие KDA понижательное влияние на спрос на память?

Я не предсказатель, но существует небольшая, но ненулевая вероятность того, что это может лопнуть пузырь на рынке памяти.

Во-первых, почему это может не повлиять на спрос на память:

  • Хотя экономия реальна, если открытый ИИ получит широкое распространение, большинство развертываний не будут такими же эффективными, как в закрытых передовых лабораториях. Следовательно, любой выигрыш на уровне модели будет потерян на уровне индустрии. У нас будет большое количество небольших развертываний, которые не очень эффективны. Например, у большинства предприятий и правительств использование происходит в течение 12 часов в день. Что будет делать их инфраструктура для моделей с открытым исходным кодом и ее память ночью? Инфраструктура в крупных лабораториях используется 24/7 из-за глобальной клиентской базы.
  • Кроме того, мы делаем большое предположение, что ведущие лаборатории еще не имеют подобных подходов. OpenAI, Anthropic, DeepMind нанимают одних из самых умных людей в мире. Так что существует довольно высокая вероятность того, что такие инновации уже используются и учтены в спросе на память.

Тем не менее, время от времени появляется SpaceX, которая показывает лидерам индустрии, насколько неэффективными были их подходы. Они мыслят с точки зрения первых принципов. Действующие игроки — из-за проблем с организационной структурой или из-за недостаточной мотивации — не внедряют инновации по ключевым направлениям. История капитализма полна тысяч таких примеров...

GDP - inline image

Так что это маловероятный сценарий — но все же с некоторой ненулевой вероятностью — что, если бы крупные лаборатории не были так ограничены в ресурсах, они, возможно, не исследовали все пространство дизайна, чтобы так сильно снизить спрос на память.

В самой индустрии ИИ это происходило много раз, когда крупные лаборатории проявляли грубую некомпетентность:

  1. Конвейер обучения XAI имел плохой MFU (утилизация GPU) — из-за привычки решать проблемы, закидывая их вычислительными мощностями, плюс другие проблемы с конфигурацией кластера и организационные проблемы.
  2. Несмотря на все ресурсы в их распоряжении, Meta смогла обучить дрянную версию MoE от DeepSeek для Llama 4.
  3. Google потребовалось 1,5 года с момента запуска ChatGPT, чтобы вывести Gemini на передовые позиции, и до сих пор это ничья любимая модель для самого популярного случая использования: ИИ-программирования.
GDP - inline image

Ограничения стимулируют инновации, поэтому вполне вероятно, что небольшие, хорошо организованные команды могут превзойти крупные, богатые ресурсами команды. И теперь, когда K3 выпущен и его архитектура хорошо известна, если техника, подобная KDA, которая теперь успешна на передовом уровне, будет принята и закрытыми лабораториями; это означает снижение спроса на память как минимум на 75% для некоторых лабораторий, а они сами по себе довольно велики, так что влияние может исчисляться десятками миллиардов.

Эта экономия памяти, безусловно, может быть съедена возросшим использованием из-за снижения стоимости (парадокс Джевонса), но не гарантировано, что рост потребления всегда будет опережать экономию...

GDP - inline image

Распространение других инноваций: главная инновация Kimi K3 — это не только KDA!

Kimi K3 полностью избавляется от позиционного кодирования: Позиционные кодировки сообщают, каков порядковый номер каждого токена в контексте. Его слои KDA, из-за их рекуррентной природы, не нуждаются в позиционных кодировках. Они избавляются от них даже для слоев MLA, и это не вредит. Преимущества? Не требуется никаких особых усилий для расширения длины контекста модели по сравнению с более ранними моделями. Элегантно.

Kimi K3 реализует остаточное внимание в масштабе 2,8T: Это гарантирует, что более высокие слои могут избирательно обращать внимание на входные данные от более низких слоев. В более ранних подходах более высокие слои не могли различать входные данные от более низких слоев на данной позиции токена, так как все значения агрегировались. Этот новый подход дает модели гораздо большую различительную способность. (https://arxiv.org/pdf/2603.15031

Kimi K3 реализует Stable Latent MoE от Nvidia: Основное преимущество стабильной латентной архитектуры Mixture-of-Experts (LatentMoE) заключается в более высокой точности модели и большей емкости экспертов при той же или меньшей стоимости вывода. Это достигается путем проецирования представлений токенов в меньшее латентное пространство перед выполнением маршрутизации и вычислений экспертов. Они позаимствовали это из статьи Nvidia от января 2026 года (https://arxiv.org/pdf/2601.18089v1

GDP - inline image

Со всеми этими инновациями вместе взятыми, команда MoonShot добилась 2,5-кратной эффективности обучения по сравнению с их предыдущей архитектурой Kimi K2. Это означает, что они достигают таких же потерь при валидации, используя в 2,5 раза меньше FLOPs. Это огромная экономия даже для вычислительных мощностей обучения!!!! Это позволит большему количеству лабораторий обучать такие масштабные модели с ограниченными вычислительными ресурсами...

GDP - inline image

С K3 Moonshot открыла новые законы масштабирования. Kimi K3 достигает 2,5-кратного увеличения эффективности масштабирования по сравнению с Kimi K2

MoonShot также открыла исходный код своего GPU-ядра FlashKDA для быстрого вычисления состояния KDA и MoonMoE для диспетчеризации и объединения токенов. Они довольно уверены в том, что делятся таким объемом знаний, потому что они уже работают над следующим набором инноваций, которые продвинут их еще дальше (в конце концов, они тоже капиталисты).

GDP - inline image

Законы масштабирования — это не законы природы, мы всегда можем найти лучшие

Более того, мы можем открыть новые законы масштабирования с новыми архитектурами и парадигмами обучения, предлагающими еще более плотный интеллект. Законы масштабирования — это статистические наблюдения, это не законы природы, которые нельзя изменить. Это означает, что с новыми моделями, меньшего размера (и с меньшим KV и состоянием), мы можем добиться лучшей производительности. Таким образом, взрывной рост спроса не означает вечного использования одних и тех же больших моделей. Модели будут продолжать становиться более плотными с точки зрения интеллекта.

У нас есть экосистема в виде китайских лабораторий, которая сильно ограничена и очень способна — очень мощная смесь, как уже обсуждалось. Они открывают уголки пространства дизайна, которые не были открыты более финансируемыми лабораториями. Они добиваются быстрого прогресса благодаря открытому обмену знаниями. Это избавляет других от траты усилий и изобретения велосипеда. Эволюция архитектуры происходит гораздо быстрее, чем в противном случае...

Кроме того, этот успех команды MoonShot обязательно вдохновит другие не менее способные команды в DeepSeek, ZAI, MiniMax, Tencent, Alibaba, ByteDance SEED и даже emerging players, такие как Baidu, Ant Ling, Xiaomi Mimo, Meituan и многие другие, стремиться быть лучшими, не просто как модель с открытым исходным кодом, но быть лучшими в целом.

Много новых инноваций произойдет и в emerging labs на Западе, будь то в xAI или MSL, теперь, когда они взялись за ум и начали выпускать отличные модели.

Тем не менее, как я постоянно указываю, в Китае самое большое количество молодых исследователей ИИ согласно статистике NEURIPS. Вклад в эту область непропорционально велик со стороны более молодых исследователей (исходная ветка), поэтому из этой части мира, вероятно, появится еще больше прорывов.

GDP - inline image

В Китае также есть три крупных городских центра с плотностью талантов в области ИИ, соперничающей с Кремниевой долиной; они действуют как плавильные котлы для идей (исходная ветка).

GDP - inline image

Запрет открытого ИИ не поможет:

Неутешительным выводом из этого обсуждения может быть то, что мы должны запретить открытый ИИ для защиты западных рынков. Но это было бы крайне контрпродуктивно.

Будет открытый ИИ запрещен на Западе или нет, эти пространства дизайна будут исследованы, и статьи будут опубликованы. На Западе также появляется много новых отличных лабораторий. Они тоже откроют много новых идей, теперь, когда стало понятно, что все еще возможна значительная экономия эффективности.

Лучшее, что можно сделать, — это поощрять и внедрять эти инновации, быть ответственными в инвестициях и избегать безрассудных спекуляций.

Будущее благодаря этой технологии очень и очень светлое, но мы должны быть осторожны, чтобы не стать безумными спекулянтами, которые получают margin call.

Мы не используем ИИ так много, как могли бы: будь то в корпоративном мире, образовании, исследованиях или развлечениях.

  1. В то время как программирование было основным направлением использования токенов GenAI, такие приложения, как CoWorker, только начинаются.
  2. Мне бы хотелось, чтобы каждый студент в Индии имел неограниченный доступ к моделям уровня Opus 4.8 или Kimi K3. У них есть доступ, но только к более слабым моделям.
  3. Более того, у нас могут быть гораздо более ценные варианты использования ИИ в науке, инженерии и медицине.
  4. Кроме того, у нас стареющий мир, о котором нужно заботиться. ИИ будет там чрезвычайно полезен. Существует так много возможностей и в сфере развлечений, и в играх. Как упомянул Дженсен Хуанг: «каждый пиксель, который мы видим на экране для развлечения, будет сгенерирован».

Заключение:

GDP - inline image
GDP - inline image

Биржевой крах 1929 года — Великая депрессия — не был результатом разрушения спроса. Это был результат спекулятивных излишеств. Весь мир страдал два десятилетия. Можно утверждать, что это привело к подъему фашизма и Второй мировой войне.

Хотя будущее неопределенно, в моих наблюдениях ясно одно: быки по ИИ и, в частности, по памяти, не учитывают алгоритмические инновации и открытие новых законов масштабирования. Для них все пожирается парадоксом Джевонса, поэтому это неинтересно. Это отношение проникло и в розничных инвесторов и привело к безумному поведению, которое может обрушить экономику нескольких стран. Я хочу внести новые углы в их анализ. У них есть гораздо лучшая информация о ситуациях в цепочках поставок и корпоративных доходах. Я хочу вооружить их более технической перспективой.

Чтобы обрушить акции памяти и ИИ, нам не нужно массовое сокращение спроса, как указала Джая Гупта. Даже небольшое сокращение спроса может запустить теоретико-игровую конкуренцию, в которой существующие держатели мешков начнут фиксировать прибыль с намерением купить акции позже, что может обрушить весь рынок. И, похоже, это уже началось...

Важно не допускать образования таких больших пузырей и их катастрофического лопания для общества. В целом, я остаюсь очень оптимистичным в отношении потенциала этой технологии (и даже спроса на память) и будущего строительства инфраструктуры. Это самое захватывающее время, чтобы быть живым!

(НЕ ИНВЕСТИЦИОННАЯ РЕКОМЕНДАЦИЯ)

Приложение

Детальный расчет экономии памяти:

Чтобы показать, насколько хорош Kimi K3, я попросил сам K3 выполнить эти расчеты, и я проверил, что они верны. Как упоминалось ранее, мы рассматриваем два случая:

1) Kimi K3: 69 KDA + 24 Gated MLA полное внимание vs

2) Full MLA: 93 MLA полное внимание

GDP - inline image
GDP - inline image
GDP - inline image
Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи