Economia de memória do Kimi K3 vs. Paradoxo de Jevons: Uma análise tecnológica e histórica profunda

@bookwormengr
INGLÊShá 2 dias · 29 de jul. de 2026
155K
449
43
5
970

TL;DR

Esta análise explora a arquitetura KDA do Kimi K3, que utiliza atenção linear híbrida para alcançar uma economia massiva de memória sem sacrificar o desempenho de fronteira, impactando potencialmente o mercado de ações de memória para IA.

Um dos detalhes que chamou a atenção da comunidade do X é que o Kimi K3 tem estado constante. Em outras palavras, ele não possui um cache KV que cresce linearmente conforme o contexto aumenta ou a conversa se alonga (na maior parte dos casos – veremos detalhes e ressalvas em breve).

Casos de uso de contexto longo – como codificação agêntica – aumentaram drasticamente a demanda por memória, resultando em um aumento de 10 a 30 vezes nos preços das ações de memória. Se você não precisa de tanta memória para armazenar o cache KV, esse aumento de preço é justificado? Há um debate vibrante sobre esse assunto no X.

Os detratores dizem que a atenção linear híbrida usada pelo Kimi K3, chamada Kimi Delta Attention (KDA), já existe há algum tempo. Portanto, isso já está precificado nos preços das ações de memória.

No entanto, eles perdem o ponto principal – ao contrário das tentativas anteriores – o Kimi K3 provou que a atenção linear híbrida poderia funcionar muito bem em uma escala de 1 trilhão+ de parâmetros e entregar desempenho de fronteira. **Esta é uma informação COMPLETAMENTE NOVA e merece atenção séria. Antes do Kimi K3, acreditava-se que a atenção linear híbrida não era uma técnica para a fronteira, mas apenas um truque interessante usado por empresas como

**- Qwen (que nunca chega de fato à fronteira) ou

  • Nvidia (que tenta de tudo, só porque tem GPUs infinitas).

Vamos mergulhar!

(Quero deixar claro – ISTO NÃO É UM CONSELHO DE INVESTIMENTO).

Breve histórico da atenção linear híbrida:

Modelos lineares sempre foram muito promissores no papel, assim como o comunismo.

Em vez de um cache KV que cresce constantemente à medida que o contexto aumenta, eles têm um estado constante que é atualizado. O tamanho do estado é constante, quer você tenha mil tokens ou um milhão de tokens.

Parece bom demais para ser verdade, porque é! Modelos lineares têm problemas para recuperar conteúdo de partes anteriores da conversa perfeitamente – por exemplo, um número de telefone do início da conversa.

Por quê? Isso ocorre porque esses modelos estão constantemente atualizando seu 'resumo' interno (chamado de estado) do contexto. No entanto, como esse contexto/resumo tem um tamanho fixo (por exemplo, 128\128 no caso do Kimi K3, por cabeça), sua capacidade de armazenamento é limitada. Ele comprime informações para ser eficiente (é isso que o modelo aprende durante o treinamento), mas com certeza precisa descartar algumas informações. Em outras palavras, a compressão é com perdas.*

Uma maneira de resolver o problema é optar pela 'atenção linear híbrida', onde você combina camadas lineares (tipicamente 75%) com camadas de atenção total (25%). A atenção linear híbrida também pode ter uma versão eficiente da atenção total (por exemplo, o MLA estilo DeepSeek no caso do Kimi K3). Embora isso tenha sido tentado, os modelos lineares híbridos anteriores não tinham desempenho no nível de fronteira!

O que o Kimi K3 mostrou é que – com sua variação chamada Kimi Delta Linear Attention (KDA) – você pode alcançar uma recuperação quase perfeita, tão boa quanto a de modelos que usam atenção total em todas as camadas. Isso é um avanço massivo, independentemente do que lhe disseram sobre isso….

Como o Kimi K3 conseguiu isso?

A Moonshot não é a primeira a usar atenção linear híbrida, mas eles criaram uma variação altamente eficaz. Ela permite um controle refinado sobre o decaimento da memória.

Claro, eles fizeram muitas outras coisas, envolvendo engenharia de dados, desenvolvimento de kernels, uso de resíduos de atenção, MoE latente estável, etc. (vamos entender isso no final). Mas eles fizeram algo aparentemente simples que resultou em um ganho excepcional de desempenho na parte de atenção.

O estado KDA do modelo pode ser pensado essencialmente como uma pilha de memórias (versão simplificada). A cada nova posição de token, uma matriz diagonal é calculada e o estado é multiplicado por ela. Isso resulta em esquecer algumas memórias mais e outras menos (jargão: decaimento por canal). Em versões anteriores, você esqueceria todas as memórias na mesma proporção. Esse truque de esquecer seletiva e criteriosamente melhorou significativamente o desempenho!

GDP - inline image

Esta é uma visualização bonita que mostra como as atualizações da matriz de estado acontecem. Terei outro blog em breve explicando como isso leva ao santo graal do "aprendizado contínuo".

GDP - inline image

Quanta economia de memória há com o Kimi K3?**

O K3 tem 93 camadas e 96 cabeças. O KDA tem dimensões dv e dk de 128.

GDP - inline image

Vamos ver o que é necessário para processar 128 mil tokens e 1 milhão de tokens em termos de armazenamento de estado e KV. Vamos considerar dois casos:

1) 93 camadas de atenção total MLA (All-MLA) vs

2) 69 KDA + 24 atenção total MLA (modelo Kimi K3 real, conforme mostrado acima)

No final do artigo, publiquei os cálculos.

**Observações principais:

**1. Para All-MLA, o armazenamento do cache KV cresce de 13,7 GB para 107 GB, de 128 mil para 1 milhão de tokens.

  1. Como você pode ver, o estado KDA para o Kimi K3 é constante em 0,22 GB, independentemente do comprimento do contexto. Apenas a parte MLA cresce de 3,5 GB para 29 GB, de 128 mil para 1 milhão de tokens de contexto.

Em ambos os casos, há uma economia de cerca de 73%. A beleza é que o KDA não compromete o desempenho de fronteira enquanto oferece essas economias. O MLA já é uma economia massiva em relação ao MHA e GQA (quase 90%), o KDA economiza 73%!

Alguns argumentarão que as economias com a arquitetura DeepSeek V4 na escala do Kimi K3 seriam ainda maiores. Verdade, o DeepSeek V4 ainda não está na fronteira. E mesmo que chegue lá, ele melhorará exatamente na mesma direção: menos armazenamento.

GDP - inline image

Esta bela visualização produzida pelo próprio Kimi K3 mostra as economias:

GDP - inline image

O Kimi K3 é único no setor quando se trata de uma economia de memória tão dramática?

O DeepSeek V4 (https://arxiv.org/pdf/2606.19348v1) fez um trabalho excepcional na redução do cache KV em 98%, mas ninguém o considera próximo da fronteira. Quando o DeepSeek V4 foi lançado, você observou o mesmo nível de atividade no X?

Além disso, apesar de toda a sua genialidade, todas as camadas do DeepSeek V4 são CSA (Compressed Sparse Attention) ou HCA (Highly Compressed Attention) – ambos os tipos são comprimidos ao longo da dimensão da sequência e têm perdas. Não há uma única camada que tenha informações não comprimidas, ou seja, todas as camadas têm perdas – no Kimi K3, 25% das camadas têm atenção total.

Minha hipótese é que o Kimi K3 terá melhor capacidade de recuperar informações específicas de contextos anteriores em cenários de contexto longo. Portanto, prevejo que a arquitetura do Kimi K3 será amplamente adotada por outros laboratórios também (por exemplo, ZAI, MiniMax, Qwen, Tencent, Xiaomi, etc.), assim como o DeepSeek V3 (MLA) e, posteriormente, o DeepSeek V3.2 (MLA + DSA) se tornaram difundidos no setor.

GDP - inline image

CSA do DeepSeek. Observe a compressão ao longo da dimensão da sequência. Resulta em 1 token comprimido para cada 4 tokens.

**

GDP - inline image

HCA do DeepSeek. Observe a compressão ao longo da dimensão da sequência. Resulta em 1 token comprimido para cada 128 tokens.

E quanto ao ponto da Funda AI de que você precisa armazenar em cache o estado KDA várias vezes, já que ele não é aditivo como o cache KV? Além disso, os subagentes não precisarão de armazenamento de cache KV?

Lembre-se do exemplo anterior, o estado KDA total em 69 camadas é de 0,22 GB. Então, mesmo quando você o armazena em cache/instantâneo a cada 20 mil tokens durante uma sessão longa, são 50 vezes ao longo de 1 milhão de contexto.

Portanto, esses 50 instantâneos ocuparão 50 * 0,22 GB. Tudo isso soma apenas 11 GB – o total (29,22 GB + 11 GB) fica bem abaixo dos 107 GB necessários para o All-MLA em um contexto de 1 milhão de tokens.

Segundo, o ponto da Funda AI era que agentes principais podem gerar subagentes. As pessoas gerarão muitos subagentes. Mas, normalmente, quando um subagente retorna o controle ao agente principal, seu trabalho está concluído. Seu KV + estado é excluído. Portanto, mesmo que as pessoas lancem agentes que lancem centenas de subagentes, as necessidades de KV + estado não são de longo prazo. O estado do agente principal/sessão principal precisa ser preservado por muito mais tempo; e é aí que o KDA economiza muito!!!

Existem padrões com agentes assíncronos de longa duração; nesses casos, seu KV + estado precisariam ser mantidos. Mas vejo esses padrões raramente implementados. Isso não quer dizer que não mudará no futuro.

Subagentes síncronos (um padrão muito comum):

GDP - inline image

Subagentes assíncronos (um padrão relativamente raro)

GDP - inline image

A adoção do KDA terá então um impacto negativo na demanda por memória?

Não sou vidente, mas há uma pequena e não nula probabilidade de estourar a bolha da memória.

Primeiro, por que pode não ter impacto na demanda por memória:

  • Embora as economias sejam reais, se a IA de código aberto for amplamente adotada, a maioria das implantações não será tão eficiente quanto nos laboratórios de fronteira fechados. Portanto, quaisquer ganhos no nível do modelo serão perdidos no nível do setor. Teremos um grande número de pequenas implantações que não são muito eficientes. Por exemplo, para a maioria das empresas e governos, o uso ocorre ao longo de 12 horas por dia. O que a infraestrutura de modelo de código aberto e sua memória farão à noite? A infraestrutura em grandes laboratórios é usada 24 horas por dia, 7 dias por semana, devido à base global de clientes.
  • Além disso, estamos fazendo uma grande suposição de que os principais laboratórios já não possuem abordagens semelhantes. OpenAI, Anthropic, DeepMind empregam algumas das pessoas mais inteligentes do mundo. Portanto, há boas chances de que tais inovações já estejam em uso e tenham sido precificadas na demanda por memória.

Dito isso, de vez em quando surge uma SpaceX que mostra aos líderes do setor como suas abordagens eram ineficientes. Eles pensam a partir dos primeiros princípios. As empresas estabelecidas – devido a problemas de estrutura organizacional ou por não estarem famintas o suficiente – não inovam em dimensões-chave. A história do capitalismo está repleta de milhares desses exemplos….

GDP - inline image

Portanto, é um cenário improvável – mas ainda com alguma probabilidade não nula – de que, se os grandes laboratórios não fossem tão carentes de recursos, eles podem não ter explorado todo o espaço de design para reduzir a demanda por memória a tal ponto.

Na própria indústria de IA, isso já aconteceu muitas vezes antes, onde grandes laboratórios mostraram uma enorme incompetência:

  1. O pipeline de treinamento do XAI tinha baixo MFU (utilização de GPU) – devido ao hábito de jogar poder computacional no problema, além de outras configurações incorretas do cluster e problemas organizacionais.
  2. Apesar de todos os recursos à sua disposição, a Meta treinou uma versão ruim do MoE do DeepSeek para o Llama 4.
  3. O Google levou 1,5 anos desde o lançamento do ChatGPT para trazer o Gemini ao primeiro plano e ainda não é o modelo favorito de ninguém para o caso de uso mais popular: codificação de IA.
GDP - inline image

Restrições forçam a inovação, portanto, não é improvável que pequenas equipes altamente organizadas superem grandes equipes ricas em recursos. E agora que o K3 foi lançado e sua arquitetura é bem conhecida, se uma técnica como a KDA – que agora é bem-sucedida na escala de fronteira – for adotada também por laboratórios fechados; isso significa uma redução de 75% na demanda por memória, pelo menos para alguns laboratórios, e eles são bastante grandes individualmente, então o impacto pode ser na casa das dezenas de bilhões.

Essas economias de memória poderiam ser consumidas pelo aumento do uso devido à redução de custo, com certeza (paradoxo de Jevons), mas não é garantido que o crescimento do consumo sempre superará as economias….

GDP - inline image

Difusão de outras inovações: a principal inovação do Kimi K3 não é apenas o KDA!

O Kimi K3 elimina completamente a codificação posicional: As codificações posicionais informam qual é o número de sequência de cada token no contexto. Suas camadas KDA, devido à sua natureza recorrente, não precisam de codificações posicionais. Eles as eliminam até mesmo para as camadas MLA e isso não prejudica. Benefícios? Não requer nenhum esforço especial para estender o comprimento do contexto do modelo em comparação com modelos anteriores. Elegante.

O Kimi K3 implementa resíduos de atenção na escala de 2,8T: Isso garante, efetivamente, que as camadas superiores sejam capazes de prestar atenção seletiva às entradas das camadas inferiores. Em abordagens anteriores, as camadas superiores não conseguiam distinguir entre entradas de camadas inferiores em uma determinada posição de token, pois todos os valores costumavam ser agregados. Essa nova abordagem dá ao modelo uma discernibilidade muito maior. (https://arxiv.org/pdf/2603.15031

O Kimi K3 implementa o Stable Latent MoE da Nvidia: O principal benefício de uma arquitetura latente Mixture-of-Experts (LatentMoE) estável é maior precisão do modelo e mais capacidade de especialista com o mesmo ou menor custo de inferência. Ele consegue isso projetando representações de tokens em um espaço latente menor antes de executar o roteamento e o cálculo dos especialistas. Eles pegaram isso do artigo de janeiro de 2026 da Nvidia (https://arxiv.org/pdf/2601.18089v1

GDP - inline image

Com todas essas inovações juntas, a equipe MoonShot alcançou uma eficiência de treinamento 2,5 vezes maior em relação à sua arquitetura anterior, Kimi K2. Isso significa que eles alcançam a mesma perda de validação com 2,5 vezes menos FLOPs. Isso é uma economia massiva até mesmo para o treinamento computacional!!!! Isso permitirá que muitos mais laboratórios treinem modelos de escala tão alta com poder computacional limitado….

GDP - inline image

Com o K3, a Moonshot desbloqueou novas leis de escala. O Kimi K3 alcança um ganho de 2,5× em eficiência de escala em relação ao Kimi K2

A MoonShot também disponibilizou como código aberto seu kernel GPU FlashKDA para computação rápida do estado KDA e MoonMoE para despacho e combinação de tokens. Eles estão bastante confiantes em compartilhar tanto conhecimento, porque já estão na próxima série de inovações que os levarão ainda mais longe (no final do dia, eles também são capitalistas).

GDP - inline image

Leis de escala não são leis da natureza, podemos sempre descobrir melhores

Além disso, podemos descobrir novas leis de escala com novas arquiteturas e paradigmas de treinamento, oferecendo inteligência ainda mais densa. Leis de escala são observações estatísticas, não são leis da natureza que não podem ser alteradas. O que isso significa é que, com modelos mais novos, para um tamanho menor (e KV e estado mais baixos), podemos ter um desempenho melhor. Portanto, a explosão da demanda não significa executar os mesmos modelos grandes para sempre. Os modelos continuarão a se tornar mais densos em termos de inteligência.**

Temos um ecossistema na forma de laboratórios chineses que é altamente restrito e altamente capaz – uma mistura muito potente, como discutido. Eles estão descobrindo cantos do espaço de design que não foram descobertos por laboratórios com mais recursos financeiros. Eles fazem progressos rápidos devido ao compartilhamento aberto de conhecimento. Isso evita que outros desperdicem seus esforços reinventando a roda. A evolução da arquitetura acontece muito mais rapidamente do que de outra forma….

Além disso, este sucesso da equipe MoonShot certamente inspirará outras equipes igualmente capazes em toda a DeepSeek, ZAI, MiniMax, Tencent, Alibaba, ByteDance SEED e até mesmo players emergentes como Baidu, Ant Ling, Xiaomi Mimo, Meituan e muitos outros a serem os melhores, não apenas como um modelo de código aberto, mas para serem os melhores em geral.

Muitas novas inovações acontecerão em laboratórios emergentes no Ocidente também, seja na xAI ou MSL, agora que eles se organizaram e começaram a entregar ótimos modelos.

Dito isso, como continuo apontando, a China tem o maior número de jovens pesquisadores de IA, com base nas estatísticas do NEURIPS. As contribuições neste campo vêm desproporcionalmente mais de pesquisadores mais jovens (o tópico de origem), portanto, é provável que surjam muitos mais avanços dessa parte do mundo.

GDP - inline image

A China também tem 3 grandes centros urbanos com densidade de talentos em IA rivalizando com a do Vale do Silício, eles atuam como cadinhos de mistura de ideias (o tópico de origem ).

GDP - inline image

Proibir a IA de código aberto não ajudará:

Uma conclusão infeliz desta discussão pode ser que devemos proibir a IA de código aberto para proteger os mercados ocidentais. Mas isso seria altamente contraproducente.

Independentemente de a IA de código aberto ser proibida ou não no mundo ocidental, esses espaços de design serão explorados e artigos serão publicados. O Ocidente também tem muitos novos e ótimos laboratórios surgindo. Eles também descobrirão muitas ideias novas, agora que se percebeu que ainda pode haver muitos ganhos de eficiência possíveis.

O melhor é incentivar e adotar essas inovações, ser responsável com os investimentos e evitar especulações selvagens.

O futuro é muito, muito brilhante devido a esta tecnologia, mas temos que ter cuidado para não sermos especuladores loucos que recebem chamadas de margem.

Não temos usado tanta IA quanto poderíamos: seja no mundo corporativo, na educação, na pesquisa ou no entretenimento.

  1. Embora a codificação tenha sido o esteio do uso de tokens de GenAI, aplicações como CoWorker estão apenas começando.
  2. Eu adoraria que todos os estudantes na Índia tivessem acesso ilimitado a modelos de nível Opus 4.8 ou Kimi K3. Eles têm acesso, mas apenas a modelos mais fracos.
  3. Além disso, poderíamos ter casos de uso de IA de valor muito maior na Ciência, Engenharia e Medicina.
  4. Além disso, temos um mundo envelhecido do qual precisamos cuidar. A IA será extremamente benéfica nesse aspecto. Existem tantas possibilidades no entretenimento e nos jogos também. Como Jensen Huang mencionou: "cada pixel que vemos na tela para entretenimento será gerado".

Conclusão:

GDP - inline image
GDP - inline image

O crash da bolsa de valores de 1929 – a Grande Depressão – não foi resultado da destruição da demanda. Foi resultado de excessos especulativos. O mundo inteiro sofreu por duas décadas. Argumentavelmente, levou à ascensão do Fascismo e à Segunda Guerra Mundial.

**

Embora o futuro seja incerto, o que está claro em minhas observações é que os otimistas da IA e, em particular, os otimistas da memória, não levam em conta as inovações algorítmicas e a descoberta de novas leis de escala. Para eles, tudo é consumido pelo paradoxo de Jevons, portanto, não é interessante. Essa atitude se infiltrou também nos investidores de varejo e levou a um comportamento insano que tem o potencial de derrubar as economias de vários países. **Quero introduzir novos ângulos em suas análises. Eles têm informações muito melhores sobre as situações da cadeia de suprimentos e lucros corporativos. Quero equipá-los com uma perspectiva mais técnica.

Para derrubar as ações de memória e IA, não precisamos de uma redução massiva na demanda, conforme Jaya Gupta apontou. Mesmo uma pequena redução na demanda pode iniciar uma competição de teoria dos jogos em que os atuais detentores de posições começam a realizar lucros com a intenção de comprar ações depois, isso pode derrubar todo o mercado. E isso parece ter começado….

É importante não deixar que bolhas tão grandes se formem e estourem catastroficamente para a sociedade. No geral, continuo muito otimista sobre o potencial desta tecnologia (e até mesmo da demanda por memória) e a futura construção de infraestrutura. É o momento mais emocionante para estar vivo!

(NÃO É UM CONSELHO DE INVESTIMENTO)

Apêndice

Cálculo detalhado das economias de memória:

Para mostrar o quão bom é o Kimi K3, pedi ao próprio K3 para fazer esses cálculos; verifiquei e estão corretos. Conforme mencionado anteriormente, consideramos dois casos:

1) Kimi K3: 69 KDA + 24 Gated MLA de atenção total vs

2) Full MLA: 93 MLA de atenção total

GDP - inline image
GDP - inline image
GDP - inline image
Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais