Um dos detalhes que chamou a atenção da comunidade do X é que o Kimi K3 possui estado constante. Em outras palavras, ele não tem um cache KV que cresce linearmente à medida que o contexto ou a conversa se alonga (na maior parte dos casos — veremos detalhes e ressalvas em breve).
Casos de uso de contexto longo — como codificação agêntica — aumentaram massivamente a demanda por memória, resultando em um aumento de 10 a 30 vezes nos preços das ações de memória. Se você não precisa de tanta memória para armazenar o cache KV, esse aumento de preço é justificado? Há um debate vibrante sobre esse tópico no X.
Os detratores dizem que a Atenção Híbrida Linear usada pelo Kimi K3, chamada Kimi Delta Attention (KDA), existe há bastante tempo. Portanto, já está precificada nas ações de memória.
No entanto, eles perdem de vista que — ao contrário de tentativas anteriores — o Kimi K3 provou que a Híbrida Linear poderia funcionar tão bem em uma escala de 1T+ parâmetros e entregar desempenho de fronteira. **Isso é INFORMAÇÃO TOTALMENTE NOVA e merece atenção séria. Antes do Kimi K3, acreditava-se que a Híbrida Linear não era uma técnica para a fronteira, mas apenas um truque interessante usado por empresas como:
- **Qwen (que nunca chega realmente à fronteira) ou
- **Nvidia (que tenta de tudo, só porque tem GPUs infinitas).
Vamos mergulhar!
(Quero deixar claro — ISSO NÃO É UM CONSELHO DE INVESTIMENTO).
Breve histórico da Híbrida Linear:
Modelos lineares sempre foram muito promissores no papel, assim como o comunismo.
Em vez de um cache KV que cresce constantemente à medida que o contexto aumenta, eles têm um estado constante que é atualizado. O tamanho do estado é constante, quer você tenha mil tokens ou um milhão de tokens.
Parece bom demais para ser verdade, porque é! Modelos lineares têm problemas para recuperar conteúdo de partes anteriores da conversa perfeitamente — por exemplo, um número de telefone do início da conversa.
Por quê? Isso ocorre porque esses modelos estão constantemente atualizando seu 'resumo' interno (chamado de estado) do contexto. No entanto, como esse contexto/resumo tem um tamanho fixo (por exemplo, 128\128 no caso do Kimi K3, por cabeça), sua capacidade de armazenamento é limitada. Ele comprime informações para ser eficiente (é isso que o modelo aprende durante seu treinamento), mas com certeza precisa descartar algumas informações. Em outras palavras, a compressão é com perdas.*
Uma maneira de resolver o problema é optar pela 'híbrida linear', onde você combina camadas lineares (tipicamente 75%) com camadas de atenção total (25%). A Híbrida Linear também pode ter uma versão eficiente de atenção total (por exemplo, MLA estilo DeepSeek no caso do Kimi K3). Embora isso tenha sido tentado, os modelos híbridos lineares anteriores não tinham desempenho no nível de fronteira!
O que o Kimi K3 mostrou é que — com sua variação chamada Kimi Delta Linear Attention (KDA) — você pode alcançar uma recuperação quase perfeita, tão boa quanto a de modelos que usam atenção total em todas as camadas. Isso é um avanço massivo, independentemente do que lhe disseram sobre isso...
Como o Kimi K3 conseguiu isso?
A Moonshot não é a primeira a usar a híbrida linear, mas eles criaram uma variação altamente eficaz. Ela permite um controle refinado sobre o decaimento da memória.
Claro, eles fizeram muitas outras coisas, envolvendo engenharia de dados, desenvolvimento de kernels, uso de resíduos de atenção, MoE latente estável, etc. (vamos entendê-las no final). Mas eles fizeram algo aparentemente simples que resultou em um ganho excepcional de desempenho na parte de atenção.
O estado KDA do modelo pode ser essencialmente pensado como uma pilha de memórias (versão simplificada). A cada nova posição de token, uma matriz diagonal é calculada e o estado é multiplicado por ela. Isso resulta em esquecer algumas memórias mais e outras menos (jargão: decaimento por canal). Nas versões anteriores, você esqueceria todas as memórias na mesma proporção. Esse truque de esquecer seletiva e criteriosamente melhorou significativamente o desempenho!

Esta é uma visualização bonita que mostra como as atualizações da matriz de estado acontecem. Terei outro blog em breve que explica como isso leva ao santo graal do "aprendizado contínuo".

Quanta economia de memória existe com o Kimi K3?
O K3 tem 93 camadas e 96 cabeças. O KDA tem dimensões dv e dk de 128.

Vamos ver o que é necessário para processar 128K tokens e 1 milhão de tokens em termos de armazenamento de estado e KV. Vamos ver dois casos:
1) 93 camadas de atenção total MLA (All-MLA) vs
2) 69 KDA + 24 atenção total MLA (modelo real Kimi K3 conforme mostrado acima)
No final do artigo, publiquei os cálculos.
Observações principais:
- Para All-MLA, o armazenamento do cache KV cresce de 13,7 GB para 107 GB, de 128K para 1M tokens.
- Como você pode ver, o estado KDA para o Kimi K3 é constante em 0,22 GB, independentemente do comprimento do contexto. Apenas a parte MLA cresce de 3,5 GB para 29 GB, de 128K para 1M tokens de contexto.
Em ambos os casos, há uma economia de cerca de 73%. A beleza é que o KDA não compromete o desempenho de fronteira ao oferecer essas economias. MLA já é uma economia massiva em relação a MHA e GQA (quase 90%), e KDA economiza 73%!
Alguns argumentarão que as economias com a arquitetura DeepSeek V4 na escala do Kimi K3 seriam ainda maiores. Verdade, o DeepSeek V4 ainda não está na fronteira. E mesmo que chegue à fronteira, ele melhorará exatamente na mesma direção: menos armazenamento.

Esta bela visualização produzida pelo próprio Kimi K3 mostra as economias:

O Kimi K3 é único no setor quando se trata de uma economia de memória tão dramática?
O DeepSeek V4 (https://arxiv.org/pdf/2606.19348v1) fez um trabalho excepcional na redução do cache KV em 98%, mas ninguém o considera próximo da fronteira. Quando o DeepSeek V4 foi lançado, você observou o mesmo nível de atividade no X?
Além disso, por toda a sua genialidade, todas as camadas do DeepSeek V4 são CSA (Compressed Sparse Attention) ou HCA (Highly Compressed Attention) — ambos os tipos são comprimidos ao longo da dimensão da sequência e são com perdas. Não há uma única camada que tenha informações descomprimidas, ou seja, todas as camadas são com perdas — no Kimi K3, 25% das camadas têm atenção total**.
Minha hipótese é que o Kimi K3 terá melhor capacidade de recuperar informações específicas de contextos anteriores em cenários de contexto longo. Portanto, prevejo que a arquitetura do Kimi K3 será amplamente adotada por outros laboratórios também (por exemplo, ZAI, MiniMax, Qwen, Tencent, Xiaomi, etc.), assim como o DeepSeek V3 (MLA) e, posteriormente, o DeepSeek V3.2 (MLA + DSA) se tornaram difundidos no setor.

CSA do DeepSeek. Observe a compressão ao longo da dimensão da sequência. Resulta em 1 token comprimido para cada 4 tokens.
**

HCA do DeepSeek. Observe a compressão ao longo da dimensão da sequência. Resulta em 1 token comprimido para cada 128 tokens.
E quanto ao ponto da Funda AI de que você precisa armazenar em cache o estado KDA várias vezes, já que ele não é aditivo como o cache KV? Além disso, os subagentes não precisarão de armazenamento de cache KV?
Lembre-se do exemplo anterior, o estado KDA total em 69 camadas é de 0,22 GB. Então, mesmo quando você o armazena em cache/faz um snapshot a cada 20K tokens durante uma sessão longa, são 50 vezes em um contexto de 1M.
Portanto, esses 50 snapshots ocuparão 50 * 0,22 GB. Tudo isso soma apenas 11 GB — o total (29,22 GB + 11 GB) fica bem abaixo dos 107 GB necessários para All-MLA em um contexto de 1M tokens.
Segundo, o ponto da Funda AI era que os agentes principais podem gerar subagentes. As pessoas criarão muitos subagentes. Mas, normalmente, uma vez que um subagente retorna o controle ao agente principal, seu trabalho está concluído. Seu KV + estado é excluído. Portanto, mesmo que as pessoas lancem agentes que criam centenas de subagentes, as necessidades de KV + estado não são de longo prazo. O estado da sessão principal / do agente principal precisa ser preservado por muito mais tempo; e é aí que o KDA economiza muito!!!
Existem padrões onde há agentes assíncronos de longa duração; nesses casos, seu KV + estado precisariam ser mantidos. Mas vejo esses padrões raramente implementados. Isso não quer dizer que não mudará no futuro.
Subagentes síncronos (um padrão muito comum):

Subagentes assíncronos (um padrão relativamente raro)

A adoção do KDA terá então um impacto negativo na demanda por memória?
Não sou vidente, mas há uma pequena e não nula probabilidade de isso estourar a bolha da memória.
Primeiro, por que pode não ter nenhum impacto na demanda por memória:
- Embora as economias sejam reais, se a IA de código aberto for amplamente adotada, a maioria das implantações não será tão eficiente quanto nos laboratórios de fronteira fechados. Portanto, quaisquer ganhos no nível do modelo serão perdidos no nível do setor. Teremos um grande número de pequenas implantações que não são muito eficientes. Por exemplo, para a maioria das empresas e governos, o uso ocorre ao longo de 12 horas por dia. O que a infraestrutura de modelo de código aberto e sua memória farão à noite? A infraestrutura em grandes laboratórios é usada 24 horas por dia, 7 dias por semana, devido à base global de clientes.
- Além disso, estamos fazendo uma grande suposição de que os principais laboratórios já não possuem abordagens semelhantes. OpenAI, Anthropic, DeepMind empregam algumas das pessoas mais inteligentes do mundo. Portanto, há boas chances de que tais inovações já estejam em uso e tenham sido precificadas na demanda por memória.
Dito isso, de vez em quando surge uma SpaceX que mostra aos líderes do setor como suas abordagens eram ineficientes. Eles pensam a partir dos primeiros princípios. Os incumbentes — devido a problemas de estrutura organizacional ou por não estarem famintos o suficiente — não inovam em dimensões-chave. A história do capitalismo está cheia de milhares desses exemplos...

Portanto, é um cenário improvável — mas ainda com alguma probabilidade não nula — de que, se os grandes laboratórios não fossem tão carentes de recursos, eles poderiam não ter explorado todo o espaço de design para reduzir a demanda por memória a tal ponto.
Na própria indústria de IA, isso já aconteceu muitas vezes antes, onde grandes laboratórios mostraram grossa incompetência:
- O pipeline de treinamento do XAI tinha baixo MFU (utilização de GPU) — devido ao hábito de jogar poder computacional no problema, além de outras configurações incorretas do cluster e problemas de nível organizacional.
- Apesar de todos os recursos à sua disposição, a Meta treinou uma versão horrível do MoE do DeepSeek para o Llama 4.
- O Google levou 1,5 anos desde o lançamento do ChatGPT para trazer o Gemini à vanguarda, e ele ainda não é o modelo favorito de ninguém para o caso de uso mais popular: codificação de IA.

As restrições forçam a inovação, portanto, não é improvável que pequenas equipes altamente organizadas superem equipes grandes e ricas em recursos. E agora que o K3 foi lançado e sua arquitetura é bem conhecida, se uma técnica como a KDA — que agora é bem-sucedida na escala de fronteira — for adotada também por laboratórios fechados; isso significa uma redução de 75% na demanda por memória, pelo menos para alguns laboratórios, e eles são bastante grandes individualmente, então o impacto poderia ser de dezenas de bilhões.
Essas economias de memória poderiam ser consumidas pelo aumento do uso devido à redução de custo, com certeza (paradoxo de Jevons), mas não é garantido que o crescimento do consumo sempre supere as economias...

Difusão de outras inovações: a grande inovação do Kimi K3 não é apenas o KDA!
O Kimi K3 elimina completamente a codificação posicional: As codificações posicionais informam qual é o número de sequência de cada token no contexto. Suas camadas KDA, devido à sua natureza recorrente, não precisam de codificações posicionais. Eles as eliminam até mesmo para as camadas MLA e isso não prejudica. Benefícios? Não requer nenhum esforço especial para estender o comprimento do contexto do modelo em comparação com modelos anteriores. Elegante.
O Kimi K3 implementa resíduos de atenção na escala de 2,8T: Isso garante, efetivamente, que as camadas superiores consigam prestar atenção seletiva às entradas das camadas inferiores. Em abordagens anteriores, as camadas superiores não conseguiam distinguir entre entradas de camadas inferiores em uma determinada posição de token, pois todos os valores costumavam ser agregados. Essa nova abordagem dá ao modelo uma discernibilidade muito maior. (https://arxiv.org/pdf/2603.15031
O Kimi K3 implementa o Stable Latent MoE da Nvidia: O principal benefício de uma arquitetura latente Mixture-of-Experts (LatentMoE) estável é maior precisão do modelo e mais capacidade de especialista com o mesmo ou menor custo de inferência. Ele consegue isso projetando representações de tokens em um espaço latente menor antes de executar o roteamento e o cálculo dos especialistas. Eles pegaram isso do artigo de janeiro de 2026 da Nvidia (https://arxiv.org/pdf/2601.18089v1

Com todas essas inovações juntas, a equipe MoonShot alcançou uma eficiência de treinamento 2,5 vezes maior em relação à sua arquitetura anterior, Kimi K2. Isso significa que eles alcançam a mesma perda de validação com 2,5 vezes menos FLOPs. Isso é uma economia massiva até mesmo para o treinamento computacional!!!! Isso permitirá que muitos mais laboratórios treinem modelos de alta escala com poder computacional limitado...

Com o K3, a Moonshot desbloqueou novas leis de escalonamento. O Kimi K3 alcança um ganho de 2,5× na eficiência de escalonamento em relação ao Kimi K2
A MoonShot também disponibilizou como código aberto seu kernel GPU FlashKDA para cálculo rápido do estado KDA e MoonMoE para despacho e combinação de tokens. Eles estão bastante confiantes em compartilhar tanto conhecimento, porque já estão trabalhando no próximo conjunto de inovações que os levarão ainda mais longe (no final das contas, eles também são capitalistas).

Leis de escalonamento não são leis da natureza, sempre podemos descobrir melhores
Além disso, podemos descobrir novas leis de escalonamento com novas arquiteturas e paradigmas de treinamento, oferecendo inteligência ainda mais densa. Leis de escalonamento são observações estatísticas, não são leis da natureza que não podem ser alteradas. O que isso significa é que, com modelos mais novos, para tamanhos menores (e KV e estado mais baixos), podemos ter melhor desempenho. Portanto, a explosão da demanda não significa executar os mesmos modelos grandes para sempre. Os modelos continuarão a se tornar mais densos em termos de inteligência.
Temos um ecossistema na forma de laboratórios chineses que é altamente restrito e altamente capaz — uma mistura muito potente, como discutido. Eles estão descobrindo cantos do espaço de design que não foram descobertos por laboratórios com mais financiamento. Eles fazem progresso rápido devido ao compartilhamento aberto de conhecimento. Isso poupa outros de desperdiçar seus esforços e reinventar a roda. A evolução da arquitetura ocorre muito mais rapidamente do que de outra forma...
Além disso, esse sucesso da equipe MoonShot certamente inspirará outras equipes igualmente capazes em toda a DeepSeek, ZAI, MiniMax, Tencent, Alibaba, ByteDance SEED e até mesmo players emergentes como Baidu, Ant Ling, Xiaomi Mimo, Meituan e muitos outros a serem os melhores, não apenas como um modelo de código aberto, mas para serem os melhores no geral.
Muitas novas inovações acontecerão em laboratórios emergentes no Ocidente também, seja no xAI ou MSL agora que eles se organizaram e começaram a entregar ótimos modelos.
Dito isso, como continuo apontando, a China tem o maior número de jovens pesquisadores de IA, de acordo com as estatísticas do NEURIPS. As contribuições neste campo vêm desproporcionalmente mais de pesquisadores mais jovens (o tópico de origem), portanto, é provável que muitos mais avanços surjam dessa parte do mundo.

A China também tem 3 grandes centros urbanos com densidade de talento em IA rivalizando com a do Vale do Silício; eles atuam como cadinhos de mistura de ideias (o tópico de origem).

Proibir a IA de código aberto não ajudará:
Uma conclusão infeliz desta discussão pode ser que devemos proibir a IA de código aberto para proteger os mercados ocidentais. Mas isso seria altamente contraproducente.
Se a IA de código aberto for proibida ou não no mundo ocidental, esses espaços de design serão explorados e artigos serão publicados. O Ocidente também tem muitos novos grandes laboratórios surgindo. Eles descobrirão muitas novas ideias também, agora que se percebeu que ainda podem existir muitos ganhos de eficiência.
O melhor é incentivar e adotar essas inovações, ser responsável com os investimentos e evitar especulações selvagens.
O futuro é muito, muito brilhante devido a esta tecnologia, mas temos que ter cuidado para não sermos especuladores loucos que recebem chamadas de margem.
Não estamos usando tanta IA quanto poderíamos: seja no mundo corporativo, na educação, na pesquisa ou no entretenimento.
- Embora a codificação tenha sido o principal uso de tokens de GenAI, aplicações como CoWorker estão apenas começando.
- Eu adoraria que todos os alunos na Índia tivessem acesso ilimitado a modelos de nível Opus 4.8 ou Kimi K3. Eles têm acesso, mas apenas a modelos mais fracos.
- Além disso, poderíamos ter casos de uso de IA de valor muito maior em Ciência, Engenharia e Medicina.
- Além disso, temos um mundo envelhecido pelo qual precisamos cuidar. A IA será extremamente benéfica nesse aspecto. Existem tantas possibilidades no entretenimento e nos jogos também. Como Jensen Huang mencionou: "cada pixel que vemos na tela para entretenimento será gerado".
Conclusão:


O crash da bolsa de valores de 1929 - a Grande Depressão - não foi resultado da destruição da demanda. Foi resultado de excessos especulativos. O mundo inteiro sofreu por duas décadas. Argumentavelmente, levou à ascensão do fascismo e à Segunda Guerra Mundial.
**
Embora o futuro seja incerto, o que está claro nas minhas observações é que os touros da IA e da memória, em particular, não levam em conta as inovações algorítmicas e a descoberta de novas leis de escalonamento. Para eles, tudo é consumido pelo paradoxo de Jevons, portanto, não é interessante. Essa atitude se infiltrou também nos investidores de varejo e levou a um comportamento insano que tem potencial para derrubar as economias de vários países. **Quero introduzir novos ângulos em suas análises. Eles têm informações muito melhores sobre as situações da cadeia de suprimentos e lucros corporativos. Quero equipá-los com uma perspectiva mais técnica.
Para quebrar as ações de memória e IA, não precisamos de uma redução massiva na demanda, como Jaya Gupta apontou. Mesmo uma pequena redução na demanda pode iniciar uma competição de teoria dos jogos na qual os atuais detentores começam a realizar lucros com a intenção de comprar ações mais tarde; isso pode quebrar todo o mercado. E parece que isso já começou...
É importante não deixar que bolhas tão grandes se formem e estourem catastroficamente para a sociedade. No geral, continuo muito otimista quanto ao potencial dessa tecnologia (e até mesmo da demanda por memória) e à futura construção de infraestrutura. É o momento mais emocionante para estar vivo!
(NÃO É UM CONSELHO DE INVESTIMENTO)
Apêndice
Cálculo detalhado das economias de memória:
Para mostrar o quão bom é o Kimi K3, pedi ao próprio K3 para fazer esses cálculos; verifiquei que estão corretos. Conforme mencionado anteriormente, consideramos dois casos:
1) Kimi K3: 69 KDA + 24 Gated MLA atenção total vs
2) Full MLA: 93 MLA atenção total








