Esta é uma análise completa de A a Z sobre o que realmente é o Kimi K3, o que ele pode fazer e por que está se tornando silenciosamente o modelo de codificação mais importante sobre o qual ninguém está falando ainda.
Marque esta página para não perder este artigo.
2,8 trilhões de parâmetros. 1 milhão de tokens de contexto.
Aqui está tudo sobre ele.
Antes de Falarmos sobre Benchmarks, Vamos Falar sobre o que Acabou de Acontecer
Nos últimos três anos, a história tem sido a mesma: laboratórios americanos constroem a fronteira, laboratórios chineses constroem a cópia barata seis meses depois.
Em 16 de julho, a Moonshot AI lançou o Kimi K3.
https://x.com/Kimi_Moonshot/status/2077830229968683203
2,8 trilhões de parâmetros totais — aproximadamente 75% maiores que o DeepSeek V4 Pro e quase 4x a série GLM 5 da Zhipu. O maior modelo de código aberto já lançado.
Ele supera o Claude Opus 4.8. Supera o GPT-5.6 Sol. E nos benchmarks da Moonshot, ele está no mesmo nível do Fable 5 — o modelo mais capaz disponível ao público hoje.
A história da cópia acabou.
Os Números

Aquela última linha é a que as pessoas estão interpretando errado. Vamos lidar com ela direito.
A Realidade dos Preços — Leia Isto com Atenção
O Kimi K3 não é um modelo de desconto. A US$ 3/US$ 15 por milhão de tokens, ele tem um preço aproximadamente no nível do Claude Sonnet — não nos grandes descontos que os lançamentos anteriores da Moonshot ofereciam.
Então, de onde vem o "5x mais barato que o Fable 5"?
Custo por tarefa, não preço por token.
O K3 usa substancialmente menos tokens de saída para concluir o mesmo trabalho. Em uma tarefa de codificação representativa: o Fable 5 custa cerca de US$ 1,30. O K3 custa cerca de US$ 0,25.
Mesmo nível de saída. Menos tokens. Conta total mais baixa.
O enquadramento honesto: Preço de Sonnet, experiência de nível Fable. Você não está comprando os tokens mais baratos do mercado. Você está comprando capacidade de fronteira a um preço intermediário, e chegando lá com menos etapas.
Se você está comparando preços brutos de tokens, o K3 parece comum. Se você está comparando o custo para concluir um trabalho, a conversa é completamente diferente.
Onde o Kimi K3 é Estado da Arte
De acordo com os benchmarks publicados pela Moonshot, o K3 define o estado da arte em:
- HLE com ferramentas — O Último Exame da Humanidade, aumentado com ferramentas
- SWE-Bench Pro — engenharia de software do mundo real
- SWE-Bench Multilingual — engenharia em vários idiomas
- BrowseComp — navegação na web e pesquisa
- Toolathlon — uso de ferramentas em escala
- CharXiv com Python — raciocínio com gráficos e figuras
- MathVision com Python — matemática visual

Contra a concorrência: supera Opus 4.8 e GPT-5.6 Sol, está no mesmo nível do Fable 5.
Em testes cegos pelo avaliador de IA Arena, os desenvolvedores preferiram o Kimi a todos os principais modelos dos EUA.
As Duas Inovações de Arquitetura Que Realmente Importam
Esta é a parte que a maioria das coberturas está pulando, e é a coisa mais interessante no lançamento.

- Kimi Delta Attention (KDA)
Um mecanismo de atenção linear híbrido. O resultado: até 6,3x mais rápida na decodificação em contextos de milhões de tokens.
Uma janela de contexto de 1M só é útil se você puder realmente trabalhar nela sem esperar para sempre. A KDA é o que torna a janela de contexto prática em vez de teórica.
- Attention Residuals (AttnRes)
Um substituto direto para conexões residuais. Entrega aproximadamente 25% maior eficiência de treinamento com menos de 2% de custo adicional.
Ambas as técnicas foram publicadas como pesquisa aberta pela equipe da Moonshot no GitHub antes do modelo ser lançado. Isso não é marketing — é um trabalho verificável por pares.
E, combinadas, elas explicam a eficiência de tokens: o K3 usa 21% menos tokens de saída que o K2.6 em tarefas equivalentes.
A Parte Que Deveria Te Deixar Boquiaberto: K3 Otimizou Sua Própria Arquitetura
A Moonshot deu ao K3 a implementação do Attention Residuals — seu próprio componente arquitetural — e um objetivo: torná-lo mais rápido no hardware H200 sem alterar o comportamento numérico.
Então eles o deixaram sozinho.
20 horas de experimentos. Zero intervenção humana. Aceleração de 1,6x.
Em uma execução separada, o K3 reduziu o tempo de forward/backward do FLA Triton AttnRes de 283,6ms para 114,4ms — uma aceleração de 2,48x — novamente sem alterar os números.

E ele iterou mais rápido que o Fable 5 fazendo a mesma tarefa.
Leia isso de novo. O modelo melhorou o mecanismo que faz o modelo funcionar. Autonomamente. Da noite para o dia.
Isto é o que a "auto-aprimoramento recursivo" parece na prática — não um cenário de ficção científica, mas um trabalho de 20 horas com um resultado mensurável. É a mesma capacidade que a Anthropic sinalizou como motivo de cautela semanas atrás, rodando em um modelo de pesos abertos que qualquer um pode baixar em 27 de julho.
Codificação de Longo Horizonte É o Ponto Principal
O próprio enquadramento da Moonshot: "K3 é o modelo de codificação de código aberto mais poderoso da Moonshot AI até o momento. Operando com supervisão humana mínima, ele pode sustentar longas sessões de engenharia, navegar em repositórios massivos e orquestrar ferramentas de terminal."
As três coisas que importam para o trabalho real de engenharia:
- Sessões sustentadas — o experimento autônomo de 20 horas não é uma demonstração. É o alvo do design.
- Repositórios massivos — uma janela de contexto de 1M com decodificação 6,3x mais rápida significa que você pode colocar uma base de código real no contexto e realmente trabalhar nela.
- Orquestração de ferramentas — Estado da arte em Toolathlon e BrowseComp significa que ele lida com o terminal, o navegador e as chamadas de API sem desmoronar.
A codificação de frontend atinge o nível do Fable 5. Cenas de jogos de qualidade AAA a partir de um único prompt. WebGPU, Three.js, shaders, física — coisas que antes exigiam um estúdio.
Vibe Coding com Kimi K3
É aqui que o modelo deixa de ser um número de benchmark e começa a ser obviamente útil.
A codificação de frontend do K3 está no nível do Fable 5. Na prática, isso significa que a parede entre uma descrição e um produto 3D funcional agora é um único prompt.
O que as pessoas realmente entregaram a partir de prompts únicos:
Jogos — Arenas de combate WebGPU com efeitos visuais. Travessia de cidade 3D baseada em navegador com mecânicas de grappling.
- FPS de zumbis.
- Corrida multiplayer.
- Um emulador de GBA 3D funcional.
- Estrutura completa de MMORPG.
Não é uma "demo parecida com um jogo" — são cenas jogáveis com reações de acerto, feedback de impacto e física que se comporta corretamente.

Objetos 3D com trabalho real de material — Um Rolex com brilho e comportamento de luz corretos. Uma arma do CSGO que se monta e desmonta em 33 peças modeladas individualmente. Uma desmontagem de câmera Sony. Um buraco negro com lente gravitacional. Simulação oceânica com dinâmica de ondas real.

Cenas de física — Simulação de tecido. Colapso estrutural. Colisões de veículos com transferência de momento que parece certa em vez de parecer roteirizada.
O que torna isso diferente das demos anteriores de "IA constrói um site": o K3 lida com os detalhes que normalmente quebram. Iluminação. Sombras. Brilho do material. As 20 pequenas coisas que separam "claramente gerado por IA" de "alguém construiu isso."
Um prompt. Quatro milhões de tokens. Uma cena que antes precisava de uma equipe.
4 Prompts Testados em Batalha (Prontos para Copiar e Colar)
Estes são estruturados para explorar no que o K3 é realmente bom: trabalho de longo horizonte, uso de ferramentas e manter um grande contexto sem se desviar.
Prompt 1 — O Teste de Estresse de Física
Este é o prompt que separa a capacidade real do polimento de demonstração. Se um modelo consegue fazer todas as três cenas com qualidade, é real.
1Construa três cenas de canvas HTML5 autossuficientes com física real.2Sem bibliotecas externas. Tudo em um arquivo por cena.34Cena 1: Um trem descarrilando de uma ponte quebrada na água.5Inclua: momento dos vagões, falha estrutural da ponte,6deslocamento de água no impacto.78Cena 2: Dois carros saltando de rampas e colidindo no ar9sobre um desfiladeiro. Inclua: arcos de trajetória corretos,10transferência de momento na colisão, detritos.1112Cena 3: Um caminhão monstro esmagando uma fileira de carros estacionados.13Inclua: compressão da suspensão, deformação da chapa metálica,14distribuição de peso.1516Requisitos para todas as três:17- A física deve ser calculada, não animada18- Alvo de 60fps19- Inclua um botão de reset20- Comente a matemática da física para que eu possa verificar2122Construa todas as três. Não faça perguntas de esclarecimento.
Prompt 2 — A Tarefa de Repositório de Longo Horizonte
Isto é para o que o K3 foi realmente construído. Aponte-o para uma base de código real e dê a ele um resultado, não uma tarefa.
1Leia toda esta base de código antes de escrever qualquer coisa.23[cole seu repositório, ou aponte para o diretório]45Objetivo: [declare um resultado mensurável — por exemplo, "reduzir6o tempo de resposta da API p95 em 30%" ou "eliminar todas as consultas7N+1 na camada de dados"]89Regras:10- Crie um perfil primeiro. Mostre-me onde o tempo realmente vai11 antes de mudar qualquer coisa.12- Não altere interfaces públicas ou comportamento numérico.13- Execute o conjunto de testes existente após cada alteração.14- Se uma alteração piorar as coisas, reverta-a e diga-me porquê.15- Trabalhe até que o objetivo seja atingido ou você possa provar que16 não é alcançável sem quebrar as regras.1718Relatório no final: o que você mudou, o que ganhou com isso,19o que você tentou que não funcionou.
A linha "o que você tentou que não funcionou" é importante. É o que transforma a saída de um diff em um registro de engenharia.
Prompt 3 — A Construção de Produto 3D
Para qualquer pessoa que trabalhe com frontend, landing pages ou visualização de produtos.
1Construa um [objeto] 3D interativo no navegador.2Arquivo HTML único. Three.js.34O objeto: [descreva-o precisamente — materiais,5número de peças, o que se move]67Deve incluir:8- Propriedades de material corretas (brilho, rugosidade,9 metalicidade quando relevante)10- Iluminação de três pontos com sombras reais11- Controles de órbita12- [Qualquer interação — montagem/desmontagem, animação,13 estados de hover]1415Padrão de qualidade: deve parecer um render de produto,16não uma demo de WebGL. Se um detalhe fosse visível na vida17real, modele-o.1819Construa a coisa toda. Mostre-me o arquivo.
A linha "padrão de qualidade" faz mais trabalho do que qualquer outra coisa no prompt. O K3 responde a padrões, não apenas a instruções.
Prompt 4 — Funcionalidade em Tempo Real com uma Parte Móvel
CRUD full-stack é uma forma de aplicativo. Tempo real é uma forma completamente diferente — o estado precisa permanecer sincronizado entre os clientes, não apenas persistir em um banco de dados. É aqui que muitos modelos silenciosamente desmoronam.
1Adicione uma funcionalidade em tempo real a um aplicativo existente: um sistema2de cursor + comentário colaborativo ao vivo, como o do Figma.34REQUISITOS:5- Conexão WebSocket (use Socket.io ou ws nativo)6- Mostre as posições do cursor de outros usuários conectados em tempo real7- Clique em qualquer lugar para soltar um pino de comentário8- Comentários são atualizados ao vivo para todos os clientes conectados9- Lide com desconexão/reconexão de forma graciosa — sem cursores fantasmas10- Debounce nas atualizações de cursor para não sobrecarregar o socket1112CONSTRUÇÃO:131. Configure o servidor WebSocket142. Construa a conexão do lado do cliente com reconexão automática153. Implemente a transmissão de cursor com debouncing164. Implemente o sistema de pinos de comentário175. Adicione um indicador de presença simples (quem está online)186. Teste com pelo menos 2 clientes simulados para confirmar que a sincronização funciona1920Mostre-me como você testou a sincronização de vários clientes antes de considerar isso concluído.
Resultado esperado: Uma camada de tempo real funcional em 15–30 minutos, com prova visível de que foi testada contra mais de um cliente.

A última linha é a parte importante. Bugs de tempo real não aparecem com apenas uma aba do navegador aberta — eles aparecem com duas. Um modelo que pula o teste de vários clientes vai te entregar um código que parece pronto e não está.
Quando o K3 Dá Errado: Guia de Solução de Problemas
É um modelo novo com arestas reais. Aqui está o que quebra e o que fazer.
- Problema: Ele queima tokens em tarefas triviais
Este é o grande, e é estrutural.
O K3 atualmente vem com apenas um nível de esforço de raciocínio — 'máximo'. Não há um modo "apenas responda rapidamente." Testadores independentes mediram 13.241 tokens de raciocínio para gerar um SVG simples — aproximadamente US$ 0,25 por algo que deveria custar frações de centavo.
A correção:
não direcione trabalho simples para o K3. É um modelo de fronteira com uma única marcha, e essa marcha é "pense muito sobre tudo." Use o K2.7 ou um modelo menor para código padrão, formatação e qualquer coisa mecânica. Guarde o K3 para trabalhos que justifiquem o raciocínio.
Este é o maior erro único que as pessoas cometerão no primeiro mês: tornar o K3 o padrão para tudo e depois se surpreender com a conta.
- Problema: A janela de contexto enche de qualquer maneira
1M de tokens parece infinito até você colocar um repositório real e ele não ser.
A correção:
não despeje tudo. Aponte-o para os diretórios que importam. A força do K3 no trabalho de longo horizonte vem do foco sustentado, não de ter todos os arquivos no contexto. Um conjunto enxuto de 200K do código certo supera um inchado de 900K de todo o monorepo.
- Problema: Ele se desvia em execuções autônomas muito longas
O experimento autônomo de 20 horas é real, mas funcionou porque o objetivo era mensurável — "torne isso mais rápido no H200 sem alterar os números." Dê a ele um objetivo vago e rédea longa, e ele vagará.
A correção:
todo prompt de longo horizonte precisa de uma condição de sucesso verificável. Não "melhore o código." Um número, um teste que passa, um benchmark que se move. Se você não pode afirmar como verificaria se ele teve sucesso, ele se desviará.
- Problema: Você não consegue reproduzir o resultado de benchmark de alguém
Ninguém fora da Moonshot auditou este modelo. Os pesos não serão lançados até 27 de julho. Cada número circulando agora — incluindo neste artigo — é relatado pelo fornecedor.
A correção:
espere até 27 de julho, ou teste em suas próprias tarefas e confie nisso. Suas cinco tarefas reais valem mais do que a tabela de benchmarks de qualquer um.
- Problema: Erros de integração após mudar da OpenAI ou Anthropic
O K3 é compatível com o SDK da OpenAI, o que lida com 90% da migração. Os 10% restantes geralmente são o comportamento de raciocínio — o K3 pensa por padrão e retorna tokens de raciocínio que você pode não estar esperando no tratamento da sua resposta.
A correção:
verifique sua contabilidade de tokens e seu parsing de resposta antes de assumir que o modelo está quebrado. A maioria das reclamações "K3 é caro" são na verdade "esqueci que tokens de raciocínio são tokens de saída."
O Contexto Que Ninguém Deve Ignorar
A Moonshot está sediada em Pequim, fundada por Yang Zhilin, um ex-pesquisador do Google, e apoiada pela Alibaba.
https://x.com/kirillk_web3/status/2057528102368977328
Eles construíram um modelo de fronteira de 2,8 trilhões de parâmetros sob três anos de crescentes controles de exportação dos EUA sobre chips avançados.
Os analistas do Bank of America disseram diretamente: "Apesar das persistentes restrições de capacidade de hardware/computação na China, o K3 demonstra que o escalonamento de pré-treinamento, combinado com inovação arquitetural, ainda pode entregar ganhos de mudança de patamar para modelos chineses emblemáticos."
E o momento não é acidental: o K3 chegou dias antes da Conferência Mundial de Inteligência Artificial de 2026 em Xangai.
A Pergunta de 27 de Julho
Os pesos serão lançados em 27 de julho. Essa data importa mais do que a data de lançamento.
Até lá, o K3 é um modelo de fronteira que você pode usar através de uma API — impressionante.
Em 27 de julho, ele se torna outra coisa: um modelo de classe de fronteira que qualquer um pode baixar, inspecionar, modificar e executar em seu próprio hardware. Sem API. Sem limites de uso. Sem termos de serviço. Sem retenção de prompt de 30 dias.
Essa é a verdadeira história. Não "China alcançou."
A China alcançou e distribuiu de graça.

Vale notar: reguladores chineses têm discutido seus próprios controles de exportação de IA. Se o K3 é o último lançamento de fronteira de código aberto da China ou o primeiro de muitos, é genuinamente incerto no momento.
Como Experimentar
Chat: kimi.com — K3 está ativo agora
API: Compatível com o SDK da OpenAI, então se você já está construindo com as toolchains da OpenAI ou Anthropic, a integração é uma mudança de configuração, não uma reescrita
Pesos: 27 de julho
A compatibilidade com o SDK é um negócio maior do que parece. Trocar modelos geralmente significa reescrever sua camada de integração. Aqui, significa mudar uma URL base e uma string de modelo.
Como Instalar o Kimi Code (O Agente de Terminal)
Se você quiser o K3 rodando dentro da sua base de código real em vez de uma janela de chat, esta é a configuração.

Requisitos:
- Um computador (Mac, Windows ou Linux)
- Acesso ao terminal
- Conta Kimi — kimi.com
Passo 1 — Instalar o Kimi Code
Mac/Linux:
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
Windows (PowerShell):
1irm https://code.kimi.com/kimi-code/install.ps1 | iex
No Windows, instale o Git for Windows primeiro — a CLI do Kimi Code usa o Git Bash agrupado como ambiente de shell.
Verifique a instalação:
1kimi --version
Devido ao Gatekeeper do macOS, a primeira execução pode demorar consideravelmente mais. Adicione seu aplicativo de terminal em Ajustes do Sistema → Privacidade e Segurança → Ferramentas de Desenvolvedor para acelerar inicializações futuras.
Se você já tiver o uv instalado, pode instalar diretamente:
1uv tool install --python 3.13 kimi-cli
A CLI do Kimi Code suporta Python 3.12–3.14, com 3.13 recomendado para melhor compatibilidade.
Passo 2 — Navegue até seu projeto e inicie
1cd seu-projeto2kimi
Na primeira inicialização, execute /login dentro da sessão para configurar sua fonte de API — ele abre uma janela do navegador para OAuth.
Passo 3 — Dê a ele uma tarefa
O Kimi Code agora está rodando dentro do seu projeto, com acesso direto de leitura/escrita a todos os arquivos. Descreva uma tarefa em inglês simples — ele planeja as etapas, edita o código, executa testes e relata o que fez.
O Que Isso Realmente Significa
Se você está executando cargas de trabalho de produção:
Teste antes de mudar. Benchmarks de fornecedores e desempenho no mundo real divergem constantemente. Escolha cinco tarefas reais, execute o K3 e seu modelo atual lado a lado, meça o custo por trabalho concluído — não o custo por token.

A matemática por tarefa é todo o argumento. A US$ 3/US$ 15, o K3 não é barato no papel. Com 21% menos tokens e saída de nível Fable, é barato onde importa.
27 de julho muda o cálculo. Pesos abertos significam auto-hospedagem, fine-tuning e dependência zero de qualquer API permanecer online ou de quaisquer termos permanecerem favoráveis. Para qualquer coisa sensível, isso não é pouca coisa.
Conclusão
A fronteira costumava ser um lugar que laboratórios americanos construíam e todos os outros visitavam seis meses depois.
2,8 trilhões de parâmetros. 1M de contexto. Codificação de nível Fable 5 a preço de Sonnet. Construído sob controles de exportação, pelo laboratório de menor valor na sala, e distribuído de graça em 27 de julho.
A questão interessante não é se o K3 vence o Fable 5 em algum benchmark. É o que acontece com a economia dos modelos de fronteira fechados quando um de pesos abertos os iguala.
Links
- Kimi K3: https://www.kimi.com
- Meu Telegram: https://t.me/kirillk_web3
- Meu Twitter/X: https://x.com/kirillk_web3
- Hospedagem Parceira: https://ishosting.com/affiliate/NzE0MiM2
Siga para mais informações sobre Vibe Coding. Obrigado por ler!





