Kimi K3: Guia completo de A a Z sobre o modelo aberto que superou o Fable 5

@kirillk_web3
INGLÊShá 2 dias · 19/07/2026
235K
78
16
13
156

TL;DR

O Kimi K3 é um modelo de código aberto de 2,8 trilhões de parâmetros da Moonshot AI que rivaliza com modelos proprietários de alto nível, como o Fable 5. Ele apresenta uma arquitetura inovadora para programação de alta velocidade com contexto longo e autoaperfeiçoamento autônomo.

Este é um guia A–Z completo sobre o que o Kimi K3 realmente é, o que ele pode fazer e por que está se tornando silenciosamente o modelo de codificação mais importante sobre o qual ninguém está falando ainda.

Marque esta página para não perder este artigo.

2,8 trilhões de parâmetros. 1 milhão de tokens de contexto.

Aqui está tudo sobre ele.

Antes de Falarmos sobre Benchmarks, Vamos Falar sobre o que Acabou de Acontecer

Nos últimos três anos, a história tem sido a mesma: laboratórios americanos constroem a fronteira, laboratórios chineses constroem a cópia barata seis meses depois.

Em 16 de julho, a Moonshot AI lançou o Kimi K3.

https://x.com/Kimi_Moonshot/status/2077830229968683203

2,8 trilhões de parâmetros totais — aproximadamente 75% maior que o DeepSeek V4 Pro e quase 4x a série GLM 5 da Zhipu. O maior modelo de código aberto já lançado.

Ele supera o Claude Opus 4.8. Supera o GPT-5.6 Sol. E nos benchmarks da Moonshot, está no mesmo nível do Fable 5 — o modelo mais capaz disponível ao público hoje.

A história da cópia acabou.

Os Números

Kirill - inline image

Aquela última linha é a que as pessoas estão interpretando errado. Vamos lidar com ela corretamente.

A Realidade dos Preços — Leia Isto com Atenção

O Kimi K3 não é um modelo de desconto. A $3/$15 por milhão de tokens, seu preço é aproximadamente o nível do Claude Sonnet — não os grandes descontos que os lançamentos anteriores da Moonshot ofereciam.

Então, de onde vem o "5x mais barato que o Fable 5"?

Custo por tarefa, não preço por token.

O K3 usa substancialmente menos tokens de saída para concluir o mesmo trabalho. Em uma tarefa de codificação representativa: o Fable 5 custa cerca de $1,30. O K3 custa cerca de $0,25.

Mesmo nível de saída. Menos tokens. Conta total mais baixa.

O enquadramento honesto: Preço de Sonnet, experiência de nível Fable. Você não está comprando os tokens mais baratos do mercado. Você está comprando capacidade de fronteira a um preço médio, e chegando lá em menos etapas.

Se você está comparando preços brutos de tokens, o K3 parece comum. Se você está comparando quanto custa para concluir um trabalho, é uma conversa completamente diferente.

Onde o Kimi K3 é State of the Art

De acordo com os benchmarks publicados pela Moonshot, o K3 define SOTA em:

  • HLE com ferramentas — O Último Exame da Humanidade, aumentado com ferramentas
  • SWE-Bench Pro — engenharia de software do mundo real
  • SWE-Bench Multilíngue — engenharia em vários idiomas
  • BrowseComp — navegação na web e pesquisa
  • Toolathlon — uso de ferramentas em escala
  • CharXiv com Python — raciocínio com gráficos e figuras
  • MathVision com Python — matemática visual
Kirill - inline image

Contra a concorrência: supera Opus 4.8 e GPT-5.6 Sol, no mesmo nível do Fable 5.

Em testes cegos pelo avaliador de IA Arena, os desenvolvedores preferiram o Kimi a todos os principais modelos dos EUA.

As Duas Inovações de Arquitetura que Realmente Importam

Esta é a parte que a maioria das coberturas está pulando, e é a coisa mais interessante do lançamento.

Kirill - inline image
  • Kimi Delta Attention (KDA)

Um mecanismo de atenção linear híbrido. O resultado: até 6,3x mais rápido na decodificação em contextos de milhões de tokens.

Uma janela de contexto de 1M só é útil se você puder realmente trabalhar nela sem esperar para sempre. A KDA é o que torna a janela de contexto prática, em vez de teórica.

  • Residuais de Atenção (AttnRes)

Um substituto drop-in para conexões residuais. Oferece aproximadamente 25% mais eficiência de treinamento a um custo adicional inferior a 2%.

Ambas as técnicas foram publicadas como pesquisa aberta pela equipe da Moonshot no GitHub antes do modelo ser lançado. Isso não é marketing — é trabalho inspecionável por pares.

E, combinadas, elas explicam a eficiência de tokens: o K3 usa 21% menos tokens de saída que o K2.6 em tarefas equivalentes.

A Parte que Deveria Te Deixar Atento: K3 Otimizou Sua Própria Arquitetura

A Moonshot deu ao K3 a implementação dos Residuais de Atenção — seu próprio componente arquitetônico — e um objetivo: torná-lo mais rápido no hardware H200 sem alterar o comportamento numérico.

Então eles o deixaram sozinho.

20 horas de experimentos. Zero intervenção humana. Aceleração de 1,6x.

Em uma execução separada, o K3 reduziu o tempo de ida/volta do FLA Triton AttnRes de 283,6ms para 114,4ms — uma aceleração de 2,48x — novamente sem alterar a parte numérica.

Kirill - inline image

E ele iterou mais rápido que o Fable 5 fazendo a mesma tarefa.

Leia isso de novo. O modelo melhorou o mecanismo que faz o modelo funcionar. Autonomamente. Da noite para o dia.

Isto é o que "autoaperfeiçoamento recursivo" parece na prática — não um cenário de ficção científica, um trabalho de 20 horas com um resultado mensurável. É a mesma capacidade que a Anthropic sinalizou como motivo de cautela semanas atrás, rodando em um modelo de pesos abertos que qualquer um pode baixar em 27 de julho.

Codificação de Longo Horizonte é o Ponto Central

O próprio enquadramento da Moonshot: "O K3 se destaca como o modelo de codificação de código aberto mais poderoso da Moonshot AI até o momento. Operando com supervisão humana mínima, ele pode sustentar longas sessões de engenharia, navegar em repositórios massivos e orquestrar ferramentas de terminal."

As três coisas que importam para o trabalho real de engenharia:

  1. Sessões sustentadas — o experimento autônomo de 20 horas não é uma demonstração. É o alvo do design.
  2. Repositórios massivos — uma janela de contexto de 1M com decodificação 6,3x mais rápida significa que você pode colocar uma base de código real no contexto e realmente trabalhar nela.
  3. Orquestração de ferramentas — SOTA em Toolathlon e BrowseComp significa que ele lida com o terminal, o navegador e as chamadas de API sem desmoronar.

A codificação frontend atinge o nível do Fable 5. Cenas de jogos de qualidade AAA a partir de um único prompt. WebGPU, Three.js, shaders, física — coisas que costumavam exigir um estúdio.

Vibe Coding com Kimi K3

É aqui que o modelo deixa de ser um número de benchmark e começa a ser obviamente útil.

A codificação frontend do K3 está no nível do Fable 5. Na prática, isso significa que a parede entre uma descrição e um produto 3D funcional agora é um único prompt.

O que as pessoas realmente lançaram a partir de prompts únicos:

Jogos — Arenas de combate WebGPU com VFX. Travessia de cidade 3D baseada em navegador com mecânica de gancho.

  1. FPS de zumbis.
  2. Corrida multiplayer.
  3. Um emulador GBA 3D funcional.
  4. Estrutura completa de MMORPG.

Não é uma "demo parecida com um jogo" — cenas jogáveis com reações a acertos, feedback de impacto e física que se comporta.

Kirill - inline image

Objetos 3D com trabalho de material real — Um Rolex com brilho e comportamento de luz corretos. Uma arma de CSGO que se monta e desmonta em 33 peças modeladas individualmente. Uma desmontagem de câmera Sony. Um buraco negro com lente gravitacional. Simulação oceânica com dinâmica de ondas real.

Kirill - inline image

Cenas de física — Simulação de tecido. Colapso estrutural. Colisões de veículos com transferência de momento que parece correta, em vez de parecer roteirizada.

O que torna isso diferente das demos anteriores de "IA constrói um site": o K3 lida com os detalhes que normalmente quebram. Iluminação. Sombras. Brilho do material. As 20 pequenas coisas que separam "claramente gerado por IA" de "alguém construiu isso."

Um prompt. Quatro milhões de tokens. Uma cena que costumava precisar de uma equipe.

4 Prompts Testados em Batalha (Prontos para Copiar e Colar)

Estes são estruturados para explorar no que o K3 é realmente bom: trabalho de longo horizonte, uso de ferramentas e manter um grande contexto sem se desviar.

Prompt 1 — O Teste de Estresse de Física

Este é o prompt que separa a capacidade real do polimento de demonstração. Se um modelo conseguir fazer as três cenas com qualidade, é real.

text
1Construa três cenas HTML5 autônomas em canvas com física real.
2Sem bibliotecas externas. Tudo em um arquivo por cena.
3
4Cena 1: Um trem descarrilando de uma ponte quebrada na água.
5Inclua: momento dos vagões, falha estrutural da ponte,
6deslocamento de água no impacto.
7
8Cena 2: Dois carros saltando de rampas e colidindo no ar
9sobre um desfiladeiro. Inclua: arcos de trajetória corretos,
10transferência de momento de colisão, detritos.
11
12Cena 3: Um caminhão monstro esmagando uma fileira de carros estacionados.
13Inclua: compressão da suspensão, deformação da chapa metálica,
14distribuição de peso.
15
16Requisitos para todas as três:
17- A física deve ser calculada, não animada
18- Alvo de 60fps
19- Inclua um botão de reset
20- Comente a matemática da física para que eu possa verificar
21
22Construa todas as três. Não faça perguntas de esclarecimento.

Prompt 2 — A Tarefa de Repositório de Longo Horizonte

Isto é para o que o K3 foi realmente construído. Aponte-o para uma base de código real e dê a ele um resultado, não uma tarefa.

text
1Leia toda esta base de código antes de escrever qualquer coisa.
2
3[cole seu repositório, ou aponte para o diretório]
4
5Objetivo: [declare um resultado mensurável — por exemplo, "reduzir
6o tempo de resposta p95 da API em 30%" ou "eliminar todas as consultas
7N+1 na camada de dados"]
8
9Regras:
10- Crie um perfil primeiro. Mostre-me onde o tempo realmente vai
11 antes de mudar qualquer coisa.
12- Não altere interfaces públicas ou comportamento numérico.
13- Execute o conjunto de testes existente após cada alteração.
14- Se uma alteração piorar as coisas, reverta-a e me diga por quê.
15- Trabalhe até que o objetivo seja atingido ou você possa provar que
16 não é alcançável sem quebrar as regras.
17
18Relatório no final: o que você mudou, o que ganhou com isso,
19o que tentou que não funcionou.

A linha "o que você tentou que não funcionou" é importante. É o que transforma a saída de um diff em um registro de engenharia.

Prompt 3 — A Construção de Produto 3D

Para quem trabalha com frontend, landing pages ou visualização de produtos.

text
1Construa um [objeto] 3D interativo no navegador.
2Arquivo HTML único. Three.js.
3
4O objeto: [descreva-o precisamente — materiais,
5número de peças, o que se move]
6
7Deve incluir:
8- Propriedades de material corretas (brilho, rugosidade,
9 metalicidade onde relevante)
10- Iluminação de três pontos com sombras reais
11- Controles de órbita
12- [Qualquer interação — montagem/desmontagem, animação,
13 estados de hover]
14
15Padrão de qualidade: deve parecer um render de produto,
16não uma demo WebGL. Se um detalhe fosse visível na vida
17real, modele-o.
18
19Construa a coisa toda. Mostre-me o arquivo.

A linha "padrão de qualidade" faz mais trabalho do que qualquer outra coisa no prompt. O K3 responde a padrões, não apenas a instruções.

Prompt 4 — Recurso em Tempo Real com uma Parte Móvel

CRUD full-stack é uma forma de aplicativo. Tempo real é uma forma completamente diferente — o estado tem que permanecer sincronizado entre os clientes, não apenas persistir em um banco de dados. É aqui que muitos modelos silenciosamente desmoronam.

text
1Adicione um recurso em tempo real a um aplicativo existente: um sistema
2de cursor + comentário colaborativo ao vivo, como o do Figma.
3
4REQUISITOS:
5- Conexão WebSocket (use Socket.io ou ws nativo)
6- Mostre as posições do cursor de outros usuários conectados em tempo real
7- Clique em qualquer lugar para soltar um pino de comentário
8- Comentários são atualizados ao vivo para todos os clientes conectados
9- Lide com desconexão/reconexão graciosamente — sem cursores fantasmas
10- Debounce nas atualizações de cursor para não sobrecarregar o socket
11
12CONSTRUÇÃO:
131. Configure o servidor WebSocket
142. Construa a conexão do lado do cliente com reconexão automática
153. Implemente a transmissão de cursor com debouncing
164. Implemente o sistema de pinos de comentário
175. Adicione um indicador de presença simples (quem está online)
186. Teste com pelo menos 2 clientes simulados para confirmar que a sincronização funciona
19
20Mostre-me como você testou a sincronização multi-cliente antes de considerar isso pronto.

Resultado esperado: Uma camada de tempo real funcional em 15–30 minutos, com prova visível de que foi testada contra mais de um cliente.

Kirill - inline image

A última linha é a parte importante. Bugs de tempo real não aparecem com uma única aba do navegador aberta — eles aparecem com duas. Um modelo que pula o teste multi-cliente lhe entregará um código que parece pronto e não está.

Quando o K3 Dá Errado: Guia de Solução de Problemas

É um modelo novo com arestas reais. Aqui está o que quebra e o que fazer.

  • Problema: Ele queima tokens em tarefas triviais

Este é o grande problema, e é estrutural.

O K3 atualmente vem com apenas um nível de esforço de raciocínio — 'máximo'. Não há um modo "apenas responda rapidamente." Testadores independentes mediram 13.241 tokens de raciocínio para gerar um SVG simples — aproximadamente $0,25 por algo que deveria custar frações de centavo.

A correção:

não direcione trabalhos simples para o K3. É um modelo de fronteira com uma marcha, e essa marcha é "pense profundamente em tudo." Use o K2.7 ou um modelo menor para boilerplate, formatação e qualquer coisa mecânica. Guarde o K3 para trabalhos que justifiquem o raciocínio.

Este é o maior erro que as pessoas cometerão no primeiro mês: tornar o K3 o padrão para tudo e depois se surpreender com a conta.

  • Problema: A janela de contexto enche de qualquer maneira

1M de tokens parece infinito até você colocar um repositório real e ele não ser.

A correção:

não despeje tudo. Aponte-o para os diretórios que importam. A força do K3 no trabalho de longo horizonte vem do foco sustentado, não de ter todos os arquivos no contexto. Um conjunto enxuto de 200K do código certo supera um inchado de 900K do monorepo inteiro.

  • Problema: Ele se desvia em execuções autônomas muito longas

O experimento autônomo de 20 horas é real, mas funcionou porque o objetivo era mensurável — "tornar isso mais rápido no H200 sem alterar a parte numérica." Dê a ele um objetivo vago e muita liberdade, e ele vagará.

A correção:

todo prompt de longo horizonte precisa de uma condição de sucesso verificável. Não "melhore o código." Um número, um teste que passa, um benchmark que se move. Se você não puder declarar como verificaria se ele teve sucesso, ele se desviará.

  • Problema: Você não consegue reproduzir o resultado de benchmark de alguém

Ninguém fora da Moonshot auditou este modelo. Os pesos não serão lançados até 27 de julho. Cada número circulando agora — incluindo neste artigo — é relatado pelo fornecedor.

A correção:

espere até 27 de julho, ou teste em suas próprias tarefas e confie nisso. Suas cinco tarefas reais valem mais do que a tabela de benchmark de qualquer um.

  • Problema: Erros de integração após mudar da OpenAI ou Anthropic

O K3 é compatível com o SDK da OpenAI, o que cobre 90% da migração. Os 10% restantes geralmente são o comportamento de raciocínio — o K3 pensa por padrão e retorna tokens de raciocínio que você pode não estar esperando no tratamento da sua resposta.

A correção:

verifique sua contabilidade de tokens e seu parsing de resposta antes de assumir que o modelo está quebrado. A maioria das reclamações "K3 é caro" são, na verdade, "esqueci que tokens de raciocínio são tokens de saída."

O Contexto que Ninguém Deve Ignorar

A Moonshot está sediada em Pequim, fundada por Yang Zhilin, um ex-pesquisador do Google, e apoiada pela Alibaba.

https://x.com/kirillk_web3/status/2057528102368977328

Eles construíram um modelo de fronteira de 2,8 trilhões de parâmetros sob três anos de crescentes controles de exportação dos EUA sobre chips avançados.

Os analistas do Bank of America disseram diretamente: "Apesar das persistentes restrições de hardware/capacidade de computação na China, o K3 demonstra que o scaling de pré-treinamento, combinado com inovação arquitetônica, ainda pode entregar ganhos transformacionais para os modelos chineses de ponta."

E o momento não é acidental: o K3 foi lançado dias antes da Conferência Mundial de Inteligência Artificial de 2026 em Xangai.

A Pergunta de 27 de Julho

Os pesos serão lançados em 27 de julho. Essa data importa mais do que a data de lançamento.

Até lá, o K3 é um modelo de fronteira que você pode usar através de uma API — impressionante.

Em 27 de julho, ele se torna outra coisa: um modelo de classe de fronteira que qualquer um pode baixar, inspecionar, modificar e executar em seu próprio hardware. Sem API. Sem limites de uso. Sem termos de serviço. Sem retenção de prompt de 30 dias.

Essa é a história real. Não "China alcançou."

A China alcançou e o deu de graça.

Kirill - inline image

Vale notar: reguladores chineses têm discutido controles de exportação de IA próprios. Se o K3 é o último lançamento de fronteira de peso aberto da China ou o primeiro de muitos, é genuinamente incerto neste momento.

Como Experimentar

Chat: kimi.com — K3 está online agora

API: Compatível com o SDK da OpenAI, então se você já está construindo com as toolchains da OpenAI ou Anthropic, a integração é uma mudança de configuração, não uma reescrita

Pesos: 27 de julho

A compatibilidade com o SDK é um negócio maior do que parece. Trocar modelos geralmente significa reescrever sua camada de integração. Aqui significa mudar uma URL base e uma string de modelo.

Como Instalar o Kimi Code (O Agente de Terminal)

Se você quiser o K3 rodando dentro da sua base de código real em vez de uma janela de chat, esta é a configuração.

Kirill - inline image

Requisitos:

  • Um computador (Mac, Windows ou Linux)
  • Acesso ao terminal
  • Conta Kimi — kimi.com

Passo 1 — Instalar o Kimi Code

Mac/Linux:

bash
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Windows (PowerShell):

text
1irm https://code.kimi.com/kimi-code/install.ps1 | iex

No Windows, instale o Git for Windows primeiro — o Kimi Code CLI usa o Git Bash agrupado como ambiente de shell.

Verifique a instalação:

bash
1kimi --version

Devido ao Gatekeeper do macOS, a primeira execução pode demorar consideravelmente mais. Adicione seu aplicativo de terminal em Ajustes do Sistema → Privacidade e Segurança → Ferramentas de Desenvolvedor para acelerar os lançamentos posteriores.

Se você já tiver o uv instalado, pode instalar diretamente:

bash
1uv tool install --python 3.13 kimi-cli

O Kimi Code CLI suporta Python 3.12–3.14, com 3.13 recomendado para melhor compatibilidade.

Passo 2 — Navegue até seu projeto e inicie

bash
1cd seu-projeto
2kimi

No primeiro lançamento, execute /login dentro da sessão para configurar sua fonte de API — ele abre uma janela do navegador para OAuth.

Passo 3 — Dê a ele uma tarefa

O Kimi Code agora está rodando dentro do seu projeto, com acesso direto de leitura/escrita a todos os arquivos. Descreva uma tarefa em inglês simples — ele planeja as etapas, edita o código, executa testes e relata o que fez.

O Que Isso Realmente Significa

Se você está executando cargas de trabalho de produção:

Teste antes de mudar. Benchmarks de fornecedores e desempenho no mundo real divergem constantemente. Escolha cinco tarefas reais, execute o K3 e seu modelo atual lado a lado, meça o custo por trabalho concluído — não o custo por token.

Kirill - inline image

A matemática por tarefa é todo o argumento. A $3/$15, o K3 não é barato no papel. Com 21% menos tokens e saída de nível Fable, é barato onde importa.

27 de julho muda o cálculo. Pesos abertos significam auto-hospedagem, fine-tuning e dependência zero de a API de alguém ficar online ou os termos de alguém permanecerem favoráveis. Para qualquer coisa sensível, isso não é pouca coisa.

Conclusão

A fronteira costumava ser um lugar que laboratórios americanos construíam e todos os outros visitavam seis meses depois.

2,8 trilhões de parâmetros. 1M de contexto. Codificação de nível Fable 5 a preço de Sonnet. Construído sob controles de exportação, pelo laboratório de menor valor na sala, e dado de graça em 27 de julho.

A pergunta interessante não é se o K3 supera o Fable 5 em algum benchmark. É o que acontece com a economia dos modelos de fronteira fechados quando um de peso aberto os iguala.

Links

Siga para mais informações sobre Vibe Coding. Obrigado por ler!

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais