Como usar o Kimi K3 no Claude Code (Programação nível Fable, 5x mais barato)

@sairahul1
INGLÊShá 2 dias · 20 de jul. de 2026
211K
103
11
9
295

TL;DR

Rahul compartilha um sistema para reduzir os custos de programação com IA em 90%, substituindo o caro modelo Fable 5 pelo Kimi K3 no Claude Code para tarefas rotineiras, como boilerplate e testes.

Claude Code é um dos melhores ambientes de codificação já criados.

Isso não significa que toda solicitação deva ir para o Fable 5.

A maioria das pessoas usa o Claude Code e deixa cada solicitação individual atingir o modelo mais caro disponível.

Ler código. Pesquisar arquivos. Escrever código padrão. Executar testes. Documentação.

Nada disso precisa de raciocínio de fronteira.

Você está pagando por um reator nuclear para ferver uma chaleira.

Aqui está o sistema que eu uso para rodar o Claude Code com um custo 10x menor, sem mexer no harness, no diff engine ou na UX que eu realmente amo.

O problema que ninguém menciona

Rahul - inline image

O Fable 5 custa $10 de entrada / $50 de saída por milhão de tokens.

O Kimi K3 custa $3 de entrada / $15 de saída por milhão de tokens.

Isso é 5x mais barato só no preço de tabela.

Mas a diferença real é maior do que isso.

O K3 tem uma janela de contexto de 1 milhão de tokens — preço fixo, sem taxa extra para prompts longos.

O Fable 5 fica caro rapidamente quando você está arrastando repositórios grandes pelo contexto.

O K3 também tem uma taxa de transferência significativa.

Em bases de código grandes e tarefas de alto volume, o K3 custa uma fração porque acerta o cache em contextos repetidos a $0,30 por milhão, em vez de $3.

A matemática em uma sessão real:

800K de contexto de base de código estável + 50K de tokens novos por turno.

→ K3 com cache: $0,24 + $0,15 = $0,39 por turno

→ Fable 5 mesmo contexto: $8,50 por turno

Mesmo contexto. 21x mais barato.

Isso não é sobre o K3 ser melhor que o Fable 5.

É sobre o K3 ser barato o suficiente para usar em todos os lugares onde o Fable 5 é exagero.

O que você está realmente pagando

Rahul - inline image

A maioria dos desenvolvedores pensa que está comprando o Claude quando paga pelo Claude Code.

Não estão.

Eles estão comprando o harness.

O diff engine. O fluxo de aprovação. A edição de múltiplos arquivos. O uso de ferramentas. O planejamento. O gerenciamento de sessão. A UX que realmente te faz 10x mais rápido.

Tudo isso vive no ambiente Claude Code.

Não no modelo Claude.

O modelo é apenas a camada de inteligência.

E a camada de inteligência é substituível.

Você pode manter tudo o que torna o Claude Code excelente e rotear tarefas específicas para o K3.

O harness permanece. Apenas o modelo por trás dessas tarefas muda.

3 maneiras de rodar o K3 dentro do seu Claude Code

Da mais fácil à mais poderosa.

━━━

Método 1: Kimi Code (5 minutos, sem configuração)

Rahul - inline image

O Kimi Code é o próprio CLI deles, compatível com o Claude Code.

Mesma sensação do harness. K3 por baixo dos panos. Assinatura de $19/mês.

Você tem uma cota diária, então nunca fica olhando o contador de tokens.

A $0,60 por milhão de tokens de entrada (vs $3 do Claude Code), é 5x mais barato na API bruta.

Instalação:

Rahul - inline image

Depois de rodar, instale a skill de frontend-design para evitar a saída padrão feia do vibe-coding:

Rahul - inline image

Melhor para: desenvolvedores que querem abandonar completamente a assinatura do Claude Code e economizar 80%+ imediatamente.

Método 2: K3 dentro do Codex via CC Switch (5 minutos, uma GUI)

Rahul - inline image

Esta é a configuração mais limpa atualmente.

O CC Switch é uma GUI desktop que gerencia configurações de modelo para Codex e Claude Code sem precisar mexer em arquivos de configuração manualmente.

Você adiciona o K3 como provedor, ativa o roteamento local, e o Codex roteia através do K3 em cada chamada.

Passo a passo:

Passo 1: Obtenha uma chave de API Kimi

→ Acesse platform.kimi.ai

→ Crie uma conta

→ Adicione crédito (até $10 já te colocam pra frente)

→ Gere a chave de API

Passo 2: Instale o CC Switch

ccswitch.io → baixe para seu sistema operacional

→ É um aplicativo GUI, basta abrir

Passo 3: Adicione Kimi como provedor

→ Abra o CC Switch

→ Selecione: Codex (ou Claude Code)

→ Adicionar Provedor → Kimi

→ Cole sua chave de API

→ Modelo: kimi-k3

→ Janela de Contexto: 1048576

→ Formato Upstream: Chat Completions

(Codex fala Responses API, Kimi fala Chat Completions

O CC Switch lida com a tradução — esta é a configuração chave)

Passo 4: Ative o roteamento

→ Configurações → Roteamento → Roteamento Local → chave mestre LIGADA

Passo 5: Abra o Codex

→ Pronto. Cada solicitação agora é roteada através do K3.

→ O seletor de modelo mostra "Personalizado" — apenas cosmético, funciona perfeitamente

Diferença de custo na prática:

Codex padrão (GPT-5.6 Sol): ~$5 entrada / $30 saída por milhão de tokens

K3 via CC Switch: $3 entrada / $15 saída

Em uma sessão típica de contexto de 800K: Sol custa $24+, K3 custa $2,40.

10x mais barato em uma única sessão.

Método 3: Plugin de Orquestração do Codex (mais poderoso)

Rahul - inline image

É aqui que fica interessante.

O plugin de Orquestração do Codex permite que você atribua diferentes modelos a diferentes funções dentro de uma única sessão do Codex.

Planejador. Conselheiro. Designer. Executor.

Cada função recebe um modelo diferente.

Você não está apenas trocando modelos — está roteando tipos específicos de trabalho para o modelo mais barato e capaz para aquela tarefa.

Instalação:

Rahul - inline image

Repositório: https://github.com/Cjbuilds/Codex-Orchestration

Exemplos de configuração:

Por que K3 como Designer funciona especificamente:

O K3 tem visão nativa e entrada multimodal.

Ele lê capturas de tela de UI, entende layout, gera especificações de design.

Para trabalho frontend, é genuinamente forte — e a $15/M de saída vs $50/M do Fable 5, é o executor óbvio para qualquer coisa visual.

As regras de roteamento que eu realmente uso

Nada complicado. Árvore de decisão simples.

Rahul - inline image

A regra: use o K3 até que a tarefa realmente precise do teto do Fable 5.

A maioria das tarefas não precisa.

Até 95% das tarefas que você acha que precisam do Fable 5, não precisam.

Teste o K3 primeiro. Escalone apenas quando você realmente atingir o limite.

O que fazer a partir de hoje

Escolha o caminho que se encaixa onde você está.

Se você quer a vitória mais rápida (5 minutos):

Instale o Kimi Code. $19/mês. Use para tudo que não for crítico.

Rahul - inline image

Se você quer o K3 dentro do Codex (também 5 minutos):

Instale o CC Switch. Adicione K3 como provedor. Ative o roteamento local.

Rahul - inline image

Se você quer orquestração completa baseada em funções:

Instale o plugin de Orquestração do Codex. Atribua modelos às funções.

Rahul - inline image

Em todos os três casos — salve suas regras de roteamento no CLAUDE.md:

Rahul - inline image

Esse bloco CLAUDE.md carrega em todas as sessões.

O roteamento acontece automaticamente.

Você para de pensar nisso.

Você não está escolhendo entre Claude Code e Kimi.

Você está escolhendo entre usar um modelo caro para tudo ou rotear de forma inteligente, porque ambos são equivalentes (às vezes, o Kimi funciona até melhor que o Fable).

O Claude Code permanece. O diff engine permanece. O fluxo de aprovação permanece. A UX que te faz 10x mais rápido permanece.

Apenas a camada de inteligência por trás de tarefas específicas muda.

Fable 5 para os 10% que realmente precisam.

K3 para os 90% que não precisam.

A conta cai em 90%.

A qualidade da saída permanece a mesma ou melhora porque a fase de planejamento agora recebe atenção total do modelo mais forte, em vez de ser queimada em código padrão.

Esse é o sistema completo.

Se isso foi útil:

→ Replique para compartilhar com todos os desenvolvedores pagando o preço cheio pelo Claude Code

→ Siga @sairahul1 para mais sistemas que cortam custos sem cortar resultados

→ Salve isto — todos os três caminhos de configuração estão prontos para copiar e colar

Inscreva-se em theaibuilders.co para mais artigos interessantes como este

Eu escrevo sobre IA, construção de produtos e sistemas que funcionam sem você.

━━━━━━━━━━━━━━━━━━

Ferramentas mencionadas:

→ Kimi Code: kimi.com/code

→ Kimi API: platform.kimi.ai

→ CC Switch: ccswitch.io

→ Codex Orchestration: github.com/Cjbuilds/Codex-Orchestration

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais