Cómo usar Kimi K3 en Claude Code (programación nivel Fable, 5 veces más barato)

@sairahul1
INGLÉShace 2 días · 20 jul 2026
211K
103
11
9
295

TL;DR

Rahul comparte un sistema para reducir los gastos de programación con IA en un 90 % al sustituir el costoso modelo Fable 5 por Kimi K3 en Claude Code para tareas rutinarias como la creación de boilerplate y pruebas.

Claude Code es uno de los mejores entornos de programación jamás creados.

Eso no significa que cada solicitud deba ir a Fable 5.

La mayoría de la gente usa Claude Code y deja que cada petición golpee el modelo más caro disponible.

Leer código. Buscar archivos. Escribir código boilerplate. Ejecutar pruebas. Documentación.

Nada de eso necesita razonamiento de frontera.

Estás pagando por un reactor nuclear para hervir agua.

Aquí está el sistema que uso para ejecutar Claude Code a un costo 10 veces menor sin tocar el arnés, el motor de diffs ni la UX que tanto me gusta.

El problema del que nadie habla

Rahul - inline image

Fable 5 cuesta $10 de entrada / $50 de salida por millón de tokens.

Kimi K3 cuesta $3 de entrada / $15 de salida por millón de tokens.

Eso es 5 veces más barato solo en precio de etiqueta.

Pero la brecha real es aún mayor.

K3 tiene una ventana de contexto de 1 millón de tokens — tarifa plana, sin prima por prompt largo.

Fable 5 se vuelve caro rápido cuando arrastras repos grandes a través del contexto.

K3 también tiene un rendimiento serio.

En bases de código grandes y tareas de alto volumen, K3 cuesta una fracción porque acierta en caché con contexto repetido a $0.30 por millón en lugar de $3.

Las cuentas en una sesión real:

800K de contexto de base de código estable + 50K de tokens nuevos por turno.

→ K3 con caché: $0.24 + $0.15 = $0.39 por turno

→ Fable 5 mismo contexto: $8.50 por turno

Mismo contexto. 21 veces más barato.

Esto no va de que K3 sea mejor que Fable 5.

Va de que K3 es lo suficientemente barato para usarlo en todas partes donde Fable 5 es excesivo.

Lo que realmente estás pagando

Rahul - inline image

La mayoría de los desarrolladores piensan que están comprando Claude cuando pagan por Claude Code.

No es así.

Están comprando el arnés.

El motor de diffs. El flujo de aprobación. La edición multiarchivo. El uso de herramientas. La planificación. La gestión de sesiones. La UX que realmente te hace 10 veces más rápido.

Todo eso vive en Claude Code, el entorno.

No en Claude, el modelo.

El modelo es solo la capa de inteligencia.

Y la capa de inteligencia es intercambiable.

Puedes conservar todo lo que hace grande a Claude Code y enrutar tareas específicas a K3.

El arnés se queda. Solo cambia el modelo detrás de esas tareas.

3 formas de ejecutar K3 dentro de tu Claude Code

De la más fácil a la más potente.

━━━

Método 1: Kimi Code (5 minutos, sin configuración)

Rahul - inline image

Kimi Code es su propia CLI compatible con Claude Code.

La misma sensación de arnés. K3 bajo el capó. Suscripción de $19/mes.

Obtienes una cuota diaria para no estar mirando el contador de tokens.

A $0.60 por millón de tokens de entrada (vs $3 de Claude Code), es 5 veces más barato en API pura.

Instalación:

Rahul - inline image

Una vez en marcha, instala la habilidad de diseño de frontend para dejar de obtener el feo output generado por defecto:

Rahul - inline image

Ideal para: desarrolladores que quieren dejar la suscripción de Claude Code por completo y ahorrar más del 80% de inmediato.

Método 2: K3 dentro de Codex vía CC Switch (5 minutos, una GUI)

Rahul - inline image

Esta es la configuración más limpia ahora mismo.

CC Switch es una GUI de escritorio que gestiona configuraciones de modelo para Codex y Claude Code sin tocar archivos de configuración manualmente.

Añades K3 como proveedor, activas el enrutamiento local, y Codex enruta a través de K3 en cada llamada.

Paso a paso:

Paso 1: Obtén una clave API de Kimi

→ Ve a platform.kimi.ai

→ Crea una cuenta

→ Añade crédito (incluso $10 te bastan para empezar)

→ Genera clave API

Paso 2: Instala CC Switch

ccswitch.io → descarga para tu sistema operativo

→ Es una app GUI, solo ábrela

Paso 3: Añade Kimi como proveedor

→ Abre CC Switch

→ Selecciona: Codex (o Claude Code)

→ Añadir Proveedor → Kimi

→ Pega tu clave API

→ Modelo: kimi-k3

→ Ventana de Contexto: 1048576

→ Formato Upstream: Chat Completions

(Codex habla Responses API, Kimi habla Chat Completions

CC Switch maneja la traducción — esta es la configuración clave)

Paso 4: Habilita el enrutamiento

→ Ajustes → Enrutamiento → Enrutamiento Local → interruptor principal ON

Paso 5: Abre Codex

→ Listo. Cada solicitud ahora se enruta a través de K3.

→ El selector de modelos muestra "Personalizado" — solo cosmético, funciona bien

Diferencia de costos en la práctica:

Codex por defecto (GPT-5.6 Sol): ~$5 de entrada / $30 de salida por millón de tokens

K3 vía CC Switch: $3 de entrada / $15 de salida

En una sesión típica de 800K de contexto: Sol cuesta $24+, K3 cuesta $2.40.

10 veces más barato en una sola sesión.

Método 3: Plugin de Orquestación de Codex (el más potente)

Rahul - inline image

Aquí es donde se pone interesante.

El plugin de Orquestación de Codex te permite asignar diferentes modelos a diferentes roles dentro de una misma sesión de Codex.

Planificador. Asesor. Diseñador. Ejecutor.

Cada rol recibe un modelo diferente.

No solo estás intercambiando modelos — estás enrutando tipos específicos de trabajo al modelo más barato y capaz para esa tarea.

Instalación:

Rahul - inline image

Repositorio: https://github.com/Cjbuilds/Codex-Orchestration

Ejemplos de configuración:

Por qué K3 como Diseñador funciona específicamente:

K3 tiene visión nativa y entrada multimodal.

Lee capturas de pantalla de UI, entiende el diseño, genera especificaciones de diseño.

Para trabajo de frontend es genuinamente bueno — y a $15/M de salida vs $50/M de Fable 5, es el ejecutor obvio para cualquier cosa visual.

Las reglas de enrutamiento que realmente uso

No es complicado. Árbol de decisión simple.

Rahul - inline image

La regla: usa K3 hasta que la tarea realmente necesite el techo de Fable 5.

La mayoría de las tareas no lo necesitan.

Incluso el 95% de las tareas que crees que necesitan Fable 5 no lo necesitan.

Prueba K3 primero. Escala solo cuando realmente llegues al límite.

Qué hacer realmente desde hoy

Elige el camino que se ajuste a dónde estás.

Si quieres la victoria más rápida (5 minutos):

Instala Kimi Code. $19/mes. Úsalo para todo lo no crítico.

Rahul - inline image

Si quieres K3 dentro de Codex (también 5 minutos):

Instala CC Switch. Añade K3 como proveedor. Habilita el enrutamiento local.

Rahul - inline image

Si quieres orquestación completa basada en roles:

Instala el plugin de Orquestación de Codex. Asigna modelos a roles.

Rahul - inline image

En los tres casos — guarda tus reglas de enrutamiento en CLAUDE.md:

Rahul - inline image

Ese bloque de CLAUDE.md se carga en cada sesión.

El enrutamiento ocurre automáticamente.

Dejas de pensar en ello.

No estás eligiendo entre Claude Code y Kimi.

Estás eligiendo entre usar un modelo caro para todo o enrutar de forma inteligente porque ambos son iguales (a veces incluso Kimi funciona mejor que Fable).

Claude Code se queda. El motor de diffs se queda. El flujo de aprobación se queda. La UX que te hace 10 veces más rápido se queda.

Solo cambia la capa de inteligencia detrás de tareas específicas.

Fable 5 para el 10% que realmente lo necesita.

K3 para el 90% que no.

La factura se reduce un 90%.

La calidad del output se mantiene igual o mejora porque la etapa de planificación ahora recibe toda la atención del modelo más fuerte en lugar de quemarse en código boilerplate.

Ese es todo el sistema.

Si te fue útil:

→ Comparte para que lo vea todo desarrollador que paga el precio completo por Claude Code

→ Sigue a @sairahul1 para más sistemas que reducen costos sin recortar resultados

→ Marca esto como favorito — las tres rutas de configuración están listas para copiar y pegar

Suscríbete a theaibuilders.co para más artículos interesantes como este

Escribo sobre IA, creación de productos y sistemas que funcionan sin ti.

━━━━━━━━━━━━━━━━━━

Herramientas mencionadas:

→ Kimi Code: kimi.com/code

→ Kimi API: platform.kimi.ai

→ CC Switch: ccswitch.io

→ Codex Orchestration: github.com/Cjbuilds/Codex-Orchestration

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales