Claude Code 에서 Kimi K3 사용하는 방법 (Fable 수준의 코딩, 비용 5배 절감)

@sairahul1
영어2일 전 · 2026년 7월 20일
211K
103
11
9
295

TL;DR

Rahul 이 일상적인 보일러플레이트 및 테스트 작업 시 Claude Code 에서 고가의 Fable 5 모델 대신 Kimi K3 를 사용하여 AI 코딩 비용을 90% 절감하는 시스템을 공유합니다.

Claude Code 는 지금까지 만들어진 최고의 코딩 환경 중 하나입니다.

그렇다고 모든 요청을 Fable 5 에 보내야 한다는 뜻은 아닙니다.

대부분의 사람들은 Claude Code 를 사용하면서 모든 요청을 가장 비싼 모델에 보냅니다.

코드 읽기. 파일 검색. 보일러플레이트 작성. 테스트 실행. 문서화.

이 모든 작업에 프론티어 추론이 필요하지 않습니다.

주전자에 물을 끓이기 위해 원자로를 가동하는 격입니다.

제가 사용하는 시스템은 Claude Code 의 핸들러, diff 엔진, 그리고 제가 사랑하는 UX 를 건드리지 않고 비용을 10 배 낮춥니다.

아무도 이야기하지 않는 문제

Rahul - inline image

Fable 5 는 입력 100 만 토큰당 $10, 출력 100 만 토큰당 $50 입니다.

Kimi K3 는 입력 100 만 토큰당 $3, 출력 100 만 토큰당 $15 입니다.

스티커 가격만으로도 5 배 저렴합니다.

하지만 실제 차이는 그보다 더 큽니다.

K3 는 100 만 토큰 컨텍스트 윈도우를 제공하며, 긴 프롬프트에 대한 추가 요금이 없습니다.

Fable 5 는 대규모 레포를 컨텍스트에 끌어올 때 비용이 빠르게 증가합니다.

K3 는 또한 처리량이 뛰어납니다.

대규모 코드베이스와 대량 작업에서 K3 는 반복되는 컨텍스트에 대해 캐시를 적용하여 100 만 토큰당 $0.30 (Fable 5 의 $3 대비) 의 비용으로 실행되므로 비용이 훨씬 저렴합니다.

실제 세션에서의 계산:

800K 안정적인 코드베이스 컨텍스트 + 턴당 50K 새로운 토큰.

→ K3 (캐시 적용): $0.24 + $0.15 = 턴당 $0.39

→ Fable 5 (동일 컨텍스트): 턴당 $8.50

동일한 컨텍스트. 21 배 저렴합니다.

이것은 K3 가 Fable 5 보다 낫다는 이야기가 아닙니다.

K3 가 Fable 5 가 과잉인 모든 곳에서 사용하기에 충분히 저렴하다는 이야기입니다.

당신이 실제로 지불하고 있는 것

Rahul - inline image

대부분의 개발자들은 Claude Code 에 비용을 지불할 때 Claude 를 구매한다고 생각합니다.

하지만 그렇지 않습니다.

그들은 핸들러를 구매하는 겁니다.

diff 엔진. 승인 흐름. 다중 파일 편집. 도구 사용. 계획 수립. 세션 관리. 실제로 당신을 10 배 빠르게 만드는 UX.

이 모든 것은 Claude Code 라는 환경에 있습니다.

Claude 라는 모델이 아닙니다.

모델은 단지 지능 계층일 뿐입니다.

그리고 지능 계층은 교체 가능합니다.

Claude Code 를 훌륭하게 만드는 모든 것을 유지하면서 특정 작업을 K3 로 라우팅할 수 있습니다.

핸들러는 그대로 유지됩니다. 해당 작업 뒤에 있는 모델만 변경됩니다.

Claude Code 내에서 K3 를 실행하는 3 가지 방법

가장 쉬운 방법부터 가장 강력한 방법까지.

━━━

방법 1: Kimi Code (5분, 설정 불필요)

Rahul - inline image

Kimi Code 는 Claude Code 와 호환되는 자체 CLI 입니다.

동일한 핸들러 느낌. 내부는 K3. 월 $19 구독.

일일 할당량이 제공되므로 토큰 카운터를 신경 쓸 필요가 없습니다.

100 만 입력 토큰당 $0.60 (Claude Code 의 $3 대비) 으로, 원시 API 기준 5 배 저렴합니다.

설치:

Rahul - inline image

실행 후, 기본적으로 제공되는 지저분한 느낌의 출력을 피하기 위해 프론트엔드 디자인 스킬을 설치하세요:

Rahul - inline image

적합한 대상: Claude Code 구독을 완전히 없애고 즉시 80% 이상을 절약하려는 개발자.

방법 2: CC Switch 를 통한 Codex 내 K3 (5분, GUI 하나)

Rahul - inline image

이것이 현재 가장 깔끔한 설정입니다.

CC Switch 는 Codex 및 Claude Code 용 모델 설정을 관리하는 데스크톱 GUI 로, 설정 파일을 수동으로 건드릴 필요가 없습니다.

K3 를 공급자로 추가하고, 로컬 라우팅을 켜면 Codex 가 모든 호출에서 K3 를 통해 라우팅됩니다.

단계별 가이드:

1단계: Kimi API 키 받기

platform.kimi.ai 로 이동

→ 계정 생성

→ 크레딧 추가 ($10 만 있어도 시작 가능)

→ API 키 생성

2단계: CC Switch 설치

ccswitch.io → 운영체제에 맞게 다운로드

→ GUI 앱이므로 그냥 열면 됩니다.

3단계: Kimi 를 공급자로 추가

→ CC Switch 열기

→ Codex (또는 Claude Code) 선택

→ 공급자 추가 → Kimi

→ API 키 붙여넣기

→ 모델: kimi-k3

→ 컨텍스트 윈도우: 1048576

→ 업스트림 형식: Chat Completions

(Codex 는 Responses API, Kimi 는 Chat Completions 를 사용합니다.

CC Switch 가 변환을 처리합니다. 이것이 핵심 설정입니다.)

4단계: 라우팅 활성화

→ 설정 → 라우팅 → 로컬 라우팅 → 마스터 스위치 켜기

5단계: Codex 열기

→ 완료. 이제 모든 요청이 K3 를 통해 라우팅됩니다.

→ 모델 선택기에 "Custom" 이 표시되지만, 외형상의 문제일 뿐 정상 작동합니다.

실제 비용 차이:

Codex 기본 (GPT-5.6 Sol): 100 만 토큰당 입력 ~$5, 출력 ~$30

CC Switch 를 통한 K3: 100 만 토큰당 입력 $3, 출력 $15

일반적인 800K 컨텍스트 세션: Sol 은 $24 이상, K3 는 $2.40.

단일 세션에서 10 배 저렴합니다.

방법 3: Codex Orchestration 플러그인 (가장 강력함)

Rahul - inline image

여기서부터 흥미로워집니다.

Codex Orchestration 플러그인을 사용하면 단일 Codex 세션 내에서 여러 역할에 서로 다른 모델을 할당할 수 있습니다.

계획자. 조언자. 디자이너. 실행자.

각 역할에 서로 다른 모델이 할당됩니다.

단순히 모델을 교체하는 것이 아니라, 특정 유형의 작업을 해당 작업에 가장 적합한 가장 저렴한 모델로 라우팅하는 것입니다.

설치:

Rahul - inline image

저장소: https://github.com/Cjbuilds/Codex-Orchestration

설정 예시:

K3 를 디자이너로 사용하는 이유:

K3 는 네이티브 비전 및 멀티모달 입력을 지원합니다.

UI 스크린샷을 읽고, 레이아웃을 이해하며, 디자인 사양을 생성합니다.

프론트엔드 작업에서 매우 강력합니다. 출력 100 만 토큰당 $15 (Fable 5 의 $50 대비) 로, 시각적 작업에 최적의 실행자입니다.

제가 실제로 사용하는 라우팅 규칙

복잡하지 않습니다. 간단한 의사 결정 트리입니다.

Rahul - inline image

규칙: 작업이 진정으로 Fable 5 의 한계를 필요로 할 때까지 K3 를 사용하세요.

대부분의 작업은 그렇지 않습니다.

Fable 5 가 필요하다고 생각하는 작업의 95% 조차도 필요하지 않습니다.

먼저 K3 로 테스트하세요. 실제로 한계에 도달했을 때만 업그레이드하세요.

오늘부터 실제로 해야 할 일

자신의 상황에 맞는 경로를 선택하세요.

가장 빠른 결과를 원한다면 (5분):

Kimi Code 를 설치하세요. 월 $19. 중요하지 않은 모든 작업에 사용하세요.

Rahul - inline image

Codex 내에서 K3 를 사용하고 싶다면 (역시 5분):

CC Switch 를 설치하세요. K3 를 공급자로 추가하세요. 로컬 라우팅을 활성화하세요.

Rahul - inline image

전체 역할 기반 오케스트레이션을 원한다면:

Codex Orchestration 플러그인을 설치하세요. 모델을 역할에 할당하세요.

Rahul - inline image

세 가지 경우 모두 — 라우팅 규칙을 CLAUDE.md에 저장하세요:

Rahul - inline image

해당 CLAUDE.md 블록은 모든 세션에서 로드됩니다.

라우팅이 자동으로 이루어집니다.

더 이상 신경 쓸 필요가 없습니다.

Claude Code 와 Kimi 사이에서 선택하는 것이 아닙니다.

모든 작업에 하나의 비싼 모델을 사용하는 것과, 똑똑하게 라우팅하는 것 사이에서 선택하는 것입니다. 둘 다 동일하며 (때로는 Kimi 가 Fable 보다 더 잘 작동하기도 합니다).

Claude Code 는 그대로 유지됩니다. diff 엔진도 그대로입니다. 승인 흐름도 그대로입니다. 당신을 10 배 빠르게 만드는 UX 도 그대로입니다.

변경되는 것은 특정 작업 뒤에 있는 지능 계층뿐입니다.

진정으로 필요할 때만 Fable 5 (10%).

그렇지 않은 경우 K3 (90%).

청구 금액이 90% 감소합니다.

출력 품질은 동일하거나 더 좋아집니다. 계획 수립 단계에서 이제 가장 강력한 모델이 집중적으로 사용되며, 보일러플레이트에 낭비되지 않기 때문입니다.

이것이 전체 시스템입니다.

도움이 되었다면:

→ Claude Code 에 정가를 지불하는 모든 개발자와 공유하기 위해 리포스트하세요.

→ 비용을 줄이면서 출력을 유지하는 더 많은 시스템을 위해 @sairahul1 을 팔로우하세요.

→ 북마크하세요 — 세 가지 설정 경로 모두 복사하여 바로 사용할 수 있습니다.

더 흥미로운 기사를 보려면 theaibuilders.co 를 구독하세요.

저는 AI, 제품 구축, 그리고 당신 없이도 작동하는 시스템에 대해 글을 씁니다.

━━━━━━━━━━━━━━━━━━

언급된 도구:

→ Kimi Code: kimi.com/code

→ Kimi API: platform.kimi.ai

→ CC Switch: ccswitch.io

→ Codex Orchestration: github.com/Cjbuilds/Codex-Orchestration

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기