Cách sử dụng Kimi K3 trong Claude Code (Lập trình cấp độ Fable, rẻ hơn 5 lần)

@sairahul1
TIẾNG ANH2 ngày trước · 20 thg 7, 2026
211K
103
11
9
295

TL;DR

Rahul chia sẻ một hệ thống giúp giảm 90% chi phí lập trình AI bằng cách thay thế mô hình Fable 5 đắt đỏ bằng Kimi K3 trong Claude Code cho các tác vụ thông thường như viết mã khung (boilerplate) và kiểm thử.

Claude Code là một trong những môi trường lập trình tốt nhất từng được xây dựng.

Nhưng điều đó không có nghĩa là mọi yêu cầu đều phải gửi đến Fable 5.

Hầu hết mọi người dùng Claude Code và để mọi yêu cầu chạy trên mô hình đắt nhất hiện có.

Đọc code. Tìm kiếm file. Viết code mẫu. Chạy test. Tài liệu hướng dẫn.

Không việc nào trong số đó cần đến khả năng suy luận tiên tiến.

Bạn đang trả tiền cho một lò phản ứng hạt nhân để đun một ấm nước.

Đây là hệ thống tôi dùng để chạy Claude Code với chi phí thấp hơn 10x mà không cần động đến harness, diff engine, hay UX mà tôi thực sự yêu thích.

Vấn đề mà không ai nói đến

Rahul - inline image

Fable 5 có giá $10 đầu vào / $50 đầu ra trên một triệu token.

Kimi K3 có giá $3 đầu vào / $15 đầu ra trên một triệu token.

Chỉ riêng giá niêm yết đã rẻ hơn 5x.

Nhưng khoảng cách thực tế còn lớn hơn thế.

K3 có cửa sổ ngữ cảnh 1 triệu token — giá cố định, không phụ phí cho prompt dài.

Fable 5 trở nên đắt đỏ nhanh chóng khi bạn kéo các repo lớn qua ngữ cảnh.

K3 cũng chạy với thông lượng cao.

Trên các codebase lớn và tác vụ khối lượng cao, K3 chỉ tốn một phần nhỏ chi phí vì nó sử dụng cache cho ngữ cảnh lặp lại với giá $0.30 mỗi triệu thay vì $3.

Phép tính trong một phiên thực tế:

800K ngữ cảnh codebase ổn định + 50K token mới mỗi lượt.

→ K3 với cache: $0.24 + $0.15 = $0.39 mỗi lượt

→ Fable 5 cùng ngữ cảnh: $8.50 mỗi lượt

Cùng ngữ cảnh. Rẻ hơn 21x.

Đây không phải là K3 tốt hơn Fable 5.

Mà là K3 đủ rẻ để sử dụng ở mọi nơi mà Fable 5 là quá mức cần thiết.

Bạn thực sự đang trả tiền cho cái gì

Rahul - inline image

Hầu hết các nhà phát triển nghĩ rằng họ đang mua Claude khi trả tiền cho Claude Code.

Nhưng không phải vậy.

Họ đang mua harness.

Diff engine. Luồng phê duyệt. Chỉnh sửa nhiều file. Sử dụng công cụ. Lập kế hoạch. Quản lý phiên. UX thực sự giúp bạn nhanh hơn 10x.

Tất cả những thứ đó nằm trong môi trường Claude Code.

Không phải mô hình Claude.

Mô hình chỉ là lớp thông minh.

Và lớp thông minh có thể thay thế được.

Bạn có thể giữ lại mọi thứ làm nên sự tuyệt vời của Claude Code và định tuyến các tác vụ cụ thể đến K3.

Harness vẫn giữ nguyên. Chỉ có mô hình đằng sau các tác vụ đó thay đổi.

3 cách chạy K3 bên trong Claude Code

Từ dễ nhất đến mạnh mẽ nhất.

━━━

Phương pháp 1: Kimi Code (5 phút, không cần cấu hình)

Rahul - inline image

Kimi Code là CLI tương thích với Claude Code của riêng họ.

Cảm giác harness tương tự. Bên dưới là K3. Đăng ký $19/tháng.

Bạn có hạn ngạch hàng ngày nên không bao giờ phải nhìn vào bộ đếm token.

Với $0.60 mỗi triệu token đầu vào (so với $3 của Claude Code), rẻ hơn 5x trên API thô.

Cài đặt:

Rahul - inline image

Sau khi chạy, cài đặt kỹ năng frontend-design để tránh nhận đầu ra mặc định xấu xí kiểu vibe-coded:

Rahul - inline image

Phù hợp nhất cho: các nhà phát triển muốn bỏ hoàn toàn đăng ký Claude Code và tiết kiệm hơn 80% ngay lập tức.

Phương pháp 2: K3 bên trong Codex qua CC Switch (5 phút, một GUI)

Rahul - inline image

Đây là thiết lập sạch sẽ nhất hiện tại.

CC Switch là GUI trên máy tính quản lý cấu hình model cho Codex và Claude Code mà không cần chạm vào file config thủ công.

Bạn thêm K3 làm nhà cung cấp, bật định tuyến cục bộ, và Codex sẽ định tuyến qua K3 cho mọi lệnh gọi.

Hướng dẫn từng bước:

Bước 1: Lấy API key của Kimi

→ Truy cập platform.kimi.ai

→ Tạo tài khoản

→ Thêm tín dụng (chỉ $10 là đủ để bắt đầu)

→ Tạo API key

Bước 2: Cài đặt CC Switch

ccswitch.io → tải về cho hệ điều hành của bạn

→ Đây là ứng dụng GUI, chỉ cần mở nó

Bước 3: Thêm Kimi làm nhà cung cấp

→ Mở CC Switch

→ Chọn: Codex (hoặc Claude Code)

→ Thêm nhà cung cấp → Kimi

→ Dán API key của bạn

→ Model: kimi-k3

→ Context Window: 1048576

→ Upstream Format: Chat Completions

(Codex nói Responses API, Kimi nói Chat Completions

CC Switch xử lý việc dịch thuật — đây là cài đặt quan trọng)

Bước 4: Bật định tuyến

→ Cài đặt → Định tuyến → Định tuyến cục bộ → bật công tắc chính

Bước 5: Mở Codex

→ Xong. Mọi yêu cầu bây giờ đều định tuyến qua K3.

→ Trình chọn model hiển thị "Custom" — chỉ mang tính trang trí, hoạt động tốt

Khác biệt chi phí trong thực tế:

Codex mặc định (GPT-5.6 Sol): ~$5 đầu vào / $30 đầu ra mỗi triệu token

K3 qua CC Switch: $3 đầu vào / $15 đầu ra

Trong một phiên ngữ cảnh 800K điển hình: Sol tốn $24+, K3 tốn $2.40.

Rẻ hơn 10x trong một phiên duy nhất.

Phương pháp 3: Plugin Codex Orchestration (mạnh mẽ nhất)

Rahul - inline image

Đây là lúc mọi thứ trở nên thú vị.

Plugin Codex Orchestration cho phép bạn gán các model khác nhau cho các vai trò khác nhau trong một phiên Codex duy nhất.

Người lập kế hoạch. Cố vấn. Nhà thiết kế. Người thực thi.

Mỗi vai trò có một model khác nhau.

Bạn không chỉ hoán đổi model — bạn đang định tuyến các loại công việc cụ thể đến model rẻ nhất có khả năng cho công việc đó.

Cài đặt:

Rahul - inline image

Repo: https://github.com/Cjbuilds/Codex-Orchestration

Ví dụ thiết lập:

Tại sao K3 làm Nhà thiết kế lại hiệu quả:

K3 có khả năng thị giác và đa phương thức nguyên bản.

Nó đọc ảnh chụp màn hình UI, hiểu bố cục, tạo đặc tả thiết kế.

Đối với công việc frontend, nó thực sự mạnh — và với giá $15/M đầu ra so với $50/M của Fable 5, nó là người thực thi hiển nhiên cho bất cứ thứ gì liên quan đến hình ảnh.

Các quy tắc định tuyến tôi thực sự sử dụng

Không phức tạp. Chỉ là cây quyết định đơn giản.

Rahul - inline image

Nguyên tắc: sử dụng K3 cho đến khi tác vụ thực sự cần đến giới hạn của Fable 5.

Hầu hết các tác vụ đều không cần.

Thậm chí 95% các tác vụ bạn nghĩ cần Fable 5 cũng không cần.

Hãy thử K3 trước. Chỉ leo thang khi bạn thực sự chạm đến giới hạn.

Những gì bạn nên làm ngay từ hôm nay

Chọn con đường phù hợp với vị trí của bạn.

Nếu bạn muốn kết quả nhanh nhất (5 phút):

Cài đặt Kimi Code. $19/tháng. Sử dụng nó cho mọi thứ không quan trọng.

Rahul - inline image

Nếu bạn muốn K3 bên trong Codex (cũng 5 phút):

Cài đặt CC Switch. Thêm K3 làm nhà cung cấp. Bật định tuyến cục bộ.

Rahul - inline image

Nếu bạn muốn phối hợp đầy đủ dựa trên vai trò:

Cài đặt plugin Codex Orchestration. Gán model cho các vai trò.

Rahul - inline image

Trong cả ba trường hợp — hãy lưu các quy tắc định tuyến của bạn vào CLAUDE.md:

Rahul - inline image

Khối CLAUDE.md đó được tải trong mỗi phiên.

Việc định tuyến diễn ra tự động.

Bạn không còn phải nghĩ về nó nữa.

Bạn không phải chọn giữa Claude Code và Kimi.

Bạn đang chọn giữa việc sử dụng một model đắt tiền cho mọi thứ và định tuyến thông minh vì cả hai đều giống nhau (thậm chí đôi khi Kimi còn hoạt động tốt hơn Fable)

Claude Code vẫn giữ nguyên. Diff engine vẫn giữ nguyên. Luồng phê duyệt vẫn giữ nguyên. UX giúp bạn nhanh hơn 10x vẫn giữ nguyên.

Chỉ có lớp thông minh đằng sau các tác vụ cụ thể thay đổi.

Fable 5 cho 10% thực sự cần nó.

K3 cho 90% còn lại.

Hóa đơn giảm 90%.

Chất lượng đầu ra vẫn giữ nguyên hoặc tốt hơn vì giai đoạn lập kế hoạch giờ đây được mô hình mạnh nhất chú ý trọn vẹn thay vì bị đốt cháy vào code mẫu.

Đó là toàn bộ hệ thống.

Nếu điều này hữu ích:

→ Đăng lại để chia sẻ với mọi nhà phát triển đang trả giá đầy đủ cho Claude Code

→ Theo dõi @sairahul1 để biết thêm các hệ thống cắt giảm chi phí mà không giảm sản lượng

→ Đánh dấu trang này — cả ba đường dẫn thiết lập đều sẵn sàng để copy-paste

Đăng ký theaibuilders.co để nhận thêm nhiều bài viết thú vị như thế này

Tôi viết về AI, xây dựng sản phẩm và các hệ thống hoạt động mà không cần bạn.

━━━━━━━━━━━━━━━━━━

Các công cụ được đề cập:

→ Kimi Code: kimi.com/code

→ Kimi API: platform.kimi.ai

→ CC Switch: ccswitch.io

→ Codex Orchestration: github.com/Cjbuilds/Codex-Orchestration

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral