Kimi K3: Hướng dẫn toàn tập về mô hình mã nguồn mở đã đánh bại Fable 5

@kirillk_web3
TIẾNG ANH2 ngày trước · 19 thg 7, 2026
235K
78
16
13
156

TL;DR

Kimi K3 là mô hình mã nguồn mở với 2,8 nghìn tỷ tham số từ Moonshot AI, cạnh tranh trực tiếp với các mô hình độc quyền hàng đầu như Fable 5. Mô hình này sở hữu kiến trúc đột phá giúp tối ưu hóa lập trình với ngữ cảnh dài, tốc độ cao và khả năng tự cải thiện tự động.

Đây là bản phân tích hoàn chỉnh từ A đến Z về Kimi K3 thực sự là gì, nó có thể làm được những gì, và tại sao nó đang lặng lẽ trở thành mô hình lập trình quan trọng nhất mà chưa ai thực sự nhắc đến.

Đánh dấu trang này để không bỏ lỡ bài viết.

2,8 nghìn tỷ tham số. Ngữ cảnh 1 triệu token.

Đây là tất cả những gì bên trong nó.

Trước Khi Nói Về Điểm Chuẩn, Hãy Nói Về Những Gì Vừa Xảy Ra

Trong ba năm qua, câu chuyện vẫn luôn giống nhau: Các phòng thí nghiệm Mỹ xây dựng tiên phong, các phòng thí nghiệm Trung Quốc xây dựng bản sao giá rẻ sáu tháng sau đó.

Vào ngày 16 tháng 7, Moonshot AI đã phát hành Kimi K3.

https://x.com/Kimi_Moonshot/status/2077830229968683203

Tổng cộng 2,8 nghìn tỷ tham số — lớn hơn khoảng 75% so với DeepSeek V4 Pro và gần gấp 4 lần dòng GLM 5 của Zhipu. Mô hình mã nguồn mở lớn nhất từng được phát hành.

Nó vượt trội hơn Claude Opus 4.8. Nó vượt trội hơn GPT-5.6 Sol. Và trên các điểm chuẩn của Moonshot, nó ngang hàng với Fable 5 — mô hình có khả năng nhất hiện có cho công chúng.

Câu chuyện sao chép đã kết thúc.

Các Con Số

Kirill - inline image

Hàng cuối cùng đó là hàng mọi người đang đọc sai. Hãy xử lý nó một cách chính xác.

Thực Tế Về Giá Cả — Hãy Đọc Kỹ Điều Này

Kimi K3 không phải là một mô hình giá rẻ. Ở mức 3/15 USD cho mỗi triệu token, nó được định giá xấp xỉ ở mức Claude Sonnet — không phải ở mức chiết khấu sâu mà các bản phát hành trước đó của Moonshot đưa ra.

Vậy "rẻ hơn 5 lần so với Fable 5" đến từ đâu?

Chi phí cho mỗi tác vụ, không phải giá cho mỗi token.

K3 sử dụng ít token đầu ra hơn đáng kể để hoàn thành cùng một công việc. Trong một tác vụ lập trình điển hình: Fable 5 tốn khoảng 1,30 USD. K3 tốn khoảng 0,25 USD.

Cùng một cấp độ đầu ra. Ít token hơn. Tổng hóa đơn thấp hơn.

Cách nói trung thực: Giá Sonnet, trải nghiệm Fable. Bạn không mua những token rẻ nhất trên thị trường. Bạn đang mua khả năng tiên phong ở mức giá trung cấp và đạt được điều đó trong ít bước hơn.

Nếu bạn so sánh giá token thô, K3 trông có vẻ bình thường. Nếu bạn so sánh chi phí để hoàn thành một công việc, đó là một câu chuyện hoàn toàn khác.

Nơi Kimi K3 Là Tiên Tiến Nhất

Theo các điểm chuẩn đã công bố của Moonshot, K3 thiết lập SOTA trên:

  • HLE với công cụ — Bài kiểm tra cuối cùng của nhân loại, được hỗ trợ bởi công cụ
  • SWE-Bench Pro — kỹ thuật phần mềm trong thế giới thực
  • SWE-Bench Đa ngôn ngữ — kỹ thuật qua nhiều ngôn ngữ
  • BrowseComp — duyệt web và nghiên cứu
  • Toolathlon — sử dụng công cụ ở quy mô lớn
  • CharXiv với Python — suy luận biểu đồ và hình vẽ
  • MathVision với Python — toán học trực quan
Kirill - inline image

So với đối thủ cạnh tranh: vượt trội hơn Opus 4.8 và GPT-5.6 Sol, ngang hàng với Fable 5.

Trong thử nghiệm mù bởi công cụ đánh giá AI Arena, các nhà phát triển ưa thích Kimi hơn mọi mô hình hàng đầu của Mỹ.

Hai Cải Tiến Kiến Trúc Thực Sự Quan Trọng

Đây là phần mà hầu hết các bài viết đang bỏ qua và nó là điều thú vị nhất trong bản phát hành.

Kirill - inline image
  • Kimi Delta Attention (KDA)

Một cơ chế chú ý tuyến tính lai. Kết quả: tốc độ giải mã nhanh hơn tới 6,3 lần trong ngữ cảnh triệu token.

Cửa sổ ngữ cảnh 1M chỉ hữu ích nếu bạn thực sự có thể làm việc trong đó mà không phải chờ đợi vô tận. KDA là thứ làm cho cửa sổ ngữ cảnh trở nên thực tế thay vì lý thuyết.

  • Phần dư chú ý (AttnRes)

Một sự thay thế trực tiếp cho các kết nối dư. Mang lại hiệu quả đào tạo cao hơn khoảng 25% với chi phí bổ sung dưới 2%.

Cả hai kỹ thuật đều được nhóm Moonshot công bố dưới dạng nghiên cứu mở trên GitHub trước khi mô hình được phát hành. Đây không phải là tiếp thị — đó là công trình có thể được kiểm tra chuyên môn.

Và kết hợp lại, chúng giải thích hiệu quả token: K3 sử dụng ít hơn 21% token đầu ra so với K2.6 trong các tác vụ tương đương.

Phần Nên Khiến Bạn Chú Ý: K3 Tự Tối Ưu Hóa Kiến Trúc Của Chính Nó

Moonshot đã cung cấp cho K3 việc triển khai Attention Residuals — thành phần kiến trúc của chính nó — và một mục tiêu: làm cho nó nhanh hơn trên phần cứng H200 mà không thay đổi hành vi số học.

Sau đó, họ để nó một mình.

20 giờ thử nghiệm. Không có sự can thiệp của con người. Tăng tốc 1,6 lần.

Trong một lần chạy riêng biệt, K3 đã cắt giảm thời gian chuyển tiếp/lùi của FLA Triton AttnRes từ 283,6ms xuống còn 114,4ms — tăng tốc 2,48 lần — một lần nữa mà không thay đổi các phép tính số học.

Kirill - inline image

Và nó lặp lại nhanh hơn Fable 5 khi thực hiện cùng một tác vụ.

Hãy đọc lại điều đó. Mô hình đã cải thiện cơ chế làm cho mô hình hoạt động. Một cách tự chủ. Qua một đêm.

Đây là những gì "tự cải thiện đệ quy" trông như thế nào trong thực tế — không phải là một kịch bản khoa học viễn tưởng, mà là một công việc kéo dài 20 giờ với một kết quả có thể đo lường được. Đó là cùng một khả năng mà Anthropic đã cảnh báo như một lý do để thận trọng vài tuần trước, đang chạy trong một mô hình trọng số mở mà bất kỳ ai cũng có thể tải xuống vào ngày 27 tháng 7.

Lập Trình Tầm Xa Là Toàn Bộ Ý Nghĩa

Cách nói của chính Moonshot: "K3 là mô hình lập trình mã nguồn mở mạnh mẽ nhất của Moonshot AI cho đến nay. Hoạt động với sự giám sát tối thiểu của con người, nó có thể duy trì các phiên kỹ thuật dài, điều hướng các kho lưu trữ lớn và điều phối các công cụ terminal."

Ba điều quan trọng cho công việc kỹ thuật thực sự:

  1. Các phiên làm việc liên tục — thử nghiệm tự động kéo dài 20 giờ không phải là một bản demo. Đó là mục tiêu thiết kế.
  2. Kho lưu trữ lớn — cửa sổ ngữ cảnh 1M với tốc độ giải mã nhanh hơn 6,3 lần có nghĩa là bạn có thể đặt một cơ sở mã thực vào ngữ cảnh và thực sự làm việc trong đó.
  3. Điều phối công cụ — SOTA trên Toolathlon và BrowseComp có nghĩa là nó xử lý terminal, trình duyệt và các lệnh gọi API mà không bị sụp đổ.

Lập trình frontend đạt đến cấp độ Fable 5. Cảnh game chất lượng AAA từ một lời nhắc duy nhất. WebGPU, Three.js, shader, vật lý — những thứ mà trước đây cần cả một studio.

Vibe Coding Với Kimi K3

Đây là nơi mô hình không còn là một con số điểm chuẩn và bắt đầu trở nên hữu ích một cách rõ ràng.

Khả năng lập trình frontend của K3 đạt đến cấp độ Fable 5. Trong thực tế, điều đó có nghĩa là bức tường giữa một mô tả và một sản phẩm 3D đang hoạt động giờ đây chỉ là một lời nhắc.

Những gì mọi người thực sự đã tạo ra từ những lời nhắc đơn lẻ:

Game — Đấu trường WebGPU có hiệu ứng VFX. Di chuyển trong thành phố 3D trên trình duyệt với cơ chế móc vật.

  1. Bắn súng zombie.
  2. Đua xe nhiều người chơi.
  3. Trình giả lập GBA 3D hoạt động.
  4. Khung MMORPG hoàn chỉnh.

Không phải "bản demo giống game" — những cảnh có thể chơi được với phản ứng khi trúng đòn, phản hồi khi va chạm và vật lý hoạt động chính xác.

Kirill - inline image

Vật thể 3D với chất liệu thực tế — Một chiếc Rolex với độ bóng và hành vi ánh sáng chính xác. Một vũ khí CSGO lắp ráp và tháo rời qua 33 bộ phận được mô hình hóa riêng lẻ. Một bản phân tích máy ảnh Sony. Một lỗ đen với thấu kính hấp dẫn. Mô phỏng đại dương với động lực sóng thực tế.

Kirill - inline image

Cảnh vật lý — Mô phỏng vải. Sụp đổ cấu trúc. Va chạm xe cộ với sự truyền động lượng trông có vẻ đúng thay vì trông có vẻ như được kịch bản hóa.

Điều làm cho điều này khác biệt so với các bản demo "AI xây dựng trang web" trước đây: K3 xử lý các chi tiết thường bị hỏng. Ánh sáng. Bóng đổ. Độ bóng của chất liệu. 20 điều nhỏ nhặt phân tách giữa "rõ ràng là do AI tạo ra" và "ai đó đã xây dựng cái này."

Một lời nhắc. Bốn triệu token. Một cảnh mà trước đây cần một nhóm.

4 Lời Nhắc Đã Được Kiểm Chứng (Sẵn Sàng Copy-Paste)

Chúng được cấu trúc để khai thác những gì K3 thực sự giỏi: công việc tầm xa, sử dụng công cụ và giữ một ngữ cảnh lớn mà không bị lạc hướng.

Lời nhắc 1 — Bài Kiểm Tra Vật Lý

Đây là lời nhắc phân tách khả năng thực sự khỏi phần trình diễn bóng bẩy. Nếu một mô hình có thể thực hiện cả ba cảnh ở chất lượng cao, thì nó là thật.

text
1Xây dựng ba cảnh HTML5 canvas độc lập với vật lý thực.
2Không có thư viện bên ngoài. Mọi thứ trong một tệp cho mỗi cảnh.
3
4Cảnh 1: Một đoàn tàu trật bánh khỏi cây cầu gãy rơi xuống nước.
5Bao gồm: động lượng toa tàu, sự phá hủy cấu trúc cầu,
6sự dịch chuyển nước khi va chạm.
7
8Cảnh 2: Hai chiếc xe nhảy khỏi dốc và va chạm giữa không trung
9trên một hẻm núi. Bao gồm: quỹ đạo đường cong chính xác,
10truyền động lượng va chạm, mảnh vỡ.
11
12Cảnh 3: Xe tải quái vật nghiền nát một hàng xe đang đỗ.
13Bao gồm: nén hệ thống treo, biến dạng kim loại tấm,
14phân bố trọng lượng.
15
16Yêu cầu cho cả ba:
17- Vật lý phải được tính toán, không phải hoạt ảnh
18- Mục tiêu 60fps
19- Bao gồm nút đặt lại
20- Bình luận về phép toán vật lý để tôi có thể xác minh
21
22Xây dựng cả ba. Đừng hỏi câu hỏi làm rõ.

Lời nhắc 2 — Nhiệm Vụ Kho Lưu Trữ Tầm Xa

Đây là thứ K3 thực sự được xây dựng để làm. Hướng nó vào một cơ sở mã thực và đưa ra một kết quả, không phải một nhiệm vụ.

text
1Đọc toàn bộ cơ sở mã này trước khi viết bất cứ điều gì.
2
3[dán repo của bạn, hoặc hướng nó vào thư mục]
4
5Mục tiêu: [nêu một kết quả có thể đo lường được — ví dụ: "giảm
6thời gian phản hồi API p95 xuống 30%" hoặc "loại bỏ tất cả các truy vấn N+1
7trong lớp dữ liệu"]
8
9Quy tắc:
10- Lập hồ sơ trước. Cho tôi thấy thời gian thực sự đi đâu
11 trước khi bạn thay đổi bất cứ điều gì.
12- Không thay đổi giao diện công khai hoặc hành vi số học.
13- Chạy bộ kiểm tra hiện có sau mỗi thay đổi.
14- Nếu một thay đổi làm cho mọi thứ tồi tệ hơn, hãy hoàn nguyên nó và cho tôi biết tại sao.
15- Làm việc cho đến khi đạt được mục tiêu hoặc bạn có thể chứng minh rằng nó
16 không thể đạt được nếu không vi phạm các quy tắc.
17
18Báo cáo khi kết thúc: bạn đã thay đổi những gì, nó mang lại lợi ích gì,
19những gì bạn đã thử mà không hiệu quả.

Dòng "những gì bạn đã thử mà không hiệu quả" rất quan trọng. Nó biến đầu ra từ một bản diff thành một nhật ký kỹ thuật.

Lời nhắc 3 — Xây Dựng Sản Phẩm 3D

Dành cho bất kỳ ai làm frontend, trang đích hoặc trực quan hóa sản phẩm.

text
1Xây dựng [vật thể] 3D tương tác trong trình duyệt.
2Một tệp HTML duy nhất. Three.js.
3
4Vật thể: [mô tả chính xác — chất liệu,
5số lượng bộ phận, bộ phận nào chuyển động]
6
7Phải bao gồm:
8- Thuộc tính chất liệu chính xác (độ bóng, độ nhám,
9 độ kim loại nếu có liên quan)
10- Chiếu sáng ba điểm với bóng đổ thực
11- Điều khiển quỹ đạo
12- [Bất kỳ tương tác nào — lắp ráp/tháo rời, hoạt ảnh,
13 trạng thái di chuột]
14
15Thanh chất lượng: cái này sẽ trông giống như một kết xuất sản phẩm,
16không phải một bản demo WebGL. Nếu một chi tiết có thể nhìn thấy trong thực tế,
17hãy mô hình hóa nó.
18
19Xây dựng toàn bộ. Cho tôi xem tệp.

Dòng "thanh chất lượng" hoạt động hiệu quả hơn bất cứ thứ gì khác trong lời nhắc. K3 phản hồi với các tiêu chuẩn, không chỉ các hướng dẫn.

Lời nhắc 4 — Tính Năng Thời Gian Thực Với Một Bộ Phận Chuyển Động

CRUD full-stack là một dạng của ứng dụng. Thời gian thực là một dạng hoàn toàn khác — trạng thái phải được đồng bộ hóa giữa các máy khách, không chỉ được lưu trữ trong cơ sở dữ liệu. Đây là nơi nhiều mô hình lặng lẽ thất bại.

text
1Thêm một tính năng thời gian thực vào ứng dụng hiện có: một hệ thống con trỏ
2+ bình luận cộng tác trực tiếp, giống như của Figma.
3
4YÊU CẦU:
5- Kết nối WebSocket (sử dụng Socket.io hoặc ws gốc)
6- Hiển thị vị trí con trỏ của những người dùng khác đang kết nối trong thời gian thực
7- Nhấp vào bất kỳ đâu để thả một ghim bình luận
8- Bình luận cập nhật trực tiếp cho tất cả các máy khách đang kết nối
9- Xử lý ngắt kết nối/kết nối lại một cách duyên dáng — không có con trỏ ma
10- Rung lắc cập nhật con trỏ để không làm ngập socket
11
12XÂY DỰNG:
131. Thiết lập máy chủ WebSocket
142. Xây dựng kết nối phía máy khách với tự động kết nối lại
153. Triển khai phát sóng con trỏ với rung lắc
164. Triển khai hệ thống ghim bình luận
175. Thêm một chỉ báo hiện diện đơn giản (ai đang trực tuyến)
186. Kiểm tra với ít nhất 2 máy khách mô phỏng để xác nhận đồng bộ hóa hoạt động
19
20Cho tôi thấy bạn đã kiểm tra đồng bộ hóa nhiều máy khách như thế nào trước khi gọi cái này là hoàn thành.

Kết quả mong đợi: Một lớp thời gian thực hoạt động trong 15–30 phút, với bằng chứng rõ ràng rằng nó đã được kiểm tra với nhiều hơn một máy khách.

Kirill - inline image

Dòng cuối cùng là phần quan trọng. Lỗi thời gian thực không xuất hiện khi chỉ có một tab trình duyệt mở — chúng xuất hiện khi có hai tab. Một mô hình bỏ qua kiểm tra nhiều máy khách sẽ đưa cho bạn mã trông có vẻ hoàn thành nhưng thực tế thì không.

Khi K3 Gặp Sự Cố: Hướng Dẫn Khắc Phục Sự Cố

Đây là một mô hình mới với các cạnh thô thực sự. Đây là những gì bị hỏng và phải làm gì.

  • Vấn đề: Nó đốt token vào các tác vụ tầm thường

Đây là vấn đề lớn và nó mang tính cấu trúc.

K3 hiện chỉ có một mức nỗ lực suy luận - 'max'. Không có chế độ "chỉ trả lời nhanh". Những người thử nghiệm độc lập đã ghi nhận 13.241 token suy luận để tạo một SVG đơn giản — khoảng 0,25 USD cho một thứ chỉ nên tốn vài phần xu.

Cách khắc phục:

không định tuyến công việc đơn giản đến K3. Đó là một mô hình tiên phong với một số duy nhất và số đó là "suy nghĩ kỹ về mọi thứ." Sử dụng K2.7 hoặc một mô hình nhỏ hơn cho boilerplate, định dạng và bất cứ thứ gì mang tính cơ học. Dành K3 cho công việc xứng đáng với sự suy luận.

Đây là sai lầm lớn nhất mà mọi người sẽ mắc phải trong tháng đầu tiên: biến K3 thành mặc định cho mọi thứ và sau đó ngạc nhiên trước hóa đơn.

  • Vấn đề: Cửa sổ ngữ cảnh vẫn bị đầy

1M token nghe có vẻ vô hạn cho đến khi bạn đặt một repo thực vào đó và nó không đủ.

Cách khắc phục:

đừng đổ mọi thứ vào. Hướng nó vào các thư mục quan trọng. Sức mạnh của K3 trong công việc tầm xa đến từ sự tập trung bền bỉ, không phải từ việc có mọi tệp trong ngữ cảnh. Một 200K mã chính xác được chọn lọc tốt hơn một 900K nguyên khối cồng kềnh của toàn bộ monorepo.

  • Vấn đề: Nó bị lạc hướng trong các lần chạy tự động rất dài

Thử nghiệm tự động kéo dài 20 giờ là có thật, nhưng nó hoạt động vì mục tiêu có thể đo lường được — "làm cho cái này nhanh hơn trên H200 mà không thay đổi các phép tính số học." Đưa ra một mục tiêu mơ hồ và một sợi dây dài và nó sẽ đi lang thang.

Cách khắc phục:

mọi lời nhắc tầm xa cần có một điều kiện thành công có thể xác minh được. Không phải "cải thiện mã." Một con số, một bài kiểm tra vượt qua, một điểm chuẩn di chuyển. Nếu bạn không thể nêu cách bạn sẽ kiểm tra xem nó có thành công hay không, nó sẽ bị lạc hướng.

  • Vấn đề: Bạn không thể tái tạo kết quả điểm chuẩn của người khác

Không ai bên ngoài Moonshot đã kiểm toán mô hình này. Trọng số sẽ không được phát hành cho đến ngày 27 tháng 7. Mọi con số đang được lưu hành ngay bây giờ — bao gồm cả trong bài viết này — đều do nhà cung cấp báo cáo.

Cách khắc phục:

chờ đến ngày 27 tháng 7, hoặc tự kiểm tra trên các tác vụ của bạn và tin tưởng vào điều đó. Năm tác vụ thực tế của bạn có giá trị hơn bất kỳ bảng điểm chuẩn nào của bất kỳ ai.

  • Vấn đề: Lỗi tích hợp sau khi chuyển đổi từ OpenAI hoặc Anthropic

K3 tương thích với OpenAI SDK, điều này xử lý 90% quá trình di chuyển. 10% còn lại thường là hành vi suy luận — K3 suy luận theo mặc định và trả về các token suy luận mà bạn có thể không mong đợi trong quá trình xử lý phản hồi của mình.

Cách khắc phục:

kiểm tra kế toán token và phân tích cú pháp phản hồi của bạn trước khi cho rằng mô hình bị hỏng. Hầu hết các khiếu nại "K3 đắt" thực ra là "Tôi quên mất token suy luận là token đầu ra."

Bối Cảnh Không Ai Nên Bỏ Qua

Moonshot có trụ sở tại Bắc Kinh, được thành lập bởi Yang Zhilin, một cựu nhà nghiên cứu của Google, và được hỗ trợ bởi Alibaba.

https://x.com/kirillk_web3/status/2057528102368977328

Họ đã xây dựng một mô hình tiên phong với 2,8 nghìn tỷ tham số trong vòng chưa đầy ba năm với các biện pháp kiểm soát xuất khẩu ngày càng leo thang của Mỹ đối với chip tiên tiến.

Các nhà phân tích của Bank of America đã nói thẳng: "Bất chấp những hạn chế về năng lực phần cứng/tính toán dai dẳng ở Trung Quốc, K3 chứng minh rằng việc mở rộng quy mô tiền đào tạo, kết hợp với đổi mới kiến trúc, vẫn có thể mang lại những bước tiến nhảy vọt cho các mô hình hàng đầu của Trung Quốc."

Và thời điểm không phải là ngẫu nhiên: K3 ra mắt vài ngày trước Hội nghị Trí tuệ Nhân tạo Thế giới 2026 tại Thượng Hải.

Câu Hỏi Ngày 27 Tháng 7

Trọng số sẽ được phát hành vào ngày 27 tháng 7. Ngày đó quan trọng hơn ngày ra mắt.

Cho đến lúc đó, K3 là một mô hình tiên phong mà bạn có thể sử dụng thông qua API — ấn tượng.

Vào ngày 27 tháng 7, nó trở thành một thứ khác: một mô hình cấp tiên phong mà bất kỳ ai cũng có thể tải xuống, kiểm tra, sửa đổi và chạy trên phần cứng của riêng họ. Không có API. Không có giới hạn sử dụng. Không có điều khoản dịch vụ. Không có lưu giữ lời nhắc trong 30 ngày.

Đó là câu chuyện thực sự. Không phải "Trung Quốc đã bắt kịp."

Trung Quốc đã bắt kịp và cho đi miễn phí.

Kirill - inline image

Đáng chú ý: Các cơ quan quản lý Trung Quốc đã thảo luận về các biện pháp kiểm soát xuất khẩu AI của riêng họ. Liệu K3 có phải là bản phát hành trọng số mở tiên phong cuối cùng từ Trung Quốc hay là bản đầu tiên trong số nhiều bản thực sự không rõ ràng vào lúc này.

Cách Dùng Thử

Trò chuyện: kimi.com — K3 đã hoạt động ngay bây giờ

API: Tương thích với OpenAI SDK, vì vậy nếu bạn đã xây dựng trên các chuỗi công cụ của OpenAI hoặc Anthropic, việc tích hợp chỉ là một thay đổi cấu hình, không phải viết lại

Trọng số: Ngày 27 tháng 7

Khả năng tương thích SDK là một vấn đề lớn hơn so với vẻ ngoài của nó. Việc hoán đổi mô hình thường có nghĩa là viết lại lớp tích hợp của bạn. Ở đây, nó có nghĩa là thay đổi một URL cơ sở và một chuỗi mô hình.

Cách Cài Đặt Kimi Code (Tác Nhân Terminal)

Nếu bạn muốn chạy K3 bên trong cơ sở mã thực tế của mình thay vì cửa sổ trò chuyện, đây là cách thiết lập.

Kirill - inline image

Yêu cầu:

  • Một máy tính (Mac, Windows hoặc Linux)
  • Quyền truy cập terminal
  • Tài khoản Kimi — kimi.com

Bước 1 — Cài đặt Kimi Code

Mac/Linux:

bash
1curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Windows (PowerShell):

text
1irm https://code.kimi.com/kimi-code/install.ps1 | iex

Trên Windows, cài đặt Git for Windows trước — CLI Kimi Code sử dụng Git Bash đi kèm của nó làm môi trường shell.

Xác minh cài đặt:

bash
1kimi --version

Do Gatekeeper của macOS, lần chạy đầu tiên có thể mất nhiều thời gian hơn đáng kể. Thêm ứng dụng terminal của bạn vào Cài đặt hệ thống → Quyền riêng tư & Bảo mật → Công cụ dành cho nhà phát triển để tăng tốc các lần khởi chạy sau.

Nếu bạn đã cài đặt uv, bạn có thể cài đặt trực tiếp:

bash
1uv tool install --python 3.13 kimi-cli

CLI Kimi Code hỗ trợ Python 3.12–3.14, với phiên bản 3.13 được khuyến nghị để có khả năng tương thích tốt nhất.

Bước 2 — Điều hướng đến dự án của bạn và khởi chạy

bash
1cd your-project
2kimi

Trong lần khởi chạy đầu tiên, chạy /login trong phiên để cấu hình nguồn API của bạn — nó sẽ mở một cửa sổ trình duyệt để xác thực OAuth.

Bước 3 — Giao cho nó một nhiệm vụ

Kimi Code hiện đang chạy bên trong dự án của bạn, với quyền truy cập đọc/ghi trực tiếp vào mọi tệp. Mô tả một nhiệm vụ bằng tiếng Anh đơn giản — nó sẽ lên kế hoạch các bước, chỉnh sửa mã, chạy kiểm tra và báo cáo những gì nó đã làm.

Điều Này Thực Sự Có Nghĩa Là Gì

Nếu bạn đang chạy khối lượng công việc sản xuất:

Hãy kiểm tra nó trước khi chuyển đổi. Các điểm chuẩn của nhà cung cấp và hiệu suất thế giới thực luôn phân kỳ. Chọn năm tác vụ thực tế, chạy song song K3 và mô hình hiện tại của bạn, đo chi phí cho mỗi công việc đã hoàn thành — không phải chi phí cho mỗi token.

Kirill - inline image

Phép toán cho mỗi tác vụ là toàn bộ lý lẽ. Ở mức 3/15 USD, K3 không rẻ trên giấy tờ. Ở mức ít hơn 21% token và đầu ra cấp Fable, nó rẻ ở nơi quan trọng.

Ngày 27 tháng 7 thay đổi cách tính toán. Trọng số mở có nghĩa là tự lưu trữ, tinh chỉnh và không phụ thuộc vào API của bất kỳ ai luôn trực tuyến hoặc các điều khoản của bất kỳ ai luôn thuận lợi. Đối với bất cứ điều gì nhạy cảm, đó không phải là một điều nhỏ nhặt.

Kết Luận

Tiên phong từng là một nơi mà các phòng thí nghiệm Mỹ xây dựng và mọi người khác ghé thăm sáu tháng sau đó.

2,8 nghìn tỷ tham số. Ngữ cảnh 1M. Lập trình cấp Fable 5 với giá Sonnet. Được xây dựng dưới các biện pháp kiểm soát xuất khẩu, bởi phòng thí nghiệm có giá trị thấp nhất trong phòng và được cho đi miễn phí vào ngày 27 tháng 7.

Câu hỏi thú vị không phải là liệu K3 có đánh bại Fable 5 trên một số điểm chuẩn hay không. Mà là điều gì sẽ xảy ra với kinh tế của các mô hình tiên phong đóng khi một mô hình trọng số mở sánh ngang với chúng.

Liên Kết

Theo dõi để biết thêm thông tin về Vibe Coding. Cảm ơn bạn đã đọc!

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral