Kimi K3 ra mắt vào ngày 16 tháng 7 năm 2026. 2,8 nghìn tỷ tham số. Ngữ cảnh 1 triệu token. Mô hình mã nguồn mở lớn nhất từng được phát hành.
Tính năng nổi bật là K3 Swarm Max: lên đến 300 tác nhân phụ chạy song song, phối hợp qua 4.000 bước, tạo ra các tệp thực tế thay vì câu trả lời dạng chat. Hai biến thể dùng chung một bộ não. K3 Max xử lý các tác vụ hàng ngày. K3 Swarm Max hướng cả một đội tàu vào vấn đề.

Hầu hết mọi người mở Kimi, gõ một câu hỏi, nhận câu trả lời, rồi đóng tab. Đó chỉ là khoảng 10% những gì sản phẩm có thể làm. Hướng dẫn này sẽ bao gồm 90% còn lại.

Swarm không phải là một phần ghép thêm. Bộ điều phối là một chính sách đã được học, được huấn luyện với Học Tăng Cường Đa Tác Nhân Song Song. Bạn mô tả mục tiêu. Swarm quyết định cách phân chia, cần tạo bao nhiêu tác nhân, và cách kết hợp các kết quả lại với nhau. Swarm hoạt động tốt với các công việc phạm vi rộng, có thể song song hóa: nghiên cứu qua 50+ nguồn, phân tích hàng loạt, giám sát cạnh tranh, xây dựng tập dữ liệu. Chúng gặp khó khăn với các tác vụ tuần tự sâu, nơi bước 3 phụ thuộc vào bước 2.

- Viết một bản spec, không phải một prompt
"Nghiên cứu thị trường ứng dụng thể dục" là cách bạn đốt credit và nhận lại rác. Một prompt một dòng cho phép swarm tự quyết định mọi thứ. Nó sẽ quyết định sai.

Hãy đối xử với swarm như một nhà thầu. Một bản spec xác định rõ cần thu thập gì, thế nào là hợp lệ, nguồn nào được phép, định dạng đầu ra chính xác, và phải làm gì khi có xung đột. Spec là thành phần đòn bẩy cao nhất trong toàn bộ quy trình, bởi vì ở Cấp độ 2, nó trở thành hạt giống cho Kỹ năng có thể tái sử dụng của bạn.
1# DỰ ÁN: [tên]2MỤC TIÊU: [một câu, sản phẩm bàn giao, không phải chủ đề]3PHẠM VI: [những gì bao gồm, những gì loại trừ rõ ràng]4QUY TẮC: [xác thực, thế nào được coi là phát hiện đã xác minh]5NGUỒN: [bài đăng chính thức, bài báo, chỉ nguồn chính, không trang tổng hợp]6ĐẦU RA: [loại tệp / số lượng / cách đặt tên / chi tiết định dạng]7KHI XUNG ĐỘT: đánh dấu hàng đó, không bao giờ giải quyết âm thầm8ĐIỀU KIỆN DỪNG: [khi nào nên dừng và báo cáo thay vì đoán]
- Đọc kế hoạch phân chia trước khi bạn tiêu tốn
Sau khi bạn gửi spec, Kimi sẽ hiển thị kế hoạch thực thi trước khi chạy: bao nhiêu tác nhân phụ, mỗi tác nhân xử lý gì, thứ tự phụ thuộc, ngân sách bước. Đây là bước mà người mới thường bỏ qua, và đó là bước đắt giá nhất để bỏ qua.

Một swarm 200 tác nhân phân chia sai sẽ tiêu tốn tiền thật. Kiểm tra kế hoạch không tốn gì. Bạn cần tìm ba điều: nó có hiểu phạm vi không, số lượng tác nhân có hợp lý cho tác vụ không, và kế hoạch đầu ra có khớp với những gì bạn thực sự cần không.
1Cho tôi xem đề xuất phân chia trước khi chạy:2- có bao nhiêu tác nhân phụ, và mỗi tác nhân xử lý gì3- thứ tự phụ thuộc (cái gì chặn cái gì)4- ngân sách bước ước tính5- nơi nào có nguy cơ giảm chất lượng lớn nhất6CHƯA thực thi. Chờ xác nhận của tôi.
Một chi tiết đáng biết: 4.000 bước là tổng ngân sách phối hợp trên toàn bộ swarm, không phải 4.000 mỗi tác nhân. Một lần chạy 300 tác nhân trung bình mỗi tác nhân khoảng 13 bước. Điều đó cho bạn biết liệu tác vụ của bạn có phù hợp với hình dạng này không.
- Chạy nó
Bây giờ bạn thực thi. Lên đến 300 tác nhân phụ khởi chạy theo từng đợt song song, mỗi tác nhân trong ngữ cảnh giới hạn riêng. Chỉ đầu ra có cấu trúc mới được gửi lại bộ điều phối.
1Thực thi spec từ đầu đến cuối.2Song song hóa ở bất cứ nơi nào kế hoạch cho phép.3Báo cáo ngay bất kỳ trình chặn nào, không giải quyết âm thầm.4Hợp nhất mọi thứ vào ĐẦU RA đã định nghĩa trong spec.
Bạn có gì sau Cấp độ 1
Một đầu ra swarm duy nhất được xây dựng từ spec của bạn. Thô, chưa xác minh, nhưng có cấu trúc. Hầu hết mọi người dừng lại ở đây. Giá trị thực sự bắt đầu từ Cấp độ 2.

- Yêu cầu tệp thực tế, không phải câu trả lời dạng chat
"Một báo cáo toàn diện" cho phép các tác nhân dừng lại sớm. "Một PDF 40 trang + một CSV 20.000 hàng + 14 biểu đồ PNG sẵn sàng xuất" cho họ một mục tiêu chất lượng.
Luôn dẫn đầu spec bằng đầu ra. Tính cụ thể ở cấp độ đầu ra là sự khác biệt giữa một đội nghiên cứu và một hộp gợi ý đắt tiền.
1# ví dụ đầu ra mạnh:2ĐẦU RA: 1 .xlsx, một hàng mỗi mô hình, + bản tóm tắt 200 từ3ĐẦU RA: 30 tệp HTML, một tệp mỗi cửa hàng, đặt tên theo doanh nghiệp4ĐẦU RA: PDF 40 trang + CSV 20.000 hàng + 14 biểu đồ PNG
- Yêu cầu tệp thực tế, không phải câu trả lời dạng chat
"Một báo cáo toàn diện" cho phép các tác nhân dừng lại sớm. "Một PDF 40 trang + một CSV 20.000 hàng + 14 biểu đồ PNG sẵn sàng xuất" cho họ một mục tiêu chất lượng. Luôn dẫn đầu spec bằng đầu ra. Tính cụ thể ở cấp độ đầu ra là sự khác biệt giữa một đội nghiên cứu và một hộp gợi ý đắt tiền.
1# ví dụ đầu ra mạnh:2ĐẦU RA: 1 .xlsx, một hàng mỗi mô hình, + bản tóm tắt 200 từ3ĐẦU RA: 30 tệp HTML, một tệp mỗi cửa hàng, đặt tên theo doanh nghiệp4ĐẦU RA: PDF 40 trang + CSV 20.000 hàng + 14 biểu đồ PNG
- Chỉ một mô hình riêng biệt vào đầu ra
Lỗ hổng đã biết của swarm: trừ khi bạn yêu cầu xác minh rõ ràng, nó tạo ra các tuyên bố tự tin, thiếu trích dẫn, và các tác nhân phụ độc lập đôi khi mâu thuẫn với nhau. "Trông có vẻ xong" và "đúng" là hai hành tinh khác nhau.
Sử dụng một mô hình thứ hai làm cổng xác minh. Công việc duy nhất của nó: bác bỏ, không phải khen ngợi. Bạn không trả token cao cấp để tạo ra. Bạn trả chúng để bắt lỗi âm thầm trước khi bước tiếp theo lưu quy trình công việc dưới dạng Kỹ năng có thể tái sử dụng.

1Bạn là NGƯỜI XÁC MINH. Một swarm các tác nhân đã tạo ra đầu ra đính kèm.2Công việc duy nhất của bạn là tìm ra những gì sai.34Kiểm tra:5- Mọi con số được tuyên bố có dẫn đến một nguồn được đặt tên không?6- Có hai phần nào mâu thuẫn với nhau không?7- Có điều gì được trình bày như sự thật nhưng thực ra là suy luận?8- Đầu ra có khớp với yêu cầu định dạng của spec không?910Với mỗi vấn đề: trích dẫn vị trí chính xác và cách sửa.11Nếu mọi thứ đều ổn: ĐÃ DUYỆT.12Nếu bất cứ điều gì sai: TỪ CHỐI + sửa lỗi quan trọng nhất trước.
- Lưu toàn bộ quy trình công việc dưới dạng Kỹ năng
Sau một lần chạy đã xác minh, yêu cầu Kimi ghi lại toàn bộ quy trình công việc: định dạng đầu vào, các bước tác nhân, định dạng đầu ra, quy tắc xác thực. Lần chạy đầu tiên mất 20 phút. Mọi lần chạy sau mất 30 giây. Kỹ năng là lý do hệ thống tích lũy thay vì khởi động lại mỗi lần.
1Lưu toàn bộ quy trình công việc này dưới dạng Kỹ năng có thể tái sử dụng: "[tên]"2Ghi lại:3- định dạng đầu vào (những tệp / hình dạng spec nào nó mong đợi)4- các bước tác nhân đã hoạt động5- định dạng đầu ra và quy ước đặt tên6- các quy tắc xác thực từ spec7Lần tới tôi chạy cái này, tôi đính kèm tệp mới và nhận được cùng hình dạng.
Bạn có gì sau Cấp độ 2
Một đầu ra đã xác minh mà bạn có thể tin tưởng, và một Kỹ năng đã lưu mà bạn có thể phát lại mà không cần xây dựng lại spec. Đây là nơi vòng lặp bắt đầu tích lũy.

- Đưa tài liệu của riêng bạn vào làm kiến thức swarm
Kỹ năng ghi lại quy trình. Tài liệu thành Kỹ năng ghi lại miền. Tải lên công việc tốt nhất của bạn và Kimi ghi lại dấu vân tay cấu trúc của nó dưới dạng một kỹ năng mà mọi swarm trong tương lai sẽ áp dụng.

Mọi PDF, bản ghi chép, hay bảng tính bạn đưa vào đều trở thành ngữ cảnh mà tất cả 300 tác nhân dựa vào, thay vì dựa vào dữ liệu huấn luyện. Bạn càng đưa nhiều vào, đầu ra càng giống công việc của bạn thay vì AI chung chung.
1Ghi lại tài liệu này dưới dạng một kỹ năng có thể tái sử dụng. Xác định những gì làm nó hoạt động:2- cấu trúc và thứ tự các phần3- giọng điệu và mức độ giọng nói4- độ sâu phân tích mỗi phần5Lưu nó dưới dạng "[tên]". Sau đó tạo một tài liệu mới về [chủ đề khác]6sử dụng kỹ năng đã ghi lại. Khớp mức chất lượng, không phải nội dung.
- Biến mỗi lần từ chối thành một quy tắc vĩnh viễn
Bước xác minh bắt được một lỗi một lần. Bước này đảm bảo swarm không bao giờ mắc lỗi đó nữa. Chắt lọc phản hồi thành các quy tắc cứng và viết chúng vào một tệp ràng buộc mà swarm đọc trước khi làm bất cứ điều gì.
1# CONSTRAINTS.md, được tải tự động2- mọi con số được tuyên bố phải dẫn đến nguồn chính hoặc được gắn cờ3- không giải quyết xung đột âm thầm: hiển thị mâu thuẫn4- [quy tắc được chắt lọc từ phản hồi của người xác minh lần chạy trước]5- [lỗi bạn không bao giờ muốn lặp lại]6Khóa phạm vi: không chạm vào bất cứ thứ gì bên ngoài khối PHẠM VI của spec.
- Phát lại kỹ năng trên các đầu vào mới
Đây là nơi "tích lũy" không còn là một từ thông dụng và xuất hiện trên hóa đơn. Lần chạy thứ hai không bắt đầu từ con số không. Nó bắt đầu từ kỹ năng, kiến thức swarm, và tệp ràng buộc bạn đã xây dựng ở trên. Cùng quy trình công việc, tệp mới, một phần nhỏ thời gian thiết lập.
Kinh tế học thay đổi đáng kể khi phát lại. Giá cache-hit của K3 giảm xuống còn $0,30 mỗi triệu token cho ngữ cảnh lặp lại, rẻ hơn 10 lần so với giá đầu vào lần chạy đầu tiên. Kỹ năng, ràng buộc, và spec đều là ngữ cảnh lặp lại. Chỉ các tệp đầu vào mới của bạn mới có giá đầy đủ. Lần chạy đầu tiên là một khoản đầu tư. Mọi lần chạy tiếp theo đều thu hoạch lợi nhuận.

Đầu ra cũng cải thiện về mặt cấu trúc. Kỹ năng thực thi định dạng. Ràng buộc chặn mọi lỗi mà người xác minh đã bắt. Kiến thức swarm căn cứ mọi tác nhân vào tài liệu thực tế của bạn thay vì dữ liệu huấn luyện. Lần chạy thứ tư không chỉ rẻ hơn lần chạy đầu tiên. Nó tạo ra kết quả tốt hơn, bởi vì hệ thống đã học hỏi từ ba vòng phản hồi thực tế.

1Chạy kỹ năng đã lưu "[tên]" trên các đầu vào mới này.2Áp dụng CONSTRAINTS.md. Sử dụng định dạng đầu ra đã ghi lại.3[đính kèm tệp mới]45So sánh đầu ra của lần chạy này với lần chạy trước.6Báo cáo:7- phát hiện mới không có lần trước8- phát hiện đã thay đổi kể từ lần chạy trước9- bất cứ điều gì đã biến mất (gắn cờ là khoảng trống tiềm năng)10- sai lệch so với hình dạng mong đợi của kỹ năng
Bạn có gì sau Cấp độ 3
Một đường ống nghiên cứu tự cải thiện. Mỗi lần chạy rẻ hơn, nhanh hơn, và chính xác hơn lần trước vì thư viện kỹ năng, cơ sở kiến thức, và tệp ràng buộc tiếp tục phát triển.

- Nâng cấp kỹ năng thành một tác nhân được lên lịch
Khi vòng lặp đã ổn định và được hỗ trợ bởi kỹ năng, bạn ngừng khởi chạy thủ công. Hướng Kimi vào một trình kích hoạt: một lịch trình, một tệp mới được thả, một URL được giám sát. Để nó chạy toàn bộ swarm một cách chủ động, chỉ đưa ra sản phẩm bàn giao và những sai lệch đáng để bạn chú ý.

Giám sát cạnh tranh là một ví dụ rõ ràng. Lần chạy một: bạn xây dựng và xác minh bằng tay. Đến khi nó trở thành một tác nhân nền, nó đang kiểm tra mọi đối thủ cạnh tranh song song hàng tuần và thả một bản tóm tắt vào hộp thư đến của bạn với chi phí thời gian biên bằng không. Con người duy nhất còn lại trong vòng lặp là câu hỏi bạn đặt ra và quyết định bạn đưa ra trên câu trả lời.
1Chạy kỹ năng "[tên]" theo lịch hàng tuần.2Trình kích hoạt: [lịch trình / tệp mới / URL được giám sát]3Mỗi lần chạy: thực thi swarm, áp dụng CONSTRAINTS.md,4xác minh, sau đó gửi ĐẦU RA + sự khác biệt so với lần chạy trước.5Chỉ ping tôi nếu một sai lệch vượt qua [ngưỡng].
Những gì 2,8 nghìn tỷ tham số không thể sửa được

Ảo giác mở rộng theo độ song song. Càng nhiều tác nhân tìm kiếm, càng có nhiều câu trả lời sai nhưng tự tin trừ khi bạn chạy một bước xác minh. Swarm không tự kiểm tra thực tế.
K3 đắt gấp 3-4 lần K2.6. Đầu vào: $3,00/M so với $0,95/M. Đầu ra: $15,00/M so với $4,00/M. Bộ nhớ đệm giúp ích khi phát lại, nhưng lần chạy đầu tiên rất đắt. Để tối ưu hóa chi phí thuần túy, K2.6 vẫn là lựa chọn tiết kiệm.
Trọng số mở chưa được phát hành. Moonshot đã hứa chúng vào ngày 27 tháng 7 năm 2026. Cho đến lúc đó, K3 chỉ chạy qua API và ứng dụng Kimi.
Swarm khuếch đại các spec tồi. Một prompt mơ hồ qua một tác nhân lãng phí một cửa sổ ngữ cảnh. Qua 300 tác nhân, nó lãng phí 300 cửa sổ song song.
Danh sách ngắn
- Prompt một dòng. Swarm tự quyết định mọi thứ. Nó quyết định sai.
- Bỏ qua đánh giá phân chia. Bước đắt nhất để bỏ qua.
- Không có bước xác minh. "Trông có vẻ xong" không phải là "đúng."
- Lưu đầu ra chưa xác minh dưới dạng kỹ năng. Lỗi này tích lũy trong mọi lần chạy trong tương lai.
- 300 tác nhân cho một tác vụ tuần tự. Một swarm không thể song song hóa một chuỗi suy nghĩ.
- Sử dụng K3 khi K2.6 là đủ. Không phải mọi tác vụ đều cần 2,8 nghìn tỷ tham số.
Kết luận
Hầu hết mọi người sẽ mở Kimi, gõ một câu hỏi, đóng tab. Đó là hộp chat. Nó chỉ chiếm khoảng 10% những gì K3 có thể làm.
90% còn lại là một đội nghiên cứu bạn xây dựng một lần và phát lại mãi mãi. Mỗi cấp độ mở khóa thêm đòn bẩy: đầu tiên là chạy, sau đó là tin cậy, rồi tích lũy, rồi tự chủ. Bạn không cần cả bốn cấp độ vào ngày đầu tiên. Bắt đầu từ Cấp độ 1 với một spec. Nếu đầu ra hữu ích, chuyển sang Cấp độ 2 và xác minh nó. Nếu bạn định chạy lại, hãy lưu Kỹ năng. Hệ thống sẽ trở nên sắc bén hơn từ đó.
Viết spec, không phải prompt. Xác minh trước khi lưu. Sau đó xem mọi lần chạy rẻ hơn và sắc bén hơn lần trước.





