四天前,史上最大的開源權重 AI 模型低調上線了。
把這篇存起來 :)
沒有主題演講,沒有直播。Moonshot AI 只是在一夜之間把 kimi.com 翻新,然後推出了 Kimi K3:2.8 兆個參數、一百萬 token 的上下文視窗,以及一項從未有開源模型做到過的編碼能力。
在 Arena 的盲測中(開發者不知道答案來自哪個模型,直接對輸出投票),K3 在「前端程式碼」賽道拿下第一名。它贏過了 Claude Fable 5,也贏過了 GPT-5.6 Sol。第一名,而且是開發者在不曉得自己選的是開源模型的情況下,選出來的。
多數人看到標題就滑過去了。幾乎沒有人真正去測試它到底能做出什麼東西。
我做了。以下是 K3 從單一提示詞就能產出的 20 樣東西,其中大部分連那些在吵基準測試的人都沒試過。直接複製提示詞,自己測試看看。在它被洗版之前,先把這篇存起來。
在列出清單前,先說個老實話,因為誠實才是重點:K3 在盲測中的前端程式碼確實是世界第一,但整體來說大約排在第四名,大概跟 Opus 4.8 同級,在更廣泛的基準測試上落後 Fable 5 和 GPT-5.6 Sol。但在它擅長的領域,它贏得很徹底。這份清單就是那些領域。
首先,用 60 秒搞懂 K3 到底是什麼
如果你是新手,在我們進入實際作品之前,先用白話文講清楚。
Kimi K3 是 Moonshot AI 的大型語言模型,這是一家北京實驗室,由前 Google 研究員楊植麟創立,並獲得阿里巴巴支持。它於 2026 年 7 月 16 日推出,有兩種版本:Max 版本用於對話和 Agent 工作,Swarm 版本則專為大規模平行任務設計。
2.8 兆參數這個數字聽起來根本跑不動,但實際上 K3 是混合專家模型(Mixture-of-Experts)。想像一下,不是用一個巨大的大腦,而是 896 個專家。對於任何給定的任務,它只會喚醒最適合的 16 個專家(約佔總數的 1.8%),其他專家則保持休眠。所以它擁有 2.8 兆參數模型的知識,但實際運算成本卻低得多。紙上看起來巨大,實際運作卻很精簡。這就是讓下面所有東西都變得負擔得起的關鍵。
再加上三項功能:一百萬 token 的上下文視窗,讓整個程式碼庫或一疊長文件都能一次放入記憶體;原生多模態輸入,可以直接讀取圖像和影片,而不是透過附加元件;以及永遠開啟的推理能力(Moonshot 稱之為「思考模式」),讓它預設就會逐步解決問題。最後這項是雙面刃,我們之後會再提到。
這就是這台機器。現在來看看它能做什麼。
第一部分:遊戲與 3D 世界(它打敗所有東西的領域)
這正是讓 K3 拿下競技場第一名的類別。從「描述一個 3D 東西」到「有個能用的 3D 東西」之間的鴻溝,現在只需要一個提示詞。
1. 具備真實物理的瀏覽器可玩遊戲。
不是那種看起來像遊戲的展示品。而是有碰撞反應、衝擊回饋,而且物理表現真實的可玩場景。有人已經從單一提示詞中拉出了包含視覺效果的戰鬥競技場、有擺盪機制的瀏覽器 3D 城市探索、俯視角賽車,還有殭屍射擊遊戲。K3 強大的地方在於,它處理了那些通常會出錯的二十個小細節:碰撞反應、動量、鏡頭手感。
1建立一個單一檔案的瀏覽器遊戲:一個俯視角競技場,玩家要閃避並射擊一波波的敵人。2使用 WebGL 或 canvas,無外部素材。3包含:真實的移動動量、敵人受擊反應、衝擊時螢幕震動、分數計算器,以及重新開始按鈕。4目標 60fps。讓它感覺反應靈敏,而不是飄飄的。把整個東西做出來。
2. 看起來像渲染圖、而不是展示品的互動式 3D 產品。
一隻光澤度和光線行為都正確的手錶。一台可以拆解的相機。一個由數十個獨立零件組成的機械物件,點擊時可以組裝和拆解。和之前所有「AI 做出 3D 東西」的嘗試不同之處在於材質的準確性:粗糙度、金屬感,以及真正的陰影,而不是扁平塑膠。
3. 經過計算而非動畫的物理模擬。
會飄動的布料。會因自身重量而倒塌的結構。兩輛車在空中碰撞,動量轉移看起來正確,而不是腳本化的效果。具有真實波浪動態的海洋表面。叫 K3 計算物理並在數學公式旁加上註解,讓你可以驗證,它會照做。
1建立三個 HTML5 canvas 場景,使用計算物理,無函式庫,每個檔案一個:2(1) 一座橋倒塌,將一輛車掉入水中並產生水位移,3(2) 布料落在一個看不見的物體上,4(3) 一堆積木被輕輕一推後倒下。5物理是計算出來的,不是動畫,60fps,有重置按鈕,並在方程式旁加上註解。6不要先問問題。
4. Shader 和 WebGPU 視覺場景。
真正困難的圖形工作。一個具有重力透鏡效應的黑洞,會彎曲其後方的星空。由數千個粒子組成的粒子系統。隨你移動而生成的程式化地形。以前需要靠寫 GLSL 維生的人才能完成的工作,K3 可以起草,然後根據你設定的品質標準來改進。訣竅是明確說出標準,例如「這應該看起來像 demoscene 作品,而不是教學範例」,因為 K3 對標準的反應遠比對指令更敏銳。
1建立一個單一檔案的 WebGL 場景:一個具有重力透鏡效應的黑洞,能明顯彎曲其後方的星空,2加上一個根據溫度顯示顏色的吸積盤。3加入軌道控制。品質標準:這應該看起來像科學視覺化,而不是 shader 教學。4建立這個檔案。
第二部分:真實產品與介面
除了視覺效果之外,K3 的前端能力也轉化為可出貨的產品工作。
5. 看起來有設計感、而不是模板的登陸頁面。
給它一個產品和一種美學風格(例如「野獸派」、「溫暖編輯風格」、「乾淨金融科技風」),它就能產出一個具有真正排版層次和佈局意圖的頁面,而不是那種 AI 垃圾的通用感。明確設定標準,它就能達成。
6. 根據規格產生的全端應用程式骨架。
描述產品、技術棧和功能,K3 就會把前端、後端、資料庫結構和認證層一起骨架化,而且彼此串接,而不是零散的片段。這不是玩具;這是一個你可以從中強化、真正可用的起點程式碼庫,這正是它長程規劃能力的設計目標。把完整規格放在一個提示詞中,讓它分階段建構。
1建立一個習慣追蹤網頁應用程式的骨架。技術棧:React 前端、Node/Express API、2Postgres、電子郵件+密碼認證。功能:用戶註冊、建立/編輯/刪除習慣、3每日簽到、連續天數計數器、每週摘要檢視。4先建立資料庫結構,然後是 API,最後是 UI。把它們串接起來,5並註明運行時需要設定的任何事項。
7. 真正保持同步的即時協作功能。
這是較弱模型會偷偷造假的地方。即時狀態必須在客戶端之間同步,而不只是儲存到資料庫,而且錯誤只有在打開兩個瀏覽器時才會出現。K3 處理 WebSocket 層、重新連線和多客戶端同步,你可以要求它證明工作成果。
1為一個應用程式加入即時協作層:即時游標加上點擊放置評論圖釘,類似 Figma。2使用 WebSocket(Socket.io 或原生 ws)。需求:其他用戶的游標即時顯示、3評論立即對所有人出現、優雅重新連線且無幽靈游標、游標更新去抖動。4完整建立從頭到尾,然後在用兩個模擬客戶端證明同步正常運作後,才算完成。
8. 從原始資料產生的儀表板和資料視覺化。
給它一個 CSV 檔案和一個問題,它就能一次建立互動式儀表板、圖表和篩選器。它的圖表和圖形推理能力是其有記錄的強項之一,所以它不只是繪製數據,還會推理數據顯示了什麼。
第三部分:嚴肅工程(長程超能力)
K3 是為了在大型程式碼庫中進行持續編碼會話而設計的。如果你靠寫程式維生,這部分很重要。
9. 具有可衡量目標的完整儲存庫工作。
這是使用 K3 最強大的方式。不要給它一個任務,而是給它一個結果目標,讓它一直工作直到數字改變。
1在修改任何東西之前,先閱讀整個程式碼庫。2目標:將 /search 端點的 p95 回應時間降低 30%。3規則:先進行效能分析,告訴我時間花在哪裡;不要改變公開介面或輸出;4每次修改後執行測試;如果某個修改讓事情變得更糟,就還原它並說明原因。5持續工作直到達成目標,或者你能證明在不違反規則的情況下無法達成目標。6最後提供一個日誌:你改了什麼、獲得了多少改善、你嘗試過但失敗了什麼。
10. 一次將整個真實儲存庫放入上下文。
一百萬 token 的視窗在這裡不是規格表上的炫耀。你可以載入一個真實的程式碼庫,然後問架構層級的問題、撰寫文件,或追蹤橫跨數十個檔案的錯誤,因為模型實際上可以看到整個東西,而不是猜測你沒有貼上的部分。這是 K3 和視窗較小的模型之間最大的實際差異:它推理的是你的系統,而不是系統的片段。不過有一個值得注意的陷阱:通常,精選 20 萬個重要檔案,比塞入 90 萬個整個單一儲存庫的垃圾檔案更好,因為它的長程超能力來自於專注,而不是數量。
11. 在框架或語言之間遷移程式碼。
K3 在多語言軟體工程方面處於領先地位,所以將服務從一種語言移植到另一種語言,或從一個框架移植到其後繼者,正是它的強項,包括那些通常會被忽略的無聊邊緣情況。因為它將整個專案放在上下文中,所以能在遷移過程中保持行為一致,而不是逐個檔案翻譯,然後悄悄改變程式碼的實際功能。
12. 具有可驗證成功條件的自主會話。
K3 可以長時間、大部分時間無人看管地運行,但只有在目標是可檢查的情況下才能表現良好。「改善程式碼」會讓它迷失方向。而「讓這個測試通過」或「達到這個基準」則給它一個可以努力達成的目標,而不會偏離方向。永遠給長程任務一個數字,而不是一種感覺。
第四部分:Agent、工具與研究
K3 在工具使用和網路研究基準測試中接近頂尖,這讓它不僅僅是一個寫作者,更是一個操作者。
13. 終端機和瀏覽器協調。
它驅動 shell、瀏覽器和 API 呼叫,而不會崩潰,這是每個真實 Agent 任務所需的連接組織。將它指向一個需要查閱資料並採取行動的目標,它會自己串聯步驟,而不是在每個岔路口停下來問你要做什麼。
1目標:在這個開源專案的 GitHub issues 中找出最受歡迎的三個功能,2然後為最受歡迎的那個功能草擬一份簡短規格。3步驟:搜尋該儲存庫的 issues,按反應數量和評論數量排序,4找出前三個,選擇影響最大的那個,寫一頁規格,包含範圍、邊緣情況和大致的實作計畫。5展示你的工作過程。
14. 深度、工具增強的網路研究。
K3 在瀏覽基準測試中處於領先地位。給它一個研究問題,它就會搜尋、閱讀主要來源、交叉比對,然後帶著結構化且附有引用的結果回來,而且花費的時間比以前瀏覽十個分頁還短。
15. 透過 Swarm 變體進行大規模平行工作。
K3 以兩種形式推出,而 Swarm 變體是為大規模平行處理而設計的:將一個大型批次任務同時分派給許多子 Agent,然後合併結果,而不是一個接一個地慢慢處理。
16. 將一堆文件轉化為單一可交付成果。
將它指向一個 PDF 資料夾或一個長篇研究語料庫,要求一個綜合輸出——例如文獻回顧、比較表格、摘要簡報——它會處理整個集合,然後交出組裝好的結果,而不是十五份獨立的摘要。
第五部分:多模態與強大操作
K3 原生讀取文字、圖像和影片,這開啟了不同層級的工作。
17. 從螢幕截圖或模型直接生成可運行的程式碼。
給它一個設計模型或介面截圖,它就會寫出複製該介面的前端程式碼。原生視覺能力加上其前端王冠,讓這成為此清單中對任何建構 UI 的人來說最實用的功能之一。
18. 對圖表、圖形和視覺數學進行推理。
給它一個圖表、圖解或拍攝的數學問題,它不僅會描述圖像,還會進行推理、提取數字並進行運算,在需要真正計算時會使用 Python 支援。這是有記錄的其中一個最先進領域。
19. 將影片理解作為輸入。
因為多模態輸入包含影片,你可以直接將影片片段作為上下文交給它,而不需要先進行轉錄,讓它推理螢幕上實際發生的事件。
20. 在 7 月 27 日之後完全擁有該模型。
最強大的操作是大多數人誤解的那個。7 月 27 日,K3 的完整權重將在寬鬆許可證下開放。對於一個認真的團隊來說,這意味著可以在自己的硬體上自行託管、用自己的資料進行微調、檢查其確切行為,並且不需要依賴任何人的 API 持續上線或條款保持有利。這種獨立性,對於一個接近前沿的模型來說,才是真正重塑市場的部分。
在深入之前,兩個誠實的警告
因為一份沒有附帶條款的超能力清單,就是讓人浪費錢並被燒傷的方式。
不要把 K3 當作所有事情的預設模型。 它的推理永遠開啟。它會對每個請求進行深入思考,這對上面二十件事來說很棒,但對於格式化清單或重新命名變數來說就很荒謬。早期測試者看到它在那些應該只花費幾分之一的任務上燒掉數千個推理 token。將瑣碎的工作路由到更小、更快的模型,把 K3 留給需要真正運算力的工作。這是新用戶最常犯的代價高昂的錯誤。
不過,關於成本有一個細微差別,它反過來也說明了另一面:K3 的 API 價格是每百萬輸入 token 3 美元、每百萬輸出 token 15 美元,屬於中階,不算便宜,但它完成一個真實工作所使用的輸出 token 通常比那些價格更高但會繞來繞去才能得到相同答案的模型更少。所以,誠實的評估方式是看「完成任務的總成本」,而不是「每 token 成本」。在它設計的工作上,總帳單通常比標價看起來更低。但在瑣碎工作上,永遠開啟的思考模式完全抹去了這個優勢,這正是路由之所以重要的原因。
「開源權重」並不代表「可以在你的筆電上運行」。 當權重在 7 月 27 日發布時,你並不是把 K3 下載到你的 MacBook 上。即使經過高度壓縮,它仍然遠超過 1 TB,並且需要數十個加速晶片才能運行。開源權重是送給能夠自行託管的組織和能夠進行微調的研究人員的禮物,而不是給你遊戲 PC 的私人模型。對幾乎所有人來說,「使用 K3」意味著使用應用程式或 API,這完全沒問題。
如何立即試用
→ 聊天: kimi.com,現在就上線,零設定的方式,可以直接運行上面的所有提示詞。
→ API: 與 OpenAI-SDK 相容,所以從 OpenAI 或 Anthropic 的設定切換過來,只需要改基礎 URL 和模型字串,不需要重寫。
→ 在你的程式碼庫中: 從 kimi.com 的官方說明安裝 Kimi Code CLI,打開你的專案,讓它直接存取檔案來規劃、編輯和測試。
→ 權重: 完整開放發布預計在 7 月 27 日,這一天之後,它就不再是你租用的服務,而是任何擁有硬體的人都可以擁有的東西。
為什麼這比基準測試更重要
先退一步看提示詞,因為背景才是真正的故事。
Moonshot 在美國對你通常需要訓練這種規模模型所需的晶片實施出口管制不斷升級的三年內,建造了一個 2.8 兆參數、接近前沿的模型。他們靠的是架構上的巧思,而不是原始運算力,然後,他們沒有把它永遠鎖在 API 後面,反而宣布要免費釋出權重。這個發布時間正好選在上海世界人工智慧大會之前,這不是巧合。
有趣的問題從來不是「中國是否趕上了」。而是當一個免費、開源的模型落在同一個等級時,封閉、昂貴的前沿模型的經濟學將會發生什麼變化。當前沿等級的能力不再只有三家公司可以銷售,而是任何有資源的團隊都可以下載時,封閉實驗室的定價能力就會改變。這種壓力才是這裡真正的事件,比任何單一基準測試數字都重要。
還有一個真正的開放問題懸而未決。中國監管機構一直在討論他們自己的 AI 出口規則,所以 K3 是來自那邊的最後一個偉大開源權重發布,還是眾多發布中的第一個,目前還不清楚。無論如何,模型已經出來了,而且不會再回去。
真正的重點
三年來,情況很簡單:美國實驗室建造了前沿,而其他所有人半年後得到一個更便宜的複製品。Kimi K3 打破了這個模式。它是史上最大的開源模型,在盲測中是世界第一的前端程式碼模型,而且一週後就會免費。
它不是最便宜的 token,它沒有在所有排行榜上排名第一,你也不會在家裡運行它。這些都是真的,但沒有一個改變這個標題:一個在建造東西方面擊敗封閉旗艦模型的前沿等級模型,即將屬於每個人。
上面的二十個提示詞就是你的領先優勢。那些本週實際運行它們的人,將會知道這個模型能做些什麼,而其他人還在爭論基準測試表格。
大多數人會看到發布推文,然後永遠不會打開模型。而那些花一個晚上用它來建造東西的人,將會比整個時間線領先一個月。
我會剖析每一次主要的 AI 發布,不帶 hype,並提供提示詞讓你自己試試看。追蹤我,準備好下一次,並在 K3 還是新聞時把這篇存起來。
如何試用:
→ 聊天與應用程式: kimi.com
→ API: 與 OpenAI-SDK 相容
→ 開源權重: 預計 7 月 27 日
如果你覺得這篇文章有用,請追蹤我 @eng_khairallah1 以獲得更多類似這樣的 AI 內容。我每週都會發布分析、課程和工具。
希望這對你有幫助,Khairallah ❤️





