Kimi K3 終結了 AI 訂閱時代

@0xDominiqq
英語3 天前 · 2026年7月18日
275K
83
12
4
176

TL;DR

Moonshot AI 的 Kimi K3 引入了擁有 2.8 兆參數的開源權重模型,具備百萬級 Token 的上下文視窗,透過混合專家模型(MoE)與創新的注意力機制,大幅降低成本並挑戰封閉式 API 的壟斷地位。

頭條數字不是故事的全部

7 月 27 日,Moonshot AI 以修改版 MIT 授權發布了 Kimi K3 的完整權重。規格表看起來像在炫技:2.8 兆個參數、一百萬 token 的上下文視窗,以及史上最大開源權重模型(比 DeepSeek V4 Pro 大約 75%)的頭銜。

但這個規模只是誘餌。真正的故事在於,誰掌控了前沿級 AI 的存取權。三年來,最好的模型都藏在 API 後面。你付租金,房東說了算,如果供應商調漲端點價格或悄悄改變模型行為,你的產品就得承受後果。

開放權重打破了这个格局。一旦檔案公開,沒有任何實驗室能收回這項能力。這一個事實就改變了所有人的經濟模式,包括那些永遠不會下載任何一個分片的用戶。

規格一覽

規格

數值

參數

2.8 兆

專家

896 個總數,每 token 啟動 16 個

上下文視窗

1,048,576 個 token

授權

修改版 MIT

權重發布

7 月 27 日

與 DeepSeek V4 Pro 相比

大約大 75%

與 K2 相比的擴展效率

大約 2.5 倍

定價

費率

輸入(快取命中)

$0.30 / 每 1M tokens

輸入(快取未命中)

$3.00 / 每 1M tokens

輸出

$15.00 / 每 1M tokens

2.8T 模型如何避開 2.8T 的帳單

這個規模的密集模型根本無法使用。對每個 token 都運行所有參數,是所有兆級模型都會撞上的牆:太慢、太貴、根本無解。

K3 透過激進的混合專家(MoE)設計繞過了這個問題。模型內部有 896 個專門的子網路。在任何一個 token 上,只有 16 個會被啟動。你獲得了 2.8 兆參數的儲存知識,卻只需支付一小部分模型規模的推論成本。

這就是稀疏性,而 K3 比任何先前的開源模型都更依賴它。K2 證明了這個方法可行。K3 則將其變成了核心賭注。

Dominique - inline image

兩篇扛起重擔的研究論文

兩項架構變革讓其他一切成為可能,而且這兩項變革都在模型發布前以開放研究的形式發表,這讓 Moonshot 在還沒看到任何基準測試前,就贏得了研究人員的信任。

第一個是 Kimi Delta Attention(KDA),一種混合線性注意力機制。標準注意力機制的成本會隨著上下文變長而呈二次方增長,這就是為什麼百萬 token 的視窗通常只存在於行銷簡報中。KDA 的擴展方式不同,而這個差異正是百萬 token 視窗能以大家真正負擔得起的價格存在的唯一原因。

第二個是 Attention Residuals,一種用於取代標準殘差連接的機制。Moonshot 將其歸功於持續的擴展增益,讓他們能夠建立更深的模型而不會出現常見的退化問題。根據他們自己的數據,這個組合的擴展效率大約是 K2 的 2.5 倍。

一百萬個 token 消滅了什麼

Dominique - inline image

現在生產環境中 AI 的大多數檢索基礎設施都是一種權宜之計。分塊、嵌入、向量資料庫、RAG 流程:這一切都是為了彌補模型無法同時在工作記憶體中容納足夠資訊的缺陷。

一百萬個 token 改變了這個預設值。整個程式碼庫可以放進一個提示詞中。一整年的內部文件。五十份影片逐字稿。所有內容同時進入注意力範圍,模型可以在整個語料庫上進行推理,而不是拼湊檢索到的片段並希望接縫處能撐住。

原生視覺能力進一步擴大了輸入範圍。螢幕截圖、白板照片、架構圖表和圖表,都可以與周圍的程式碼和文字在同一上下文中被讀取。K3 最強的基準測試成績出現在前端程式碼領域,這絕非偶然:模型在一個上下文視窗內看到設計,然後寫出實作。

比基準測試更重要的定價表

列出的費率:快取命中時每百萬輸入 token 為 $0.30,快取未命中時為 $3.00,每百萬輸出 token 為 $15.00,上下文為 1,048,576 個 token。

快取數字是值得關注的重點。Moonshot 報告在長時間的程式碼編寫會話中,快取命中率超過 90%。想想看一個 Agent 實際在做什麼:它會反覆讀取同一個儲存庫好幾個小時。沒有快取,它每次傳遞都要支付完整的輸入價格。有了快取,長時間會話的成本大約會減少 4 倍。

長時程 Agent 的成敗完全取決於這個數學題。K3 是為需要最少監督、運行數小時的會話而設計的,在儲存庫中導航、協調終端工具、檢查自己的成果。這個定價結構本身就是產品。

一個不容忽視的陷阱

K3 沒有經濟模式。推理功能永遠開啟且固定為最大值。獨立測試人員發現,它為了一個簡單的 SVG 請求就消耗了超過 13,000 個思考 token,相當於一次無關緊要的查詢花了 $0.25。

教訓在於路徑選擇。快速、便宜、高流量的呼叫應該交給較小的模型。只有在上下文大小和任務複雜度足以證明始終開啟推理的合理性時,K3 才值得它的成本。把它當作通用聊天端點使用,就是在燒錢。

五分鐘就能串接完成

API 相容於 OpenAI。更換 base_url 和 key,保留你現有的程式碼:

text
1from openai import OpenAI
2import os
3
4client = OpenAI(
5 api_key=os.environ["MOONSHOT_API_KEY"],
6 base_url="https://api.moonshot.ai/v1",
7)
8
9completion = client.chat.completions.create(
10 model="kimi-k3",
11 messages=[{"role": "user", "content": "用一句話介紹 Kimi K3。"}],
12)
13print(completion.choices[0].message.content)

推理功能透過一個頂層欄位進行設定,目前僅接受 "max":

text
1completion = client.chat.completions.create(
2 model="kimi-k3",
3 reasoning_effort="max",
4 messages=[{"role": "user", "content": "證明根號 2 是無理數。"}],
5)
6print(completion.choices[0].message.content)

串流使用標準方式,推理內容會以獨立的 delta 欄位傳送,讓你可以分別呈現思考過程和最終答案:

text
1stream = client.chat.completions.create(
2 model="kimi-k3",
3 messages=[{"role": "user", "content": "解釋為什麼天空是藍色的。"}],
4 stream=True,
5)
6
7for chunk in stream:
8 delta = chunk.choices[0].delta
9 reasoning = getattr(delta, "reasoning_content", None)
10 if reasoning:
11 print(reasoning, end="", flush=True)
12 if delta.content:
13 print(delta.content, end="", flush=True)

視覺輸入接受與文字在同一個訊息中的 base64 編碼圖片。這就是完整的截圖轉程式碼流程:

text
1import base64
2from pathlib import Path
3
4image_data = base64.b64encode(Path("landing.png").read_bytes()).decode()
5
6completion = client.chat.completions.create(
7 model="kimi-k3",
8 messages=[
9 {
10 "role": "user",
11 "content": [
12 {
13 "type": "image_url",
14 "image_url": {"url": f"data:image/png;base64,{image_data}"},
15 },
16 {"type": "text", "text": "用 HTML 和 Tailwind 重建這個登陸頁面。"},
17 ],
18 }
19 ],
20)
21print(completion.choices[0].message.content)

為什麼這會影響到從不碰權重的人

說實話:幾乎沒有人會自己託管 2.8 兆個參數。即使有稀疏性,硬體成本也遠遠超出業餘愛好者的範圍,甚至超出大多數公司的能力。

這從來就不是重點。公開權重為封閉實驗室在類似能力上所能收取的費用設定了天花板。第三方託管商會互相競爭,以商品化利潤提供 K3 服務,這與之前每次重大開源發布時發生的動態一樣。整個市場的價格都會向開源基準靠攏。

無論你有沒有下載任何檔案,這項好處最終都會透過你目前使用的任何供應商的帳單體現出來。

實用操作指南

餵給它完整的東西。完整的儲存庫供審查、完整的合約資料夾、整個內容庫。停止對那些不再需要分塊的內容進行分塊。

讓它長時間運行。排隊進行多小時的工程任務,然後再回來檢查結果。快取會吸收每次重讀的成本。

把鏡頭對準問題。截圖一個登陸頁面,要求重建。拍攝一張白板照片,要求實現。

讓瑣碎的流量遠離它。一個始終以最大強度推理的模型,不適合處理快速、高流量的呼叫。將這些任務路由到其他地方,把 K3 留給真正值得的工作。

十天倒數計時

三年來,前沿技術是你租來的,條款不是你定的,價格隨時可能變動。

到了 7 月 27 日,它將變成一個檔案。而一個檔案,跟訂閱服務不同,是你真正擁有的東西。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章