完成特定工作的最佳模型,幾乎從來都不是排行榜上最優秀的模型。
在 AI 世界,聖誕節大約每週一次。新模型推出,每個人都盯著同樣的虛假精度基準圖表,我們都同意這是自切片麵包以來最棒的東西,直到下週,我們再重複一次。
但這些圖表都無法回答唯一重要的問題:這個模型真的能執行你的每日簡報或向客戶發送報價嗎?在 Hyperagent,我們讓你在頂尖 Agent 之上使用所有這些模型。所以我們自己對它們進行了測試。十四個模型,四十二次運行,針對我們的客戶每天交給 Agent 的真正知識工作。有三件事很突出。
- 同樣的工作,帳單金額相差 50 倍。 同一套測試在 Qwen 3.7 Plus 上花費 1.48 美元,在 Fable 5 上花費 75.16 美元。
- 基準測試的贏家不是工作的贏家。 GPT 5.6 Sol 在我們的基準測試中名列前茅,但一旦在 Hyperagent 內部執行真實工作,就從未進入前三名。Grok 4.5 在基準測試中處於中游,但在完成工作、速度和成本方面卻名列第一。
- 而且沒有模型能贏得一切。 正確的選擇會隨著工作而改變。
重點不是一個新的最愛模型,而是一種決定方式,根據工作來決定哪個模型值得花費成本。
知識工作的 AI 模型地圖
你會交給 Agent 的每一件工作都可以歸結為兩個問題:它需要多少判斷力,以及它運行的頻率如何?繪製這兩個軸線,知識工作就會落入四個區域,每個區域都需要不同類型的模型。

大量工作(左上角)。分類、監控、路由、資料同步。程序明確,持續運行,而且錯誤很容易修復。這類工作需要快速且便宜的模型。
日常工藝(右上角)。草擬、報告、研究、客戶溝通。填滿一週大部分時間的重複性知識工作——它需要真正的綜合能力和良好的寫作語氣,並且要可靠且經常地完成。
高風險(右下角)。合約審查、定價決策、深入探討。很少發生,但錯誤答案的代價可能是失去客戶、合約或一個季度的利潤。這就是錯誤成本遠高於模型帳單的地方,也是價格最貴的模型值得其費率的地方。
不要優化(左下角)。偶爾發生的簡單請求,任何有能力模型都能輕鬆勝任,價格差距太小,不值得花心思決定。這是地圖上我們告訴人們不必考慮的唯一區域。
三種模型類別
從地圖中浮現出三種工作類別。它們描述的是工作的經濟性和判斷力狀況,而不是為模型評定好壞。
短跑選手 專為大量工作打造——快速、便宜且穩定,適用於程序明確且錯誤容易修正的情況。例如 Haiku 4.5、Gemini 3.5 Flash 和 DeepSeek V4 Pro。
中量級選手 負責日常工藝。它們能綜合資料來源、執行多步驟計劃,並寫出好文章,同時不會為每份報告收取頂級費率。例如 Sonnet 5、GPT 5.6 Terra、Grok 4.5 和 GLM 5.2——大多數知識工作都屬於這個類別。
重量級選手 處理高風險任務,投入更強的判斷力和更多的推理時間,在錯誤答案成本遠高於模型帳單的工作中發揮作用。例如 Opus 4.8、GPT 5.6 Sol 和 Fable 5。
大多數人的本能是從高處開始,然後向下嘗試——用 Fable 5 或 Opus 4.8 運行所有任務,取得你想要的輸出,然後嘗試更便宜的模型,直到品質下降。這方法可行,但我們發現大多數工作不需要這樣做。一旦你能命名工作並將其放在地圖上,通常就可以直接從正確的類別開始。對於日常工藝(這是你大部分的工作),這意味著從像 Sonnet 5 這樣的可靠中量級選手開始。只有當工作確實處於高風險端時,你才需要動用從上到下的搜尋方法。
領域遠比 Claude、GPT 和 Gemini 更廣闊
大多數團隊預設使用他們已經知道的少數模型名稱。這是個合理的起點,但它忽略了許多其他模型——而且一些在 Hyperagent 中執行最有用的工作的模型並非家喻戶曉的名字。以下是我們從測試組合和日常使用中得到的操作印象,以及我們觀察客戶運行的情況。
Grok 4.5 適合快速、即時的研究。它在大量使用工具的研究中移動迅速,並且與 Hyperagent 的原生 Exa 搜索搭配使用時表現尤其出色。它還有一個與 X 的原生連接,因此關於即時情緒的問題可以帶著答案背後的真實貼文一起返回。它在完整運行中以 9.71 美元的價格在完成工作評分中領先。
Muse Spark 1.1 寫作清晰且會自我檢查。它在測試中排名第二,我們最初的看法是:簡潔、結構良好的散文,並且有一個有用的習慣,即在交回工作之前先審計自己的工作。它還很新,所以我們建議先讓它在有監督的日常工作中使用,然後再進行長時間無人值守的任務。
Kimi K2.6 以開放模型的價格提供深度研究。它並行運行搜索,並將證據整合到單一答案中,而不收取旗艦級費率,這使其成為一個強大的研究專家。它唯一的真正限制是文件大小,上下文窗口上限為 256,000 個 token。
GLM 5.2 是超值之選。它在常規研究、草擬和長文件工作方面出奇地接近封閉源碼的中量級選手,而價格約為其三分之一,其散文品質在 Sonnet 和 Opus 之外是最強的之一。它已成為 Hyperagent 團隊許多人的日常驅動模型。
Qwen 3.7 Plus 是螢幕工作者。它特別擅長在渲染頁面上找到按鈕、欄位和選單,而且對於結構化提取來說價格低廉——它在我們的測試中產生了成本最低的完整運行。當工作涉及操作介面或移動資料時使用它,而不是在需要注重語調時。
DeepSeek V4 Pro 以極低成本進行結構化分析。它在對帳、資料清理、定期數字工作以及類似的結構化任務方面表現最強。它的寫作風格直白簡潔,這很適合內部說明,但不適合面向客戶的散文。它是一個專家,而且非常經濟實惠。
以合理的價格為你的常駐 Agent 配備人員
Steve Juba 經營一家六人旅行公司。他建立了一個連接到八個即時資料來源的簡報 Agent,每天運行數次,將他早上收集資訊的時間從跨八個分頁的三個多小時縮短到十五分鐘。
像這樣的 Agent 讀取的內容遠多於寫入的內容,並且每年執行相同的工作數百次,因此每次運行的小幅價格差異就不再是四捨五入的誤差,而是一筆真實的預算開支。考慮一個每天讀取 100,000 個 token 並寫入 2,000 個 token 的簡報。按照 2026 年 7 月的標價,這種形式的工作大致花費:
- 使用 Qwen 3.7 Plus(短跑選手)每年約 16 美元
- 使用 Kimi K2.6(中量級選手)每年約 38 美元
- 使用 Haiku 4.5(短跑選手)每年約 40 美元
- 使用 Sonnet 5(中量級選手)每年約 80 美元

對於像這樣讀取密集型的工作,開放權重選項改變了成本計算。Kimi K2.6 在這項工作上以 38 美元的價格提供中量級品質的研究和綜合——不到 Sonnet 5 的一半,而且與運行 Haiku 短跑選手的成本差不多。你並不是在用判斷力換取成本;你是在用短跑選手的價格獲得中量級的工作。如果工作只是純粹的提取而無需判斷,Qwen 可以以 16 美元的價格運行——但一旦需要真正的綜合,Kimi 就能以接近相同的價格為你提供服務。
更換模型,保留 Agent
如果更換模型意味著重建 Agent,那麼這一切都毫無意義。在 Hyperagent 內部,這不是問題,因為模型只是一個設定,而角色在其之上。更換模型,Agent 會保留所有使其有用的東西:
- 其指令和範圍
- 其技能、腳本和工作程序
- 其對修正的記憶
- 其參考文件和公司背景
- 其與工作所在系統的連接
- 其評估品質的量規

這將模型選擇變成了一次測試,而不是一次遷移。同一個 Agent 可以在兩個模型上運行相同的工作,而無需重建,因此你可以找到最便宜且能滿足你標準的模型,而不是猜測。
這也讓困難工作流程中昂貴的部分只需要支付一次。當工作確實需要時,使用較重的模型來設計和調試工作流程——然後將程序編寫成技能,這樣中量級或短跑選手就可以每天以極低的成本運行它。
不過,還有一個隱藏成本需要注意。一個帳單金額低的較便宜模型,如果每個輸出都需要修正,那就不便宜了——人工審查時間和錯誤的成本是實際價格的一部分。稱之為審查稅。它設定了你能用多輕量模型的下限。在 Hyperagent 中不同的是,審查不僅僅是支付成本,它還會產生複利:隨著 Agent 透過記憶從你的修正中學習,這些審查工作會被 harness 捕獲,並在下一次運行中產生更好的 Agent。
客戶已經用這種方式為他們的 Agent 配備人員。Ankit Das 建立了一個營運,由一個運行在 Sonnet 5 上的 Growth Orchestrator 做出判斷決策,八個運行在 GLM 5.2 上的頻道專家負責產生重複性頻道工作,並有獨立的 QA Agent 檢查品牌合規性和寫作品質——全部從單一執行緒啟動。Eli Weiss 更簡單地描述了他的分配:在他的技能和常規工作中,大約 85% 使用 Sonnet,15% 使用 Opus。大多數工作由日常驅動模型運行;Opus 則負責少數需要額外判斷力並值得花費成本的工作。
這就是 Hyperagent 內部模型選擇的實際價值。有意識地花費在工作上,並將額外的資金留給那些額外判斷力能改變結果的工作。
先選擇工作,再選擇模型
對你已經在運行的 Agent 使用以下順序:
- 命名工作。「準備週一客戶報告」比「協助報告」更有用。
- 將它放在地圖上。 決定它需要多少判斷力以及它將運行的頻率。
- 從地圖建議的位置開始。 對於大多數工作,這是一個有能力的卡車——使用它直到你了解工作的邊緣情況,並將流程編寫成技能。
- 測試輕一個類別,進行五次真實運行。 保持指令、技能、記憶、資料來源和量規不變。
- 比較總成本。 追蹤完成品質、一致性、時間、事實錯誤、模型帳單和人工審查時間。
- 有目的地升級。 當審查負擔或錯誤答案的成本超過模型溢價時,引入重量級選手。
- 使用不同的模型來審查重要工作。 犯錯的模型通常最不可能發現錯誤。
保留能可靠滿足你標準的最便宜模型。然後將差額花在值得投入的任務上。





