充分發揮 GPT-5.6 的潛力:Sol、Terra 與 Luna

@cerebras
英語1 天前 · 2026年7月27日
218K
1.3K
89
53
1.1K

TL;DR

本指南深入探討 GPT-5.6 模型系列,比較 Sol、Terra 與 Luna 的速度與智慧表現。內容涵蓋推理等級、提示詞快取 (prompt caching) 以及多 Agent 工作流程的策略,協助您將 AI 效率最大化。

作者:@0xSero 與 Zhenwei Gao(@zhennydez

您的 Codex 訂閱現在包含 3 個主要模型:Sol、Terra 與 Luna,每個模型均經過獨立訓練與部署,並配備推理強度調節器。三者結合,讓您能為每項任務選擇速度、成本與智能的最佳平衡。

價格一覽(OpenAI 開發者定價 2026 年 7 月 21 日

價格方面,Terra 的成本僅為 Sol 的一半,而 Luna 的成本僅為 Sol 的五分之一,無論是短上下文還是長上下文都適用。

Cerebras - inline image

這樣的定價與智能及速度密切相關。在實際使用中,每個模型最適合不同類型的工作:

  1. Sol 三者中最聰明的。最適合長時間運行的任務、複雜的技術挑戰,以及個人助理工作。更高的能力伴隨著更高的延遲與成本,但 Sol 擅長協調子 Agent 並處理跨長時間工作流程的大型專案。
  2. Terra 居中表現穩定,以 Sol 一半的價格提供大部分智能,且速度也中等偏快。搭配 Sol 使用時,Terra 可以成為強力的子 Agent:Sol 能權衡選項並設定方向,再將實作工作交給更快、更便宜的 Terra。
  3. Luna 是三者中最快速且最經濟的,同時仍優於市場上大多數模型,價格僅為 Sol 的五分之一。對於大部分日常 AI 任務,Luna 完全勝任,能以極低成本提供可靠的表現。截至 2026 年 7 月 17 日,它在 Artificial Intelligence 的模型智能指數中排名第 16/576 名
Cerebras - inline image

為任務挑選最佳模型

如何決定哪個模型來處理請求,以及它應該應用多少推理能力?這個選擇必須在生成任何 token 之前做出。

從 Luna 開始,再逐步升級。

處理任何任務的一個簡單方法是選擇在您願意支付的價格下,提供速度與智能最佳平衡的模型。在 GPT-5.6 系列中:

1. GPT-5.6-Sol:最高智能下限與上限

2. GPT-5.6-Luna:最高速度下限與上限

一個好的預設做法是先用 Luna 處理大部分任務,當進度停滯時(例如 Agent 卡住、修復無法落實,或模型開始失焦),再升級到 Terra 或 Sol。如果您願意為速度和智能支付更多費用,可以在 Cerebras 上以每秒 750 個 token 運行 Sol,這比 Sol 的常規模式快上 10 倍

Cerebras - inline image

測試時計算 / 推理

另一種調整模型處理任務方式的方法是調整其推理等級。在 Codex 中,您可以從五個選項中選擇:「輕度」、「中度」、「高度」、「極高」和「極致」。

透過使用更多電腦運算時間來提高輸出的準確性,模型會在給出答案之前產生自我質疑與辯論的 token。

  • 輕度: 非常適合快速完成基本任務,例如尋找檔案、複製與設定儲存庫、整理下載內容等。這是您在模型知道要做什麼且失敗率很低的情況下,基本上應該選擇的推理等級。
  • 中度: 良好的日常預設值,適用於需要一些解讀、規劃或除錯,但不需要深入探索的任務。這可能包括跨檔案摘要、實作小型功能,或排除常見問題。
  • 高度極高: 最適合困難的 STEM 與程式設計任務,例如複雜除錯、架構決策、大型重構,或有多種可行方法的問題。大多數日常助理任務不需要這麼多的推理。
  • 極致: 當您確實知道自己想要什麼,並有詳細限制時,才使用最高推理模式,特別是涉及多個獨立系統的工作。例如,以非常特定的方式建立介面與 API 來連接兩個 API。

我們通常將極致模式保留給最大的研究問題與新穎挑戰。極致模式會迅速消耗您的使用限制,但您可以放心,模型已使用完整的推理預算來探索、驗證並完善其答案。

Artificial Analysis 7 月 17 日的測試中,GPT-5.6 Sol 的推理等級每提升一級,平均每次任務成本約增加 50%。下圖顯示了額外推理如何影響智能與成本。

Cerebras - inline image

善用快取讀取。

快取輸入比全新輸入便宜 90%。Codex 任務如果反覆處理相同的程式碼庫或上下文,將從中受益匪淺。

每個 GPT-5.6 模型都有約 30 分鐘的快取 TTL。這意味著維持單一工作階段會比為每項任務開啟新工作階段更好。

Codex 的壓縮功能也已經足夠強大,您可以運行單一工作階段處理數億個 token,而不會遇到任何問題。

如果您保持工作階段活躍,提示處理將會便宜許多。您可以設定每 20 分鐘執行一次的 Codex 自動化任務來保持快取存活,並利用這些自動化任務驅動長時間的運作流程。

Cerebras - inline image

有效運用多 Agent 工作流程。

不同的模型基於不同的資料訓練,並針對不同的目標進行最佳化,這意味著每個模型在某些方面會略有優劣

顧問工作流程讓一個 Agent 承擔狹義的工作:讀取整個工作階段、追蹤目標與限制,並在工作 Agent 開始偏離時介入。這有助於自動引導工作 Agent 並提高長時間任務的可靠性。

Local Codex 也讓您將其他提供商引入應用程式。這表示您可以嘗試低成本、開放的模型,例如 Kimi K2.7 Code,或具有不同優勢的模型(例如用於長時推理與程式設計的 GLM-5.2),同時仍留在熟悉的 Codex 體驗中。

然後,您可以將這些外部模型用於有限制的子 Agent 工作,以降低成本或利用每個模型的不同優勢。

一個重要的細微差別:這是透過 Codex 配置和自訂 Agent 檔案來完成的,而不是簡單的應用程式內模型選擇器。Codex 支援本地提供商,例如 Ollama 和 LM Studio,以及自訂的 Responses 相容提供商。

Cerebras - inline image

結論

訂閱使用限制相當寬鬆,但隨著 AI Agent 對越來越多的人變得有用,許多人正將限制推向一個訂閱無法提供的範圍。

而且即使您有錢可以揮霍,並非每個「前沿」模型都處於所有使用案例的前沿。通常,一個小型模型可以在某些基準測試上完全擊敗一群世界上最好的模型。

速度是一個重要的開關。在白天與 Agent 互動時,高 tok/s 可以大幅提升您的體驗。 在離峰時段,使用一個緩慢、具有額外推理能力的模型執行 /goal 可能會帶來天壤之別的差異。

最後,請密切關注 Artificial Analysis,那裡充滿了高品質的模型速度基準測試和智能指數。

感謝 Sarah Chieng([@MilksandMatcha](https://x.com/@MilksandMatcha))、Joyce Er 和 Hai-Ching 的審閱與意見,以及 Halley Change([@halleychangg](https://x.com/@halleychangg))為本部落格設計圖表。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章