作者:@0xSero 和 Zhenwei Gao (@zhennydez
你的 Codex 订阅现附带了三个主要模型——Sol、Terra 和 Luna,每个模型都经过 独立训练和服务,并配有推理调节旋钮。它们共同让你能够为每项任务选择合适的速度、成本和智能组合。
价格速览(OpenAI 开发者定价,2026 年 7 月 21 日)
在价格方面,Terra 的成本是 Sol 的一半,而 Luna 的成本是 Sol 的五分之一,无论是短上下文还是长上下文使用场景都如此。

这种定价与智能水平和速度高度吻合。在实际使用中,每个模型最适合不同类型的工作:
- Sol 是最智能的模型。它最适合 长时间运行的任务、复杂的技术挑战以及个人助理。这种额外能力带来了更高的延迟和成本,但 Sol 在协调子代理以及处理跨扩展工作流的大型项目方面表现出色。
- Terra 恰好处于中间位置,以 Sol 一半的价格提供了大部分智能。它的速度也中等偏快。与 Sol 搭配使用时,Terra 可以成为强大的子代理:Sol 可以权衡选项并设定方向,然后将实现工作交给更快、更便宜的 Terra。
- Luna 是三款中最快、最实惠的模型,同时仍优于市面上大多数模型,价格仅为 Sol 的五分之一。对于大多数日常 AI 任务来说,Luna 完全够用,能够以极低的成本提供可靠的性能。截至 2026 年 7 月 17 日,它在 Artificial Intelligence 的模型智能指数中排名第 16/576 位。

为任务选择最佳模型
如何决定哪个模型应该处理某个请求,以及它应该应用多少推理?这个选择必须在生成任何 token 之前做出。
从 Luna 开始,然后升级。
处理任何任务的一种简单方法是,选择在你愿意支付的价格下提供最佳速度与智能平衡的模型。在 GPT-5.6 系列中:
1. GPT-5.6-Sol:智能下限和上限最高
2. GPT-5.6-Luna:速度下限和上限最高
一个好的默认做法是,用 Luna 开始大多数任务,然后在进展停滞时升级到 Terra 或 Sol,例如当代理卡住、修复无法落地或模型开始失去上下文时。如果你愿意为速度和智能支付更多费用,你可以在 Cerebras 上以每秒 750 个 token 的速度运行 Sol,这比 Sol 的常规模式快了高达 10 倍。

测试时计算 / 推理
另一种调整模型处理任务方式的方法是调节其 推理级别。在 Codex 中,你可以从五个选项中选择:“轻量”、“中等”、“高”、“超高”和“极限”。
通过使用更多的计算机处理时间来提高输出的准确性,模型会在给出答案之前生成自我反驳和自我质疑的 token。
- 轻量:非常适合快速完成基本任务,如查找文件、克隆和配置仓库、整理下载内容等。这是你应该为基本上任何模型知道该做什么且失败可能性较低的任务选择的推理级别。
- 中等:适用于需要一些解释、规划或调试但不需深入探索的日常任务。这可能包括跨文件总结、实现小功能或排查常见问题。
- 高 和 超高:最适合困难的 STEM 和编程任务,例如复杂调试、架构决策、大型重构或存在多种合理方案的问题。大多数日常助理任务不需要这么多(甚至任何)推理。
- 极限:如果确实清楚自己想要什么并且有详细的约束条件,特别是在涉及多个独立系统的工作中,请使用最高推理模式。例如,以非常特定的方式构建接口和 API 来连接两个 API。
我们通常将极限模式保留给最大的研究问题和新颖挑战。极限模式很容易迅速耗尽你的使用限制,但你可以放心,模型已经使用了可用推理预算来探索、验证和完善其答案。
在 Artificial Analysis 于 7 月 17 日的测试中,GPT-5.6 Sol 的推理级别每提升一级,每项任务的平均成本大约增加 50%。下面的图表显示了额外推理如何影响智能和成本。

善用缓存读取
缓存输入比新鲜输入便宜 90%。反复处理相同代码库或上下文的 Codex 任务会从中受益匪浅。
每个 GPT-5.6 模型的缓存 TTL 约为 30 分钟。这意味着,在单个会话中持续工作比每次任务都启动新会话要好。
Codex 的压缩功能也已经足够好,你可以在单个会话中运行数亿个 token 而不会遇到任何问题。
如果你保持会话活跃,提示词处理将便宜得多。你可以设置每 20 分钟执行一次的 Codex 自动化任务来保持缓存存活,并利用这些自动化来驱动长时间运行的进程。

有效使用多代理工作流
不同模型基于不同数据训练并针对不同目标优化,这意味着每个模型在某些方面会略微更好或更差。
顾问工作流:给一个代理分配狭窄的任务——读取整个会话,跟踪目标和约束条件,并在工作代理开始偏离时介入。这有助于自动引导工作代理,并在较长时间任务中提高可靠性。
本地 Codex 还允许你将其他提供商引入应用。这意味着你可以尝试成本更低的开放权重模型,例如 Kimi K2.7 Code,或具有不同优势的模型,例如 GLM-5.2(适用于长时域推理和编程),同时仍在熟悉的 Codex 体验中工作。
然后,你可以将这些外部模型用于范围有限的任务,从而帮助降低成本或利用每个模型的不同优势。
一个重要的细微差别是:这是通过 Codex 配置和自定义代理文件完成的,而不是通过简单的应用内模型选择器。Codex 支持 Ollama 和 LM Studio 等本地提供商,以及自定义的 Responses 兼容提供商。

结论
订阅使用限制相当宽松,但随着 AI 代理对越来越多的人变得更加有用,许多人的使用量远远超过单个订阅所能提供的。
而且,即使你有钱可烧,并非所有“前沿”模型在所有用例中都处于前沿。通常,一个小模型可以在几个基准测试上完全碾压世界上最佳模型的联合体。
速度是一个重要的切换因素:白天与代理互动时,高 token/s 可以显著提升体验。在非工作时间,使用较慢、额外推理的模型执行 /goal 任务可以带来天壤之别。
最后,请密切关注 Artificial Analysis,它充满了高质量的模型速度基准和智能指数。
感谢 Sarah Chieng ([@MilksandMatcha](https://x.com/@MilksandMatcha))、Joyce Er 和 Hai-Ching 的审阅和意见,以及 Halley Change ([@halleychangg](https://x.com/@halleychangg)) 为本博客设计图形。





