著者: @0xSero & Zhenwei Gao (@zhennydez
あなたの Codex サブスクリプションには、3 つの主要モデル、Sol、Terra、Luna が含まれるようになりました。それぞれが独立してトレーニングおよび提供されており、推論ダイヤルを備えています。これらを組み合わせることで、タスクごとに速度、コスト、知能のバランスを選択できます。
価格比較の概要(OpenAI 開発者向け価格 2026 年 7 月 21 日)
価格面では、Terra は Sol の半分のコストで、Luna は 5 分の 1 のコストで、ショートコンテキストとロングコンテキストの両方の使用で利用できます。

この価格設定は、知能と速度にほぼ比例しています。実際には、各モデルは異なる種類の作業に最適です:
- Sol はグループ内で最も賢いモデルです。長時間のタスク、複雑な技術的課題、および個人アシスタントに最適です。その追加機能には高いレイテンシとコストが伴いますが、Sol はサブエージェントの調整や、長時間のワークフローにわたる大規模プロジェクトの処理に優れています。
- Terra は中程度に位置し、Sol の半分の価格でほとんどの知能を提供します。また、適度に高速です。Sol と組み合わせると、Terra は強力なサブエージェントになります:Sol が選択肢を検討して方向性を設定し、その後、より高速で安価な Terra に実装を引き継ぐことができます。
- Luna は 3 つの中で最も高速で手頃な価格ですが、それでも市場のほとんどのモデルよりも優れた性能を発揮し、価格は Sol のわずか 5 分の 1 です。2026 年 7 月 17 日現在、Artificial Intelligence のモデル知能指数で全モデル中 16/576 位にランクされています。

タスクに最適なモデルの選択
どのモデルにリクエストを処理させるか、またどの程度の推論を適用するかをどのように決定しますか?その選択は、トークンが生成される前に行う必要があります。
Luna から始めて、必要に応じてアップグレード
あらゆるタスクに取り組む簡単な方法は、支払ってもよい価格で、速度と知能の最適なバランスを提供するモデルを選択することです。GPT-5.6 ファミリー内では:
1. GPT-5.6-Sol: 最も高い知能の下限と上限
2. GPT-5.6-Luna: 最も高い速度の下限と上限
良いデフォルトは、ほとんどのタスクを Luna で開始し、エージェントが行き詰まったり、修正が適用されなくなったり、モデルが文脈を見失ったりした場合に、Terra または Sol にアップグレードすることです。速度と知能の両方にもっと支払ってもよい場合は、Sol on Cerebras を 750 トークン/秒で実行できます。これは通常モードの Sol よりも最大 10 倍の高速です。

テスト時計算 / 推論
モデルがタスクを処理する方法を調整する別の方法は、推論レベルを調整することです。Codex では、「Light」、「Medium」、「High」、「Extra High」、「Ultra」の 5 つのオプションから選択できます。
より多くのコンピュータ処理時間を使って出力の精度を高めることで、モデルはユーザーに回答を提供する前に、自分自身と議論し、疑問を投げかけるトークンを生成します。
- Light: 基本的なタスクを迅速かつ完全に完了するのに最適です。ファイルの検索、リポジトリのクローンと設定、ダウンロードの整理など。これは、モデルが何をすべきかを把握しており、失敗の可能性が低い場合に選択すべき推論レベルです。
- Medium: ある程度の解釈、計画、デバッグが必要だが、深い探求は必要ないタスクに適した日常のデフォルトです。例としては、ファイル間の要約、小さな機能の実装、よくある問題のトラブルシューティングなどが含まれます。
- High および Extra-High: 困難な STEM およびコーディングタスクに最適です。複雑なデバッグ、アーキテクチャの決定、大規模なリファクタリング、またはいくつかの妥なアプローチがある問題など。大分の日常なアシスタントタスクには、これほどの推論は必ありません。
- Ultra: 本当やたいことが明確で、特複数独立たシスムにわた作業に細制約がある場に使用ます。例ば、2のAPIを特の方で続けためイタフェースやAPIを築する場など。
通、Ultra モードは最大の研究質問や新たな課題に予約しています。Ultra モードは使用制限をすぐに消費する傾向がありますが、モデルが利用可能な推論予算をすべて使って回答を探求、検証、洗ったことを安してくださ。
7月17の Artificial Analysis のテストでは、GPT-5.6 Sol の推論レベルを一段階上げるごとに、タスクあたりの平均コストが約 50% 増加しました。以のグラフは、追加の推論が知能とコストにどのように影響するかを示しています。

キャッシュリードを活用する
キャッシングされた入力は、新しい入力よりも 90% 安価です。同じコードベースやコンテキストを繰り返し理する Codex タスクは、大きな恩恵を受けます。
GPT-5.6 の各モデルは、約 30 分のキャッシュ TTL を持っています。つまり、作業中の単一セッションを維持することが、タスクごとに新しいセッションを開始するよりも優れています。
Codex のコンパクションも十分に改善され、何億トークンにも及ぶ単一セッションを問題なく実行できます。
セッションをホットに保てば、プロンプト処理が大幅に安くなります。20 分ごとに Codex オートメーションをスケジュルしてキャッシを維持し、そのオートメションを使って長時間実行プロセスを駆動できます。

マルチエージェントワークフローの効果的な活用
異なるモデルは異なるデータでトレーニングされ、異なる目標に最適化されているため、各モデルは特定の事柄においてわずかに優れたり劣ったりします。
アドバイザーワークフローでは、1 つのエージェントに狭いジョブを与えます:セッション全体を読み、目標と制約を把握し、ワーカーが逸れ始めたらいつでも介入します。これにより、ワーカーを自動的に導き、長時間のタスク全体の信頼性を向上させます。
ローカル Codex では、アプリに他のプロバイダーを追加することもできます。つまり、Kimi K2.7 Code のような低コストのオープンウェイトモデルや、長期推論とコーディングに優れた GLM-5.2 などの異なる強みを持つモデルを、使い慣れた Codex 環境内で試すことができます。
その後、これらの外部モデルを制限されたサブエージェント作業に使用することで、コストを削減したり、各モデルの異なる強みを活用したりできます。
重要な注意点:これは、単純なアプリ内モデル選択ではなく、Codex 設定とカスタムエージェントファイルを通じて行われます。Codex は、Ollama や LM Studio などのローカルプロバイダーと、カスタムの Responses 互換プロバイダーをサポートしています。

結論
サブスクリプションの利用制限はかなり寛大ですが、AI エージェントがより多くの人々にとって有用になるにつれて、多くの人が 1 つのサブスクリプションで提供できる範囲をはるかに超えてプッシュしています。
そして、たとえお金があり余っていたとしても、すべての「フロンティア」モデルがあらゆるユースケースで最先端というわけではありません。多くの場合、小さなモデルがいくつかのベンチマークで世界最高のモデルの連合を完全に打ち負かすことがあります。
速度は重要なトグルです。日中にエージェントと対話しているときは、高いトークン/秒が体験を劇的に向上させます。 オフ時間帯には、低速で追加の推論モデルを使った /goal が大きな違いを生むことがあります。
そして最後に、Artificial Analysis に注目してください。高品質なモデル速度ベンチマークと知能指数が満載です。
Sarah Chieng([@MilksandMatcha](https://x.com/@MilksandMatcha))、Joyce Er、Hai-Ching の皆様にはレビューとインプットをいただき、Halley Change(@halleychangg)にはこのブログのグラフィックデザインを担当していただきました。ありがとうございました。





