Авторы: @0xSero и Чжэньвэй Гао (@zhennydez
Теперь в вашу подписку Codex входят 3 основные модели — Sol, Terra и Luna, каждая из которых независимо обучена и обслуживается с возможностью регулировки глубины рассуждений. Вместе они позволяют выбирать баланс скорости, стоимости и интеллекта для каждой задачи.
Сравнение цен в двух словах (Цены OpenAI для разработчиков от 21 июля 2026 г.
По цене Terra стоит в 2 раза дешевле Sol, а Luna — в 5 раз дешевле, причём как для короткого, так и для длинного контекста.

Это ценообразование довольно точно соответствует уровню интеллекта и скорости. На практике каждая модель лучше всего подходит для определённого типа задач:
- Sol — самая умная из трёх. Она лучше всего подходит для длительных задач, сложных технических вызовов и персонального ассистента. Дополнительные возможности сопровождаются более высокой задержкой и стоимостью, но Sol отлично справляется с координацией под-агентов и масштабными проектами в рамках длительных рабочих процессов.
- Terra занимает золотую середину, обеспечивая большую часть интеллекта вдвое дешевле Sol. К тому же она умеренно быстрее. В паре с Sol Terra может быть сильным под-агентом: Sol оценивает варианты и задаёт направление, а затем передаёт реализацию более быстрой и дешёвой Terra.
- Luna — самая быстрая и доступная из трёх, при этом она превосходит большинство моделей на рынке, стоя всего одну пятую цены Sol. Для большинства повседневных AI-задач Luna более чем достаточна, обеспечивая надёжную производительность по невероятно низкой цене. По состоянию на 17 июля 2026 года она занимает 16/576 место среди всех моделей в индексе интеллекта Artificial Analysis.

Выбор лучшей модели для задачи
Как решить, какая модель должна обрабатывать запрос и сколько рассуждений ей следует применять? Этот выбор должен быть сделан до того, как будут сгенерированы токены.
Начните с Luna, затем повышайте.
Простой подход к любой задаче — выбрать модель, которая предлагает наилучший баланс скорости и интеллекта по цене, которую вы готовы платить. В рамках семейства GPT-5.6:
1. GPT-5.6-Sol: Наивысший потолок и пол интеллекта
2. GPT-5.6-Luna: Наивысший потолок и пол скорости
Хорошая стратегия по умолчанию — начинать большинство задач с Luna, а затем переходить на Terra или Sol, когда прогресс замедляется — например, когда агенты застревают, исправления перестают работать или модель начинает терять нить разговора. Если вы готовы платить больше и за скорость, и за интеллект, вы можете запустить Sol на Cerebras со скоростью 750 токенов в секунду, что до 10 раз быстрее обычного режима Sol.

Вычислительные ресурсы во время тестирования / Рассуждения
Ещё один способ настроить обработку задачи моделью — регулировать уровень рассуждений. В Codex вы можете выбрать один из пяти вариантов: «Light», «Medium», «High», «Extra High» и «Ultra».
Используя больше вычислительного времени для повышения точности вывода, модель генерирует токены, спорящие и подвергающие сомнению собственные ответы, прежде чем выдать результат пользователю.
- Light: Отлично подходит для быстрого выполнения базовых задач: поиска файлов, клонирования и настройки репозитория, организации загрузок и т.п. Этот уровень рассуждений следует выбирать для всего, где модель знает, что делать, и вероятность ошибки низка.
- Medium: Хороший повседневный вариант для задач, требующих некоторой интерпретации, планирования или отладки, но не глубокого исследования. Сюда можно отнести обобщение информации из нескольких файлов, реализацию небольшой функции или устранение знакомой проблемы.
- High и Extra-High: Лучше всего подходят для сложных задач STEM и кодинга, таких как сложная отладка, архитектурные решения, крупные рефакторинги или проблемы с несколькими правдоподобными подходами. Для большинства рутинных задач ассистента такой уровень рассуждений, если вообще нужен, не требуется.
- Ultra: Используйте наивысший режим рассуждений, если вы точно знаете, чего хотите, и имеете детальные ограничения, особенно для работы, охватывающей несколько независимых систем. Например, создание интерфейсов и API для соединения двух API очень специфическим образом.
Обычно мы оставляем режим Ultra для самых масштабных исследовательских вопросов и новых задач. Режим Ultra имеет тенденцию очень быстро расходовать ваши лимиты, но вы можете быть уверены, что модель использовала полный бюджет рассуждений для исследования, проверки и уточнения своего ответа.
В тестировании Artificial Analysis от 17 июля каждый шаг повышения уровня рассуждений GPT-5.6 Sol увеличивал среднюю стоимость задачи примерно на 50%. Диаграммы ниже показывают, как дополнительные рассуждения влияют на интеллект и стоимость.

Используйте кэширование чтения.
Кэшированный ввод на 90% дешевле свежего ввода. Задачи Codex, которые многократно обрабатывают одну и ту же кодовую базу или контекст, получают огромную выгоду.
Каждая из моделей GPT-5.6 имеет TTL кэша около 30 минут. Это означает, что поддержание одного сеанса, в котором вы работаете, будет лучше, чем запуск нового сеанса для каждой задачи.
Компактизация Codex также стала достаточно хорошей, чтобы вы могли запускать один сеанс на сотни миллионов токенов без каких-либо проблем.
Если вы поддерживаете сеанс активным, обработка промптов будет гораздо дешевле. Вы можете настроить автоматизацию Codex с интервалом в 20 минут, чтобы поддерживать кэш активным, и использовать эти автоматизации для запуска длительных процессов.

Эффективное использование многопоточных рабочих процессов.
Разные модели обучаются на разных данных и оптимизированы для разных целей, а значит каждая из них будет немного лучше или хуже в определённых вещах.
Рабочий процесс Advisor даёт одному агенту узкую задачу: читать весь сеанс, отслеживать цель и ограничения и вмешиваться, когда рабочий начинает отклоняться. Это помогает автоматически направлять рабочего и повышать надёжность при выполнении длительных задач.
Локальный Codex также позволяет подключать к приложению других провайдеров. Это означает, что вы можете экспериментировать с более дешёвыми моделями с открытыми весами, такими как Kimi K2.7 Code, или моделями с другими сильными сторонами, например GLM-5.2 для долгосрочных рассуждений и кодинга, оставаясь в привычном интерфейсе Codex.
Затем вы можете использовать эти внешние модели для ограниченной работы под-агентов, что помогает снизить затраты или использовать различные сильные стороны каждой модели.
Один важный нюанс: это делается через конфигурацию Codex и пользовательские файлы агентов, а не через простой выбор модели в приложении. Codex поддерживает локальных провайдеров, таких как Ollama и LM Studio, а также пользовательских провайдеров, совместимых с Responses.

Заключение
Лимиты использования по подписке довольно щедры, но по мере того, как AI-агенты становятся полезнее для большего числа людей, многие выходят далеко за рамки того, что может предложить одна подписка.
И даже если у вас есть лишние деньги, не каждая «передовая» модель находится на переднем крае всех сценариев использования. Часто маленькая модель может полностью разгромить консорциум лучших мировых моделей по нескольким бенчмаркам.
Скорость — важный переключатель: в течение дня, когда вы взаимодействуете с агентами, высокий tok/s может кардинально улучшить ваш опыт. В нерабочее время /goal с медленной моделью с дополнительными рассуждениями может иметь огромное значение.
И наконец, следите за Artificial Analysis — там много высококачественных бенчмарков скорости моделей и индексов интеллекта.
Благодарим Сару Чианг (@MilksandMatcha), Джойс Эр и Хай-Чинг за рецензирование и вклад, а также Хэлли Чендж (@halleychangg) за дизайн графики, представленной в этом блоге.





