GPT-5.6 활용 극대화하기: Sol, Terra, Luna 완벽 가이드

@cerebras
영어2일 전 · 2026년 7월 27일
278K
1.3K
98
53
1.2K

TL;DR

본 가이드에서는 GPT-5.6 모델 제품군을 살펴보고 Sol, Terra, Luna의 속도와 지능을 비교합니다. AI 효율성을 극대화하기 위한 추론 수준 설정, 프롬프트 캐싱, 멀티 에이전트 워크플로우 전략을 제공합니다.

작성자: @0xSero & Zhenwei Gao (@zhennydez

이제 구독하는 Codex 에는 Sol, Terra, Luna 의 3 가지 주요 모델이 포함되며, 각 모델은 독립적으로 훈련 및 서비스되며 추론 다이얼이 함께 제공됩니다. 이를 통해 각 작업에 맞는 속도, 비용 및 지능의 균형을 선택할 수 있습니다.

가격 비교 한눈에 보기 (OpenAI 개발자 가격 2026년 7월 21일

가격 측면에서 Terra 는 Sol 의 절반 비용이고, Luna 는 Sol 의 5 분의 1 비용으로, 짧은 컨텍스트와 긴 컨텍스트 사용 모두에 해당합니다.

Cerebras - inline image

이러한 가격 책정은 지능과 속도와 밀접하게 연관됩니다. 실제로 각 모델은 서로 다른 종류의 작업에 가장 적합합니다:

  1. Sol 은 가장 똑똑한 모델입니다. https://openai.com/index/previewing-gpt-5-6-sol/ 장기 실행 작업, 복잡한 기술적 과제 및 개인 비서 역할에 가장 적합합니다. 이러한 추가 기능은 더 높은 지연 시간과 비용을 수반하지만, Sol 은 확장된 워크플로우 전반에 걸쳐 하위 에이전트를 조정하고 대규모 프로젝트를 처리하는 데 탁월합니다.
  2. Terra 는 중간에 안정적으로 위치하며, Sol 가격의 절반으로 대부분의 지능을 제공합니다. 또한 적당히 더 빠릅니다. Sol 과 함께 사용하면 Terra 는 강력한 하위 에이전트가 될 수 있습니다. Sol 이 옵션을 평가하고 방향을 설정한 다음, 더 빠르고 저렴한 Terra 에게 구현을 넘길 수 있습니다.
  3. Luna 는 세 모델 중 가장 빠르고 저렴하며, 시중의 대부분의 모델을 능가하는 성능을 Sol 가격의 5 분의 1에 제공합니다. 대부분의 일상적인 AI 작업에서 Luna 는 매우 저렴한 비용으로 안정적인 성능을 제공할 만큼 충분히 강력합니다. 2026년 7월 17일 기준, Artificial Analysis 의 모델 지능 지수에서 전체 모델 576개 중 16위를 기록했습니다.
Cerebras - inline image

작업에 가장 적합한 모델 선택하기

요청을 처리할 모델과 적용할 추론 수준을 어떻게 결정할까요? 이 선택은 토큰이 생성되기 전에 이루어져야 합니다.

Luna 로 시작한 후, 단계적으로 올리기.

모든 작업에 접근하는 간단한 방법은 지불할 의사가 있는 가격에 최적의 속도와 지능 균형을 제공하는 모델을 선택하는 것입니다. GPT-5.6 제품군 내에서:

1. GPT-5.6-Sol: 가장 높은 지능 하한 및 상한

2. GPT-5.6-Luna: 가장 빠른 속도 하한 및 상한

좋은 기본 방법은 대부분의 작업을 Luna 로 시작한 다음, 에이전트가 막히거나, 수정 사항이 적용되지 않거나, 모델이 맥락을 놓치기 시작할 때 Terra 또는 Sol 로 올리는 것입니다. 속도와 지능 모두에 더 많은 비용을 지불할 의향이 있다면, Cerebras 에서 Sol 을 초당 750 토큰으로 실행할 수 있으며, 이는 Sol 의 일반 모드보다 최대 10배 빠른 속도 이점을 제공합니다.

Cerebras - inline image

테스트 시간 컴퓨팅 / 추론

모델이 작업을 처리하는 방식을 조정하는 또 다른 방법은 추론 수준을 조정하는 것입니다. Codex 에서는 "낮음", "중간", "높음", "매우 높음", "울트라"의 다섯 가지 옵션 중에서 선택할 수 있습니다.

더 많은 컴퓨터 처리 시간을 사용하여 출력의 정확도를 높이면, 모델은 사용자에게 답변을 제공하기 전에 스스로 논쟁하고 질문하는 토큰을 생성합니다.

  • 낮음: 기본 작업을 신속하게 완료하거나, 파일 찾기, 리포지토리 복제 및 구성, 다운로드 정리 등에 적합합니다. 모델이 수행해야 할 작업을 알고 있고 실패 가능성이 낮은 모든 작업에 대해 선택해야 하는 추론 수준입니다.
  • 중간: 약간의 해석, 계획 또는 디버깅이 필요하지만 깊은 탐색이 필요하지 않은 작업에 적합한 일상적인 기본값입니다. 여러 파일에 걸친 요약, 작은 기능 구현 또는 익숙한 문제 해결 등이 포함될 수 있습니다.
  • 높음매우 높음: 복잡한 디버깅, 아키텍처 결정, 대규모 리팩터링 또는 여러 가지 그럴듯한 접근 방식이 있는 문제와 같은 어려운 STEM 및 코딩 작업에 가장 적합합니다. 대부분의 일상적인 비서 작업에는 이 정도의 추론이 필요하지 않습니다.
  • 울트라: 특히 여러 독립적인 시스템에 걸친 작업에서 원하는 바를 정확히 알고 있고 상세한 제약 조건이 있는 경우 가장 높은 추론 모드를 사용하세요. 예를 들어, 두 API 를 매우 특정한 방식으로 연결하기 위한 인터페이스와 API 를 구축하는 경우입니다.

우리는 일반적으로 울트라 모드를 가장 큰 연구 질문과 새로운 도전 과제를 위해 예약합니다. 울트라 모드는 사용량 한도를 매우 빠르게 소진하는 경향이 있지만, 모델이 답변을 탐색, 확인 및 개선하는 데 사용 가능한 전체 추론 예산을 사용했다는 점을 안심할 수 있습니다.

7월 17일 Artificial Analysis 테스트에서 GPT-5.6 Sol 의 추론 수준이 한 단계씩 올라갈 때마다 작업당 평균 비용이 약 50% 증가했습니다. 아래 차트는 추가 추론이 지능과 비용 모두에 어떤 영향을 미치는지 보여줍니다.

Cerebras - inline image

캐시 읽기 활용하기.

캐시된 입력은 새로운 입력보다 90% 저렴합니다. 동일한 코드베이스나 컨텍스트를 반복적으로 처리하는 Codex 작업은 엄청난 이점을 얻습니다.

각 GPT-5.6 모델의 캐시 TTL 은 약 30분입니다. 즉, 각 작업에 대해 새 세션을 시작하는 것보다 하나의 세션을 유지하며 작업하는 것이 더 좋습니다.

Codex 의 압축 기능도 충분히 개선되어 단일 세션에서 수억 개의 토큰을 문제 없이 실행할 수 있습니다.

세션을 활성 상태로 유지하면 프롬프트 처리가 훨씬 저렴해집니다. 20분마다 실행되도록 Codex 자동화를 설정하여 캐시를 활성 상태로 유지하고 이러한 자동화를 사용하여 장기 실행 프로세스를 구동할 수 있습니다.

Cerebras - inline image

멀티 에이전트 워크플로우 효과적으로 사용하기.

서로 다른 모델은 서로 다른 데이터로 훈련되고 서로 다른 목표에 최적화되어 있으므로, 각 모델은 특정 작업에서 약간 더 좋거나 나쁠 수 있습니다.

어드바이저 워크플로우는 한 에이전트에게 좁은 작업을 할당합니다: 전체 세션을 읽고, 목표와 제약 조건을 추적하며, 작업자가 방향을 잃기 시작할 때 개입하는 것입니다. 이는 긴 작업 전반에 걸쳐 작업자를 자동으로 안내하고 안정성을 향상시키는 데 도움이 됩니다.

로컬 Codex 를 사용하면 앱에 다른 공급자를 가져올 수도 있습니다. 즉, 익숙한 Codex 경험 안에서 Kimi K2.7 Code 와 같은 저비용 오픈 가중치 모델이나 장기 추론 및 코딩을 위한 GLM-5.2 와 같은 다른 강점을 가진 모델을 실험해 볼 수 있습니다.

그런 다음 이러한 외부 모델을 제한된 하위 에이전트 작업에 사용하여 비용을 절감하거나 각 모델의 다양한 강점을 활용할 수 있습니다.

한 가지 중요한 세부 사항: 이는 간단한 앱 내 모델 선택기가 아닌 Codex 설정 및 사용자 지정 에이전트 파일을 통해 수행됩니다. Codex 는 Ollama 및 LM Studio 와 같은 로컬 공급자와 함께 사용자 지정 Responses 호환 공급자를 지원합니다.

Cerebras - inline image

결론

구독 사용량 한도는 상당히 넉넉하지만, AI 에이전트가 더 많은 사람들에게 유용해짐에 따라 많은 사람들이 한도가 하나의 구독으로 제공할 수 있는 것 이상으로 늘어나고 있습니다.

그리고 돈이 충분하다 하더라도, 모든 "최첨단" 모델이 모든 사용 사례에서 최첨단에 있는 것은 아닙니다. 종종 작은 모델이 몇 가지 벤치마크에서 세계 최고의 모델 컨소시엄을 완전히 압도할 수 있습니다.

속도는 중요한 토글입니다. 낮에 에이전트와 상호 작용할 때 높은 tok/s 는 경험을 획기적으로 향상시킬 수 있습니다. 업무 시간 외에는 느리고 추가 추론 모델을 사용하는 /goal 이 큰 차이를 만들 수 있습니다.

마지막으로, Artificial Analysis 를 주목하세요. 고품질 모델 속도 벤치마크와 지능 지수로 가득합니다.

Sarah Chieng (@MilksandMatcha), Joyce Er, Hai-Ching 님의 검토와 의견, 그리고 이 블로그에 사용된 그래픽을 디자인해 주신 Halley Change (@halleychangg) 님께 감사드립니다.

YouMind에서 다시 만들기

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기