Autores: @0xSero y Zhenwei Gao (@zhennydez
Tu suscripción a Codex ahora incluye 3 modelos principales: Sol, Terra y Luna, cada uno entrenado y servido de forma independiente, con diales de razonamiento. Juntos, te permiten elegir un equilibrio de velocidad, costo e inteligencia para cada tarea.
Comparativa de Precios de un Vistazo (Precios para desarrolladores de OpenAI, 21 de julio de 2026
En cuanto al precio, Terra cuesta la mitad que Sol, mientras que Luna cuesta una quinta parte, tanto en uso de contexto corto como largo.

Esta fijación de precios se correlaciona bastante con la inteligencia y la velocidad. En la práctica, cada modelo es más adecuado para un tipo diferente de trabajo:
- Sol es el más inteligente del grupo. Es ideal para tareas de larga duración, desafíos técnicos complejos y asistencia personal. Esa capacidad adicional conlleva una mayor latencia y costo, pero Sol sobresale en la coordinación de subagentes y en abordar grandes proyectos a lo largo de flujos de trabajo extensos.
- Terra se sitúa cómodamente en el medio, ofreciendo la mayor parte de la inteligencia a la mitad del precio de Sol. También es moderadamente más rápido. Combinado con Sol, Terra puede ser un subagente sólido: Sol puede sopesar las opciones y establecer la dirección, para luego delegar la implementación al más rápido y económico Terra.
- Luna es el más rápido y asequible de los tres, superando aún a la mayoría de los modelos del mercado, con solo una quinta parte del precio de Sol. Para la mayoría de las tareas cotidianas de IA, Luna es más que capaz, ofreciendo un rendimiento fiable a un costo increíblemente bajo. A partir del 17 de julio de 2026, ocupa el puesto 16/576 en el índice de inteligencia de modelos de Artificial Analysis.

Elegir el Mejor Modelo para la Tarea
¿Cómo decides qué modelo debe manejar una solicitud y cuánto razonamiento debe aplicar? Esa elección debe hacerse antes de generar cualquier token.
Empieza con Luna, luego Escala.
Una forma sencilla de abordar cualquier tarea es elegir el modelo que ofrezca el mejor equilibrio entre velocidad e inteligencia al precio que estés dispuesto a pagar. Dentro de la familia GPT-5.6:
1. GPT-5.6-Sol: El nivel de inteligencia más alto, tanto en el mínimo como en el máximo.
2. GPT-5.6-Luna: El nivel de velocidad más alto, tanto en el mínimo como en el máximo.
Una buena opción por defecto es comenzar la mayoría de las tareas con Luna, y luego subir a Terra o Sol cuando el progreso se estanque, por ejemplo, cuando los agentes se quedan atascados, las correcciones no se aplican o el modelo comienza a perder el hilo. Si estás dispuesto a pagar más por velocidad e inteligencia, puedes ejecutar Sol en Cerebras a 750 tokens por segundo, lo que supone una ventaja de velocidad hasta 10 veces mayor que el modo normal de Sol.

Cómputo en Tiempo de Prueba / Razonamiento
Otra forma de adaptar cómo el modelo maneja una tarea es ajustando su nivel de razonamiento. En Codex, puedes elegir entre cinco opciones: "Ligero", "Medio", "Alto", "Muy Alto" y "Ultra".
Al usar más tiempo de procesamiento computacional para aumentar la precisión del resultado, el modelo generará tokens discutiendo y cuestionándose a sí mismo antes de dar una respuesta al usuario.
- Ligero: Ideal para completar tareas básicas rápidamente, como encontrar archivos, clonar y configurar un repositorio, organizar tus descargas y más. Este es el nivel de razonamiento que deberías elegir básicamente para cualquier cosa en la que el modelo sepa lo que tiene que hacer y la probabilidad de fallo sea baja.
- Medio: Un buen valor predeterminado para el día a día en tareas que requieren cierta interpretación, planificación o depuración, pero no una exploración profunda. Esto podría incluir resumir archivos, implementar una funcionalidad pequeña o solucionar un problema familiar.
- Alto y Muy Alto: Ideal para tareas difíciles de STEM y codificación, como depuración compleja, decisiones de arquitectura, refactorizaciones grandes o problemas con varios enfoques plausibles. La mayoría de las tareas de asistencia rutinarias no necesitan tanto razonamiento.
- Ultra: Usa el modo de razonamiento más alto si realmente sabes lo que quieres y tienes restricciones detalladas, especialmente en trabajos que abarcan múltiples sistemas independientes. Por ejemplo, construir interfaces y APIs para conectar 2 APIs de una manera muy específica.
Normalmente reservamos el modo Ultra para nuestras preguntas de investigación más importantes y desafíos novedosos. El modo Ultra tiende a agotar tus límites de uso muy rápidamente, pero puedes estar seguro de que el modelo ha utilizado todo el presupuesto de razonamiento disponible para explorar, verificar y refinar su respuesta.
En las pruebas de Artificial Analysis del 17 de julio, cada aumento en el nivel de razonamiento de GPT-5.6 Sol incrementaba el costo promedio por tarea en aproximadamente un 50%. Los gráficos a continuación muestran cómo el razonamiento adicional afecta tanto a la inteligencia como al costo.

Aprovecha las Lecturas de Caché.
La entrada en caché es un 90% más barata que la entrada nueva. Las tareas de Codex que procesan repetidamente el mismo código base o contexto se benefician enormemente.
Cada uno de los modelos GPT-5.6 tiene un TTL de caché de aproximadamente 30 minutos. Esto significa que mantener una sola sesión en la que trabajes será mejor que iniciar una nueva sesión para cada tarea.
La compactación de Codex también ha mejorado lo suficiente como para que puedas ejecutar una sola sesión con cientos de millones de tokens sin siquiera experimentar problemas.
Si mantienes la sesión activa, tendrás un procesamiento de indicaciones mucho más barato. Puedes configurar automatizaciones de Codex programadas cada 20 minutos para mantener tu caché activa y usar esas automatizaciones para impulsar procesos de larga duración.

Usando Flujos de Trabajo Multiagente de Forma Efectiva.
Diferentes modelos están entrenados con diferentes datos y optimizados para diferentes objetivos, lo que significa que cada uno será ligeramente mejor o peor en ciertas cosas.
El flujo de trabajo Asesor le da a un agente un trabajo específico: leer la sesión completa, hacer un seguimiento del objetivo y las restricciones, e intervenir cuando el trabajador comience a desviarse. Esto ayuda a guiar automáticamente al trabajador y mejorar la fiabilidad en tareas más largas.
Codex Local también te permite traer otros proveedores a la aplicación. Esto significa que puedes experimentar con modelos de bajo costo y peso abierto como Kimi K2.7 Code, o modelos con diferentes puntos fuertes, como GLM-5.2 para razonamiento y codificación a largo plazo, mientras te mantienes dentro de la experiencia familiar de Codex.
Luego puedes usar estos modelos externos para trabajo de subagentes acotado, ayudando a reducir costos o aprovechar las diferentes fortalezas de cada modelo.
Un matiz importante: esto se hace a través de la configuración de Codex y archivos de agente personalizados, en lugar de un simple selector de modelos dentro de la aplicación. Codex es compatible con proveedores locales como Ollama y LM Studio, junto con proveedores personalizados compatibles con Responses.

Conclusión
Los límites de uso de las suscripciones son bastante generosos, pero a medida que los agentes de IA se vuelven más útiles para más personas, muchos están llevando los límites mucho más allá de lo que una suscripción puede ofrecer.
E incluso si tienes dinero de sobra, no todos los modelos "frontera" se sitúan en la frontera de todos los casos de uso. A menudo, un modelo pequeño puede dejar en ridículo a un consorcio de los mejores modelos del mundo en algunos puntos de referencia.
La velocidad es un factor importante. Durante el día, cuando interactúas con tus agentes, una alta tasa de tokens/segundo puede mejorar drásticamente tu experiencia. Fuera del horario laboral, un /goal con un modelo lento y de razonamiento extra puede marcar una gran diferencia.
Y, por último, echa un vistazo a Artificial Analysis, está lleno de puntos de referencia de velocidad de modelos de alta calidad e índices de inteligencia.
Agradecimientos a Sarah Chieng (@MilksandMatcha), Joyce Er y Hai-Ching por su revisión y aportes, y a Halley Change (@halleychangg) por diseñar los gráficos presentados en este blog.





