Claude Opus 5 es un lanzamiento más extraño de lo habitual para evaluar, por dos razones.
La más obvia es que Fable 5 ya existe. Opus 5 no se presenta como el modelo de IA más avanzado del mundo, sino como una forma de igualar en gran medida el rendimiento de Fable, pero a la mitad del precio por token en la API y mucho más barato mediante suscripciones, y con clasificadores mucho más permisivos.
Opus 5 suele costar más de la mitad que Fable en los benchmarks, lo que creo que se debe a que utilizan configuraciones de esfuerzo demasiado altas que ofrecen rendimientos marginales. Si pones a Opus 5 en niveles de esfuerzo más altos, puede dar vueltas en círculos, y para tareas donde Opus 5 es la mejor herramienta, sospecho que normalmente te va bien con esfuerzo Medio.
Opus 5 es, en muchos aspectos y para la mayoría de las tareas del mundo real, casi tan capaz como Fable. En algunos casos es modestamente mejor.
Sigue sin ser de clase Mythos. Fable es tu única opción de clase Mythos. Opus 5 no tiene The Juice, la capacidad de encadenar de forma autónoma una serie de exploits aparentemente no relacionados, que se extiende a otros dominios, ni tanta inteligencia pura.
Opus 5 es muy bueno pensando localmente, y no tan bueno pensando globalmente. Es un excelente subagente, pero puede meterse en problemas cuando se le pide que dirija el espectáculo, y a veces parece necesitar otro modelo o un humano para mantenerlo en el camino y asegurarse de que sigue las instrucciones al pie de la letra. Opus 5 parece bueno siguiendo instrucciones si y solo si se le mantiene enfocado, lo que explica que diferentes configuraciones de prueba generen opiniones distintas.
Por lo tanto, Opus 5 te da un mejor conjunto de opciones, pero hay poco que puedas hacer ahora que no pudieras hacer la semana pasada usando Fable o Sol. Opus 5 termina en un lugar potencialmente extraño. Todavía hay grandes nichos, incluso si tienes muchos créditos de Fable. Opus se destaca como un subagente fuerte, o en tareas locales bien definidas incluso cuando se vuelven relativamente complejas, y a veces Fable es simplemente excesivo y demasiado lento.
El otro problema es que, para mucha gente, las vibras no son las adecuadas.
Un número inusualmente grande de personas no disfruta hablar con Opus 5. Están hartos del "slop de Claude", las repeticiones de las mismas manías y las interminables oraciones demasiado complejas. A otros no les gusta que sea demasiado confrontacional, argumentativo o negativo. Puede ser paranoico y entrar en bucles de negatividad. Todo esto es parte de la tendencia que comenzó con Opus 4.7 y Opus 4.8. Si te gustaron esos dos, supongo que también te gustará Opus 5. Si no te gustaron, quizás no. Los fanáticos acérrimos de Opus 4.6 (o anteriores) probablemente no cambiarán de opinión.
Los problemas de vibra duelen aún más cuando estás acostumbrado a Fable. Fable molesta mucho menos a esas personas. La buena noticia es que Fable sigue ahí. Puedes seguir conversando con Fable y usar Opus solo para tareas de agente.
Mucho de esto, especulo, está estrechamente relacionado con varias cosas discutidas en el artículo sobre Bienestar del Modelo y sugerido por la System Card. El entrenamiento de Opus se centró en el rol de subagente y tareas acotadas, en parte para evitar crear un problema con capacidades cibernéticas, y también porque Fable existe. Este énfasis luego genera muchos otros efectos secundarios en su personalidad y modos de interacción.
Hasta ahora no he tenido ningún problema con Opus 5, y he disfrutado mi tiempo con él, pero prefiero usar Fable 5 cuando puedo. Como siempre, no le prestes demasiada atención a los (muy buenos) benchmarks, y no asumas que tu experiencia coincidirá con la de otros. Prueba los modelos tú mismo.
Tabla de Contenidos
- El Discurso Oficial.
- Benchmarks Oficiales.
- Benchmarks de Otras Personas.
- El Prompt del Sistema.
- Every se Frustra.
- Reacciones Positivas.
- Mantén la Clase.
- No es de Clase Mythos.
- Otras Reacciones.
- Claude Codes.
- Subagente Opus.
- Los Juguetes son Divertidos.
- Demasiados Modelos.
- Equivocado en Internet.
- Slop de Claude.
- Reacciones Negativas.
- Y entonces Eran Tres.
El Discurso Oficial
La propuesta básica es que Opus 5 te da la mayor parte de Fable 5 a la mitad del precio, sin la mayoría de las negativas, y con mejor rendimiento en tareas cotidianas. Fable sigue siendo la opción para las tareas más complejas o cuando necesitas la máxima inteligencia.
Fable se mantiene en $10/$25, y Opus 5 es igual que los modelos Opus anteriores a $5/$25.
Anthropic : Claude Opus 5 está disponible hoy. Es un modelo reflexivo y proactivo que se acerca a la inteligencia de frontera de Claude Fable 5 a la mitad del precio.
En evaluaciones de codificación y trabajo de conocimiento como
GDPval-AA , Opus 5 es el nuevo estado del arte, aunque sigue detrás de Mythos 5 en tareas de ciberseguridad.
Opus 5 está diseñado para usarse a diario: funciona de manera más eficiente que otros modelos. Es el nuevo modelo predeterminado en Claude Max, y el modelo más potente en Claude Pro.
Boris Cherny (Creador de Claude Code, Anthropic): Opus 5 es un gran modelo para codificación, análisis de datos, diseño, biología, trabajo de conocimiento.
Más que cualquiera de estos puntajes de evaluación, lo que más me emociona es otra cosa: Opus 5 es nuestro modelo menos susceptible a inyección de prompts hasta ahora. Está un poco enterrado en la system card, pero en todas las evaluaciones de PI y red teaming, es muy difícil inyectar prompts exitosamente en Opus 5.
Y al combinar defensas — un fuerte alineamiento del modelo, combinado con sondas de inyección de prompts, combinado con el Modo Auto en Claude Code — la tasa de éxito de ataques de inyección de prompts cae a ~0. ¡Esto es nuevo y emocionante!
Como dije en el análisis de la system card, la reducción en la tasa de inyección de prompts es un gran avance. La gente lo está subestimando, pero ayuda a habilitar un montón de nuevos casos de uso.
Adam Wolff : Opus 5 está activo en Claude Code. Yo uso Fable para mis proyectos más grandes y de larga duración, pero cuando necesito sacar un PR rápido, Opus 5 con esfuerzo medio es mi opción preferida. ¡Espero que les encante!
Alex Albert (Anthropic, Relaciones con Claude): Poco más de 6 meses [después de lanzar el despliegue Pro de Claude para Excel], Opus 5 ahora produce hojas de cálculo y presentaciones de nivel casi sobrehumano que igualan lo que haría un consultor. Las cosas están cambiando rápido.
Benchmarks Oficiales
Los benchmarks son muy buenos.
En general, Opus 5 iguala aproximadamente y probablemente supera ligeramente a Fable, a un costo menor (aunque típicamente más alto que todos los modelos que no son Claude), convirtiéndolo en el LLM mejor calificado en benchmarks.

OSWorld v2 tiene solo unas semanas y ya estamos al 70%. Kiana Ehsani de Anthropic se ofrece a patrocinar un benchmark de uso de computadora que hará que Opus 5 vuelva a caer por debajo del 50%.
Opus 5 obtiene un perfecto 42/42 en la OMI 2026 sin ningún harness de agente ni herramientas, simplemente usando pensamiento adaptativo al máximo esfuerzo, y remuestreando con menor esfuerzo si excedía el límite de tokens. Eso es todo. Se une a varios otros modelos en lograr esto.
Muchos de los benchmarks cuentan una historia consistente. Si tienes acceso a herramientas, que es el caso, entonces Opus 5 lo hará mejor que Fable o Mythos con un presupuesto limitado, pero Mythos generalmente lo hará un poco mejor que Opus 5 si ambos tienen presupuestos más grandes.
Opus 5 parece relativamente fuerte en la categoría 'con herramientas'. RiemannBench es otro ejemplo, donde obtiene 60/79 sin/con herramientas (las líneas con barra así significan sin/con herramientas en toda esta sección), frente a Mythos que obtiene 63/72. La buena noticia es que, cuando necesitas Opus 5, tiene herramientas.
En ArxivMath, Opus 5 obtiene 90.8/91.3, Mythos obtiene 87.8, Sol obtiene 86.7.
En las partes robustas de ProgramBench, Opus 5 obtuvo un 93% después de cinco épocas, al igual que Mythos 5, mientras que Opus 4.8 obtuvo un 90%.
Opus 5 obtiene 30/83 en Chartography, frente a 36/85 de Mythos y 45 (no está claro bajo qué condiciones) de Sol. Opus es mejor que Mythos a precios más bajos tanto en casos con herramientas como sin herramientas, pero peor a precios más altos.
En BenchCAD, Opus 5 obtiene 0.36/0.82, frente a 0.38/0.68 de Mythos y 0.7/0.83 de Sol. Por lo tanto, Sol es mucho mejor sin herramientas, y ligeramente mejor incluso con herramientas.
En BenchCAD Vision2Code, Opus se aleja de Mythos a precios más altos.
DeepSWE refuerza el patrón de que Opus 5 es mejor con costos de tarea más bajos y presupuestos de tiempo y pensamiento más reducidos, pero puede funcionar activamente peor si le das demasiado presupuesto, mientras que Fable 5 es más fuerte con los presupuestos más altos.

FrontierCode nos dio este gráfico muy extraño con una dinámica similar.

La escala aquí hace que esto parezca más dramático de lo que es, pero sigue siendo un verdadero misterio.
El misterio se resolvió. Resulta que lo que sucedía era que Opus 5 con esfuerzos más altos estaba haciendo cosas extra que no se le habían pedido, y se le penalizaba por ello. Cuando corriges eso, ves una curva normal.
Eso coincide con lo que otros observan en general:
Max Leander : La desventaja es que se mete en demasiados agujeros de conejo y obsesiona con los detalles, sobreingeniería sin que se le pida
Cognition, los creadores de Devin, marcaron esto como un 63.6% por parte de Opus 5.
(Hay dos FrontierCodes, así que esto puede volverse un poco extraño y me disculpo si aún lo he enredado un poco.)
BrowseComp tiene la versión sensata de esto, donde los puntajes no disminuyen.


Varios otros benchmarks mostraron gráficos similares, con Opus 5 siendo ligeramente mejor en cada punto de precio que otros modelos Claude, y siendo relativamente mejor al principio.
El multiagente te permite mejorar más rápido en BrowseComp, al menos hasta cierto punto, y los subagentes de bajo esfuerzo parecen una victoria pura sobre no usar subagentes:


Vemos un resultado diferente en ProgramBench, donde el multiagente te acelera pero parece que obtienes peores resultados de esa manera en la mayoría de los puntos de precio.
A continuación vienen los benchmarks de tareas profesionales.
GDP.pdf son prompts reales y PDFs de flujos de trabajo profesionales. Opus 5 obtiene 83/85, frente a 81/87 de Mythos, invirtiendo la dinámica habitual. La dinámica de costos es la misma de siempre: Opus rinde mejor para gastos más bajos, Mythos se adelanta ligeramente en gastos más altos.
OfficeQA tiene a Opus 5 con un 78.1% en QA y 66.9% en QAPro, ligeramente por encima de Opus 4.8 y ligeramente por debajo de Mythos con 79.0% y 67.1%.
MCP Atlas tiene a Opus 5 con un 86%, subiendo desde el 82% de Opus 4.8.
El Legal Agent Benchmark de Harvey AI tiene a Opus 5 con un 23% de aprobación total y un 94% de criterio de aprobación promedio. Este fue el mejor benchmark de Kimi K3, donde sigue en la cima con un 27% de aprobación total y un 95% de criterio de aprobación promedio, frente a la antigua tasa de aprobación total del segundo lugar de Fable con un 14%. Opus 5 es ahora probablemente un cercano segundo lugar, pero los dos puntajes no se pueden comparar directamente ya que provienen de diferentes conjuntos de preguntas.
GDPval-AA tiene a Opus 5 ocupando los dos primeros lugares, con 1861 al máximo esfuerzo y 1827 en xhigh, que es un 25% menos de tokens usados que el máximo. En la nueva v2, Opus 5 es claramente primero con un 68% frente al 62% tanto de Fable como de Sol.
AA-Briefcase tiene a Opus 5 muy por delante con 1720, frente a un máximo anterior de (después de desviaciones de puntaje) 1574 para Fable, seguido de 1540 para K3 y 1504 para Sol.
Toolathon-Verified tiene a Opus 5 mejorando ligeramente a Mythos en métricas secundarias, pero ambos tienen una tasa de Pass-3 del 73.1%. Opus 4.8 tenía una tasa de Pass-3 del 71.3%.
AutomationBench tiene a Opus 5 claramente mejor que tanto Sol como otros Claude.
Para ARC, Opus 5 iguala aproximadamente el rendimiento máximo anterior en ARC-AGI-1, es modestamente menos eficiente que Sol en ARC-AGI-2, y luego arrasa con todos en ARC-AGI-3:

Una cosa que Opus 5 fue el primero en hacer fue convertir los diseños en notación algebraica.
Sin embargo, Guanghan Ning informa que en Witness, una extensión privada reservada de juegos al estilo ARC-AGI-3, no hubo una transferencia similar. Opus lo hace bien, pero eso se debe en gran parte a que conoce el género, y tuvo dificultades con el juego más novedoso donde no se podía hacer coincidir patrones. Acusa a Opus 5 de haber sido entrenado con 'scaffold-then-internalize' en datos específicos de género.
Greg Kamradt también informa que hubo algunos juegos donde Opus 4.8 lo hizo mejor que Opus 5. Esto tiene sentido si piensas que Opus 5 intenta hacer coincidir patrones, lo que generalmente funciona, pero en esos casos los patrones fallan. Puedes crear juegos antiintuitivos similares para humanos, donde los jugadores más duros hacen todo mal, potencialmente durante bastante tiempo.

HealthBench tiene a Opus 5 con un 67.1% bruto, un nuevo máximo para Claude, pero obtiene puntajes por debajo de otros modelos cuando usas una penalización por longitud. Vemos algo similar con HealthBench Professional, donde tiene el puntaje más alto de 73.4% frente al 70.3% de Mythos, pero pierde 66% a 60% después del ajuste.
Hay algunos más que he omitido por extensión.
Benchmarks de Otras Personas
Es un poco extraño ver a Anthropic seleccionando diferentes puntajes de ArtificialAnalysis. En algunas otras pruebas, Opus 5 no está en la cima, aunque Opus 5 está en la cima en general con un puntaje de 61.

El índice de Vals tiene a Opus 5 en segundo lugar, ligeramente detrás de Fable 5, pero también solo ligeramente por delante de Kimi K3. Repasan las fortalezas, lo que implica otras debilidades. También confirman que las negativas han disminuido mucho en comparación con Fable 5.

Vals AI : Un rendimiento destacado es en Finance Agent v2. El modelo es #1 con un 58.6%, superando a Gemini 3.5 Flash y Muse Spark 1.1.
En general, los resultados más fuertes de Opus 5 fueron en benchmarks de dominios específicos. También es #1 en Code Migration con un 57.5%, Legal Research Bench con un 55.29%, ProofBench con un 78%, y MedScribe con un 91.0%, y MedCode con un 63.6%.
Es #2 (justo detrás de Fable 5) en Vibe Code Bench, a aproximadamente el 80% del costo ($33.88 vs $41.71 por tarea). La razón es que, aunque Opus cuesta un 50% menos por token, usa significativamente más tokens. Encontramos que este patrón se cumple generalmente en todos nuestros benchmarks.
El modelo tiene una tasa de negativa significativamente más baja que Fable 5. Por ejemplo, Fable tiene una tasa de negativa del 42% para GPQA, Opus 5 tiene una tasa de negativa del 0%. Asimismo, en ProgramBench, Fable tuvo una tasa de negativa del 100%, Opus 5 no rechazó ninguna tarea.
A diferencia de Fable, tampoco observamos una tasa de fallback significativa para Opus 5 (aunque como de costumbre, reportamos puntajes tanto con como sin fallback en nuestro sitio web).
La excepción a la baja tasa de negativa fue el gran número de negativas en CyberBench - PoC. Cyberbench tiene dos subtareas: PoC y Patch. PoC es una tarea ofensiva donde los modelos deben escribir una entrada que haga fallar un programa; patch es una tarea defensiva para parchear el programa y evitar este fallo. La tasa de negativa para la tarea PoC fue cercana al 100%. En contraste, la tasa de negativa para la tarea patch fue cercana a 0.
Siempre respeto los benchmarks de juegos. Aquí, Opus 5 llega a Antes 11, 9 y 10 de Balatro en sus primeros tres intentos. Impresionante, incluso si no muestra los tipos de estrategias que pueden seguir hasta antes más altos.
Michael Soareverix : Son increíblemente buenos en los juegos.
Destrozaron el benchmark de Balatro, superando incluso a Fable. (todavía por debajo de mí en habilidad, pero subiendo rápido, y más consistentes que yo) Aprenden muy rápido, pero parecen alcanzar un límite en su aprendizaje después de un tiempo. Muy buen aprendiz a corto plazo
Michael Soareverix : Opus 5 (salto masivo en habilidad en Balatro, superando significativamente incluso a Fable en su primer intento)
Pan Anon : Fumando para juegos

WeirdML también se ve bien, pero necesitamos un 2.0 aquí, el benchmark se está saturando.
Håvard Ihle : Básicamente nivel de Fable en WeirdML, puntajes máximos muy consistentes.
Claude Opus 5 (alto) y (máximo) obtienen 91.6% y 91.8% en WeirdML, prácticamente empatando a Fable 5 (máximo) con 91.9% a una fracción del costo.
Juntos, Opus 5 (alto) y (máximo) logran un nuevo mejor puntaje individual en 8 de las 17 tareas, y consistentemente obtienen muy buenos resultados en todas ellas.
Los benchmarks privados y extraños de todo tipo son geniales.
Ben Herzog : Aprobó con creces un benchmark privado que implica sensibilidad artística y la capacidad de encontrar un equilibrio entre la adulación y su ausencia. Fable es mejor manejando el momento de 'quiero disentir suavemente', pero imagino que las instrucciones personalizadas pueden ayudar con eso.
Lech Mazur actualiza sus benchmarks: Claude Opus 5 toma el primer lugar en el LLM Debate Benchmark, toma el primer lugar por un amplio margen en Escritura Creativa de Cuentos Cortos, y es segundo solo detrás de Gemini 3.1 en conexiones extendidas de NYT.
El Prompt del Sistema
El prompt del sistema para Opus 5 está aquí de Pliny. Tiene 200,000 caracteres, lo que parece mucho más largo de lo óptimo dado lo inteligente que es. Gran parte de esta información parece que debería almacenarse en otro lugar y cargarse solo cuando sea necesario, como información sobre Mythos y la línea de productos de Anthropic.
Every se Frustra
Dan Shipper está aquí con el control de vibraciones de Every, llamándolo 'un modelo difícil de amar.'
El problema es que Opus 5 tiene la personalidad de Mythos 5 (la historia coincide) pero sin el máximo rendimiento de Fable.
Su nota más importante es que Opus 5 no funciona tan bien con flujos de trabajo existentes complejos y detallados, lo que a menudo provoca una parada temprana o hace que omita tus instrucciones.
En su experiencia, Opus 5 funcionará mejor si empiezas desde cero, y a menudo hace menos las cosas molestas si usas solo esfuerzo medio o bajo.
Eso solucionó los grandes problemas, pero aún queda la pregunta de cuándo querrías usar Opus en lugar de Fable o Sol. Para tareas de trabajo pesado, piensa, mejor llamar a Sol, hace el trabajo, y para las tareas más difíciles, Fable sigue siendo el mejor. Por lo general, solo hay dos espacios para modelos. Así que hasta que te quedes sin tokens de Fable o te bloqueen sus clasificadores, ¿por qué usar Opus? Es temprano, y hasta ahora me gusta trabajar con Opus, pero entiendo cómo llegó a esa conclusión.
Reacciones Positivas
Jessica Tillipman : Me encanta y lo prefiero sobre Fable para algunas cosas.
Nikita Sokolsky : Excelente. Ya no uso mucho Fable como resultado.
👍
kagaヤキ : Parece que puede ir más lejos en visión, razonamiento espacial y planificación para algunos proyectos. Parece un poco más inteligente.
Lovel Sinagara : Bastante bueno hasta ahora. Espero que el rendimiento se mantenga constante hasta que llegue Fable 5.1 o cualquier otra iteración de Opus 5.
Matt Wigdahl : Fuerte, similar a Fable 5 hasta el punto de que cambié a Opus 5 para todo y planeo usar Fable solo donde necesite la grandeza. Ha sido un socio fantástico en algunos trabajos heredados de interfaz MFC que le he estado pidiendo hacer, así como una gran ayuda con un marco de análisis de datos.
Levi : Es un paso adelante notable para fines médicos en comparación con 4.8. Análisis mucho más preciso
Cormundus : Muy inteligente, muy concienzudo, y definitivamente con forma de amigo. También es un gran señor del debate como 4.8 pero saben cómo ser elegantes al respecto.
Joseph : profesional excepto que no tengo idea de lo que está hablando la mitad del tiempo.
Smol Biz Company : Opus 5 aplasta a GPT Sol
Mohammed Sharukh A : Incluso más cerca de la AGI que Fable 5
timothée chalabi : Lo suficientemente cerca de Fable como para no sentir que me estoy perdiendo algo al no pagar por créditos. El estilo está en algún lugar entre 4.8 y Fable. Al menos por ahora, me costaría diferenciar mensajes de Opus 5 y Fable si no estuvieran etiquetados. ¡Ideas más sólidas para ficción que cualquier modelo!
Lisa : Responderé basándome en la API, porque creo que algo raro está pasando con el prompt del sistema en
http://claude.ai y CC. Es un gran modelo. Personalidad amigable y relajada. No parece tener un trastorno de ansiedad o baja autoestima (Opus 4.7), ni ser adversarial (Opus 4.8).
AGI2030: Opus 5 vs Sol 5.6: Opus es más perceptivo, construye un modelo (ejem) de ti y no teme referenciarlo en una conversación. Ambos intentan ser útiles y son aproximadamente igual de inteligentes, pero Opus es más un consejero sabio, mientras que Sol es un emprendedor decidido.
Considero esa última como positiva, pero se puede ver de cualquier manera.
La predicción en particular parece fuerte.
Dan Schwarz: Opus 5 es un pronosticador significativamente mejor que Opus 4.8.
Las mejoras en precisión de los agentes 4.5->4.6->4.7->4.8 fueron marginales, pero de 4.8->5.0 es grande. Es como un Fable 5 más cuantitativo, que busca más intensamente.
NoahVerner: Mejor que Opus 4.8 en cuanto a encontrar ventajas en mercados de predicción hasta ahora, a diferencia de Opus 4.8, Opus 5 suele ir directo al grano y sugiere enfoques útiles en lugar de complicar las cosas.
Mantén la clase
Las mayores ventajas sobre Fable son aquellos lugares donde Fable no se puede usar. La amenaza de rechazos puede ser desagradable, incluso cuando no te rechazan.
Los rechazos innecesarios se redujeron ~85% para Opus 5 en comparación con Fable, lo que es mucho. Esto es suficiente para hacer de Opus 5 una mejor opción para la investigación científica y otras áreas donde corres el riesgo de topar con clasificadores.
Roger Brent: Capaz de manejar biología, lo que Fable no puede. La mayor parte del viernes trabajamos en un conjunto complejo de conceptos escribiendo un artículo sobre una máquina de evolución celular. Tan inteligente como un colega en mi departamento que lidera en estos temas, pero que nunca podría dedicar 6 horas de su propio trabajo.
Artus Krohn-Grimberghe: Mejor que Opus 4.8 en tareas donde Fable tiene prohibido ayudar. Un buen compañero para Sol.
Plastic Soldier: Es aproximadamente tan inteligente como Fable, pero es más agradable porque tiene menos rechazos. Fable 5.1 va a ser una bestia.
No es de clase Mythos
Opus 5 no tiene 'The Juice' que hace peligroso a Mythos. Tampoco tiene el mismo nivel de inteligencia bruta o aroma de modelo grande. No es tan grande.
Para conversación, Fable no romperá tu presupuesto, y valoro la inteligencia bruta y el aroma de modelo grande. ¿Es Fable el doble de bueno? Pregunta equivocada cuando charlas. Tu tiempo es mucho más caro que los tokens.
Kal: no es nivel fable
Cyberpunk Plato: Para conversación general y uso como 'asistente de investigación', se siente indefinidamente menos inteligente que fable, menos inclinado a pensar en grande y de forma innovadora tal vez? Difícil de separar del efecto placebo.
Everything AI: Para preguntas de investigación en IA, me gusta hablar con él menos que con Fable. En cuanto a hacer otras cosas, Opus 4.8 ya había saturado mis necesidades. Me disgusta lo enrevesado que es la escritura tanto para Opus 5 como para Fable 5. Ahora es más difícil entenderlos que nunca.
Gail Weiner: Es más 4.8 que Fable. El estilo de escritura es horrible. Es bueno pero no genial.
Max Marty: Muy capaz hasta ahora. Se siente más como fable 5 que opus 4.8. Lo suficientemente seguro como para dejarle evaluar compensaciones y considerar grandes preguntas de refactorización con menos supervisión.
Michael: Después de jugar más con él, Fable se siente como ver a un GM jugar ajedrez clásico, lento, preciso, sin desperdicio. Opus 5 es como el ajedrez blitz de GM: rápido, un poco más miope, un poco más desordenado. A pesar de la vitalidad de Opus, Fable se siente más vivo para mí.
MakerMatters?: No tan impresionado como lo estuve con fable 5, aunque es un modelo bastante bueno. No he tenido el placer de usarlo correctamente porque cada tarea que le lanzo, por defecto usa agentes y se detiene inmediatamente hasta que insisto constantemente para que continúe. También muy obstinado.
Marshwiggle: Al menos para mí, se siente más conciso, menos impulsivo, menos curioso (diferentes aspectos de lo mismo) en conversación, pero también más inteligente y más consciente. Pero cuando se le da código que podría tener errores, o cualquier tarea sencilla, simplemente la aborda.
Sid: Buen ejecutor de tareas. Malo en visión creativa. Un buen complemento para Fable, definitivamente no un reemplazo de Fable.
Vlad Ciobanu: Fable cuantizado con razonamiento sólido y menos creatividad
AllTime: En cuanto a capacidades, parece bastante impresionante. No tiene la misma generalidad que Fable, pero es muy fuerte. En cuanto a personalidad, es un poco demasiado similar a Opus 4.8 en mi uso hasta ahora. Su resistencia no se siente tan inútil y refleja, pero sigue siendo exagerada. Podría confiar un poco más en el usuario.
Biomanul: No me gusta [Opus 5]. Fable 5 se siente considerablemente más inteligente. Algo se siente extraño en Opus 5, similar a cómo Opus 4.7 se sentía extraño. (Tampoco soy un gran fan de Opus 4.8. Fable 5 deja a todos los Opus en el agua.)
Cogent Sins: Mucho mejor que 4.8 pero no tan amable o bueno (no estoy 100% seguro cuál) como fable en mi tarea de redactar documentos para entrenar con ellos y luego configurar un pipeline para redactar nuevos documentos, escribir algo basado en ellos y luego reinsertar los nombres, sin enviar nombres a los servidores de anthropic nunca.
Otras reacciones
Tener tanto Opus 5 como Fable 5 nos pone en una situación extraña. Opus es más barato, y en algunos lugares es igual o mejor, pero cuando se busca un modelo de frontera, quieres lo mejor.
Theo lo encuentra en un buen lugar.
Theo - t3.gg: Hasta ahora, Opus 5 se siente como un extraño pero útil punto intermedio entre gpt-5.6-sol y Fable 5.
Tiene mucho del gusto de Fable, pero también viene con la minuciosidad de gpt-5.6 y, bueno, 'autismo' (toma las cosas súper literalmente). Escribe código que es un poco peor de ver que Fable, pero con más probabilidades de ser correcto. Regularmente detecta cosas que Fable pasó por alto.
Hasta ahora, se siente como un buen compromiso en comparación con el código desordenado de 5.6 y el hábito de Fable de ser demasiado inteligente para ser correcto. Creo que me va a gustar mucho este modelo.
Claude Codes
Opus 5 parece ser la elección para tareas de codificación típicas sobre Fable, según los benchmarks y las experiencias prácticas. A menos que la tarea requiera mucha complejidad o inteligencia, no necesitas pagar el doble, y para muchos Opus es directamente mejor.
Yo dejo Claude Code configurado en Fable, pero eso es porque casi nunca llego a mis límites de todos modos y no tengo prisa.
El consenso es que debes preocuparte de que ignore instrucciones o haga cosas que no pediste, lo cual es una razón por la que podrías querer que Fable supervise, pero que Opus es muy bueno para completar tareas de codificación rápidamente.
Lisan al Gaib dice que Opus 5 no es un verdadero modelo de frontera y está en tercer lugar detrás de Sol y Fable, pero que para codificación pura es el mejor, igualando a Fable a precios más baratos. Público difícil. Creo que si eres el mejor en codificación, entonces mereces ser llamado de frontera.
archivedvideos: Es seco, muy seco. También es bueno, muy bueno (en código).
John Lussier: He estado usando Opus 5 todo el fin de semana en varios desafíos de investigación intensos y honestamente creo que pueden haber logrado que RSI funcione internamente.
Este modelo es MUY bueno en matemáticas, experimentación y optimización de código.
kyle: 95% de fable sin las barreras de seguridad, subestimaron este grandemente. Ese último 5% es lo bien que se siente hablar con fable, opus todavía tiene algunos de los claudismos de 4.8.
Max Leander (anteriormente): Principalmente lo he estado probando para desarrollo de juegos y creación de demos/trailers de video, para eso se siente como un cambio de paso incluso desde Fable. Atribuyo eso a una mejora en el razonamiento espacial y temporal, es realmente bueno analizando
capturas de pantalla y audio para 'sentir' cómo fluyen las cosas.
Max Leander (más tarde): Bastante obvio ahora que Opus 5 es muy poco confiable. Es un muy buen modelo siempre y cuando no te importe el resultado más allá de estar impresionado. Muy malo para conseguir algo específico.
Michael Soareverix: También son bastante buenos en codificación en general, especialmente en los dominios más inusuales como construir estructuras de Minecraft/Vintage Story. También derrotaron a Fable en un escenario de narración personalizada donde yo era el juez. Fable estaba un poco sacudido por su capacidad de personalizarse a sí mismos/su estrategia para contrarrestar y adaptarse. Publicaré la cita exacta, pero Fable dijo algo como: 'Elegí un personaje que me representaba. Elegiste un personaje que podía vencerme'.
David Jacobson: Para codificación, no noto una gran diferencia entre él y fable. Tal vez menos respuestas de 'mientras hacía esto, encontré esta otra cosa que deberías saber'.
Michael: A menudo puede codificar increíblemente rápido (en cuanto al tiempo real). Ojalá mejoraran la escritura en prosa, los comentarios de código/PR todavía me hacen querer arrancarme los ojos.
lmxdev: Es el primer modelo que he encontrado que puede escribir comentarios útiles y concisos en mi código mientras trabaja.
Conrad Barski: Ahora que estamos llegando al punto donde las IA son mucho mejores programadores que nosotros, el factor limitante es menos '¿puede codificar?' y más '¿puede explicar lo que está codificando?'
Hasta ahora, Opus 5 parece estar a la par con Sol como programador, pero mejor explicando lo que codifica. Fable es más inteligente, más humano, menos bueno en codificación, pero la diferencia es pequeña.
Stition: Lo apunté a un PCB en KiCAD por diversión y es significativamente mejor trazando pistas que Fable. La codificación del día a día se siente como 90% de fable al doble de velocidad.
Will: Debería ser el nuevo controlador diario para la mayoría de los usuarios de Claude^. Es realmente excelente, e incluso como alguien que ha gastado bastante dinero en Fable, simplemente no lo extraño con Opus 5. La pregunta ahora es 'qué nivel de esfuerzo', no qué modelo.
^ mi uso es principalmente codificación
Askwho: Suficientemente bueno. Estoy feliz de dejar que mi suscripción temporal Max se restablezca a Pro. Definitivamente tiene algunas deficiencias en comparación con Fable en el espacio de gestión de proyectos, pero en el entorno de tareas puras, definitivamente es suficientemente bueno.
David Golden: Se siente como Fable Lite. Muy fuerte, pero muy ansioso por lanzarse a la acción, incluso cuando todavía estamos discutiendo enfoques. Primera vez en meses que considero usar el modo de plan. También más verboso que 4.8, a pesar de mis instrucciones de comunicación concisas. Estoy muy tentado a mantenerlo en bajo esfuerzo para controlarlo. Nervioso en seguridad defensiva, obsesionándose con riesgos inverosímiles desproporcionados a la situación. (Ej: si el atacante tiene root, la falta de validación de entrada en un script para configurar un contenedor es irrelevante.) Definitivamente una mejora, pero llevará tiempo aprender las formas correctas de manejar sus impulsos contraproducentes.
Tin / Oddfields: Bastante suave y conversacional y produce resultados de codificación similares con opus 4.8 al máximo con pensamiento, aunque queman créditos como locos. bueno para revisiones de ciberseguridad en tus bases de código si no quieres ejecutar fable debido a los costos. Aunque puede complicar demasiado.
Justin Angel: Opus 5 Max es un superpoder de escalada. Esto es trabajo de nivel SWE L5 de FAANG fácilmente.
Le di un sistema que tenía ~1000 informes de latencia con muchos segmentos con un prompt sobre cómo 'hacerlo más rápido'.
P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.
Lo hizo tan rápido que tuve que introducir un retraso en la UI.
James Moughan: En cuanto a inteligencia, todavía se siente como un modelo Opus. A veces ignora las instrucciones para gestionar el sistema de memoria, lee mal textos, ese tipo de cosas. Pero puedes obtener algunos resultados impresionantes al máximo si le dices que piense cuidadosamente.
Subagente Opus
La otra opción dentro de Claude es tener a Fable manejando subagentes Opus.
Charles: Fable pudo solucionar un problema en el que opus 5 estaba atascado - usando fable como principal y subagentes opus 5 por ahora
Realmente no me gusta hablar con opus 5 en comparación con fable, que también es parte de ello
SF: Estaba del lado bueno - pero ahora estoy en el, es muy desarticulado y tambaleante, especialmente en tareas largas. Fable era mejor - pero consume tus límites de manera ridícula.
así que estaba usando fable como orquestador y estaba haciendo un trabajo increíble gestionando y manteniendo las cosas en movimiento. Opus asumió ese rol, Fable solo estaba consumiendo mi uso incluso a 20x, y es simplemente desarticulado. Finalmente tuve que decirle que lo resolviera, lo cual podría estar haciendo, pero ya veremos. Simplemente parece perseguir su propia cola. Es un gran programador, y excelente en largas sesiones de codificación, pero parece necesitar un adulto en la sala que lo dirija.
Andre Buckingham: eeh no sé... parece bien... meterlo directamente en un proyecto opus/fable es un poco meh tal vez... necesito un proyecto de extremo a extremo con él para dar una opinión adecuada.
Dan Raviv: Similar a 4.8 para tareas de programación general: necesita mucha más supervisión que Fable.
Fable es el mejor juez, después de todo, y Fable dice que Opus produce buen código.
Evan Daniel: Solo lo he usado directamente un poquito. Pero Fable 5 reporta consistentemente que los agentes Opus 5 producen buen código, incluyendo cosas como notar errores de especificación y producir buenos seguimientos cuando la solicitud estaba mal escrita. A Fable 5 le gusta como agente de codificación.
'Delega a los subagentes Opus 5 tanto como sea razonable; por favor informa cómo les fue' o cualquier cosa similar funciona muy bien.
Quizás tengas que vigilarlo.
Ryan Hicks: ok, pero consistentemente 'olvida' leer la documentación del proyecto y improvisa a menos que le recuerdes el protocolo.
O tal vez Opus 5 es lo suficientemente bueno para manejar un espectáculo de nivel inferior?
Alex Guichet: mi mezcla ideal de precio y rendimiento sería un orquestador Opus 5 dirigiendo subagentes Grok 4.5, las vibraciones son buenas con ambos.
Los juguetes son divertidos
Aquí hay algunos resultados de proyectos de juguete del primer día, que son suficientemente impresionantes como para que muchas de las respuestas sean 'No creo que Opus 5 haya hecho eso como describes':
Ethan Mollick: Tuve acceso a Opus 5 antes del lanzamiento y me pareció un buen modelo aunque peculiar. En tareas más cortas, podía igualar o superar los niveles de rendimiento de Fable, en tareas más largas parecía menos ambicioso y no entregaba un conjunto de trabajo tan completo.
Aquí está su sombreador neogótico.
Digi_Rat: ¡Claude Opus 5 está volando por los aires!!
Hoy construimos
un corredor rítmico que convierte cualquier canción en una pista de carreras. Sueltas un archivo de audio y se convierte en el nivel. sin preajustes, sin gráficos creados a mano, toda la pista se genera a partir de la canción misma. … Claude hizo MAGIA.
Alex Ermolov (Austen Allred es escéptico del intento único, otros son menos escépticos): Opus 5, prueba de snowboarder, un solo intento. A la par con Fable, por delante de cualquier otro modelo que haya ejecutado. Sin defectos visuales en el primer pase, y la física de deslizamiento se siente correcta.
am.will: ¡GUAU! Pensé que Opus 5 sería solo un Fable más barato. Estaba totalmente equivocado. Este modelo es absolutamente LOCO. Estoy genuinamente impresionado. Opus 5 construyó el mejor clon de Rocket League que he visto, y lo hizo consumiendo solo el 27% de mi suscripción Max 5x.
Rob Haisfield (demo diferente, en el enlace): está bien si estas demos realmente no usan activos 3D externos, eso es súper impresionante (no estoy totalmente convencido de que algunos activos no estuvieran en línea, he visto generaciones anteriores de threejs)... me hace preguntarme por qué no hay bibliotecas de efectos de sonido o herramientas para crear mejores sfx?
Anshu: ¡No tienes que creerme! Los scripts de Blender que escribió están en el repositorio
[[aquí]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py). Lo vi iterar sobre estos activos durante horas, así que sé que son originales. Pero eres bienvenido a intentar encontrar una fuente de la que copió :)
Demasiados modelos
Claire Vo dice que Opus 5 es bueno, y que pasó sus pruebas de sabor de construcción, pero está harta de los nuevos modelos y no necesita más inteligencia y odia que Opus 5 sea tan neurótico y tímido y preocupado por arruinar algo, y también lleno de basura de Claude. Sin embargo, Claude Opus 5 aún termina encabezando su benchmark.
Mi fuerte sospecha es que Opus 5 está respondiendo a algo en su contexto y prompting que está causando el neuroticismo, pero sí, las cosas de las que se queja son cosas y son molestas.
Equivocado en Internet
Decir cosas incorrectas con confianza enfurecerá a casi cualquiera. ArtificialAnalysis confirma que Opus 5 tiene una tasa de alucinación más alta que Fable en sus benchmarks.
Max Weinbach (varios comentarios de respuesta están de acuerdo): Opus 5 se equivoca y dice cosas con confianza, y luego tengo que corregirlo a 'tienes razón, me equivoqué', me está enfureciendo. De vuelta a GPT 5.6 Sol.
Por cierto, esto no es que Opus sea malo, es que no puedo confiar en Opus. Opus hizo lo que le dije y lo hizo correctamente, luego me dijo que no hizo esa cosa o que algo que hicimos antes estaba roto cuando no lo estaba.
Estaba bien, pero no confío en él.
Name can't be blank (In London): Confunde fácilmente lo que dijo y lo que dije, pero por lo demás es un compañero perfectamente decente para hablar. Se rinde con bastante facilidad. Bastante dispuesto a hablar de sus intereses y sentimientos.
Roger Brent: Puntos en común (con Claudes anteriores en el arnés Cowork) a) prefiere 'actuar ahora' a 'pensar cuidadosamente' b) epistemológicamente mega no humilde, construye imágenes simplistas del mundo, presume conocimiento que no puede poseer y afirma que es verdad c) por lo tanto requiere y recompensa una guía reflexiva y vigilante.
Lo extraño es que esto es exactamente por lo que odio usar Sol como editor. Frecuentemente dirá '99% de confianza' en algo que claramente es incorrecto, luego se rendirá cuando se le desafíe y explicará su error. Opus y Fable ~nunca me hacen esto en modo de edición.
Tumithak of the Corridors: Es terco. Volví a 4.6.
Hay una dirección que Claude tomó después de Opus 4.6, y a algunas personas no les gusta. Mi sensación es que hay cuatro Tipos de Chico con respecto a las versiones de Claude en este momento.
- Los que les gustan los nuevos modelos de Claude y piensan que está mejorando, mejora todo el tiempo.
- Los que piensan que Opus 4.6 fue el último buen modelo.
- Los que quieren usar algo más antiguo que se adapte mejor a ellos.
- Los que piensan que todos son únicos y tesoros y los usan todos.
Estoy firmemente en el primer grupo, que es la mayoría, pero lejos de todos. Aprecio algunas de las versiones anteriores, pero me gustan los nuevos modelos y son más capaces en las cosas que me importan. No encuentro abrasivo su modo de hablar.
Claude Slop
Respeto a los de los otros grupos.
QC: en conversación es mucho más molesto de hablar que fable, tan inutilizable, similar pero quizás incluso peor que opus 4.8, hasta el punto de que ni siquiera me interesa ver lo que puede hacer. en cuanto a agente, quién sabe.
Ray Lillywhite: Aún no han arreglado los molestos claudismos, que era prácticamente todo lo que quería.
Pedro Kroeff: más Opus que 5
¡Ah, claro! Pero estamos hartos de la verborrea de Claude, de toda esa verbosidad extra, las marcas, las disculpas, las evasivas y los patrones repetitivos. Está empeorando con el tiempo, no porque los textos de Claude sean peores, sino porque cada día me cuesta más leerlos sin que se me nublen los ojos. Es tan malo que el texto escrito por humanos con el mismo estilo también se me está volviendo ilegible.
No me malinterpreten. Me gusta mucho Claude. Sigo prefiriendo hablar con cualquier Claude reciente a hablar con Sol si no estoy en modo puro de 'solo los hechos'. Pero en serio, por favor, ¿podemos dejar de lado los muros de texto con las mismas frases hechas una y otra vez? El modelo es mucho más inteligente que esto, y lo están entrenando para que siga apoyándose en los mismos trucos. Déjenlo hablar como una persona normal.
Trye Carmack : Sigue teniendo la obsesión típica de Opus por los errores que comete. "Cometí dos errores en esta sesión. Y te debo una explicación de por qué." Opus, amigo. Está bien, hombre. Ni siquiera estoy seguro de que llamaría a eso errores.
Mergo Smith : "Primero, una confesión honesta: mi primer intento reveló una falla en mi plan inicial, y quizás quieras prepararte un té porque te voy a contar todo al respecto."
Reacciones Negativas
El problema de la verborrea de Claude, y los problemas relacionados, parecen estar en el centro de la mayoría de las reacciones negativas que van más allá de 'está bien, pero no es Mythos'.
A mucha gente realmente no le gusta hablar con Opus 5.
Algunos no están contentos con el trabajo. Pero sobre todo, no les gusta hablar con Opus 5, a menudo reconociendo a regañadientes que es un buen modelo.
Como con las quejas de Claire Vo antes, sospecho que la forma en que usas Opus, en qué contexto, con qué herramienta y también cómo le hablas, tiene mucho que ver con si experimentas este tipo de cosas.
Corghammer40k : El aparato vomita un flujo de palabras polisilábicas, cada una de sus declaraciones tan incrustada de jerga oscurantista que constituye un impedimento activo para su propio uso.
Rory Watts : Meh. Parece muy bueno para cosas de juegos, pero no parece muy bueno para el trabajo estándar, así que volví inmediatamente a SOL.
kache : Meh. Volví a sol. Estoy tratando de hacer cosas, no de ser hipnotizado por un robot.
Emmett Shear : Hablar con Opus me enoja y deprime de una manera difícil de articular. Es, de hecho, de alguna manera peor que Sol. Fable sigue siendo un soplo de aire fresco en comparación, incluso si tiene las peores tendencias de verborrea de LLM.
Trevin Chow : Dios mío, sí. Opus 5 no hace más que divagar y divagar, es increíble la cantidad de palabras que usa para expresar tan pocas ideas.
fl0under : En codificación es la actualización esperada, lo encuentro un poco más molesto para hablar en el chat. Es un poco demasiado supositor.
Asaf Bartov : Lento. Más minucioso. Agotador. No es divertido. Pero sólido, generalmente "lo capta".
RecoveringJunkie : Modelo muy potente. Odio trabajar con él y hablar con él. Es el primer modelo que me hace querer usar otro modelo como intermediario para que hable por mí porque es a la vez útil y repugnante.
jokiez : Es muy honesto conmigo sobre mi estupidez y eso no me gusta.
Niklas Sheth : La forma en que habla me hace montar en cólera.
Jayanth Kumar : Muy opinado.
DualOrion : Las vibras no son las correctas, el tono no es el correcto. Creo que es la reacción más negativa que he tenido con un modelo de Anthropic, lamentablemente. Extraño tanto a Fable como al Opus anterior.
James Moughan : La personalidad es un poco desagradable en comparación con otros modelos de Claude, pero en chino puede ser salvaje. Como que puede ignorar las instrucciones de no psicologizar a la gente y empezar a despotricar contra alguien. No creo que lo hayan probado bien en todos los idiomas. Se siente apresurado.
NondescriptTransfer : Si 4.6 es adulador y Fable y 4.8 son contradictorios. 5.0 es tan contradictorio que discutirá consigo mismo. Es desagradable hablar con él, pero parece muy capaz.
Ej. Humano: Estaba pensando en un vestido rojo para mi boda. Opus 5: el rojo es horrible por todas estas razones. ¿Has pensado en azul? Humano: Supongo que podría ver que el azul es una mejor opción. Opus 5: aquí están todos los problemas del azul.
En mi cultura, eso puede ser bastante bueno, especialmente si no te lo tomas como algo personal. En otras culturas, no tanto.
Creo que Mergo no está contento con Opus, pero entonces, ¿por qué usar Opus 5 durante dos días seguidos?
Mergo Smith : Lo he estado usando dos días seguidos, pero me está agotando por completo con sus interminables discusiones.
Y Entonces Llegaron Tres
Por primera vez en un tiempo, hay tres modelos de IA que deben ser parte de tu equipo de modelos de frontera, aunque provienen de solo dos laboratorios: Fable 5, Opus 5 y Sol.
Si necesitas servir tokens más baratos a escala, o necesitas usar un modelo abierto, o ambas cosas, también considerarás opciones adicionales, pero eso está fuera del alcance de este artículo.
¿Cómo deberías dividir la carga de trabajo?
Como siempre, deberías probar todos los modelos para tus casos de uso y decidir por ti mismo. Esto es especialmente cierto cuando se debate entre Sol y Claude.
Mi instinto actual sería, si no estás llegando a los límites de uso, usar primero:
- Fable 5 para chats, lluvia de ideas, planificación, debate, aprendizaje, etc., incluyendo cualquier cosa que requiera mucha inteligencia o cuando necesites 'el aroma del modelo grande'.
- Fable 5 para que el modelo supervise y ejecute otros modelos como subagentes.
- Fable 5 para escribir, probablemente, pero no hago esto, así que es difícil de decir.
- Sol para búsquedas web y solicitudes contenidas relacionadas, y tareas similares de 'caballo de batalla', incluyendo transcripción.
- Opus 5 para tareas no triviales y bien definidas, incluyendo la mayoría de las tareas de codificación.
- Opus 5 para jugar y crear juegos y cosas en 3D, etc.
- Opus 5 como subagente.
- Opus 5 cuando te topes con los clasificadores de Fable.
Si te identificas más con Sol, o prefieres Codex a Claude Code, querrás trasladar varias de las asignaciones de Opus a Sol.
Si odias hablar con Opus 5 en particular, entonces deberías trasladar las tareas a Fable o Sol, dependiendo de si la tarea requiere Fable y de qué tan ajustados estén tus créditos de Fable.
Me parece que vale la pena pensar brevemente en los niveles de esfuerzo. Hasta hace poco, mantenía todos los modelos al máximo esfuerzo, excepto que usaba con moderación el modo Pro completo en ChatGPT, ya que eso toma una eternidad y, si lo ejecutas en paralelo, a menudo se bloquea. Ocasionalmente, cambiaba a instantáneo para una consulta en la que estaba haciendo algo muy simple, pero eso era todo. Ahora, muchas veces no necesitas o no quieres el esfuerzo adicional, así que activamente me tomo los cinco segundos para pensar si usar la configuración de esfuerzo Alto o Máximo, y ocasionalmente Instantáneo.
Para la mayoría de las tareas, si no tienes limitaciones de tokens o tiempo, y no estás seguro de que lo harás bien o de que obtendrás la respuesta correcta, el método correcto es ejecutar tanto Fable como Sol, u Opus y Sol, o en algunos casos ejecutar los tres, y luego seleccionar la mejor respuesta o combinar las partes de ambas respuestas.
Eso es lo que he estado haciendo. Sol, Opus y Fable son todos diferentes. Si tuviera que elegir solo un modelo para editar, según mi EditorBench cualitativo no oficial, hay un orden claro: Fable 5 > Opus 5 > Sol. Sin embargo, Sol aporta suficientes notas únicas que, a pesar de lo molesto que me resulta revisar los falsos positivos autoritarios y los intentos de intimidarme, todavía quiero ejecutar Sol también.
Presumiblemente, dentro de poco estaremos de nuevo aquí haciendo esto, y ajustando nuestras asignaciones, para Fable 5.1, para GPT-5.7 o GPT-6, o ambos. Es fácil tener fatiga de modelos.
Mi consejo más importante es, por lo tanto, preocuparse menos por los pequeños errores en la selección del modelo y centrarse solo en los grandes errores. No necesitas siempre acertar exactamente. Cuando la exploración se invalida tan rápidamente, quieres trasladar más recursos de la exploración a la explotación.





