¿Qué modelos realmente valen la pena? Pusimos a prueba 14 modelos en tareas de conocimiento reales para descubrirlo.

@andrewbusse
INGLÉShace 2 días · 23 jul 2026
166K
11
3
1
8

TL;DR

Este análisis de 14 modelos de IA revela que los líderes en benchmarks a menudo fallan en el trabajo de conocimiento real. Proporciona un marco para elegir modelos basados en el criterio y la frecuencia, categorizándolos en velocistas, pesos medianos y pesos pesados.

El mejor modelo para un trabajo casi nunca es el mejor modelo en el ranking.

En el mundo de la IA, la Navidad llega aproximadamente una vez por semana. Sale un nuevo modelo, todos miran los mismos gráficos de benchmarks con falsa precisión, y acordamos que es lo mejor desde el pan de molde, hasta la semana siguiente, cuando lo volvemos a hacer.

Pero ninguno de esos gráficos responde la única pregunta que importa. ¿Puede el modelo ejecutar tu informe diario o enviar una cotización a un cliente? En Hyperagent, te damos acceso a todos estos modelos sobre un agente de primer nivel. Así que los probamos nosotros mismos. Catorce modelos, cuarenta y dos ejecuciones, con el trabajo de conocimiento real que nuestros clientes entregan a los agentes cada día. Tres cosas destacaron.

  • La factura varió 50 veces en trabajo idéntico. La misma batería de pruebas costó $1.48 en Qwen 3.7 Plus y $75.16 en Fable 5.
  • El ganador del benchmark no fue el ganador del trabajo. GPT 5.6 Sol encabezó nuestras pruebas de referencia, pero no entró en el top tres una vez que ejecutó trabajos reales dentro de Hyperagent. Grok 4.5 estuvo en medio del pelotón en la línea base y quedó primero en trabajo terminado, velocidad y costo.
  • Y ningún modelo lo ganó todo. La elección correcta se movía con el trabajo.

La conclusión no es un nuevo modelo favorito. Es una forma de decidir, trabajo por trabajo, cuál vale su costo.

El mapa de modelos de IA para el trabajo de conocimiento

Cada trabajo que le darías a un agente se reduce a dos preguntas: ¿cuánto juicio necesita y con qué frecuencia se ejecuta? Traza esos dos ejes y el trabajo de conocimiento cae en cuatro territorios, cada uno de los cuales quiere un tipo de modelo diferente.

Andrew Busse - inline image

Trabajo de volumen (arriba a la izquierda). Triage, monitoreo, enrutamiento, sincronización de datos. Procedimiento claro, se ejecuta constantemente, y un error es barato de arreglar. Este trabajo quiere algo rápido y económico.

El oficio diario (arriba a la derecha). Redacción, informes, investigación, comunicaciones con clientes. El trabajo de conocimiento recurrente que ocupa la mayor parte de la semana: necesita síntesis real y una buena voz de escritura, hecho de manera confiable y frecuente.

Alto riesgo (abajo a la derecha). Revisión de contratos, decisiones de precios, análisis profundos. Raro, pero una respuesta incorrecta cuesta un cliente, un contrato o el margen de un trimestre. Aquí es donde el lado negativo eclipsa la factura del modelo, y donde los modelos más caros ganan su tarifa.

No optimices (abajo a la izquierda). La solicitud ocasional y simple donde cualquier modelo capaz supera el listón y la diferencia de precio es demasiado pequeña para merecer una decisión. Es el único cuadrado en el mapa que le decimos a la gente que no piense.

Las tres clases de modelos

Tres clases de trabajo emergen del mapa. Describen la economía y el perfil de juicio del trabajo, en lugar de calificar un modelo como bueno o malo.

Sprinters están diseñados para trabajo de volumen: rápidos, baratos y consistentes cuando el procedimiento es claro y un error es fácil de arreglar. Haiku 4.5, Gemini 3.5 Flash y DeepSeek V4 Pro.

Pesos medianos ejecutan el oficio diario. Sintetizan fuentes, mantienen un plan de varios pasos y escriben bien sin cobrar tarifas de primer nivel por cada informe. Sonnet 5, GPT 5.6 Terra, Grok 4.5 y GLM 5.2 — donde pertenece la mayor parte del trabajo de conocimiento.

Pesos pesados toman las decisiones de alto riesgo, aportando un juicio más sólido y más tiempo de razonamiento a un trabajo donde una respuesta incorrecta cuesta mucho más que la factura del modelo. Opus 4.8, GPT 5.6 Sol y Fable 5.

El instinto de la mayoría de la gente es empezar alto e ir bajando: ejecutar todo en un Fable 5 o un Opus 4.8, obtener el resultado que quieres, luego probar modelos más baratos hasta que la calidad caiga. Funciona, pero hemos encontrado que la mayoría de los trabajos no lo necesitan. Una vez que puedes nombrar el trabajo y colocarlo en el mapa, normalmente puedes empezar en la clase correcta desde el principio. Para el oficio diario, que es la mayor parte de lo que haces, eso significa empezar con un peso mediano sólido como Sonnet 5. Solo recurres a la búsqueda de arriba abajo cuando un trabajo realmente está en el extremo de alto riesgo.

El campo es más amplio que Claude, GPT y Gemini

La mayoría de los equipos se quedan con el puñado de nombres de modelos que ya conocen. Es un punto de partida razonable, pero deja gran parte del repertorio sin tocar, y algunos de los modelos que hacen el trabajo más útil en Hyperagent no son los nombres conocidos. Estas son nuestras impresiones operativas de la batería y del uso diario, más el trabajo que hemos visto ejecutar a los clientes.

Grok 4.5 es investigación rápida y en tiempo real. Se mueve rápidamente a través de investigación con muchas herramientas y funcionó especialmente bien combinado con la búsqueda nativa Exa de Hyperagent. También tiene una línea directa con X, así que una pregunta sobre el sentimiento en vivo puede devolver las publicaciones reales detrás de la respuesta. Lideró nuestra puntuación de trabajo terminado con $9.71 por la ejecución completa.

Muse Spark 1.1 escribe limpio y se revisa a sí mismo. Terminó segundo en el arnés, y nuestra impresión inicial es prosa concisa y bien estructurada con un hábito útil de auditar su propio trabajo antes de entregarlo. Todavía es nuevo, así que lo empezaríamos en trabajos cotidianos supervisados antes de los largos no supervisados.

Kimi K2.6 es investigación profunda a precio de modelo abierto. Ejecuta búsquedas en paralelo y trae la evidencia de vuelta a una sola respuesta sin cobrar tarifas de buque insignia, lo que lo convierte en un especialista en investigación sólido. Su único límite real es el tamaño del documento, con una ventana de contexto que alcanza un máximo de 256,000 tokens.

GLM 5.2 es la opción de valor. Se acercó sorprendentemente a los pesos medianos cerrados en investigación rutinaria, redacción y trabajo con documentos largos a aproximadamente un tercio del precio, y su prosa está entre las más fuertes fuera de Sonnet y Opus. Se ha convertido en un conductor diario para gran parte del equipo de Hyperagent.

Qwen 3.7 Plus es el trabajador de pantalla. Es particularmente bueno encontrando botones, campos y menús en páginas renderizadas, y es económico para extracción estructurada: produjo la ejecución completa de menor costo en nuestra batería. Recurre a él cuando el trabajo es interactuar con una interfaz o mover datos, no cuando la voz importa.

DeepSeek V4 Pro es análisis estructurado a muy bajo costo. Es más fuerte en conciliación, limpieza de datos, trabajo numérico programado y tareas estructuradas similares. Su escritura es literal y escueta, lo que sirve bien para explicaciones internas y mal para prosa dirigida al cliente. Un especialista, y muy económico.

Dotar a tus agentes siempre activos al precio correcto

Steve Juba dirige una empresa de viajes de seis personas. Creó un agente de informes conectado a ocho fuentes de datos en vivo que se ejecuta varias veces al día, y redujo su recopilación matutina de contexto de más de tres horas en ocho pestañas a quince minutos.

Un agente como este lee mucho más de lo que escribe y hace el mismo trabajo cientos de veces al año, por lo que una pequeña diferencia de precio por ejecución deja de ser un error de redondeo y se convierte en una partida presupuestaria real. Considera un informe que lee 100,000 tokens y escribe 2,000 cada día. A los precios de lista de julio de 2026, esa forma de trabajo cuesta aproximadamente:

  • $16 al año en Qwen 3.7 Plus (sprinter)
  • $38 al año en Kimi K2.6 (peso mediano)
  • $40 al año en Haiku 4.5 (sprinter)
  • $80 al año en Sonnet 5 (peso mediano)
Andrew Busse - inline image

Las opciones de peso abierto cambian las matemáticas en trabajos con mucha lectura como este. Kimi K2.6 hace investigación y síntesis de calidad de peso mediano por $38 en este trabajo, menos de la mitad que Sonnet 5, y aproximadamente lo mismo que ejecutar el sprinter Haiku. No estás intercambiando juicio por costo; estás obteniendo trabajo de peso mediano por dinero de sprinter. Si el trabajo fuera pura extracción sin juicio, Qwen lo ejecutaría por $16, pero en el momento que necesita síntesis real, Kimi te da eso por un precio cercano.

Cambia el modelo, mantén el agente

Nada de esto importa si cambiar de modelo significa reconstruir el agente. Dentro de Hyperagent no es así, porque el modelo es solo una configuración y el rol está por encima. Cambia el modelo y el agente conserva todo lo que lo hace útil:

  • Sus instrucciones y alcance
  • Sus habilidades, scripts y procedimientos de trabajo
  • Su memoria de correcciones
  • Sus archivos de referencia y contexto de la empresa
  • Sus conexiones con los sistemas donde vive el trabajo
  • Sus rúbricas para evaluar la calidad
Andrew Busse - inline image

Eso convierte la elección del modelo en una prueba, no en una migración. El mismo agente puede ejecutar el mismo trabajo en dos modelos sin ser reconstruido, así que puedes encontrar el más barato que supere tu listón en lugar de adivinar.

También permite que la parte costosa de un flujo de trabajo difícil se pague por sí misma una vez. Cuando un trabajo realmente lo necesita, usa un modelo más pesado para diseñar y depurar el flujo de trabajo, luego codifica el procedimiento como una habilidad para que un peso mediano o sprinter lo ejecute todos los días a una fracción del costo.

Sin embargo, hay un costo oculto a tener en cuenta. Un modelo más barato con una factura baja no es barato si cada salida necesita corrección: el tiempo de revisión humana y el costo de un error son parte del precio real. Llámalo el impuesto de revisión. Establece el piso de cuán ligero puedes ir. Lo diferente en Hyperagent es que la revisión no solo se paga, sino que se acumula: a medida que el agente aprende de tus correcciones a través de la memoria, ese esfuerzo de revisión es capturado por el arnés y produce un mejor agente en la siguiente ejecución.

Los clientes ya dotan a sus agentes de esta manera. Ankit Das construyó una operación de marketing con un Orquestador de Crecimiento en Sonnet 5 tomando las decisiones de juicio y ocho especialistas de canal en GLM 5.2 produciendo el trabajo recurrente del canal, con agentes de QA separados verificando el cumplimiento de la marca y la calidad de escritura, todo iniciado desde un solo hilo. Eli Weiss describe su división de manera más simple: aproximadamente un 85% Sonnet y un 15% Opus en sus habilidades y rutinas. La mayoría del trabajo se ejecuta en el conductor diario; Opus recibe el conjunto más pequeño de trabajos donde el juicio adicional vale su costo.

Ese es el valor práctico de la elección de modelos dentro de Hyperagent. Gasta deliberadamente en el trabajo y reserva los dólares extra para los trabajos donde el juicio adicional cambia el resultado.

Elige el modelo después de elegir el trabajo

Usa esta secuencia en un agente que ya ejecutes:

  1. Nombra el trabajo. "Preparar el informe del lunes para el cliente" es más útil que "ayudar con informes".
  2. Colócalo en el mapa. Decide cuánto juicio necesita y con qué frecuencia se ejecutará.
  3. Empieza donde el mapa lo coloca. Para la mayoría del trabajo, eso es un peso mediano capaz: úsalo hasta que entiendas los casos límite del trabajo y codifiques el proceso en habilidades.
  4. Prueba una clase más ligera durante cinco ejecuciones reales. Mantén las instrucciones, habilidades, memoria, fuentes y rúbrica sin cambios.
  5. Compara el costo total. Haz seguimiento de la calidad final, consistencia, tiempo, errores factuales, factura del modelo y tiempo de revisión humana.
  6. Escala a propósito. Trae un peso pesado cuando la carga de revisión o el costo de una respuesta incorrecta supere la prima del modelo.
  7. Usa un modelo diferente para revisar trabajos importantes. El modelo que cometió el error es a menudo el que menos probabilidades tiene de verlo.

Mantén el modelo menos costoso que supere de manera confiable tu estándar. Luego gasta la diferencia en las decisiones que lo merecen.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales